Được index nhưng không được AI trích dẫn: sửa từ đâu
Ba lớp quyết định việc AI search trích dẫn bạn: access, extractability, trust. Kèm dữ liệu 10.099 store Shopify cho thấy cái bẫy copy robots.txt.
Bạn mở Search Console, thấy trang vẫn có impression, vị trí vẫn ổn. Nhưng hỏi ChatGPT hay Perplexity đúng câu mà trang đó trả lời, nó trích dẫn ba site khác và không có bạn.
Xếp hạng và được trích dẫn là hai bài toán khác nhau. Bài này đi qua ba lớp quyết định việc một hệ thống AI có dùng trang của bạn làm nguồn hay không, kèm cách đo để biết mình đang hỏng ở lớp nào.
Ba lớp, hỏng lớp nào cũng ra kết quả giống nhau
Hướng dẫn GEO chia bài toán thành ba lớp, và nhấn mạnh bạn cần cả ba:
- Access — crawler liên quan có tới được trang không. Nếu robots.txt, firewall, CDN, hệ thống auth hay cấu hình server chặn việc truy xuất, viết lại bài không giải quyết được gì.
- Extractability — hệ thống có nhanh chóng nhận ra câu trả lời rõ ràng không.
- Trust — vì sao nó nên chọn thông tin của bạn thay vì một trang khác cùng chủ đề.
Theo bài viết: nội dung hay mà không crawl được thì vô hình; crawl được nhưng câu trả lời yếu thì bị bỏ qua; câu trả lời rõ mà thiếu độ tin cậy thì thua nguồn được hậu thuẫn tốt hơn.
Lớp 1: kiểm tra bạn có chặn nhầm không
Đây là lớp dễ hỏng nhất vì nó hỏng do copy-paste. Một khảo sát quét robots.txt của 10.099 storefront Shopify trong khoảng 29/8 đến 2/9/2026 cho thấy quy mô của cái bẫy này.
Nhóm khảo sát hỏi mỗi trong 12 tên crawler đúng một câu: nó có được fetch /products/ không. Kết quả: 133 trên 10.099 store chặn ít nhất một crawler — 1,32%. Nhưng con số đáng chú ý nằm ở chỗ chặn cái gì.
Bài viết chia 12 crawler thành hai nhóm. Tám con crawl trước để train hoặc ground model: CCBot, GPTBot, Bytespider, Amazonbot, Google-Extended, ClaudeBot, Applebot-Extended, meta-externalagent. Bốn con fetch ngay lúc người dùng đang hỏi: ChatGPT-User, PerplexityBot, OAI-SearchBot, Perplexity-User.
Trong 133 store chặn thứ gì đó, 120 store chỉ chặn nhóm training và grounding. Và có 28 store chặn đúng cùng một danh sách tám tên, nguyên văn — đúng tám con nhóm training kể trên. Tác giả nhận xét thẳng: những danh sách giống hệt nhau không tự nhiên mà trùng, cái này đọc như một đoạn snippet được chép lại, và nó không chứa con nào trong bốn crawler answer-time.
Cặp rõ nhất là của OpenAI. GPTBot dùng để train; OAI-SearchBot là thứ dựng nên kết quả search và shopping của ChatGPT. 77 store chặn con đầu. 6 store chặn con thứ hai, và cả 6 đều chặn luôn con đầu. Chiều ngược lại — giữ crawler shopping ở ngoài mà cho crawler training vào — xảy ra ở 0 store.
Kết luận của tác giả đáng dán lên tường: danh sách mà phần lớn họ chép được viết ra trước khi các crawler answer-time tồn tại, nên một store dùng nó đã ra quyết định về training và, mà không nhận ra, chưa ra quyết định nào về shopping.
Việc cần làm: mở robots.txt của bạn, đối chiếu với hai nhóm ở trên, và tự hỏi bạn đang cố chặn training hay đang vô tình tự loại mình khỏi câu trả lời. Bài GEO bổ sung một bước nữa: đọc log server thật. Robots.txt cho biết cái gì nên được phép; log cho biết cái gì thực sự chạm tới server.
Một lưu ý về phạm vi: nhóm khảo sát nói rõ mọi con số của họ là sàn, vì store còn có thể chặn ở edge bằng rule bot-management hoặc firewall, và scanner không nhìn thấy được.
Lớp 2: trả lời ngay dưới heading
Bài GEO gọi đây là cải thiện dễ nhất. Khi một heading đặt câu hỏi, hãy trả lời thẳng ngay bên dưới, rồi mới mở rộng — đừng bắt người đọc hay hệ thống truy xuất đi qua 300 từ mở bài.
Kèm theo là một nguyên tắc kỹ thuật hơn: hệ thống AI có thể truy xuất một đoạn văn thay vì đọc cả bài như một khối. Nên các đoạn quan trọng phải đứng vững một mình, không phụ thuộc nặng vào đoạn trước nó. Thay vì viết "Đây là lý do nó quan trọng", hãy viết thẳng chủ thể và câu trả lời trong chính câu đó.
Và chọn format theo dạng câu hỏi: định nghĩa thì cho định nghĩa ngắn trước; quy trình thì dùng bước đánh số; so sánh thì dùng bảng khi bảng thật sự làm khác biệt dễ thấy hơn; danh sách lựa chọn thì dùng bullet.
Lớp 3: thêm bằng chứng, không thêm keyword
Bài viết nói rõ: lặp lại cụm khóa thêm hai mươi lần không tự động làm bài dễ được trích dẫn hơn. Thứ hữu ích hơn là bằng chứng — ví dụ gốc, kết quả test, ảnh chụp màn hình, dữ liệu, mốc thời gian, phương pháp, nguồn sơ cấp, tài liệu chính thức, trải nghiệm trực tiếp.
Hai chi tiết kỹ thuật đi kèm. Thứ nhất, entity phải rõ: tên site hoặc công ty, tên tác giả, trang About, thông tin liên hệ, ngày đăng và ngày cập nhật — và dùng tên nhất quán. Nếu homepage gọi doanh nghiệp một kiểu, schema dùng tên khác, hồ sơ bên ngoài dùng biến thể thứ ba, bạn đang tự tạo mơ hồ.
Thứ hai, structured data phải khớp nội dung nhìn thấy được. Bài viết cảnh báo đừng nhồi mọi loại schema, và đừng đưa vào schema những khẳng định không thực sự hiển thị hay không đúng trên trang — schema để làm rõ nội dung, không phải để tạo một phiên bản hư cấu thứ hai.
Đo bằng một bộ câu hỏi cố định
Rank tracking truyền thống không đủ, vì câu trả lời do AI sinh ra không hành xử như một trang SERP. Cách bài viết đề xuất: lập một bộ câu hỏi cố định quan trọng với công việc của bạn, rồi test định kỳ trên các sản phẩm AI search bạn quan tâm.
Mỗi lần test, ghi lại: thương hiệu của bạn có được nhắc không, trang có được trích dẫn không, URL nào được trích, đối thủ nào xuất hiện, loại trang nào được chọn, câu trả lời có mô tả đúng về bạn không, và trích dẫn có đổi sau khi bạn cập nhật nội dung không.
Quan trọng: đừng đổi prompt mỗi lần test. Một bộ câu hỏi ổn định mới cho phép so sánh thay đổi.
Việc làm tuần này
Bắt đầu từ những trang đã có impression hoặc nhắm vào câu hỏi có giá trị — bài viết khuyên đúng thứ tự: sửa access kỹ thuật trước, cải thiện cấu trúc câu trả lời sau, rồi mới tới bằng chứng và độ tin cậy.
Ba việc cụ thể: đối chiếu robots.txt với danh sách hai nhóm crawler ở trên; lấy các trang có impression cao nhất và viết lại đoạn đầu mỗi heading thành câu trả lời đứng một mình; lập bộ câu hỏi cố định rồi chạy lần đo đầu tiên để có mốc so sánh.
Không spam, hủy đăng ký bất kỳ lúc nào.
Bài viết liên quan

Google Play siết app GenAI: 4 lỗi khiến app bị từ chối
27 thg 8, 2026
Chạy LLM 125B local: M5 Ultra có đáng tiền với dev VN?
26 thg 8, 2026