Cách để ChatGPT trích dẫn website: OpenAI nói gì?
Tìm hiểu cách để ChatGPT trích dẫn website: cho phép OAI-SearchBot, phân biệt tài liệu và suy đoán của OpenAI, đồng thời theo dõi lượt truy cập từ chatgpt.com.
Long Nguyen
Lập trình viên Fullstack · Kỹ sư AI · Nhà nghiên cứu
Cách để ChatGPT trích dẫn website: điều gì được tài liệu hóa?
Bạn chỉ kiểm soát được bước đầu tiên: đảm bảo trình thu thập dữ liệu tìm kiếm của ChatGPT được phép đọc các trang của bạn. Mọi việc sau đó—chẳng hạn trang nào được trích dẫn và trang nào bị bỏ qua—chưa được mô tả trong bất kỳ tài liệu nào của OpenAI mà tôi tìm thấy. Bài viết này sẽ tách riêng hai vấn đề đó.
Các thông tin dưới đây đã được đối chiếu với tài liệu chính thức của OpenAI vào ngày .
| Câu hỏi | OpenAI có tài liệu hóa không? | Bạn nên làm gì? |
|---|---|---|
| Mọi website công khai có thể xuất hiện trong tìm kiếm ChatGPT không? | Có | Không chặn OAI-SearchBot |
| Chặn GPTBot có khiến website bị xóa khỏi tìm kiếm không? | Không: đây là các tùy chọn riêng biệt | Cấu hình GPTBot và OAI-SearchBot độc lập |
| Thay đổi robots.txt có hiệu lực nhanh đến mức nào? | Có: khoảng 24 giờ đối với tìm kiếm | Chờ một ngày trước khi đánh giá thay đổi |
| Có thể theo dõi lượt truy cập từ ChatGPT không? | Có, thông qua tham số UTM | Lọc dữ liệu analytics theo utm_source=chatgpt.com |
| Trang nào được trích dẫn và theo thứ tự nào? | Không có trong các tài liệu tôi tìm thấy | Coi mọi lời khuyên là giả thuyết cần kiểm chứng |
| llms.txt hoặc schema markup có tăng khả năng được trích dẫn không? | Không có trong các tài liệu tôi tìm thấy | Đừng kỳ vọng mức tăng chắc chắn |
Bước 1: cho phép OAI-SearchBot thu thập dữ liệu website
FAQ dành cho nhà xuất bản của OpenAI cho biết mọi website công khai đều có thể xuất hiện trong tìm kiếm ChatGPT. Để được đưa vào phần tóm tắt và đoạn trích, bạn không được chặn OAI-SearchBot. Nếu robots.txt đang chặn bot này, hãy xử lý việc đó trước; mọi thứ khác trong bài viết sẽ chưa có ý nghĩa cho đến khi bạn hoàn tất.
Có hai chi tiết trong tài liệu về trình thu thập dữ liệu của OpenAI rất dễ bị bỏ qua:
- Thời gian cập nhật. OpenAI cho biết các hệ thống tìm kiếm có thể mất khoảng 24 giờ để điều chỉnh sau khi bạn thay đổi robots.txt. Nếu bạn sửa tệp lúc 9 giờ sáng, đừng kiểm tra lại lúc 9 giờ 5 phút.
- Tường lửa. OpenAI khuyến nghị cho phép các dải IP đã công bố của mình, đồng thời cấu hình đúng quy tắc robots.txt. Quy tắc trên Cloudflare hoặc WAF yêu cầu xác minh với các bot lạ có thể chặn OAI-SearchBot ngay cả khi robots.txt cho phép. Danh sách IP được công bố tại openai.com/searchbot.json.
Chuỗi user-agent hiện kết thúc bằng OAI-SearchBot/1.4 và OpenAI lưu ý rằng số phiên bản có thể thay đổi. Khi tự truy cập robots.txt, bot có thể thêm dấu hiệu robots.txt vào chuỗi này. Vì vậy, hãy khớp theo token OAI-SearchBot thay vì toàn bộ chuỗi.
User-agent: OAI-SearchBot
Allow: /
User-agent: GPTBot
Disallow: /
Tệp này cho phép tìm kiếm ChatGPT truy cập website của bạn và yêu cầu OpenAI không sử dụng các trang đó để huấn luyện mô hình. Đây là cấu hình phổ biến đối với các nhà xuất bản muốn tăng khả năng hiển thị mà không đóng góp dữ liệu huấn luyện.
OAI-SearchBot, GPTBot và ChatGPT-User: bot nào kiểm soát việc gì?
OpenAI vận hành ba user agent thường bị nhầm lẫn với nhau. Mỗi bot giải quyết một mục đích khác nhau.
| User agent | Nhiệm vụ | Cách kiểm soát |
|---|---|---|
| OAI-SearchBot | Đưa website vào kết quả tìm kiếm ChatGPT | robots.txt: đây là công tắc bật hoặc tắt hiển thị trong tìm kiếm |
| GPTBot | Thu thập nội dung có thể được dùng để huấn luyện mô hình | robots.txt: chặn bot này để từ chối sử dụng cho huấn luyện |
| ChatGPT-User | Truy cập một trang vì có người yêu cầu ChatGPT thực hiện | OpenAI cho biết các quy tắc robots.txt có thể không áp dụng |
Hệ quả thực tế là: một dòng nhật ký từ ChatGPT-User chứng minh có người đã hỏi về trang của bạn, chứ không chứng minh website đã được đưa vào chỉ mục tìm kiếm. OpenAI cũng cho biết tùy chọn từ chối tìm kiếm phải được đặt cho OAI-SearchBot, vì vậy chặn ChatGPT-User không phải là cách tắt hiển thị trong tìm kiếm.
Cách kiểm tra robots.txt cho ChatGPT chỉ với 10 dòng
Đừng chỉ kiểm tra bằng mắt. Đoạn script này sử dụng thư viện chuẩn của Python để cho biết robots.txt xử lý ba agent của OpenAI như thế nào đối với bất kỳ URL nào.
from urllib.robotparser import RobotFileParser
BOTS = ["OAI-SearchBot", "GPTBot", "ChatGPT-User"]
def check(site, path="/"):
rp = RobotFileParser(site.rstrip("/") + "/robots.txt")
rp.read()
for bot in BOTS:
ok = rp.can_fetch(bot, site.rstrip("/") + path)
print(bot, "ALLOWED" if ok else "BLOCKED")
check("https://example.com", "/blog/my-post")
Có một điểm dễ gây nhầm lẫn mà tôi đã xác nhận khi chạy thử. Với một robots.txt có quy tắc chung User-agent: * đi kèm Disallow: /, một nhóm được đặt tên chỉ cho phép OAI-SearchBot, và thêm một quy tắc chặn GPTBot được đặt tên riêng, bộ phân tích của Python sẽ báo OAI-SearchBot được phép, GPTBot bị chặn và ChatGPT-User bị chặn. Nguyên nhân là ChatGPT-User không có nhóm riêng nên rơi vào quy tắc wildcard.
Đối với điều kiện xuất hiện trong tìm kiếm, kết quả đó không có vấn đề vì OAI-SearchBot mới là bot quan trọng. Tuy nhiên, nó cho thấy một quy tắc wildcard có thể âm thầm áp dụng cho mọi agent mà bạn chưa chỉ định. Bộ phân tích của Python không phải bộ phân tích của OpenAI, vì vậy hãy xác nhận hành vi thực tế trong nhật ký máy chủ sau khoảng thời gian 24 giờ.
Vì sao trang bị chặn vẫn có thể xuất hiện dưới dạng liên kết?
Chặn OAI-SearchBot không đảm bảo trang sẽ hoàn toàn biến mất. FAQ của OpenAI cho biết nếu hệ thống biết URL của một trang bị cấm từ nhà cung cấp tìm kiếm bên thứ ba hoặc qua việc thu thập dữ liệu các trang khác, đồng thời nhận thấy các tín hiệu cho thấy trang đó liên quan, hệ thống vẫn có thể chỉ hiển thị liên kết và tiêu đề trang. OpenAI nêu điều này trong tài liệu về ChatGPT Atlas.
Cách khắc phục được tài liệu hóa là dùng thẻ meta noindex. Tuy nhiên, có một điểm dễ mắc bẫy: trình thu thập dữ liệu chỉ đọc được thẻ meta trên trang mà nó được phép truy cập. Nếu bạn vừa muốn loại một trang khỏi kết quả vừa chặn trang đó trong robots.txt, thẻ noindex sẽ không bao giờ được nhìn thấy. Hãy cho phép thu thập dữ liệu, phân phối thẻ noindex và để thẻ này xử lý việc loại trang.
ChatGPT chọn nguồn để trích dẫn như thế nào?
Câu trả lời trung thực là: OpenAI chưa công bố logic lựa chọn. Tôi đã tìm kiếm trong trung tâm trợ giúp và tài liệu dành cho nhà phát triển của OpenAI, nhưng chỉ tìm thấy các quy tắc về trình thu thập dữ liệu và tham số giới thiệu, không thấy tiêu chí xếp hạng, yếu tố chấm điểm hay danh sách tín hiệu nào.
Điều này quan trọng vì trên Internet có rất nhiều con số nghe có vẻ chính xác: tỷ lệ các trang được truy xuất rồi được trích dẫn, cấu trúc có thể nhân khả năng được trích dẫn lên bao nhiêu lần, hay cần bao nhiêu referring domain. Hầu hết đều đến từ các nhà cung cấp công cụ SEO và GEO, dựa trên mối tương quan trong các mẫu dữ liệu riêng của họ. Không con số nào là tuyên bố của OpenAI, và nhiều bài viết còn lặp lại số liệu của nhau. Hãy coi chúng là giả thuyết để kiểm tra, không phải quy tắc.
Một nhận định thường xuyên xuất hiện là tìm kiếm ChatGPT dựa nhiều vào chỉ mục của Bing. Tuy nhiên, điều này cũng chưa được xác nhận trong các trang của OpenAI mà tôi đã đọc. Việc xác minh website trong Bing Webmaster Tools chỉ mất vài phút nên vẫn đáng làm để giảm rủi ro. Chỉ đừng lập kế hoạch dựa trên đó như thể đây là một sự thật đã được xác nhận.
Cách viết nội dung để ChatGPT dễ trích dẫn
Vì cơ chế lựa chọn chưa được công bố, phần này là nhận định của tôi chứ không phải chính sách của OpenAI. Lập luận khá đơn giản: một hệ thống tổng hợp câu trả lời từ các trang được truy xuất cần một đoạn nội dung có thể lấy lại mà không phải viết lại. Hãy khiến việc đó trở nên dễ dàng.
- Trả lời trước. Đặt câu trả lời trực tiếp trong hai câu đầu tiên dưới mỗi tiêu đề, sau đó mới trình bày các sắc thái và ngoại lệ.
- Mỗi H2 một câu hỏi. Viết tiêu đề theo cách một người thật sẽ đặt câu hỏi, để mỗi phần có thể đứng độc lập như một đơn vị dễ trích dẫn.
- Cụ thể và có ngày tháng. Phiên bản, con số và ngày tháng hiển thị rõ giúp đoạn nội dung có thông tin mà một trang chung chung khó sánh được.
- Dùng bảng để so sánh. Bảng giúp trình phân tích hiểu rõ nội dung và giúp người đọc nắm thông tin nhanh hơn.
- Nêu tên tác giả và dẫn nguồn chính. Điều này giúp người đọc kiểm chứng nội dung—dù là người hay máy—và khả năng kiểm chứng chính là nền tảng của niềm tin.
- Đặt nội dung trong HTML. Nếu câu trả lời chỉ xuất hiện sau khi JavaScript chạy hoặc nằm sau màn hình đăng nhập, trình thu thập dữ liệu có thể không bao giờ nhìn thấy.
Hãy để ý những điều không có trong danh sách: thủ thuật. Không có schema, tệp hay cụm từ nào được OpenAI công bố là có thể buộc một trang được trích dẫn. Nếu bạn không muốn tự xử lý quyền truy cập của trình thu thập dữ liệu, quy tắc tường lửa và cấu trúc trang, đây là nhóm công việc được cung cấp trong dịch vụ SEO, AEO và GEO của Netalith.
Cách theo dõi lưu lượng truy cập đến từ ChatGPT
OpenAI cho biết các website cho phép OAI-SearchBot có thể đo lường lượt giới thiệu, vì ChatGPT thêm utm_source=chatgpt.com vào các liên kết mà hệ thống gửi đi. Trong Google Analytics, hãy lọc các phiên có nguồn là chatgpt.com và so sánh các trang đích với những trang bạn kỳ vọng sẽ được trích dẫn.
Hãy coi đây là vòng lặp phản hồi của bạn. Bạn không thể xem trực tiếp các lượt trích dẫn, nhưng có thể biết URL nào đã nhận được lượt nhấp. Hãy kiểm tra hằng tuần thay vì hằng ngày, xét đến độ trễ 24 giờ khi thay đổi trình thu thập dữ liệu và mức độ biến động của câu trả lời AI giữa các lần đặt câu hỏi.
llms.txt hoặc schema markup có giúp ChatGPT trích dẫn website không?
Không tài liệu nào trong số những tài liệu của OpenAI mà tôi đã đọc đề cập llms.txt hoặc schema markup là yếu tố của tìm kiếm ChatGPT. Schema markup có giá trị đã được xác lập đối với các tính năng tìm kiếm truyền thống, còn tệp llms.txt thì không tốn nhiều công sức để xuất bản, nên cả hai đều không phải ý tưởng tồi. Tuy nhiên, đừng tự hứa với bản thân hoặc khách hàng rằng phần thưởng sẽ là một lượt trích dẫn từ ChatGPT. Bất kỳ ai bán lời cam kết đó đều đang bán thứ mà OpenAI chưa tài liệu hóa.
Thứ tự thực hiện thực tế
- Xác nhận OAI-SearchBot được cho phép trong robots.txt và không bị tường lửa chặn.
- Quyết định riêng về GPTBot, tùy vào việc bạn có chấp nhận sử dụng nội dung để huấn luyện hay không.
- Chờ khoảng 24 giờ, sau đó kiểm tra nhật ký máy chủ để tìm OAI-SearchBot.
- Viết lại các trang tốt nhất để mỗi phần trả lời một câu hỏi ngay trong hai câu đầu tiên.
- Theo dõi lượt giới thiệu có utm_source=chatgpt.com hằng tuần và so sánh với các trang bạn đã viết lại.
Nếu muốn có người kiểm tra lại các bước từ 1 đến 3, Gói Audit + Roadmap trị giá $20 của Netalith sẽ kiểm tra quyền truy cập của trình thu thập dữ liệu và cung cấp danh sách sửa lỗi theo mức độ ưu tiên trong vòng 24 đến 48 giờ. Nguồn của bài viết: FAQ dành cho nhà xuất bản và nhà phát triển của OpenAI và tổng quan về trình thu thập dữ liệu của OpenAI.
CÂU HỎI THƯỜNG GẶP
Câu hỏi thường gặp
Mọi website có thể được ChatGPT trích dẫn không?
OpenAI cho biết mọi website công khai đều có thể xuất hiện trong tìm kiếm ChatGPT. Để được đưa vào phần tóm tắt và đoạn trích, bạn không được chặn OAI-SearchBot. Tuy nhiên, việc xuất hiện không được đảm bảo và OpenAI không công bố cách lựa chọn nguồn.
Chặn GPTBot có khiến ChatGPT không trích dẫn website của tôi không?
Không. GPTBot liên quan đến việc huấn luyện mô hình, còn OAI-SearchBot liên quan đến tìm kiếm. Đây là hai tùy chọn robots.txt riêng biệt, nên bạn có thể chặn GPTBot mà vẫn cho phép OAI-SearchBot.
Sau khi thay đổi robots.txt, ChatGPT sẽ nhận biết trong bao lâu?
OpenAI cho biết các hệ thống tìm kiếm có thể mất khoảng 24 giờ để điều chỉnh sau khi robots.txt được cập nhật. Vì vậy, hãy chờ ít nhất một ngày trước khi đánh giá thay đổi.
Làm cách nào để xem lượt truy cập từ ChatGPT trong công cụ analytics?
ChatGPT thêm utm_source=chatgpt.com vào các liên kết giới thiệu dành cho website cho phép OAI-SearchBot. Hãy lọc theo nguồn này trong Google Analytics hoặc bất kỳ công cụ nào đọc được tham số UTM.
llms.txt hoặc schema markup có đảm bảo website được ChatGPT trích dẫn không?
Không. OpenAI chưa tài liệu hóa hai yếu tố này như các yếu tố của tìm kiếm ChatGPT. Cả hai vẫn có thể hữu ích vì những lý do khác, nhưng không thể hứa hẹn rằng chúng sẽ mang lại một lượt trích dẫn.
Trang tôi đã chặn vẫn có thể xuất hiện trong ChatGPT không?
Có thể. OpenAI cho biết hệ thống có thể chỉ hiển thị liên kết và tiêu đề của một trang bị cấm nếu biết URL đó từ nơi khác. Hãy sử dụng thẻ meta noindex và vẫn cho phép trình thu thập dữ liệu truy cập trang để thẻ này có thể được đọc.