AI 爬蟲存取檢查
輸入網址,看看你的 robots.txt 在規則層對各 AI 爬蟲是敞開還是關門:9 個 AI 爬蟲逐項判定,加上 Googlebot 與 Bingbot 對照、llms.txt 存在性,以及內容是否依賴 JS 渲染。
AI 爬蟲存取檢查結果
AI 爬蟲判定(robots.txt)
「無規則」表示沒有涵蓋此路徑的規則,依慣例視為允許;與明確寫 Allow 不同,平台政策仍可能調整。
存取只是第一步。想知道內容在 AI 回答中有沒有真的被引用、卡在哪一層,走免費網站診斷。
三種判定,一個關鍵區別
判定看的是規則層;規則允許之後,內容還要讀得到、引用得到。
- 允許robots.txt 有明確 Allow,或最長的適用規則是 Allow
- 封鎖最長的適用規則是 Disallow,這個爬蟲不應抓取該路徑
- 無規則沒有涵蓋此路徑的規則,依慣例允許;與明示 Allow 的差別在於沒有書面承諾
這個工具不能做什麼
把範圍說清楚,判定才有意義。
robots.txt 採 RFC 9309 的實用子集解析:支援萬用字元與結尾錨點,不處理 Crawl-delay 語意與路徑解碼正規化。判定的是規則層結果,不代表 AI 平台實際抓取或引用行為;WAF 與反爬蟲防護層不在這裡的視野內。「初始 HTML 內容」是啟發式判斷,SPA 網站可能被誤判。llms.txt 是否被任何平台讀取,由各平台自行決定,Google 已公開說明不需要它。
為什麼 GPTBot 和 OAI-SearchBot 要分開看?
它們是 OpenAI 的不同產品:GPTBot 抓內容做模型訓練,OAI-SearchBot 是 ChatGPT 搜尋的檢索器。robots.txt 對兩者是完全獨立的規則,一個允許不代表另一個也允許。
封鎖 Google-Extended 會影響 Google 搜尋排名嗎?
不會。Google-Extended 只控管 Gemini 的訓練資料取用,Google 搜尋收錄走的是 Googlebot。兩者分開檢查才不會誤判。
判定結果等於 AI 一定會(或不會)引用我的網站嗎?
不等於。這裡判斷的是 robots.txt 規則層的結果,也就是你有沒有在規則上把爬蟲擋住。平台實際要不要抓取、要不要引用,由各家模型與產品決定。
輸入你的網站網址,取得免費 Search & AI Visibility 診斷
3 個工作天內寄出具體問題清單與優先順序,不會推銷、不會有業務打擾。
以可驗證資料為依據 · 不使用黑帽 SEO · 不承諾無法控制的排名或 AI 引用