可爬取性與可存取性

技術優化 · 有證據支持

本頁為英文版的中文翻譯,僅供參考。如中英文版本有任何歧義,概以英文版為準。

這項檢查會在你的頁面上讀什麼

robots.txt 會先抓下來,針對這個網址逐條比對,所以只限定某個路徑的 Disallow 也判得出來;負責產生答案的爬蟲(OAI-SearchBot、PerplexityBot 這些)和訓練用的爬蟲(GPTBot 這些)分開處理,擋到訓練爬蟲只會回報,不扣分。擋一個答案爬蟲,按比例扣一份;meta robots 寫 noindex 直接歸零;noarchive 算少掉一個答案平台。其餘的分數看這一頁替爬蟲開了多少路:連結能到幾個不同的站內頁面、幾成的連結是爬蟲真的跟得過去的、有沒有設 crawl-delay,另外幾項小分:canonical 和網址一致、robots.txt 裡有 Sitemap 這一行、有 doctype、html 元素有 lang、有宣告 charset。

我們對證據的判定

有證據支持最強的技術因子:封鎖能見度爬蟲會可驗證地將網站從該引擎的答案中移除,OpenAI 也直接記載了這一點。計分採用機器人類別矩陣,因此只有封鎖能見度機器人才會扣分;封鎖訓練機器人是一種政策選擇,會以中性方式回報。

OpenAI crawler documentation (blocking OAI-SearchBot removes a site from ChatGPT search answers) · Vercel and MERJ AI crawler study (569M GPTBot requests: zero JavaScript execution, no image fetches) · Bing webmaster documentation: NOARCHIVE prevents content from being used in Copilot responses and grounding

這裡判斷的是門有沒有開,不是爬蟲會不會來:robots.txt 全開、卻沒有任何站外連結指過來的頁面,在這裡照樣滿分。權重會這麼重,是因為機制有白紙黑字:OpenAI 明講擋掉它的搜尋爬蟲,網站就會從 ChatGPT 搜尋答案裡消失,Bing 對 Copilot 裡的 noarchive 也是同一套說法。門關著,頁面上其他東西做得再好都白費。

值多少分

佔「技術優化」的 65%,相當於總分 100 分裡的 13 分。

受檢頁面在這一項的表現

依據 30,738 個受檢頁面。

中位數頁面得 52 分,中間一半的頁面落在 41 到 70 分之間。

  • 良好(75 到 100)5,440 (18%)
  • 普通(50 到 74)11,072 (36%)
  • 待加強(25 到 49)12,515 (41%)
  • 嚴重不足(0 到 24)1,711 (6%)

46% 的受檢頁面在這一項低於 50 分。

哪些產業最常不及格、哪些最少

最常不及格的產業

最少不及格的產業

該怎麼修

  • 打開 robots.txt,確認你希望被引用的頁面,沒有任何一條 Disallow 擋到這裡點名的 AI 搜尋爬蟲(OAI-SearchBot、PerplexityBot、Claude-SearchBot、Claude-User、Bingbot、Googlebot,以及報告卡上列的其他幾個);要擋訓練爬蟲,另外寫一條規則。
  • 凡是希望 AI 答案引用的頁面,noindex、nofollow、noarchive 都拿掉。
  • href="#" 和 javascript: 連結換成真正的網址,再從這一頁多連幾個自家的頁面。
  • canonical 指向頁面自己的網址,robots.txt 補一行 Sitemap。
  • 宣告 doctype,html 元素加 lang,charset 也要宣告。

這個因子改過什麼

有 5 個版本的變更無法對應到個別因子,所以其中任何一個都可能更動過這個因子;完整的變更紀錄裡有它們。

其他因子

全部因子,以及分數是怎麼算出來的