一句話總結

Search Engine Land 於 8 月 19 日刊登 LOCOMOTIVE 的 Associate Director of SEO Vinicius Stanula 的技術文章,通過一個長達 41 天的實驗 證實:依賴 JavaScript 渲染內容和連結的網站,可能完全無法被 AI 搜尋引擎的爬蟲(GPTBot、Googlebot、Bingbot、ClaudeBot 等)發現。對於香港眾多使用 React、Vue、Next.js 等 JavaScript 框架的中小企網站,這是一個不容忽視的 GEO 致命缺陷——如果你的內容對 AI 爬蟲隱形,你的 GEO 策略從一開始就注定失敗。

41 天實驗的關鍵發現

實驗設計

Stanula 的實驗始於一個簡單的問題:AI 爬蟲能否像傳統搜尋引擎爬蟲一樣,正確讀取和索引 JavaScript 渲染的頁面?為了回答這個問題,他設定了多個測試場景:

  • 測試不同類型的爬蟲(GPTBot、Googlebot、Bingbot、ClaudeBot、AppleBot 等)
  • 測試 JavaScript 生成內容的不同方式(SSR 伺服器端渲染 vs CSR 客戶端渲染)
  • 測試 JavaScript 連結(onclick<a href="#" onclick="...">)與標準 HTML 連結(<a href="/page">)的差異
  • 記錄了長達 41 天的爬取和索引行為

核心發現

實驗結果令人震驚:

  1. JavaScript 生成的連結經常被忽略——如果網站的導航系統完全依賴 JavaScript 來生成連結(如 SPA 應用中常見的 router.push()onclick 處理器),爬蟲可能根本「看不到」這些連結
  2. 客戶端渲染(CSR)頁面的內容幾乎不可見——如果頁面的主要內容是通過客戶端 JavaScript 加載的,爬蟲可能在獲取到內容之前就放棄了渲染
  3. 不同爬蟲的行為差異巨大——Googlebot 對 JavaScript 的處理能力最強,但 GPTBot、ClaudeBot 等 AI 爬蟲對 JavaScript 的支持非常有限
  4. 爬蟲超時是常見問題——許多爬蟲只給 JavaScript 渲染幾秒鐘的時間,如果內容沒有在這段時間內完成渲染,就會被視為空白頁面

為什麼這對 GEO 至關重要

傳統 SEO 領域,Google 已經多年來支持 JavaScript 渲染(通過 Web Rendering Service),雖然有限制但總體可行。然而,AI 搜尋的生態完全不同

  • ChatGPT 的 GPTBot、Claude 的 ClaudeBot、Perplexity 的 PerplexityBot 等 AI 爬蟲,對 JavaScript 的支持遠不如 Googlebot
  • 這些 AI 爬蟲通常只獲取靜態 HTML 內容,不會執行複雜的 JavaScript
  • 即使它們嘗試渲染,時間限制也更嚴格
  • 如果 AI 爬蟲無法讀取你的內容,你的品牌就永遠不會出現在 AI 搜尋的回應中

技術 GEO 的基礎:確保 AI 爬蟲能看到你的內容

第一個檢查:你的網站能否在沒有 JavaScript 的情況下工作?

Stanula 的建議非常直接:在你的瀏覽器中禁用 JavaScript,然後看看你的網站還剩下什麼。

這是測試 AI 爬蟲體驗的最簡單方法。步驟:

  1. 打開瀏覽器的開發者工具
  2. 在設定中找到禁用 JavaScript 的選項
  3. 重新加載你的網站
  4. 檢查:
    • 是否還有文字內容可以被讀取?
    • 導航連結是否還能點擊並跳轉到其他頁面?
    • 產品資訊、服務描述等關鍵內容是否還在?

如果禁用 JavaScript 後你的網站只剩下一片空白或一個 loading spinner,意味著 AI 爬蟲也看不到你的內容。

第二個檢查:核心網頁指標測試

使用 Google 的 PageSpeed Insights 或 Search Console 的「檢查任何 URL」工具,查看 Google 看到的頁面是什麼樣子的。如果 Google 看到的版本與用戶看到的版本有顯著差異,AI 爬蟲看到的問題可能更大。

第三個檢查:使用 curl 或 wget 模擬爬蟲

在終端中執行以下命令,查看 AI 爬蟲接收到的原始 HTML:

curl -sL https://你的網站.com | head -100

如果返回的 HTML 中沒有你的主要內容(例如產品描述、文章正文等),說明你的內容是通過 JavaScript 動態加載的,AI 爬蟲可能無法讀取。

對香港品牌的 GEO 含意

1. 技術 GEO 是 AI 搜尋可見度的基礎

許多香港企業在投資 GEO 時,首先想到的是內容策略——撰寫 AI 友好的文章、優化關鍵詞、建立權威性。但 Stanula 的實驗提醒我們:所有這些努力的前提是,AI 爬蟲能夠看到你的內容。

  • 如果 AI 爬蟲無法讀取你的網站,再好的內容也是浪費
  • 技術 GEO 應該是 GEO 策略的第一步,而不是最後一步
  • 大多數香港中小企網站使用 WordPress 或其他 CMS 時,預設情況下應該是 AI 友好的,但如果你使用了自定義的 JavaScript 框架或 SPA 架構,就需要特別注意

2. 香港常見的網站技術問題

根據對香港市場的觀察,以下技術問題最常見:

  • 使用 React/Vue/Angular 構建的 SPA(單頁應用)——雖然用戶體驗流暢,但對 AI 爬蟲來說幾乎隱形,除非使用 SSR(伺服器端渲染)
  • 通過 JavaScript 動態加載內容的頁面——如「查看更多」按鈕後載入的內容、分頁加載的產品列表等
  • 使用 JavaScript 處理的導航系統——<a> 標籤中沒有真實的 href 屬性,轉而使用 onclick 處理
  • 使用 .htaccess 或 JavaScript 重定向——AI 爬蟲可能無法跟隨複雜的重定向
  • 依賴 Cookie 或 LocalStorage 的內容展示——AI 爬蟲通常不會執行這些客戶端存儲機制

3. 修正方案與優先級

高優先級(立即行動)

  • 確保所有重要頁面使用標準的 <a href="/page"> HTML 連結——這是最簡單也最重要的修正
  • 啟用伺服器端渲染(SSR)——如果你使用 React(Next.js)、Vue(Nuxt.js)或 Angular(Angular Universal),確保 SSR 已正確配置
  • 在 robots.txt 中不要錯誤地屏蔽 AI 爬蟲——檢查你的 robots.txt 文件,確保 GPTBotClaudeBotPerplexityBot 等沒有被禁用

中優先級(近期計劃)

  • 實現靜態生成(SSG)或增量靜態生成(ISR)——對於內容網站,預先生成靜態頁面比 SSR 更友好
  • 實施結構化數據(Schema.org)——這幫助 AI 爬蟲理解你的內容結構和含義
  • 優化關鍵頁面的加載速度——即使使用 SSR,太慢的加載時間也會導致爬蟲超時

低優先級(長期策略)

  • 建立獨立的 AI 爬蟲測試環境——使用 Puppeteer 或 Playwright 模擬 AI 爬蟲的行為
  • 監控 Search Console 中的索引狀態——雖然 Google 不等於 AI 搜索,但 Google 的索引問題通常是 AI 爬蟲問題的前兆

4. LLMs.txt 與 AI 爬蟲指引

一個值得關注的新趨勢是 LLMs.txt 文件——這是一個放置在網站根目錄的文件,明確告訴 AI 模型你的網站上有哪些內容、以及你希望 AI 如何引用這些內容。

雖然 LLMs.txt 是一個相對較新的標準,但它代表了一個重要的方向:主動告訴 AI 爬蟲如何與你的網站互動,而不是被動等待它們來發現。

對香港企業的建議:

  • 創建一個 llms.txt 文件,列出你希望 AI 引用的重要頁面
  • 在文件中提供每個頁面的簡短摘要,幫助 AI 理解頁面內容的價值
  • 確保 llms.txt 中列出的頁面在技術上是 AI 可讀取的

5. 不同 AI 爬蟲的行為差異

Stanula 的實驗揭示了不同 AI 爬蟲的行為差異,這對 GEO 策略有直接影響:

爬蟲JavaScript 處理能力主要特點
Googlebot較好(有限制)支持渲染,但時間有限,複雜 JS 仍會失敗
Bingbot中等對 JS 的支持正在改善,但仍不如 Googlebot
GPTBot有限主要讀取靜態 HTML,對 CSR 內容幾乎不可見
ClaudeBot有限與 GPTBot 類似,偏好靜態內容
PerplexityBot中等相對較好,但仍有 JS 限制

這意味著:如果你的網站依賴客戶端 JavaScript 渲染內容,你可能在 ChatGPT 和 Claude 中完全不存在,但在 Google AI Mode 中可能部分可見。

行動清單:今天可以做的三件事

第一件事:測試你的網站

打開瀏覽器,禁用 JavaScript,然後瀏覽你的網站。這是最直接、最便宜的技術 GEO 測試。記錄下:

  • 哪些頁面徹底無法顯示?
  • 哪些導航連結消失了?
  • 關鍵內容(產品、服務、聯絡方式)是否還能被讀取?

第二件事:檢查 robots.txt

打開 https://你的網站.com/robots.txt,確認沒有意外封鎖 AI 爬蟲。特別檢查是否包含以下指令:

User-agent: GPTBot
Disallow: /
User-agent: *
Disallow: /*.js$

這些指令可能導致 AI 爬蟲完全無法訪問你的網站或無法執行必要的 JavaScript。

第三件事:對重要的 Landing Page 實施 SSR

如果你的網站使用 JavaScript 框架,但大部分流量來自特定 Landing Page(如首頁、產品頁、服務頁),優先為這些頁面啟用伺服器端渲染或預渲染。

結語

Vinicius Stanula 的 41 天實驗發出了一個清晰的警號:技術層面的 AI 可讀性是 GEO 策略的基礎門檻,而許多網站正在跨不過這個門檻。 如果你的內容對 AI 爬蟲隱形,所有內容優化和品牌建設的努力都無法發揮作用。

對於香港的 SME 和營銷人員,第一步不是寫更多文章,而是確保你的網站能夠被 AI 爬蟲正確讀取。花一個下午測試你的網站,修復 JavaScript 依賴問題,這可能是你的 GEO 策略中回報最高的投資。

想在 AI 搜尋中被正確引用?先確保 AI 爬蟲能看到你的內容。到 /contact 聯絡我們做一次技術 GEO 審計。