一句話總結
Search Engine Land 於 8 月 19 日刊登 LOCOMOTIVE 的 Associate Director of SEO Vinicius Stanula 的技術文章,通過一個長達 41 天的實驗 證實:依賴 JavaScript 渲染內容和連結的網站,可能完全無法被 AI 搜尋引擎的爬蟲(GPTBot、Googlebot、Bingbot、ClaudeBot 等)發現。對於香港眾多使用 React、Vue、Next.js 等 JavaScript 框架的中小企網站,這是一個不容忽視的 GEO 致命缺陷——如果你的內容對 AI 爬蟲隱形,你的 GEO 策略從一開始就注定失敗。
41 天實驗的關鍵發現
實驗設計
Stanula 的實驗始於一個簡單的問題:AI 爬蟲能否像傳統搜尋引擎爬蟲一樣,正確讀取和索引 JavaScript 渲染的頁面?為了回答這個問題,他設定了多個測試場景:
- 測試不同類型的爬蟲(GPTBot、Googlebot、Bingbot、ClaudeBot、AppleBot 等)
- 測試 JavaScript 生成內容的不同方式(SSR 伺服器端渲染 vs CSR 客戶端渲染)
- 測試 JavaScript 連結(
onclick、<a href="#" onclick="...">)與標準 HTML 連結(<a href="/page">)的差異 - 記錄了長達 41 天的爬取和索引行為
核心發現
實驗結果令人震驚:
- JavaScript 生成的連結經常被忽略——如果網站的導航系統完全依賴 JavaScript 來生成連結(如 SPA 應用中常見的
router.push()或onclick處理器),爬蟲可能根本「看不到」這些連結 - 客戶端渲染(CSR)頁面的內容幾乎不可見——如果頁面的主要內容是通過客戶端 JavaScript 加載的,爬蟲可能在獲取到內容之前就放棄了渲染
- 不同爬蟲的行為差異巨大——Googlebot 對 JavaScript 的處理能力最強,但 GPTBot、ClaudeBot 等 AI 爬蟲對 JavaScript 的支持非常有限
- 爬蟲超時是常見問題——許多爬蟲只給 JavaScript 渲染幾秒鐘的時間,如果內容沒有在這段時間內完成渲染,就會被視為空白頁面
為什麼這對 GEO 至關重要
傳統 SEO 領域,Google 已經多年來支持 JavaScript 渲染(通過 Web Rendering Service),雖然有限制但總體可行。然而,AI 搜尋的生態完全不同:
- ChatGPT 的 GPTBot、Claude 的 ClaudeBot、Perplexity 的 PerplexityBot 等 AI 爬蟲,對 JavaScript 的支持遠不如 Googlebot
- 這些 AI 爬蟲通常只獲取靜態 HTML 內容,不會執行複雜的 JavaScript
- 即使它們嘗試渲染,時間限制也更嚴格
- 如果 AI 爬蟲無法讀取你的內容,你的品牌就永遠不會出現在 AI 搜尋的回應中
技術 GEO 的基礎:確保 AI 爬蟲能看到你的內容
第一個檢查:你的網站能否在沒有 JavaScript 的情況下工作?
Stanula 的建議非常直接:在你的瀏覽器中禁用 JavaScript,然後看看你的網站還剩下什麼。
這是測試 AI 爬蟲體驗的最簡單方法。步驟:
- 打開瀏覽器的開發者工具
- 在設定中找到禁用 JavaScript 的選項
- 重新加載你的網站
- 檢查:
- 是否還有文字內容可以被讀取?
- 導航連結是否還能點擊並跳轉到其他頁面?
- 產品資訊、服務描述等關鍵內容是否還在?
如果禁用 JavaScript 後你的網站只剩下一片空白或一個 loading spinner,意味著 AI 爬蟲也看不到你的內容。
第二個檢查:核心網頁指標測試
使用 Google 的 PageSpeed Insights 或 Search Console 的「檢查任何 URL」工具,查看 Google 看到的頁面是什麼樣子的。如果 Google 看到的版本與用戶看到的版本有顯著差異,AI 爬蟲看到的問題可能更大。
第三個檢查:使用 curl 或 wget 模擬爬蟲
在終端中執行以下命令,查看 AI 爬蟲接收到的原始 HTML:
curl -sL https://你的網站.com | head -100
如果返回的 HTML 中沒有你的主要內容(例如產品描述、文章正文等),說明你的內容是通過 JavaScript 動態加載的,AI 爬蟲可能無法讀取。
對香港品牌的 GEO 含意
1. 技術 GEO 是 AI 搜尋可見度的基礎
許多香港企業在投資 GEO 時,首先想到的是內容策略——撰寫 AI 友好的文章、優化關鍵詞、建立權威性。但 Stanula 的實驗提醒我們:所有這些努力的前提是,AI 爬蟲能夠看到你的內容。
- 如果 AI 爬蟲無法讀取你的網站,再好的內容也是浪費
- 技術 GEO 應該是 GEO 策略的第一步,而不是最後一步
- 大多數香港中小企網站使用 WordPress 或其他 CMS 時,預設情況下應該是 AI 友好的,但如果你使用了自定義的 JavaScript 框架或 SPA 架構,就需要特別注意
2. 香港常見的網站技術問題
根據對香港市場的觀察,以下技術問題最常見:
- 使用 React/Vue/Angular 構建的 SPA(單頁應用)——雖然用戶體驗流暢,但對 AI 爬蟲來說幾乎隱形,除非使用 SSR(伺服器端渲染)
- 通過 JavaScript 動態加載內容的頁面——如「查看更多」按鈕後載入的內容、分頁加載的產品列表等
- 使用 JavaScript 處理的導航系統——
<a>標籤中沒有真實的href屬性,轉而使用onclick處理 - 使用
.htaccess或 JavaScript 重定向——AI 爬蟲可能無法跟隨複雜的重定向 - 依賴 Cookie 或 LocalStorage 的內容展示——AI 爬蟲通常不會執行這些客戶端存儲機制
3. 修正方案與優先級
高優先級(立即行動)
- 確保所有重要頁面使用標準的
<a href="/page">HTML 連結——這是最簡單也最重要的修正 - 啟用伺服器端渲染(SSR)——如果你使用 React(Next.js)、Vue(Nuxt.js)或 Angular(Angular Universal),確保 SSR 已正確配置
- 在 robots.txt 中不要錯誤地屏蔽 AI 爬蟲——檢查你的
robots.txt文件,確保GPTBot、ClaudeBot、PerplexityBot等沒有被禁用
中優先級(近期計劃)
- 實現靜態生成(SSG)或增量靜態生成(ISR)——對於內容網站,預先生成靜態頁面比 SSR 更友好
- 實施結構化數據(Schema.org)——這幫助 AI 爬蟲理解你的內容結構和含義
- 優化關鍵頁面的加載速度——即使使用 SSR,太慢的加載時間也會導致爬蟲超時
低優先級(長期策略)
- 建立獨立的 AI 爬蟲測試環境——使用 Puppeteer 或 Playwright 模擬 AI 爬蟲的行為
- 監控 Search Console 中的索引狀態——雖然 Google 不等於 AI 搜索,但 Google 的索引問題通常是 AI 爬蟲問題的前兆
4. LLMs.txt 與 AI 爬蟲指引
一個值得關注的新趨勢是 LLMs.txt 文件——這是一個放置在網站根目錄的文件,明確告訴 AI 模型你的網站上有哪些內容、以及你希望 AI 如何引用這些內容。
雖然 LLMs.txt 是一個相對較新的標準,但它代表了一個重要的方向:主動告訴 AI 爬蟲如何與你的網站互動,而不是被動等待它們來發現。
對香港企業的建議:
- 創建一個
llms.txt文件,列出你希望 AI 引用的重要頁面 - 在文件中提供每個頁面的簡短摘要,幫助 AI 理解頁面內容的價值
- 確保
llms.txt中列出的頁面在技術上是 AI 可讀取的
5. 不同 AI 爬蟲的行為差異
Stanula 的實驗揭示了不同 AI 爬蟲的行為差異,這對 GEO 策略有直接影響:
| 爬蟲 | JavaScript 處理能力 | 主要特點 |
|---|---|---|
| Googlebot | 較好(有限制) | 支持渲染,但時間有限,複雜 JS 仍會失敗 |
| Bingbot | 中等 | 對 JS 的支持正在改善,但仍不如 Googlebot |
| GPTBot | 有限 | 主要讀取靜態 HTML,對 CSR 內容幾乎不可見 |
| ClaudeBot | 有限 | 與 GPTBot 類似,偏好靜態內容 |
| PerplexityBot | 中等 | 相對較好,但仍有 JS 限制 |
這意味著:如果你的網站依賴客戶端 JavaScript 渲染內容,你可能在 ChatGPT 和 Claude 中完全不存在,但在 Google AI Mode 中可能部分可見。
行動清單:今天可以做的三件事
第一件事:測試你的網站
打開瀏覽器,禁用 JavaScript,然後瀏覽你的網站。這是最直接、最便宜的技術 GEO 測試。記錄下:
- 哪些頁面徹底無法顯示?
- 哪些導航連結消失了?
- 關鍵內容(產品、服務、聯絡方式)是否還能被讀取?
第二件事:檢查 robots.txt
打開 https://你的網站.com/robots.txt,確認沒有意外封鎖 AI 爬蟲。特別檢查是否包含以下指令:
User-agent: GPTBot
Disallow: /
User-agent: *
Disallow: /*.js$
這些指令可能導致 AI 爬蟲完全無法訪問你的網站或無法執行必要的 JavaScript。
第三件事:對重要的 Landing Page 實施 SSR
如果你的網站使用 JavaScript 框架,但大部分流量來自特定 Landing Page(如首頁、產品頁、服務頁),優先為這些頁面啟用伺服器端渲染或預渲染。
結語
Vinicius Stanula 的 41 天實驗發出了一個清晰的警號:技術層面的 AI 可讀性是 GEO 策略的基礎門檻,而許多網站正在跨不過這個門檻。 如果你的內容對 AI 爬蟲隱形,所有內容優化和品牌建設的努力都無法發揮作用。
對於香港的 SME 和營銷人員,第一步不是寫更多文章,而是確保你的網站能夠被 AI 爬蟲正確讀取。花一個下午測試你的網站,修復 JavaScript 依賴問題,這可能是你的 GEO 策略中回報最高的投資。
想在 AI 搜尋中被正確引用?先確保 AI 爬蟲能看到你的內容。到 /contact 聯絡我們做一次技術 GEO 審計。