
結構化資料會提高 AI 引用嗎?實測證據與迷思破解
結構化資料會提高 AI 引用嗎?整理 Ahrefs 1,885 頁對照追蹤、OtterlyAI 七平台實測、searchVIU 價格放置測試與 GEO 論文四份證據:直接抓取時多數 AI 讀不到 JSON-LD,對已被引用的頁面加標記推不動引用,53% 與三倍差距是相關而非因果。拆解三個常見迷思,說明間接路徑、有實證的 GEO 手法與小型對照實驗設計。
- 結構化資料
- Schema
- JSON-LD
- GEO
- AI 引用
- schema markup
- AI Citations
- AI Overviews 引用
- ChatGPT 引用
- rich result
- 結構化資料 SEO
- GEO 迷思
- AI 引用 研究
約 29 分鐘閱讀作者:Whoops 編輯團隊
本頁目錄
- 證據地圖:不同設計回答不同的問題
- 五成三與三倍差距:最會流傳的數字,為什麼證明不了因果
- 1,885 個頁面加了 Schema 之後:對照追蹤的三個發現
- 單站實驗能問的問題:OtterlyAI 的三階段實測
- 直接抓取時 AI 看見什麼:八個價格的放置測試
- 被張冠李戴的經典:GEO 論文測的從來不是 Schema
- 三個迷思,對著證據逐條拆
- 迷思一:過半被引用的頁面有 Schema,所以 Schema 提高引用
- 迷思二:AI 讀不到 JSON-LD,代表結構化資料已經沒用
- 迷思三:GEO 論文證明結構化資料能提升四成能見度
- Schema 真正站得住腳的位置:基礎 SEO 與間接路徑
- 有實證的 GEO 內容手法與新鮮度關聯
- 在自己網站上驗證:小型對照實驗的設計
- 把期待放對位置
把問題問得精準一點:在頁面上加了結構化資料之後,ChatGPT、Google AI Overviews 這些生成式系統引用這個頁面的次數會跟著變多嗎?這個問題在 2025 到 2026 年之間累積了夠多的一級證據,可以給一個有依據的回答:對「已經被 AI 引用的頁面」而言,目前的介入式實測看不到直接提升。Ahrefs 在 2026 年 5 月發表的追蹤研究鎖定了 1,885 個在觀察窗內新加上 JSON-LD 標記的頁面,與 4,000 個對照頁在施測日前後各 30 天的窗口內比較,三個平台的結果都貼著零:Google AI Overviews 相對下降 4.6%,AI Mode 與 ChatGPT 分別上升 2.4% 與 2.2%,後兩者的差距在統計上與雜訊難以區分。
被否定的是「直接提升」這個特定命題,不是結構化資料本身。在讀取層面,searchVIU 與 OtterlyAI 的兩份能力測試一致顯示,多數 AI 系統在即時抓取頁面時讀不到 JSON-LD 裡的內容。可是索引階段的角色、經由自然搜尋表現的間接路徑、複合式結果帶來的點擊率回報,證據都還站得住。把「AI 讀不到標記」直接推論成「結構化資料沒有用」,中間跳過了兩三個還沒被證偽的環節,這正是這個題目最常見的兩種極端說法共通的毛病。
接下來把六份證據依設計強度排開,說明每份證據能回答什麼、不能回答什麼,再逐條拆解三個流傳最廣的迷思,收在一個在自己網站就能重複的小型對照實驗設計。結構化資料的類型選擇、JSON-LD 的寫法與驗證流程,站上已有結構化資料完全指南深入說明,以下聚焦證據軸:哪些主張有實驗撐腰,哪些只是數字的優雅誤用。
證據地圖:不同設計回答不同的問題
這個題目的討論最常見的混亂,是把不同層級的證據當成同一種東西在引用。橫斷面的相關性觀察、介入式的對照實驗、針對能力的前後測試、官方文件的定位陳述,四種證據能回答的問題不一樣。先把它們擺對位置,後面的爭議有一半會自己消解。下表是 2023 年到 2026 年間與「結構化資料乘上 AI 引用」直接相關的證據清單。
| 證據 | 設計 | 能回答的問題 | 核心結果 |
|---|---|---|---|
| Ahrefs 600 萬 URL 橫斷分析(2026 年 5 月) | 大樣本相關 | 被引用的頁面長什麼樣 | 被 AI 引用的頁面帶 JSON-LD 的比例近三倍於未被引用頁面,53% 被引用頁面帶有 schema |
| Ahrefs 1,885 頁追蹤(2026 年 5 月) | 介入式對照(配對 DiD) | 加 schema 會不會提高引用 | 三平台變化貼零,AI Overviews −4.6% |
| OtterlyAI 單站實驗(2025 年 12 月至 2026 年 3 月) | 單站前後測+競品對照 | AI 讀得到 schema 嗎 | 7 平台僅 Gemini 讀得到,覆蓋率變動與競品同步 |
| searchVIU 價格放置測試(2025 年 10 月) | 能力測試(8 個放置點) | 直接抓取時讀到什麼 | 5 系統無一讀到只存在 JSON-LD 裡的價格 |
| GEO 論文(KDD 2024) | 學術基準測試(GEO-bench) | 內容層手法的效果量 | 統計、引文、引註提升能見度 30-40%,未測 schema |
| Google Search Central 文件 | 官方定位 | 官方承諾了什麼 | rich result 資格與內容分類,AI 功能沿用基礎 SEO 建議 |
一個實用的判讀原則:主張越接近因果,需要的證據設計就越嚴格。相關性觀察只能告訴你兩件事經常同時出現。要回答「加了標記之後引用會不會變多」,只有介入式的對照設計做得到。OtterlyAI 的單站實驗介於中間,價值在於它測了別人沒測的能力問題。searchVIU 的放置測試把「讀得到」拆成可以直接檢驗的機械事實。GEO 論文提供的是內容層手法的量化基準,與 schema 的因果問題其實是兩回事,後面會單獨處理這個最容易混淆的來源。
四份分析型研究放在一起看,會發現它們咬合得意外整齊。Ahrefs 的追蹤研究說「已被引用的頁面加了標記,引用沒有增加」。searchVIU 的能力測試補上機制面的解釋「直接抓取時,隱藏的標記內容根本進不了模型」。OtterlyAI 的唯一資訊測試用另一種方式確認同一件事。GEO 論文則把「那證據支持什麼」導向內容層的手法。因果問題、機制問題、替代方案,三個位置各有一份對口的證據,這種結構在行銷領域並不常見,也讓這個題目的結論比多數 GEO 話題更站得住。
還要留意平台之間的差異。AI Overviews 的引用行為與 Google 搜尋索引同源,走的是檢索再生成的路線。ChatGPT 與 Perplexity 的即時抓取各有各的管線。Google AI Mode 在 searchVIU 的觀察裡走索引路線,動態內容要等索引完成後才讀得到。同一個「AI 引用」名詞底下至少有三種機制,證據也必須按平台分開讀,這也是 Ahrefs 把三個平台分開列結果的原因。
五成三與三倍差距:最會流傳的數字,為什麼證明不了因果
Ahrefs 研究的起點是一次大規模橫斷分析:在 600 萬個 URL 的樣本裡,被 AI 引用的頁面帶有 JSON-LD 的機率,幾乎是未被引用頁面的三倍。換成另一個口徑:被 AI 引用的頁面之中,53% 帶有 schema 標記。這種數字天生適合放進簡報與投影片,也正是在簡報與投影片裡,它悄悄從描述變成了承諾,從「被引用的頁面過半有標記」滑向「加標記就會被引用」。
Ahrefs 團隊自己對這個數字的警覺,值得當成判讀範本。他們的說明很直白:schema 標記傾向出現在維護較好、技術體質較強的網站上,而這些網站同時把內容寫得更扎實、累積更多權重與外部連結,做了其他讓頁面被引用的每一件事。標記可能真的在做工,也可能只是搭了其他訊號的便車。橫斷資料天生分不出這兩種情境,這是設計上的限制,不是分析不夠用心。
把共同原因講得更白一點:會認真導入結構化資料的團隊,通常是那種也會修正網站速度、整理資訊架構、經營內容品質的團隊。AI 系統引用的是「這種網站的頁面」,標記只是這幅拼圖裡的一片。相關性數字的正確用法是拿來產生假設,拿來當結論就會誤導資源配置。要檢驗假設,需要的是追蹤同一批頁面在施測前後的變化,這正是下一節的設計。

五成三這個數字還有一個被忽略的正確用途:當產業現況的參考值。它告訴你同類頁面裡大概有多少比例帶有標記,做競品盤點或技術健檢時,這是現成的基準線,低於它不必然吃虧,高於它也不必然佔優勢,它描述的是分布,不是門檻。把它放回這個位置,數字就恢復了誠實。一旦越過這條線去暗示因果,同一個數字就開始說謊。判斷一個統計數字能不能引用,先看它有沒有被放在與其設計相符的位置上。
1,885 個頁面加了 Schema 之後:對照追蹤的三個發現
這份研究的做法值得細看。他們先從自家爬蟲資料庫回溯每個頁面的 HTML 歷史,標記出 JSON-LD 從無到有的那一天,那一天就是這個頁面的施測日。據此得到 2025 年 8 月至 2026 年 3 月之間新加上標記的 1,885 個頁面。接著為每個施測頁挑三個對照頁:來自不同網域、施測前引用量相近、且從未加過 JSON-LD。量測的窗口是施測日前後各 30 天,範圍涵蓋 Google AI Overviews、AI Mode、ChatGPT 三個平台。主要依據是配對版的差異中的差異(DiD)分析,這種設計先把平台整體的漲跌扣掉,剩下的才是標記的淨效果。
四種檢驗裡有一種特別值得認識:事件研究法。他們把引用量按週畫成曲線,檢查施測之前兩組頁面是否已經在分道揚鑣。這一步防的是「本來就在走下坡的頁面恰好加了標記」這種時間錯置的假象,曲線貼合就代表兩組起跑點相同,施測後的差距才有資格被歸因。讀前後對比型的研究時,先找有沒有這一層檢查,是快速判斷可信度的方法。
發現一:加 schema 沒有在任何一個平台出現明顯的引用提升。AI Overviews 相對對照組下降 4.6%,幅度小但統計上顯著。AI Mode 與 ChatGPT 分別上升 2.4% 與 2.2%,差距小到在幾千個網址的尺度上容易只是隨機雜訊。用他們自己的話收攏:加了 schema 之後,引用在整體上沒有出現大的提升。
發現二:不做對照會嚴重誤導。AI Mode 的原始前後對比是正 43%,看起來像大豐收,但對照頁在同一段時間幾乎同幅上漲,那是平台整體在爆發的痕跡。把平台趨勢剝掉之後,正 43% 縮水成 2.4%。這是評估所謂「AI 引用成長」時頭號重要的方法論細節:單看自己網站的前後變化,量到的經常是整個平台的潮汐,不是自己做的工。
發現三:那個 4.6% 的下降是真的,但小到需要小心解讀。統計顯著與效果量是兩件事:這個差距由純粹機率造成的機會約為兩千五百分之一,所以它大概率不是雜訊。可是換算成絕對量,平均每頁每天少約 12 次引用,而樣本裡多數頁面本來就有每天數百次的量體,相對幅度落在 4.6%。研究團隊用四種統計視角重驗同一組資料,指向同一個結論:AI Mode 與 ChatGPT 沒有增長,AI Overviews 的下降真實存在但小到他們無法斷定該不該歸因於標記本身。他們最一致的發現是:沒有什麼真的改變。讀到「統計顯著的下降」時同時問一句「絕對量是多少」,是避免被百分比修辭牽著走的基本功。
| 平台 | 相對變化(配對 DiD) | 判讀 |
|---|---|---|
| Google AI Overviews | −4.6% | 小幅但統計顯著的相對下降,原因不明,無法斷定歸因於 schema |
| Google AI Mode | +2.4% | 與零難以區分,原始 +43% 是平台趨勢,扣除後的殘值 |
| ChatGPT | +2.2% | 與零難以區分 |
邊界條件要誠實讀,這份研究的結論有三道明確的圍欄。第一,樣本裡的頁面本來就被 AI 大量引用,都在系統的考慮名單內。對已經被撿起來的頁面,加標記推不動。第二,對完全沒被 AI 看到的頁面,標記或許在協助被抓取、解析、建索引的環節仍有角色,但研究無法回答這一段,作者自己把這塊留白講清楚了。第三,其他技術限制包括:schema 類型全部合併分析,無法分辨 Article、FAQ、Product、HowTo、Organization 之間的差異。觀察窗只有施測後 30 天,若有慢熟的效應會被漏掉。只看 HTML 裡的標記,JavaScript 注入的動態標記不在範圍內。

這三道圍欄不是客套話,它們框出了「還不知道」的範圍。追蹤研究能宣稱的只有:在被引用頁面這個族群裡,加 JSON-LD 沒有帶來可見的引用紅利。把結論外推到全部網站、全部頁面類型、全部時間尺度,就超出了資料能支撐的範圍。誠實的版本反而更有用,它告訴你把標記當成 AI 引用槓桿的期望值在哪裡。
順著圍欄往下問,翻案的條件其實很具體。要是未來有人對「從未被 AI 收錄的頁面」做出同樣嚴謹的對照追蹤,或者把 schema 類型拆開重跑,發現某個特定類型有穩定效果,又或者把窗口拉到 90 天看到慢熟型增長,現在這個結論就該更新。科學式的樂觀是保留翻案空間,同時按現有證據行動:現有證據說的是,把標記從 AI 引用的期望清單裡移出去,放到它被驗證過的位置上。
單站實驗能問的問題:OtterlyAI 的三階段實測
OtterlyAI 在 2026 年 3 月更新的實測提供了另一種視角。他們在自家網站實作五種 schema 標記(FAQ、Organization、SoftwareApplication、Review Snippets、Article/BlogPosting),直接對 7 個主要 AI 搜尋平台下指令,並以 319 個提示追蹤品牌覆蓋率三個月,實驗窗從 2025 年 12 月 7 日到 2026 年 3 月 7 日,平台涵蓋 ChatGPT、Google AI Overviews、Google AI Mode、Perplexity、Microsoft Copilot、Gemini 與 Claude。作者開宗明義講明限制:一切數據來自 OtterlyAI 自己這個站,他們是 SaaS 品牌而非電商,結論不保證移植到每個產業。
第一階段問的是最基礎的問題:AI 平台到底讀不讀得到標記?他們逐一要求每個平台把指定頁面的 schema 程式碼抓出來。結果 7 個平台裡有 6 個做不到,只有 Gemini 正確取回 JSON-LD 資料。Claude 兩次都宣稱頁面上沒有 schema。ChatGPT 偵測不到原始碼裡的標記。AI Mode 提到了多個 schema 類型,卻混入一個頁面上根本沒有的 Service 類型。Copilot 只讀得到可讀文字,碰不到原始 HTML。
AI Mode 那個「幻覺」值得單獨看。它回傳的描述聽起來頭頭是道,卻包含不存在的標記類型。OtterlyAI 對此的判讀一針見血:一個自信回傳錯誤結構化資料的平台,並沒有在讀 schema,它是在生成讀起來像 schema 的文字。這對拿 AI 回答當讀取證據的驗證方式是一記警示:模型的回答是生成的產物,拿回答當讀取證據,可能量到的只是模型的語感。
讀不到的機械原因並不神祕。AI 搜尋工作流程裡的 HTML 轉 Markdown 管線,常把 script 標籤整個忽略或破壞掉,於是包在 script 裡的 JSON-LD,經常在模型看到頁面之前就已經被移除。歷史脈絡也把這件事襯得更清楚:schema 誕生於 2011 年,解決的是當年搜尋爬蟲無法可靠解讀非結構化網頁的問題。而語言模型不需要 FAQPage 標註也能理解一頁內容在問答。這段歷史說明標記原本要解決的問題,卻不能單憑模型理解問答的能力,推斷搜尋索引與即時抓取兩條管線如何處理標記。
第二階段量品牌覆蓋率的變化。只看三個實驗頁的口徑,三個月後的數字很戲劇化:AI Overviews 增加 611%、AI Mode 增加 42%,ChatGPT 減少 71%、Gemini 減少 35%、Copilot 減少 64%、Perplexity 持平。但數字大不等於證據強:12 月 7 日之後的幾週,OtterlyAI 的品牌覆蓋率上升約 6%,從 11 月約 27% 的基線走到 30% 出頭,而同一時間,沒有任何一個競品改動過 schema,所有競品的覆蓋率卻出現相當甚至更大的變動。作者自己的結論是:那波上升屬於演算法層面的變動,與 schema 無關。
全站口徑的數字更吸引眼球:三個月後 SERP features 增加 377%,AI Overviews 增加 1,500%。作者的解讀反而把功勞還給傳統搜尋:Google 明言 AI Overviews 建立在與傳統搜尋相同的索引與爬蟲之上,標記貢獻的是複合式結果的資格與索引端的訊號,所以那 1,500% 反映的是傳統 SEO 機制,而非 GEO 機制。他們也在測試紀錄裡留了一個合理的間接論點:標記似乎會影響 AI Overviews 對某個查詢被觸發的頻率,這是繼續在頁面上保留結構化資料的理由之一。這段拆解示範了正確的歸因姿勢:看到與 AI 有關的數字上漲,先問它走的是哪一條路徑,再決定功勞記在誰頭上。
第三階段是整個實驗的收口動作。他們在 FAQ schema 裡塞進一個全站其他地方都沒有、外部網站也不存在的問題:OtterlyAI 有多少員工住在葡萄牙?答案只存在標記裡,如果 AI 平台真的會讀 schema,這題就是送分題。唯一資訊測試的結果是:受測 AI 搜尋平台沒有動用 schema 來回答這個問題。這個設計的巧妙在於它排除了「內容太常見所以不需要標記」的反駁,資訊只存在標記裡,AI 沒答出來,就代表它沒去讀。
抓取測試的附帶發現,價值不輸主結論:各平台處理網頁內容的方式根本不同。Gemini 讀得到原始 HTML 結構。多數平台把頁面轉成 Markdown,結構化資料在轉換中整個消失。AI Mode 則不管頁面上實際有什麼,都生成聽起來合理的輸出。OtterlyAI 對此的提醒值得抄下來:這種碎片化影響 GEO 策略的每個層面,任何假設各平台有一致檢索層的技術實作,都建立在錯誤的地基上。對 Gemini 可見的東西,對 ChatGPT 或 Perplexity 可能不存在。翻成白話:不要用單一平台的測試結果幫所有平台下結論,也不要用一套技術方案期待處處通用。
OtterlyAI 的總結與 Ahrefs 的方向一致:在他們的多數平台量測裡,schema 標記沒有以可測量的方式直接影響 AI 引用行為。他們也指出,更早一批 SEO 的獨立小實驗同樣沒有找到「加標記直接改善 AI 搜尋能見度」的一致證據。兩份獨立的資料、兩種不同的設計、同一個方向,這在充滿軼事的 GEO 領域是難得的交叉驗證。單站實驗的結論強度有限,但它的三階段設計(能力測試、覆蓋率追蹤、唯一資訊測試)提供了可以複用的模板。
直接抓取時 AI 看見什麼:八個價格的放置測試
searchVIU 在 2025 年 10 月做的測試,把「AI 讀得到標記嗎」變成可以機械驗證的問題。他們為一個虛構產品做了測試頁,把價格資訊分散放在八種位置:直接可見的 HTML、JavaScript 在頁面載入後渲染進 DOM 的內容、只存在 JSON-LD 裡且頁面上完全看不到的價格、由 JavaScript 動態注入的 JSON-LD、藏在 meta 標籤裡的 Microdata、以可見形式嵌入的 Microdata,以及 RDFa 的隱藏與可見兩個變體。核心測試只有一句話:AI 系統能不能讀出純 JSON-LD 裡的資料。
結果的直接程度超出多數人預期:直接抓取時,沒有任何一個受測系統讀取 JSON-LD 標記,就算那個資訊在頁面上沒有別的地方看得到也一樣,五個受測系統沒有一個能使用隱藏的 schema 資料。最具指標性的單一數據是那個只存在 JSON-LD 裡的 8.99 歐元價格,五個系統全數沒有找到。這不是統計推論,是逐系統驗證的機械事實,也是它說服力的來源。
| 系統 | 找到的價格 | 行為特徵 |
|---|---|---|
| Gemini | 4/8(50%) | 唯一支援 JavaScript 渲染,找到動態載入的價格,仍忽略 JSON-LD 與隱藏 schema |
| ChatGPT | 3/8(37.5%) | 只解析可見 HTML,不執行 JavaScript,忽略隱藏標記 |
| Claude | 0/8(0%) | 過濾最激進,連清楚可見的價格都沒有取到 |
| Google AI Mode | 2/8(25%,索引後) | 走索引路線,索引完成後才找到部分價格 |
| Perplexity | 1/8(12.5%,索引後) | 選擇性極高,只收錄到 JavaScript 渲染進 DOM 的那一個價格,連靜態可見的商品都沒收錄 |
兩個但書讓這份測試的結論更立體。其一,ChatGPT 與 Gemini 在 searchVIU 的測試裡,都找到了可見 HTML 中的每一個價格。換句敘述,八個位置裡被讀得最穩的,正是讀者肉眼就看得到的那幾個。其二,searchVIU 對索引階段提出了明確標示為推論的假設:schema 可能在更早的階段被用上,索引階段很可能會抽取結構化資料,而 Google AI Overviews 與 Bing Copilot 能從搜尋索引取用這些資料。這個推論正好落在 Ahrefs 研究自認無法回答的空白上,兩份證據拼起來,地圖就完整了:即時抓取讀不到,索引階段可能有角色,但後者仍是待驗證的假設。
對內容經營者的直接啟示濃縮成一句:希望 AI 念出來的資訊,要存在讀者看得到的地方。價格、規格、時間、地點、問答,放在可見文字裡的版本是被讀取率最高的版本。標記可以做,但它服務的對象是搜尋索引與複合式結果,不是即時抓取的生成式模型,兩種用途不該混在同一個期望裡計價。
JavaScript 的對照結果補上一個容易被忽略的區分:即時抓取與索引是兩條不同的管線。Gemini 在即時抓取時支援 JavaScript,找到了動態渲染的那個價格。AI Mode 即時抓不到,卻在索引完成後找到同一個價格,searchVIU 以此推論 Google 的爬蟲在建索引階段會執行 JavaScript。同一份動態內容,即時抓取看得到與索引看得到,時間點與能力各不相同。做技術決策時把「AI 即時讀取」與「搜尋索引讀取」分開對待,才不會把一條管線的結論誤套到另一條上。
被張冠李戴的經典:GEO 論文測的從來不是 Schema
「GEO 研究顯示優化能把能見度提升 40%」這個數字若被用來支持結構化資料,應先核對原研究測了什麼:2023 年 11 月上傳、2024 年在 KDD 發表的 GEO 論文。論文透過評估展示 GEO 最多能把內容在生成式引擎回覆中的能見度提升 40%。他們還發表了 GEO-bench:一萬筆查詢的基準集,其中八成是資訊型查詢,並在真實部署的 Perplexity.ai 上用 200 筆測試樣本重驗了方法。關鍵是辨認實驗真正操作的變數。
翻開論文的方法清單會發現,九種受測手法全部是內容層的:權威語氣、加入統計數據、關鍵字堆砌、引用來源、加入引文、易讀化改寫、流暢度優化、獨特詞彙、專業術語。整篇論文裡 schema 這個詞一次都沒有出現。把 30-40% 的提升數字安到結構化資料頭上,等於把「加入統計數據」這類手法的成效,移植給一個論文根本沒有測量的變數,這在證據上是雙重跳接:先是換了變數,再是換了情境。
論文真正該被引用的方式其實對實作者更有用。表現最好的三個手法,依序是引用來源、加入引文、加入統計數據,在位置調整詞數指標上相對提升 30-40%,在主觀印象指標上提升 15-30%。效果依領域而異,需要按領域選擇手法。還有一個常被略過的發現:對搜尋結果裡排名較後段的網站,GEO 手法的幫助更大。以引用來源手法為例,排名第五的網站能見度提升 115.1%,排名第一的網站平均反而下降 30.3%。這代表內容層優化是相對公平的槓桿,不預先偏袒已經站在前排的大站。
三個迷思,對著證據逐條拆
迷思一:過半被引用的頁面有 Schema,所以 Schema 提高引用
這是相關與因果的混淆,也是最頑固的一個。五成三與三倍差距描述的是「同時出現」。把網站體質、內容品質、權重與連結這些共同原因納入考慮之後,介入實測裡的增長就消失了。Ahrefs 的收尾判讀值得直接引用:如果其他 SEO 工作已經做得不錯,JSON-LD 不會是那個解鎖。如果加標記的唯一理由是讓已經有能見度的頁面多拿 AI 引用,資料不支持這個押注。注意這句話的適用範圍是「已經有能見度的頁面」,對還沒被收錄的頁面,研究保持沉默,沉默不等於否定。
迷思二:AI 讀不到 JSON-LD,代表結構化資料已經沒用
讀不到是能力測試呈現的事實,但被判死刑的只有「直接路徑」,整條價值鏈沒有塌。第一,索引階段可能仍在使用標記,這是 searchVIU 標示清楚的推論,也與 AI Overviews 走索引路線的架構一致。第二,間接路徑存在:標記換來複合式結果資格與更好的自然搜尋表現,而部分 AI 平台把自然搜尋表現當成檢索訊號,這條鏈真實,但機制是間接的,中間隔著一層。第三,複合式結果、語音助理、知識圖譜、下游的實體識別,這些用途本來就有各自的證據與案例,不因為 AI 讀不到標記而消失。正確的結論是降級與重新定位,不是除名。
迷思三:GEO 論文證明結構化資料能提升四成能見度
論文沒有測 schema,測的是九種內容層手法,四成的數字屬於統計、引文、引用來源這三個表現最好的手法。若把這個數字錯安到標記上,就可能把資源導向論文沒有測試的標記工程,忽略實際受測的內容動作。修正引用方式時,應把論文的結論還給受測手法,再依自己的內容與量測目標安排測試。
Schema 真正站得住腳的位置:基礎 SEO 與間接路徑
Google 官方文件對結構化資料的定位一直很節制:它是一種標準化格式,用來提供頁面資訊並對頁面內容做分類,例如食譜頁的食材、烹調時間與熱量。加上它的直接回報,是讓搜尋結果有機會以複合式結果的形式呈現,提高與使用者互動的機會。案例層面,文件引用了 Rotten Tomatoes 的數據:在十萬個頁面加上結構化資料後,強化頁的點擊率比未強化頁高出 25%。這些才是標記被驗證過的價值所在。
對 AI 功能,Google 的說法同樣沒有給標記任何特別承諾。AI 功能說明文件寫明:AI 功能沿用與 Google 搜尋相同的基礎 SEO 最佳實踐。而在那串建議清單裡,結構化資料出現的形式是「確認你的結構化資料與頁面上的可見文字一致」。這是一致性要求,不是效果承諾。把它讀成「Google 表示 schema 有助於 AI 引用」,就超出了文件的字面範圍,也超出官方願意背書的邊界。
「與可見文字一致」是 Google 文件明列的要求。若把頁面看不到的內容寫進標記,就難以符合這項要求。searchVIU 的直接抓取測試也顯示,隱藏在標記裡的價格沒有被受測系統取出。兩份材料支持同一個實作原則:標記忠實描述讀者可見的頁面內容。要讓 AI 回答正確呈現資訊,先把關鍵資訊寫在可見文字裡,再讓標記與文字保持一致。

schema.org 的起源也支持這個定位。官方說明頁寫得清楚:這是一個社群協作計畫,使命是在網際網路上建立、維護並推廣結構化資料的詞彙,創始公司包括 Google、Microsoft、Yahoo 與 Yandex。它服務的對象是所有需要理解網頁的系統,搜尋索引是其中最成熟的消費者。生成式模型在檢索與回答階段怎麼用它,證據現況就是前面兩份能力測試呈現的樣子:即時抓取讀不到,索引階段待驗證。
所以合理的資源配置是把標記當成 SEO 的基本功來維持:該標的類型按官方規範標好,內容與可見文字保持一致,定期用驗證工具檢查,改版後跟著更新。期待值放在複合式結果、點擊率與索引理解上,而不是 AI 引用次數上。類型選擇與導入的完整流程,開頭提到的結構化資料指南有逐項的教學,不再重複。
有實證的 GEO 內容手法與新鮮度關聯
把標記的帳算清楚之後,可以把下一輪內容測試放在 GEO 論文有量測的手法上:把量化的統計數據寫進論述、放進可信來源的引文、為主張附上引用出處。論文在位置調整詞數與主觀印象兩組指標上都觀察到提升,也指出排名較後段的來源受益較大。不同領域的效果仍有差異,選用時要對照自己的內容類型與量測目標,相關的內容規劃方法可以再參考AI 偏好內容的規劃術。
另一份證據談的是被引用網址的年齡。Ahrefs 在 2025 年 7 月發表的另一份研究分析了 7 個 AI 搜尋平台的 1,700 萬次引用:AI 助理引用的網址平均年齡是 1,064 天,自然搜尋結果裡的網址平均 1,432 天,相差 25.7%。這是網址年齡與引用情況的觀察,沒有測試更新既有頁面的效果,也不能與加標記的對照追蹤視為同一套資料。若要評估更新內容是否增加引用,仍需對更新頁與可比頁面做後續觀察。
還有一個實作原則:讓關鍵資訊存在於可見文字,這是 searchVIU 測試最實用的教訓。在會直接抓取的系統裡,可見內容是被讀得最可靠的位置,隱藏的標記則全數被略過。價格、規格、步驟、問答這些希望被 AI 念出來的資訊,放在讀者看得到的地方,被讀取的機會最穩定。FAQ 的正確做法因此是雙軌:可見的問答區塊同時服務讀者與 AI,標記版本服務搜尋引擎的結構理解,兩邊內容一致,誰也不依賴誰。想系統性安排這類內容,被引用與被推薦的內容設計與AEO 的答案引擎思維有更完整的框架。
在自己網站上驗證:小型對照實驗的設計
Ahrefs 把他們的方法縮小成站長可以重複的版本。選 5 到 10 個準備加 JSON-LD 的頁面當測試組,理想條件是已經有一些 AI 引用當基準,因為零引用的頁面會讓你分不出「標記沒效」與「本來就不會被引用」。再選引用量相近、維持不加標記的頁面當對照組。記錄兩組的基準引用量,只對測試組動 schema,測試期間其他任何東西都不改。30 天後比較兩組。判讀的關鍵在對照組:問題要問成「測試組有沒有比對照組多漲」,單看測試組的前後變化,量到的經常是平台趨勢。

追蹤資料的來源,這份研究用的是 Ahrefs 的 Brand Radar,站上有Brand Radar 的評測與口徑解析可以參考。GEO 工具的橫向比較也把量測、研究、標記、落地四種用途做了分工。工具不是重點,設計才是:有對照組的粗糙數據,比沒有對照組的精緻儀表板更能回答問題。
- 先記基準再動工:兩組頁面在各平台的引用量,改造前先截圖或匯出存檔。
- 一次只改一個變數:測試期間不動標題、不動內文、不動內鏈,避免功勞記錯帳。
- 對照組誠實配對:拿引用量相近的同類頁面,不拿首頁對深層文章頁。
- 記下觀察窗:Ahrefs 只量施測後 30 天,並指出 60 或 90 天可能揭露較慢才出現的變化。
- 與對照組比,不與自己比:兩組同漲或同跌時,量到的是平台,不是施測。
兩個技術細節會直接影響自測的判讀。窗口長度:Ahrefs 只量施測後 30 天,團隊指出 60 或 90 天可能看見較慢才出現的變化。若拉長自測窗口,應把結果視為對延遲效應的額外檢查,不能只憑觀察天數判定效果更可靠。標記形態:研究只看 HTML 裡的靜態標記,不含 JavaScript 注入的動態標記,而 AI 爬蟲對兩者的對待似乎不同,所以測什麼就部署什麼,別拿靜態版的結果替動態版背書。這類細節在簡報裡常常只是 footnote,在自家數據裡卻會影響結論能否套用。
這套模具的適用範圍遠大於 schema。改標題、加章節、換開頭句、調整內鏈,同樣的測試組加對照組結構都適用。GEO 領域的說法多、快、雜,能量測的說法才有機會被改進,把行銷預算放在可驗證的動作上,是面對新平台週期最抗風險的姿勢。執行前把GEO 的基本框架與AI 爬蟲的日誌分析放在一起看,可以先把「AI 到底有沒有來抓我的站」這個前置問題回答掉,再談優化變數。
把期待放對位置
不同類型的網站還能把結論再細一層。內容站與服務型官網的證據處境,就是這四份研究呈現的樣貌:標記對 AI 引用的直接效益沒有支撐,價值回到 rich result 與索引理解。商品頁處境略不同,OtterlyAI 特別註明他們是 SaaS 而非電商,商品、價格、評論類標記在電商情境的行為可能不同,這一塊的證據還薄,不宜直接套用否定結論。還沒被 AI 收錄的新站又是第三種處境,Ahrefs 明講無法回答標記在「被抓取、解析、建索引」環節的角色。若要導入基礎標記,先按頁面需求評估所需工作,不要把尚未證實的 AI 引用紅利算進預期回報。
回到標題的問題:結構化資料會提高 AI 引用嗎?對已經被 AI 引用的頁面,兩份獨立的介入與單站實測都沒有看到直接提升。在即時抓取的場景,多數系統目前讀不到 JSON-LD。但結構化資料在複合式結果、索引理解與實體識別上的價值,有官方文件與案例支撐,經由自然搜尋表現的間接路徑也真實存在。定位講清楚之後,答案不悲觀:它是 SEO 的基本功,只是從來就不該被記在 GEO 的帳上。
行動的優先順序因此明朗:讓關鍵資訊存在於可見文字,把統計數據、可信引文與引用出處織進內容,檢驗內容更新是否影響引用,標記按規範標好但對它誠實計價。AI 搜尋的引用機制仍在變動,這張證據地圖也會過期,屆時該做的第一件事,是把新的實測放回同一張表裡對照,而不是回到印象與傳聞。對於想持續追蹤自己在 AI 回答中能見度的團隊,從AI Overviews 的整體衝擊與策略切入,會比押注單一技術變數更穩。





