SEO 重複內容指南:是什麼、如何解決負面影響
重複內容不會被 Google 懲罰,卻會瓜分權重、浪費檢索預算。本文解析重複內容的八個技術成因、內容層面近似重複、跨網域轉載風險,並教你用 canonical、301 轉址與檢查工具正確收斂版本、拿回排名主導權。
作者:褚崇名(Sliven)
本頁目錄
- 先講結論:沒有「重複內容懲罰」,但有「重複內容代價」
- 把三件事分清楚:完全重複、近似重複、關鍵字自我競爭
- 完全重複(exact duplicate)
- 近似重複(near duplicate)
- 關鍵字自我競爭(keyword cannibalization)
- 重複內容從哪裡來:八個常見技術成因
- 一個服飾電商的典型情境:篩選器炸出幾千個重複網址
- 真正要算的四筆帳:重複內容到底損失了什麼
- 四步把重複內容抓出來
- 第一步:打開 GSC 的網頁索引報表
- 第二步:用 site: 指令做快速抽查
- 第三步:用爬蟲工具整站掃描
- 第四步:檢查 canonical 被尊重的程度
- 對症下藥:canonical、301、noindex、robots.txt 怎麼選
- canonical:保留頁面、收攏權重的首選
- 301:該消失的頁面就徹底消失
- noindex 與 robots.txt:控制收錄與爬取的兩道閘門
- 內容層面的重複:兩篇文章搶同一個字,該合併還是分流
- 被別人抄,或你主動轉載:外部重複內容怎麼辦
- 情境一:你主動把內容授權轉載出去
- 情境二:你的內容被別人抄走
- AI 讓重複內容問題變得更尖銳
- 收尾:一份重複內容健檢行動清單
你也許曾經在 Google Search Console(簡稱 GSC)裡看到「重複網頁」這個檢索狀態,心裡一驚,以為網站被 Google 判了死刑?很多人聽到「重複內容(duplicate content)」四個字,腦袋裡浮現的是「懲罰、降權、被消失」。我得先把這個最大的誤解拆掉:Google 明確說明,除非內容重複是為了欺騙或操弄搜尋結果,否則不會因為一般的重複內容而處罰網站,這點 Google Search Central Blog 在〈Demystifying the duplicate content penalty〉一文中有明確說明。真正可能影響流量的,是重複網址背後沒處理好的索引、連結與爬取訊號。接下來會從「Google 怎麼看待重複內容」一路走到「怎麼用 canonical、301、noindex 把問題收乾淨」,並附上一份可以在 GSC 執行的健檢清單。
先講結論:沒有「重複內容懲罰」,但有「重複內容代價」
這是 SEO 領域裡最常被問到的問題之一:「我的網站有兩頁內容幾乎一樣,Google 會不會把我整站降權?」答案是不會整站降權,但會產生四種你感覺得到、卻說不清楚的代價。我會在後面把這四筆帳算給你看。
Google 對重複內容的真實運作機制是「分群與去蕪存菁(grouping and deduplication)」。你可以把它想成圖書館員拿到五本內容差不多的書,他不會把書燒掉,而是挑一本放上架、其他收進倉庫;這個分群邏輯在 Google 的 How Search Works「deduplication」段落有說明。換句話說,Google 會把一群長得很像的網址「群組」起來,選一個它認為最適合的版本當作「標準版本(canonical)」放進搜尋結果,其他的就不再單獨顯示。
所以問題真正的核心在於「你把決定權交給了 Google」。會不會被懲罰這件事,其實可以放一邊。當你沒有主動告訴 Google 哪一頁才是正本,它就只能自己猜。猜對了沒事,猜錯了,你就會看到一些讓人抓狂的狀況:
- 你精心寫的正式商品頁沒排名,反而是帶著
?sort=price參數的篩選頁在吃流量。 - http 版本被收錄了,https 版本反而消失,瀏覽器還跳出「不安全」警告。
- 有 www 跟沒 www 兩個版本同時存在,外部連結與內部連結訊號分散到不同網址。
這些都不是「懲罰」,是 Google 在你沒有給清楚訊號的情況下,做出了一個對它來說合理、對你來說卻很傷的選擇。所以整篇文章的核心觀念只有一句:重複內容要處理,不是因為怕被罰,而是因為你要把「哪一頁該排名」的主導權拿回自己手上。
把三件事分清楚:完全重複、近似重複、關鍵字自我競爭
很多人把這三件事混成一談,結果用錯方法處理。我先幫你把它們拆開,因為解法完全不一樣。
完全重複(exact duplicate)
兩個網址的內容一模一樣,可能只是 URL 不同。例如你的商品頁同時存在於 https://example.com/product-a 和 https://www.example.com/product-a,或一個有結尾斜線、一個沒有。這種最容易處理,多半靠 canonical 或 301 就能收掉。
近似重複(near duplicate)
兩個網址的內容高度相似但不完全相同,例如同一段產品描述在不同分類頁重複出現、只差一兩行規格表,或兩篇文章討論同一個主題但措辭雷同。Google 的演算法有能力偵測這種「實質重複」,判定標準看的是內容對讀者來說是否提供了「有意義的差異」,純粹去算字數比例沒有太大意義。如果你寫了兩篇文章,標題不同、但讀者看完一篇跟看完兩篇得到的資訊幾乎一樣,那就是近似重複的高風險區。
關鍵字自我競爭(keyword cannibalization)
這是另一個獨立的問題:你有兩篇以上的頁面,都在搶同一組關鍵字,但內容本身可能不重複。Google 不知道該推哪一篇,結果兩篇的排名都被彼此拉低。這跟重複內容的成因、解法都不一樣,通常要靠整併、重新定位搜尋意圖來處理。如果你懷疑自己遇到的是這個狀況,可以直接看關鍵字自我競爭的專文處理流程,這裡我不重複展開。
把這三層分清楚,你才知道手上的問題到底該用「技術手段(canonical、301)」還是「內容手段(整併、改寫、重新切題)」來解。我用一個表格把判斷邏輯濃縮起來,你之後遇到狀況可以回頭對照:
| 類型 | 內容是否相同 | 是否搶同關鍵字 | 主要解法 |
|---|---|---|---|
| 完全重複 | 完全相同,只是 URL 不同 | 通常是 | canonical 或 301(技術手段) |
| 近似重複 | 高度相似、有部分重疊 | 可能 | canonical、或整併改寫(看情境) |
| 關鍵字自我競爭 | 不一定相同 | 是,兩篇搶同字 | 整併或重新定位搜尋意圖(內容手段) |
下面我會照這個邏輯分成兩塊:先講技術成因,再講內容層面。
重複內容從哪裡來:八個常見技術成因
「重複內容」聽起來像是有人故意抄襲,但網站自己的技術設定也常會產生大量重複網址。這些網址多半是網站在擴充功能與內容時「長出來」的副產品,跟內容抄襲沒有關係。以下是健檢時常見的成因:
- www 與非 www:
www.example.com跟example.com如果都開放存取又沒設標準化,就是兩份一樣的網站。這是入門級的地雷,www 跟非 www 的差異與正確設定有完整做法。 - http 與 https:舊的 http 版本沒有自動轉址到 https,兩個版本同時被收錄。不只重複,http 版還會讓瀏覽器跳警告、拖累信任度。HTTP 換 HTTPS 的完整攻略可以一次解掉。
- 結尾斜線(trailing slash):
/product/跟/product在很多伺服器設定下是兩個獨立網址,回傳一樣的內容。 - 查詢參數與篩選器:這是大魔王。電商的分類頁加上排序、顏色、尺寸、價格區間篩選,同一個分類頁可以變出幾十、幾百個 URL 變體。服飾電商是最容易炸出誇張數量的情境,後面會細講。參數到底是什麼、怎麼產生這些變體,可以看網址查詢參數的基礎介紹。
- 分頁(pagination):文章或商品列表分成多頁,每一頁的標題、meta 幾乎一樣,只有列表內容不同。
- 列印版與 AMP 版:早期網站常有一個
?print=1的純文字列印版,或 AMP(Accelerated Mobile Pages)版本,跟原頁內容重複。 - 多語系與多地區版本:同一份內容翻成不同語言,或針對不同地區(如台灣繁中、香港繁中)提供近似版本時,應為各版本設定正確且雙向回指的 hreflang,並讓 canonical 指向同語言的標準版本。這部分可參考多語言網站的架構設計。
- 測試站與產品資料交換:開發中的測試環境(staging site)如果沒有登入或密碼保護,可能被搜尋引擎發現並索引。robots.txt 只能管理爬取,不能當成存取控制;需要保密的測試站應限制登入或以伺服器驗證保護。電商常見的產品資料交換(product feed)也會讓相同規格文字出現在多個網站。這類頁面可加入自有的購買指南、實測資訊或比較表格,提供制式描述之外的價值。
這八個成因有一個共同特徵:它們都不是內容問題,是網址問題。同一份內容被好幾個不同的 URL 同時掛載,Google 爬到每一個都以為是新頁面。所以解題的方向很明確:把力氣花在「統一網址、告訴 Google 哪個才是正本」上,內容本身其實不用動。
一個服飾電商的典型情境:篩選器炸出幾千個重複網址
以一個常見的服飾電商情境為例,狀況通常是這樣。站長最常提出的疑問是「為什麼我們分類頁的流量一直上不來,明明商品很多」。用爬蟲工具把整站爬一遍,往往會發現一個驚人的事實:一個「羊毛大衣」的分類頁,在 Google 眼裡其實是上千個不同的網址。
怎麼來的?網站為了讓使用者方便篩選,在分類頁上掛了一堆參數:
?sort=price_asc(依價格低到高排序)?color=silver&brand=x(篩銀色、某品牌)?page=2&sort=price_desc(第二頁、依價格高到低)- 再加上工作階段 ID(session ID)、追蹤碼(UTM)等參數
這些參數排列組合下來,商品列表可能只改變順序或顯示子集,但 URL 全都不一樣。對大型或更新頻繁的網站而言,搜尋引擎若持續爬取大量重複變體,可能降低重要商品頁被及時重新爬取的效率;Google 也可能選到你不希望展示的參數網址作為 canonical。
這個情境要怎麼收,會在後面一起說明。對電商、內容站與任何有列表頁加篩選器的網站來說,參數造成的重複內容不一定會直接降低排名,卻可能讓索引與爬取管理變得混亂,尤其大型網站更需要及早盤點。
真正要算的四筆帳:重複內容到底損失了什麼
既然沒有懲罰,那到底會損失什麼?我把實務上會遇到的代價整理成四筆帳,這才是你該在意的:
| 代價 | 發生機制 | 你會看到的症狀 |
|---|---|---|
| 1. 選錯標準網址 | Google 自己猜 canonical,可能選到帶參數、沒 www、或 http 的版本 | 搜尋結果出現一個你不想讓人看到的醜網址;正式頁排名反而掉 |
| 2. 分散連結訊號 | 別人連到不同的重複版本,外部連結訊號分散到多個網址 | 搜尋引擎需要自行整併訊號;正確 canonical 或轉址可協助集中,詳見反向連結指南 |
| 3. 吃掉爬取預算 | 爬蟲把時間花在重複變體上,重要頁面排不到被爬 | 新頁面遲遲不被收錄、大型網站更新速度變慢(見爬取預算優化) |
| 4. 體驗與數據混亂 | 同一份內容被當成多個頁面,流量、點擊率、跳出率全部被拆碎 | 分析數據失真,無法判斷某一頁的真實表現 |
這四筆帳裡,前三筆會影響搜尋引擎選擇與處理網址的效率,第四筆影響你做決策的依據。重複內容通常不是突然讓網站消失的問題,而是讓標準網址、連結訊號與報表逐漸變得難以管理。
把「哪一頁該排名」的決定權交給 Google,等於把自家大門的鑰匙交給一個不認識路的路人,他可能把你帶對地方,也可能帶你去一條又臭又長的參數網址。賭他猜對太冒險了,自己把鑰匙拿穩才踏實。
四步把重複內容抓出來
知道代價之後,下一步是先看清楚自己的站到底有沒有問題、問題在哪。我習慣用接下來這四個步驟,由淺入深,不需要花大錢買工具就能做:
第一步:打開 GSC 的網頁索引報表
在 Google Search Console 的「網頁索引」報表裡,會有「重複網頁,Google 選擇了不同的標準網址」等狀態,可先從範例網址辨認問題類型。報表不會替每個重複網址完整列出 Google 選定的 canonical;要確認單一網址,應再使用「網址檢查」查看使用者宣告與 Google 選定的標準網址。報表怎麼看、欄位代表什麼,可以對照GSC 網頁索引報表的解讀。
第二步:用 site: 指令做快速抽查
在 Google 搜尋框輸入 site:你的網域,看看被收錄的網址清單。如果你看到一堆帶參數、帶 session ID 的網址出現在清單裡,那就是重複內容已經被收錄的警訊。你也可以用 site:example.com inurl:sort= 這種組合,直接抓特定參數類型的網址。雖然 site: 指令的結果不完整,但當成快速的 sanity check 很好用。
第三步:用爬蟲工具整站掃描
site: 指令只能看被收錄的,看不到沒被收錄但會被爬的重複網址。這時候要靠整站爬蟲工具,例如 Screaming Frog。它可以把你的網站像 Google 爬蟲一樣爬一遍,然後在「URLs」分類下直接標出哪幾個網址的內容完全相同、標題重複、meta description 重複。這一步是找出「潛在重複」的關鍵,因為很多重複網址根本還沒進到 Google 的視野,但只要被爬到就會出問題。
第四步:檢查 canonical 被尊重的程度
就算你已經設了 canonical,Google 也不一定照單全收。GSC 的「網址檢查工具」裡有一欄「Google 宣告的標準網址」,把它跟你自己設的 canonical 比對。如果兩邊不一致,代表你的 canonical 訊號不夠強,Google 不採信,通常是因為內部連結、外部連結、sitemap 全都指向另一個版本,訊號打架。這個檢查能避免你以為問題解了、其實沒解的盲區。
這四步走完,你手上應該會有一份清單:哪些網址被判為重複、它們被 Google 指向哪個 canonical、還有哪些潛在重複沒被收錄但存在。有了這份清單,才能對症下藥。一個提醒:清單出來之後不要急著一次全改,先依「對排名與流量的影響」排優先順序,先處理那些會吃到流量、或被 Google 選成 canonical 的問題網址,再回頭收掉低風險的邊角案例。一次動太多,反而會讓你分不清改了什麼造成後續的波動。
對症下藥:canonical、301、noindex、robots.txt 怎麼選
這四個工具是最常被搞混的一組。很多人一律用 301、或一律用 canonical,結果該轉的沒轉、該留的沒留。我用一個表格先把「什麼時候用什麼」講清楚,再逐一說明。
| 情境 | 該用的工具 | 為什麼 |
|---|---|---|
| 兩個網址內容完全相同,且舊網址不再需要存在 | 301 永久轉址 | 直接把使用者與權重導到正本,乾淨俐落;舊網址實質消失 |
| 兩個網址內容相同,但兩個都需要可被存取(例如列印版、參數篩選頁) | rel canonical | 頁面保留給使用者,但告訴 Google 權重歸到正本;canonical 完整設定與標準網址標記有細節 |
| 頁面不該被收錄(篩選結果、內部搜尋結果頁、感謝頁) | noindex | 允許爬取與跟連結,但禁止進入索引;noindex 的作用要看清楚 |
| 公開網址不需要被爬取(例如部分無限參數組合) | robots.txt 管理爬取 | 可減少爬取,但不能保證網址不被索引,也不能保護後台或私人內容;詳見robots.txt 與 noindex 的差異 |
canonical:保留頁面、收攏權重的首選
重複網址需要同時保留給使用者時,canonical 通常是合適的選項。它在網頁的 <head> 裡放一行 rel="canonical",向 Google 指出偏好的標準網址。頁面仍能被使用者打開,Google 則會把 canonical 視為強訊號,嘗試把重複版本的索引與連結訊號整併到標準網址;它不是保證,也不代表所有「權重」必然完整轉移。
canonical 不是設了就一定採用,有幾個原則要守住:標準頁建議設定 self-referential canonical;避免 A 指到 B、B 又指到 C 的連鎖;內部連結與 XML Sitemap 應一致指向標準網址。連鎖不一定會被直接忽略,但會增加搜尋引擎解讀與維護的複雜度。
301:該消失的頁面就徹底消失
當一個網址已經沒有存在價值(例如改版後的舊網址、合併掉的文章、http 版本),用 301 永久轉址最乾淨。它把使用者直接送到新網址,也把絕大多數的權重傳遞過去。相對於 canonical 的「軟性引導」,301 是「硬性搬家」。要留意的是,301 之後舊網址實質上就不能再用了,所以只適用在「確定不要這個網址了」的情況。網站大改版、換網域這類情境,301 更是必做功課,網站搬家的 SEO 防災有完整流程。
有一個常見誤用要特別提醒:很多人把 301 當成萬用解,連「季節性活動頁」「下架商品頁」都一律 301 到首頁或分類頁,這其實是 bad practice。把大量不相關的舊網址全部指向同一個目標,等於告訴 Google「這個目標頁面跟那些舊內容有關」,反而會模糊目標頁面的主題訊號。正確做法是:下架商品轉到最相近的分類或替代商品頁,找不到合理對應時,寧可讓它回傳 410(Gone)或掛 noindex,也不要硬塞到不相關的頁面。
noindex 與 robots.txt:控制收錄與爬取的兩道閘門
這兩個常被混用,但功能差很多。noindex 是「可以爬,但不要放進索引」;robots.txt 是「連爬都不准」。看起來 robots.txt 更狠,但它有一個致命陷阱:如果你在 robots.txt 封鎖了一個頁面,Google 就爬不到它,自然也讀不到頁面上的 noindex 或 canonical,結果是它可能還是憑著外部連結把這個網址收錄進去,只是沒有內容描述。這就是為什麼這兩個不該同時掛在同一個頁面上。
實務上的分工是:對於內部搜尋結果頁等「可讓搜尋引擎存取、但不希望出現在搜尋結果」的公開頁面,可使用 noindex;對於會無限產生的參數路徑,可在確認不需要讀取其中 noindex 或 canonical 後,用 robots.txt 管理爬取。結帳、帳戶與後台等敏感頁面仍應以登入、權限或伺服器驗證保護,不能只靠 robots.txt。robots.txt 的設定值得花時間搞懂,因為設錯可能封鎖重要區塊。
回到前面的電商情境,通常要組合處理:對內容近似、需要保留的排序或篩選變體設定一致的 canonical;讓內部連結與 Sitemap 只指向乾淨網址;對不該收錄的內部搜尋結果頁加上 noindex;對無限參數則從 URL 產生規則與爬取管理著手。Google 已在 2022 年停用 Search Console 的「網址參數」工具(URL Parameters tool deprecated 公告),因此不能再依賴舊介面設定。
內容層面的重複:兩篇文章搶同一個字,該合併還是分流
技術成因處理完,還有一種重複內容是內容層面的:你自己寫的兩篇文章,主題高度重疊,Google 判定它們互相競爭。這種情況,canonical 和 301 都不是最好的解,因為這類問題的根本出在「兩篇文章對讀者來說價值高度重疊」,它屬於「同一份內容掛在兩個網址」之外、另一種更隱晦的重複,跟網址本身沒有直接關係。
判斷該合併還是該分流的關鍵,是搜尋意圖(search intent)。你可以問自己一個問題:這兩篇文章,讀者是真的需要分開看,還是看完一篇就夠了?如果搜尋意圖其實是同一個,那這兩篇就是「近似重複」的內容風險,建議整併成一篇更完整、更有深度的長文,把舊的那篇 301 到新的。回過頭,我很強調搜尋意圖的釐清,它是決定內容該不該存在的根本依據。
反過來,如果搜尋意圖不同(例如一篇是「什麼是 X」的入門介紹、另一篇是「X 的進階設定實作」),那這兩篇不該合併,而是要各自做出明確差異:標題、切入角度、目標讀者都要拉開距離,並且用內部連結互相串連。這時候你要補的是內部連結策略與資訊增量(information gain),canonical 在這個情境幫不上忙,讓 Google 與讀者都清楚看到「這兩篇是不同的東西」。關於怎麼讓內容真正有差異化價值,可以參考資訊增量的觀念與文章產製的規範。
這裡有一個我反覆講的原則:寫 5000 字每一句都有料,比寫 8000 字空洞的長文好太多了。與其維持十篇各自半吊子的近似文章互相搶排名,不如整併成三篇每篇都真正有觀點的長文。這不只是解重複內容,也是在建立主題權威(topic authority)。
如果你還是不確定手上的兩篇文章到底該合還是該分,我給你三個判斷問題,照著問一遍通常就有答案:
- 讀者會不會同時需要這兩篇?如果一個讀者看完 A 之後,還會主動想找 B 來補充,那這兩篇各有獨立價值,該做的是差異化與互相連結;如果看完 A 就等於看完了 B,那就該合併。
- 這兩篇的目標關鍵字,在 SERP 上是同一群頁面在排名嗎?你可以手動搜尋那組字,看看排上來的頁面是偏入門教學、還是偏進階操作。如果兩組字排上來的是同一批頁面,代表 Google 認為它們是同一個搜尋意圖,合併比較有利。
- 兩篇文章的轉換目的相同嗎?如果一篇是要導引讀者認識概念、另一篇是要促成諮詢或購買,那即使主題相近,也應該保留並各自優化on-page SEO與行動路徑,把它們放在轉換漏斗的不同位置。
這三個問題的核心,其實就是回到「為真人寫作,為機器人優化」這句老話。內容該不該存在、該不該合併,第一優先是看讀者需不需要,技術訊號(canonical、內部連結)只是把你對讀者的判斷,翻譯成 Google 聽得懂的語言。
被別人抄,或你主動轉載:外部重複內容怎麼辦
前面講的重複內容,多半是「網站自己跟自己重複」。但還有一種狀況會讓人焦慮:你的內容出現在別人的網站上。這又分兩種情境,解法剛好相反,一定要分清楚。
情境一:你主動把內容授權轉載出去
很多內容經營者會把文章投稿到媒體、產業專欄、或社群平台,藉此擴大觸及。這是正常的內容行銷手法,但如果你什麼訊號都不給,Google 就會看到兩份一模一樣的內容,然後自己做選擇,而它選的不一定是你。實務上常看到的狀況是,站長把原創長文投稿到一個高權重媒體,結果媒體那篇排在前面、自家網站的正本反而被當成重複版本沉到後面。授權轉載本身沒錯,錯在沒有先布局「正本是誰」。
要避免這種吃虧,有三個動作是基本功。第一,先在自己網站發布,等 Google 收錄之後再往外投稿,讓 Google 先認定你的版本是最早出現的。第二,在轉載的那一份裡,要求對方加上一條指向你正本的 canonical,或至少加上「原文出處」的明顯連結。第三,如果對方平台不讓你設 canonical(多數社群平台跟媒體都不開放這個權限),那就要評估:這個曝光機會,值不值得承擔正本被搶走排名的風險。有時候把轉載版本改成摘要或改寫版,只放完整版在自己網站,是更安全的折衷。
情境二:你的內容被別人抄走
這是另一種焦慮來源:「我辛苦寫的文章被整篇搬走,Google 會不會反而判我重複、把我降權?」老實說,這種擔心多半是過慮的。Google 的演算法在判斷原創來源時,會綜合考慮發布時間、網站的整體權威、內部連結結構、結構化資料裡的發布日期等訊號(見 Google Search Central 關於原創內容的說明)。一個剛開站、沒有權重的抄襲站,要蓋過一個有穩定內容與反向連結累積的正版網站,機率很低。
低機率不代表零風險。如果確認內容遭到未授權複製,可先保留發布紀錄與侵權證據、確認正本可索引並要求對方移除。涉及 Google 服務上的著作權移除時,再依適用法域與官方程序提出申請;DMCA 是美國法律程序,不應寫成全球都適用的通用解法。可用SERP 監測持續追蹤搜尋結果,必要時尋求法律意見。
把這兩個情境記下來,你會得到一個重要的觀念:面對外部重複內容,重點不是「消除重複」,而是「讓 Google 認得誰是正本」。正本的認定,最終還是回到你網站累積的權威與信任,而那正是長期白帽 SEO 的回報。
AI 讓重複內容問題變得更尖銳
生成式 AI 降低了大量產製內容的門檻,網站若只替同一主題更換長尾字詞,容易累積結構雷同、論點重疊的頁面。問題不在使用 AI 本身,而在這些頁面是否各自提供實質價值,或只是分散索引與內部連結訊號。早期內容農場與低價值內容的處理脈絡,可參考熊貓演算法。
Google 已在 2024 年把原本的實用內容系統整合進核心排名系統,重點仍是辨認主要為搜尋排名而製作、對讀者幫助有限的內容(Google Search Central Blog 的〈March 2024 core update and spam policies〉公告)。字句不同不代表內容就有新增價值;真正需要檢查的是每篇是否有清楚目的、可靠資訊與對讀者有用的差異。關於怎麼讓內容具備經驗與權威,可參考E-E-A-T 的完整指南。
AI 概覽與其他 AI 搜尋功能也沒有一套特殊的 Schema 或「去重門檻」可申請。Google 的官方建議仍是維持一般 SEO 基礎:頁面可被爬取與索引、重要內容以文字呈現、結構化資料與可見內容一致,並提供對讀者有幫助的原創資訊(見 Google 的〈AI features and your website〉指引)。與其猜測是否被判定重複,不如檢查內容是否真的提供新增價值。
也要提醒一句:刻意用 AI 量產近似的、換句話說的內容來塞滿搜尋結果,這在分類上屬於灰黑帽邊緣的操作,跟內容農場、黑帽 SEO只有一線之隔。短期可能嚐到流量甜頭,長期幾乎一定會被演算法收拾掉。SEO 不是花錢,是存錢,這句話在重複內容這件事上特別成立。
那麼,用 AI 輔助寫作就一定會踩到重複內容地雷嗎?也不是。關鍵在於你把 AI 放在流程的哪個位置。如果你是「給 AI 一個標題、讓它從零長出一篇」,那產出來的東西跟別人用同樣方式產出的,本質上就是近親,很容易落入近似重複。但如果你把 AI 當成效率工具,用它來整理你自己的第一手資料、把你的實戰筆記組織成結構、補上資料查證,而核心觀點與經驗是你這個人獨有的,那這樣的內容反而很難被歸類為重複。
在重複內容的語境下,這個原則可以再具體一點:每一篇你打算發表的內容,動筆前先問自己「這篇有沒有放進只有我能提供的東西」?可能是你親手處理過的某個案子、你實測過的數字、你對某個工具的第一手感想。這些都是 AI 與競品都複製不來的「資訊增量」,也正是 Google 在去蕪存菁時會優先保留的東西。
收尾:一份重複內容健檢行動清單
觀念講完了,下面是一份可以直接動手的行動清單:
- 打開 GSC,看網頁索引報表的「重複網頁」狀態,先匯出範例網址,再用網址檢查工具抽查 Google 選定的 canonical。
- 確認網站的三個標準化都有做:www 與非 www 統一、http 自動 301 到 https、結尾斜線統一。這三個是地基,沒做好其他都白搭。
- 用整站爬蟲工具掃一遍潛在重複,找出還沒被收錄但存在的重複網址(特別注意參數變體與分頁)。
- 針對參數造成的重複,先判斷頁面是否等價;等價版本可用 canonical 指向乾淨網址,無限參數則從內部連結、網址產生規則與 robots.txt 管理爬取。
- 檢查內部搜尋結果頁、篩選頁、感謝頁,需要移出索引的公開頁面使用 noindex;私人或敏感頁面則用登入與權限保護。
- 抽查 5 到 10 個重要頁面,用 GSC 網址檢查工具比對「你設的 canonical」與「Google 宣告的標準網址」是否一致,不一致就回去查訊號打架的原因。
- 盤點內容層面的近似重複,挑出主題高度重疊的兩兩文章,依搜尋意圖決定整併(301 到一篇更完整的長文)還是做出明確差異化。
- 建立一個例行檢查節奏,每季跑一次爬蟲加 GSC 報表,把重複內容當成常態性的網站健檢項目,別等到流量掉了才救火。
重複內容這件事就是「把網站的網址結構跟內容結構整理乾淨,然後持續維持」。它不是一次性的大工程,而是一種衛生習慣。網站會成長、改版、增加新功能,每一次變動都可能產生新的重複網址。把這份清單變成例行工作,能讓標準網址、索引狀態與爬取管理保持一致。
回頭看整篇文章,可以記住一條主線:先破除懲罰迷思,再用診斷清單看清問題,依成因選對工具,並用內容的獨特資訊建立差異。技術層面要依情境搭配 canonical、301、noindex 與 robots.txt;內容層面則釐清搜尋意圖與資訊增量。把這些層次顧到,重複內容就會從模糊風險,變成可持續管理的網站項目。
SEO 的很多成果都是這樣:不是一個帥氣的單點操作逆轉勝,而是把幾十個像重複內容這樣不起眼的基本功,一年一年地累積下來。時間,會證明一切。現在,就從打開 GSC 那一步開始吧。