如何封鎖 AI 爬蟲

有些 AI 網路爬蟲會在未經原始內容擁有者同意的情況下從網站爬取內容、訓練大型語言模型 (LLM) 並產生 AI 摘要。瞭解如何封鎖它們。

學習目標

閱讀本文後,您將能夠:

  • 瞭解 AI 爬蟲會做些什麼
  • 瞭解 AI 爬蟲會帶來的問題
  • 瞭解識別和限制 AI 爬蟲的步驟

複製文章連結

如何封鎖 AI 爬蟲

網路爬蟲(也稱為網頁抓取工具)是一些會存取、下載或索引網際網路上各種內容的機器人。其中有些是由搜尋引擎派出,用來索引與分類網路上的內容。而另一些則可能是惡意的,它們在未經網站擁有者同意的情況下,被派來抓取並下載內容。

人工智慧 (AI) 爬蟲是一種網路爬蟲,它們會利用所抓取的內容來訓練大型語言模型 (LLM),或用來協助產生這些模型的回應內容。

AI 爬蟲的運作方式與傳統的搜尋引擎爬蟲類似,它們會索引資訊,並利用這些資訊來回答使用者查詢。然而,它們功能的某些方面可能會給網站擁有者帶來麻煩。瞭解這些問題,是重新掌握原創內容控制權的第一步。

AI 爬蟲可能造成哪些問題?

AI 爬蟲可能會為內容發佈者帶來多種問題,包括:

     
  • 無視保護內容的網站政策:當 AI 爬蟲向網站傳送 HTTP 請求以下載網站內容時,按理它們應該向網站表明自己的身分,然後剖析內容、文字、連結、中繼資料與標籤。它們本應遵守網站的規則、robots.txt 檔案所定義的通訊協定,以及網站的一般使用方針。然而,許多 AI 爬蟲根本就會無視特定網站所設定的規則與規範,不論是否獲得授權,都會抓取它們能找到的任何內容。
  •  
  • 竊取智慧財產權 (IP):AI 爬蟲及其 LLM 可能會將原創內容重新發佈為由 AI 產生的摘要內容,而不註明出處。此外,這些爬蟲與 LLM 也可能不加區別地將來自多個網站的內容混合在一起,對某些內容過度強調或過度淡化,而沒有正確評估某些觀點的準確性或重要性。
  •  
  • 減少原創內容的訪客數量:儘管 AI 產生的摘要可能會包含原始網站連結,但當使用者可以直接獲得摘要資訊時,他們造訪原始網站的機率就會降低。結果就是,網站擁有者會面臨流量下降,以及依賴廣告的收入減少的情況。
  •  
  • 引入偏見並產生不準確資訊:AI 爬行可能會放大被抓取資料中既有的偏見或刻意散播的錯誤資訊,並且在呈現 AI 產生的摘要之前,未能充分評估這些資訊的真實性。此外,AI 模型也很容易出現「幻覺」,也就是 AI 模型會自行編造它所缺乏的資訊。
  •  
  • 降低網站效能當機器人反覆抓取網站時,它們會降低伺服器的速度、增加頁面載入時間並提高頻寬成本。

內容提供者可以採取哪些步驟來識別和限制 AI 爬蟲?

管理 AI 爬行活動的第一步就是要更深入地瞭解這些活動,並提高對它們的可見度。清楚知道哪些爬蟲正在存取您的網站、它們存取的頻率如何,以及它們帶來了多少引薦流量,將有助於您制定後續的策略。

接下來,網站擁有者可以實施一套多層次的策略,允許他們想要的爬蟲存取,並封鎖其餘爬蟲。這些策略包括:

     
  • 更新 robots.txt 檔案,以限制 AI 爬蟲存取特定內容。不過請注意,有些爬蟲可能仍會繼續無視該檔案及其指示。
  •  
  • 使用中繼標籤來阻止 AI 爬蟲使用其網站的全部或特定部分來訓練 LLM。
  •  
  • 區分人類與機器人,在不影響人類使用體驗的前提下限制機器人。雖然過去網站常使用 CAPTCHA 測驗來驗證使用者是人類,但更先進的技術(例如 Cloudflare Turnstile)能在減少使用者困擾的同時驗證人類使用者。這是限制那些無視 robots.txt 檔案指示的 AI 爬蟲的絕佳方法。
  •  
  • 區分善意機器人與惡意機器人,以便您能繼續從有益的機器人中獲益。現代的機器人管理解決方案能幫助您封鎖惡意機器人,同時允許其他有益的機器人存取您的網站。
  •  
  • 透過 Web 應用程式防火牆 (WAF) 解決方案實施限速,以封鎖或減緩 AI 爬蟲對特定內容進行過度頻繁的存取嘗試。
  •  
  • 部署 WAF 以排除某些已知的 AI 爬蟲 IP 位址,使其無法存取您的網站。
  •  
  • 利用工具(例如 Cloudflare 的 AI 迷宮)來誘捕行為不當的爬蟲,該工具會向那些已被識別為無視網站 robots.txt 檔案指示的 AI 機器人提供一堆毫無意義的內容與迷宮般的連結。
  •  
  • 預設封鎖所有爬蟲,從一個乾淨的起點開始。當您啟動一個新網站時,您可以在一開始選擇封鎖所有爬蟲。接著,您可以逐步實施識別爬蟲、監控它們行為的功能,並選擇允許哪些爬蟲在特定限制下存取您的網站。

Cloudflare 如何協助防禦 AI 爬蟲?

Cloudflare AI Crawl Control 協助網路內容擁有者重新掌握對 AI 爬蟲的控制權。Cloudflare 位於全球約 20% 的網路資產前方,因此能夠深入瞭解各種爬蟲活動。這種可見度讓內容擁有者能夠運用 AI Crawl Control 來:

     
  • 瞭解其網路內容上的 AI 爬行活動模式,可細分到每個爬蟲、每個網域或每個頁面的層級
  •  
  • 透過封鎖或允許規則管理爬蟲活動
  •  
  • 要求 AI 爬蟲按每次爬取支付費用,可以透過可自訂的 HTTP 402 回應,或是使用 Cloudflare 所打造的依爬行次數付費系統來實現

按一下這里以開始免費使用

常見問題集

什麼是 AI 爬蟲?它們如何運作?

AI 爬蟲是一種存取、下載並索引網際網路內容的網路爬蟲(或稱網頁抓取工具)。它們會利用所抓取的內容來訓練大型語言模型 (LLM),或用來協助產生這些模型的回應內容。

AI 爬蟲可能對網站擁有者造成哪些主要問題?

AI 爬蟲可能會無視網站政策(例如 robots.txt 檔案中所定義的規則)、竊取智慧財產權 (IP)、減少原創內容的訪客數量、降低網站效能、引入偏見及產生不準確的資訊。

內容提供者可以採取哪些步驟來限制 AI 爬蟲對其網站的存取?

內容提供者可以實施多層次策略,包括更新 robots.txt 檔案、使用中繼標籤阻止爬蟲造訪網站的某些部分、區分人類和機器人、採用限速以及誘捕行為不端的爬蟲。

內容提供者應如何區分善意和惡意網路爬蟲?

內容提供者可以運用現代的機器人管理解決方案,來協助封鎖惡意機器人,同時允許有益的爬蟲存取其網站。此外,他們還可以在新網站上預設封鎖所有爬蟲。

Cloudflare AI Crawl Control 如何協助網站擁有者管理 AI 爬蟲活動?

Cloudflare AI Crawl Control 可協助內容擁有者瞭解爬行模式、管理爬蟲活動並向 AI 爬蟲擁有者要求付款。