AIを活用したWebクローラーとスクレイパーは、オリジナルコンテンツを盗用し、もとのWebサイトへの訪問者数を減少させます。Webサイトの所有者とコンテンツ提供者が、Webスクレイピングの制御を取り戻す方法について説明します。
この記事を読み終えると、以下のことができるようになります。
記事のリンクをコピーする
Webスクレイピング(またはWebサイトスクレイピング)は、自動的にWebサイトからデータやコンテンツを抽出する仕組みのことです。これはもともと、検索エンジンが利用者を目的の情報へ効率的に導くために開発された、よく知られたインターネット上の手法です。基本的な動きは、クローラーとも呼ばれるWebスクレイパーがWebサイトを「クロール」してコンテンツを抽出てWebサイトを分類し、検索エンジンでインデックス化するというものです。
当初、Webスクレイピングは多くの関係者にとって利益のあるものでした:
その悔過、コンテンツ提供者はコンテンツを更新し続ける動機が得られ、システムは全体として比較的スムーズに機能し、利用者、検索エンジン、コンテンツ提供者の三者がそれぞれの目的を満たす、安定した関係が成り立っていました。
当初はうまく機能していたWebスクレイピングの仕組みも、攻撃や悪用に対して脆弱という問題があります。例えば:
過剰なWebスクレイピングが事業に直接影響することを認識したコンテンツ提供者は、「ボット管理」や「Webアプリケーションファイアウォール(WAF)」など、知的財産(IP)の窃盗や過剰なスクレイピングに対する防御策を講じています。多くのサイトではrobots.txtファイルを実装してボットがどのようにWebサイトで活動できるかのガイドラインを示していますが、このファイルはボットが「ルールを守る」ことを前提としており、実際には多くのボットが無視しています。
こうしたWebスクレイピング対策であっても、高度な回避技術を持つボットや攻撃者には突破される可能性があります。Webサイトの所有者は、独自のデータの盗難や価格および製品情報の不正取得といった被害に直面しており、競争上の優位性が損なわれる事態となっています。
近年、検索エンジンや人工知能(AI)企業が、Webスクレイパーを大規模言語モデル(LLM)と連携させて使用し、ウェブサイトからコンテンツを収集し、要約したものをユーザーに提示しています。ユーザーは検索エンジンや生成AI(GenAI)ツールでAIが生成した要約を読むことで、より少ない労力で素早く情報を確認することができます。しかし、この行為は、Webサイトの所有者やコンテンツ提供者にとって好ましくないものであると同時に悪影響を及ぼす可能性があります。
コンテンツ提供者の収入が減ることで、新しい情報や独自のコンテンツを作成する意欲と資金を失い、制作されるコンテンツの量が減少し、LLMが取得できる信頼できる情報源も減り、新たな情報の流れと普及が停滞する事態となります。
多くのブロガーやコンテンツ制作者が、扱いやすく専門知識をあまり必要としない点から、今もWordPressを利用しています。WordPressユーザーは、Webスクレイピングへの対策として、正規のクローラーがコンテンツを適切に巡回できるようにrobots.txtプロトコルを設定したり、悪意のあるボットをブロックして正規の訪問者との区別を行う高度なCAPTCHAを採用するなど、さまざまな方法を取り入れています。その他にも、高度なセキュリティ対策を使用して不審なアドレスを遮断したり、サイトのトラフィック負荷とリソース配分への負担を軽減するためにレート制限を採用する例もあります。
コンテンツ提供者にとって、コンテンツはまさに事業の母体です。そのため、悪意のある、あるいは過剰なWebスクレイピングを防ぐことは最優先の課題です。
以下の対策を講じることで、被害を大きく減らすことができます:
Cloudflareを使用することで、Webサイト所有者とコンテンツ提供者がWebスクレイピングを制御できるようになります。Cloudflare AI Crawl Controlは、AIクロールとスクレイピングの活動を完全に可視化します。ワンクリックでクローラーを許可またはブロックしたり、特定のページやコンテンツのみにスクレイピングを制限したり、特定のIPアドレスからのアクセス速度を落としたり遮断したりすることも可能です。これらすべてを、直感的で使いやすいダッシュボードからまとめて管理できます。さらに、Cloudflare Bot Managementは、リアルタイムで良質なボットと悪質なボットを区別し、クロールの許可とブロックを適用します。
Cloudflareで、コンテンツの制御を取り戻す方法について、詳細をご覧ください。
Webスクレイピング(Webサイトスクレイピング)は、自動的にWebサイトからデータやコンテンツを抽出する仕組みのことです。これはもともと、検索エンジンがコンテンツをより効率的に分類し、ユーザーを特定の情報へと導くために確立されたものです。
初期のころは、ユーザーはWebスクレイピングによって正確で網羅的な情報一覧にアクセスできるという利点を得ていました。また、コンテンツ提供者は自身の知的財産(IP)を活用して収益を得ることができました。
過度なWebスクレイピングは、コンテンツの盗用やサイトのパフォーマンス低下を引き起こします。ボットが同じサイトに何度も訪れてスクレイピングすると、ページの読み込み時間が長くなり、利用者が不満を抱いたり、コンテンツ提供者の対応コストが増加します。
従来、コンテンツ提供者は、知的財産(IP)の盗用や過剰なスクレイピングから保護するために、「ボット管理」や「Webアプリケーションファイアウォール(WAF)」などの防御策を用いてきました。「robots.txtファイル」も一般的な防御策となりますが、悪意のあるボットからは多くの場合無視されてしまいます。
検索エンジンとAI企業は、大規模言語モデル(LLM)を備えたWebスクレイパーを使用してコンテンツを収集し、その要約版をユーザーに提供します。これが実行されると元のコンテンツへの参照トラフィックが減少し、コンテンツ提供者の収益が減少します。
コンテンツ提供者は、許可するスクレイピング活動の上限を設けることで、不要かつ悪意のあるWebスクレイピングを制限すべきです。また、高度なAI搭載ボットへの対抗手段として同じAIを活用したソリューションを使用したり、AIスクレイパーへの課金モデルを導入することも可能です。
多くのWordPressユーザーは、正当なクローラーを誘導するために、robots.txtプロトコルを採用しています。また、高度なCAPTCHA識別方法を使用して、トラフィックをボットによるものと人によるものとを区別し、悪意のあるボットをブロックしています。また、不審なアドレスをブロックしたり、レート制限を使用するセキュリティ対策を講じている組織もあります。
Cloudflare AI Crawl Controlは、AIによるクロール活動を可視化し、特定のクローラーをワンクリックでブロック、制限、または速度を低下させることを可能にします。また、Cloudflare Bot Managementは、リアルタイムで良質なボットと悪質なボットを区別し、それぞれにクロールの許可とブロックを適用します。
利用開始
人工知能
機械学習
ビッグデータ
用語集