Webスクレイピングの防止方法

AIを活用したWebクローラーとスクレイパーは、オリジナルコンテンツを盗用し、もとのWebサイトへの訪問者数を減少させます。Webサイトの所有者とコンテンツ提供者が、Webスクレイピングの制御を取り戻す方法について説明します。

学習目的

この記事を読み終えると、以下のことができるようになります。

  • Webスクレイピングの本来のメリットを理解する
  • Webスクレイピングが引き起こす問題を特定する
  • Webスクレイピングを防止するためのベストプラクティスを適用する

記事のリンクをコピーする

Webスクレイピングの防止方法

Webスクレイピング(またはWebサイトスクレイピング)は、自動的にWebサイトからデータやコンテンツを抽出する仕組みのことです。これはもともと、検索エンジンが利用者を目的の情報へ効率的に導くために開発された、よく知られたインターネット上の手法です。基本的な動きは、クローラーとも呼ばれるWebスクレイパーがWebサイトを「クロール」してコンテンツを抽出てWebサイトを分類し、検索エンジンでインデックス化するというものです。

Webスクレイピングの歴史的なメリット

当初、Webスクレイピングは多くの関係者にとって利益のあるものでした:

  • 利用者にとっては、包括的で正確なWebコンテンツのリストにアクセスできるというメリットがありました。
  •  
  • 検索エンジンにとっては、検索者に目的の情報をより効率的かつ正確に提供できるというメリットがありました。
  •  
  • Webサイトやコンテンツ提供者にとっては、自社の独自コンテンツ(知的財産)を通じて、アクセス数や広告クリック、ダウンロードなどで収益を得られるというメリットがありました。

その悔過、コンテンツ提供者はコンテンツを更新し続ける動機が得られ、システムは全体として比較的スムーズに機能し、利用者、検索エンジン、コンテンツ提供者の三者がそれぞれの目的を満たす、安定した関係が成り立っていました。

Webスクレイピングが引き起こす問題

当初はうまく機能していたWebスクレイピングの仕組みも、攻撃や悪用に対して脆弱という問題があります。例えば:

     
  • コンテンツの窃盗:スクレイピング技術を悪用することで、攻撃者はサイトから機密情報を盗むことができます。また、競合他社のWebサイトから商品の価格情報を収集して同じ商品をより安く販売したり、他の人が苦労して時間をかけてまとめた資料や報告書の情報やインサイトを盗むことも可能です。
  •  
  • サイトのパフォーマンスの低下 ボットは、Webサイトに何度も訪れてスクレイピングするようにプログラムすることもできるため、それによりサーバーの応答速度が低下したり、ページ読み込み時間が長くなります。その結果、正規の利用者が不満を抱いたり、コンテンツ提供者の対応コストが増加します。

過剰なWebスクレイピングの対策に使用できるツール

過剰なWebスクレイピングが事業に直接影響することを認識したコンテンツ提供者は、「ボット管理」や「Webアプリケーションファイアウォール(WAF)」など、知的財産(IP)の窃盗や過剰なスクレイピングに対する防御策を講じています。多くのサイトではrobots.txtファイルを実装してボットがどのようにWebサイトで活動できるかのガイドラインを示していますが、このファイルはボットが「ルールを守る」ことを前提としており、実際には多くのボットが無視しています。

こうしたWebスクレイピング対策であっても、高度な回避技術を持つボットや攻撃者には突破される可能性があります。Webサイトの所有者は、独自のデータの盗難や価格および製品情報の不正取得といった被害に直面しており、競争上の優位性が損なわれる事態となっています。

AIがコンテンツ提供者のWebスクレイピング問題を深刻化させた理由

近年、検索エンジンや人工知能(AI)企業が、Webスクレイパーを大規模言語モデル(LLM)と連携させて使用し、ウェブサイトからコンテンツを収集し、要約したものをユーザーに提示しています。ユーザーは検索エンジンや生成AI(GenAI)ツールでAIが生成した要約を読むことで、より少ない労力で素早く情報を確認することができます。しかし、この行為は、Webサイトの所有者やコンテンツ提供者にとって好ましくないものであると同時に悪影響を及ぼす可能性があります。

     
  • アクセス流入の減少:一部のAIは、要約に元のコンテンツへのリンクを掲載するものもありますが、既に要約が提供されているため、利用者が元のサイトにアクセスする可能性は低くなります。
  •  
  • 収益の逸失:多くのコンテンツ提供者は、事業運営のための資金調達手段として、Webトラフィックから発生する広告収入やサブスクリプションなどに依存しており、一般的に、トラフィックが減少すると収益も減少します。
  •  
  • コンテンツの誤解:生成AIが生成するWebコンテンツの要約は、元の内容が正しく反映されておらず、情報が誤って表現される場合があります。

コンテンツ提供者の収入が減ることで、新しい情報や独自のコンテンツを作成する意欲と資金を失い、制作されるコンテンツの量が減少し、LLMが取得できる信頼できる情報源も減り、新たな情報の流れと普及が停滞する事態となります。

WordPressユーザーのWebスクレイピング対策手法

多くのブロガーやコンテンツ制作者が、扱いやすく専門知識をあまり必要としない点から、今もWordPressを利用しています。WordPressユーザーは、Webスクレイピングへの対策として、正規のクローラーがコンテンツを適切に巡回できるようにrobots.txtプロトコルを設定したり、悪意のあるボットをブロックして正規の訪問者との区別を行う高度なCAPTCHAを採用するなど、さまざまな方法を取り入れています。その他にも、高度なセキュリティ対策を使用して不審なアドレスを遮断したり、サイトのトラフィック負荷とリソース配分への負担を軽減するためにレート制限を採用する例もあります。

コンテンツ提供者が行うWebスクレイピング対策の最善策

コンテンツ提供者にとって、コンテンツはまさに事業の母体です。そのため、悪意のある、あるいは過剰なWebスクレイピングを防ぐことは最優先の課題です。

以下の対策を講じることで、被害を大きく減らすことができます:

     
  • 不要かつ悪意のあるWebスクレイピングを制限する:特定のサイトのボットをブロックしたり、スクレイピング回数を制限できるソリューションを実装します。最新の防御機能は、特定のIPアドレスからのリクエスト数を制限したり、一定期間内のスクレイピング試行回数を常識的な範囲内に制限することで、「通常」のユーザーによる閲覧に影響を与えずにボットによる過剰アクセスを抑制することができます。
  •  
  • AIを活用したソリューションを使用する:近年のスクレイパーは、AIを活用したボットを使用するケースが増えています。これに対抗するには、同じくAIを活用した防御が必要です。これらのソリューションを使用して、リアルタイムの脅威インテリジェンスフィードを監視して新たな脅威を特定したり、サイトのトラフィックを分析してボット特有の不自然な行動を検知します。
  •  
  • スクレイピングを許可するページとコンテンツを制限する:スクレイピングの許可を、製品に関するマーケティングページや開発者向けドキュメントなどの特定のページに限定します。また、広告収入の対象となるオリジナルコンテンツが掲載サレタページに対するスクレイピングを制限します。
  •  
  • AIを活用したボット検出機能を使用する:人間とボットを切り分ける「チューリング」スタイルのテストを自動的に行います。たとえば、Cloudflare Turnstileは、従来のCAPTCHAよりも優れた方式で、短いコードスニペットで人間に対するサイトのパフォーマンスを低下させることなく、ボットを自動的に検出します。
  •  
  • 新しい報酬モデルを実装する:スクレイピングによる収益減少を補うため、コンテンツを有料化して保護するという方法もありますが、この方法では、良質な情報は有料でしか得られない二極化したインターネットを生み出す恐れがあります。その代わりに、Webサイト運営者とコンテンツ提供者は、AIスクレイパーに対してオリジナルコンテンツへのアクセス料金を課すなど、関係者全員にとって公平な報酬モデルを導入する必要があります。

CloudflareでWebスクレイピングを制御する

Cloudflareを使用することで、Webサイト所有者とコンテンツ提供者がWebスクレイピングを制御できるようになります。Cloudflare AI Crawl Controlは、AIクロールとスクレイピングの活動を完全に可視化します。ワンクリックでクローラーを許可またはブロックしたり、特定のページやコンテンツのみにスクレイピングを制限したり、特定のIPアドレスからのアクセス速度を落としたり遮断したりすることも可能です。これらすべてを、直感的で使いやすいダッシュボードからまとめて管理できます。さらに、Cloudflare Bot Managementは、リアルタイムで良質なボットと悪質なボットを区別し、クロールの許可とブロックを適用します。

Cloudflareで、コンテンツの制御を取り戻す方法について、詳細をご覧ください。

よくある質問

Webスクレイピングとは?その本来の目的は?

Webスクレイピング(Webサイトスクレイピング)は、自動的にWebサイトからデータやコンテンツを抽出する仕組みのことです。これはもともと、検索エンジンがコンテンツをより効率的に分類し、ユーザーを特定の情報へと導くために確立されたものです。

初期のWebスクレイピングがもたらしたユーザーとコンテンツ提供者に対する利点は?

初期のころは、ユーザーはWebスクレイピングによって正確で網羅的な情報一覧にアクセスできるという利点を得ていました。また、コンテンツ提供者は自身の知的財産(IP)を活用して収益を得ることができました。

過度または悪意のあるWebスクレイピングがコンテンツ提供者与える損害は?

過度なWebスクレイピングは、コンテンツの盗用やサイトのパフォーマンス低下を引き起こします。ボットが同じサイトに何度も訪れてスクレイピングすると、ページの読み込み時間が長くなり、利用者が不満を抱いたり、コンテンツ提供者の対応コストが増加します。

コンテンツ提供者がWebスクレイピングを防御するために使用する一般的なセキュリティツールは?

従来、コンテンツ提供者は、知的財産(IP)の盗用や過剰なスクレイピングから保護するために、「ボット管理」や「Webアプリケーションファイアウォール(WAF)」などの防御策を用いてきました。「robots.txtファイル」も一般的な防御策となりますが、悪意のあるボットからは多くの場合無視されてしまいます。

生成AI(GenAI)はどのようにコンテンツスクレイピング問題を深刻化させるか?

検索エンジンとAI企業は、大規模言語モデル(LLM)を備えたWebスクレイパーを使用してコンテンツを収集し、その要約版をユーザーに提供します。これが実行されると元のコンテンツへの参照トラフィックが減少し、コンテンツ提供者の収益が減少します。

悪意のあるWebスクレイピングに対抗するためのベストプラクティスとは?

コンテンツ提供者は、許可するスクレイピング活動の上限を設けることで、不要かつ悪意のあるWebスクレイピングを制限すべきです。また、高度なAI搭載ボットへの対抗手段として同じAIを活用したソリューションを使用したり、AIスクレイパーへの課金モデルを導入することも可能です。

WordPressユーザーが行っている具体的な対策は?

多くのWordPressユーザーは、正当なクローラーを誘導するために、robots.txtプロトコルを採用しています。また、高度なCAPTCHA識別方法を使用して、トラフィックをボットによるものと人によるものとを区別し、悪意のあるボットをブロックしています。また、不審なアドレスをブロックしたり、レート制限を使用するセキュリティ対策を講じている組織もあります。

コンテンツ提供者がスクレイピングを制御するためにCloudflareが提供するソリューションは?

Cloudflare AI Crawl Controlは、AIによるクロール活動を可視化し、特定のクローラーをワンクリックでブロック、制限、または速度を低下させることを可能にします。また、Cloudflare Bot Managementは、リアルタイムで良質なボットと悪質なボットを区別し、それぞれにクロールの許可とブロックを適用します。