コンテンツスクレーピングやWebスクレイピングは、ボットがWebサイトからすべてのコンテンツを、ダウンロードしたり「スクレイピング」することで、多くの場合そのコンテンツを悪意をもって使用するためです。
この記事を読み終えると、以下のことができるようになります。
関連コンテンツ
是非、Cloudflareが毎月お届けする「theNET」を購読して、インターネットで最も人気のある洞察をまとめた情報を入手 してください!
記事のリンクをコピーする
コンテンツスクレイピング、またはWebスクレイピングとは、Webサイトの所有者の希望に関係なく、ボットがWebサイト上のコンテンツの多くまたはすべてをダウンロードすることを指します。コンテンツスクレイピングは、データスクレイピングの一種です。オリジナルのWebグラフィックから履歴書、レストランのレビューまで、あらゆる情報を含むコンテンツをターゲットとします。ほとんどの場合、スクレイピングは、大量の規模と速度で情報を収集することができる自動化されたボットによって実行されます。
コンテンツスクレイピングは、検索エンジン最適化のためのデータの集約など、正当な目的で使用できます。しかし、スクレイピングボットは、著作権の侵害、攻撃者が所有するWebサイトでの検索エンジン最適化のためにコンテンツを複製する、オーガニックトラフィックを盗むなど、悪意のある目的でコンテンツを再利用するためによく使用されます。これらのボットは、使用状況の偏り、サーバーリソースの枯渇につながる可能性もあります。
Webサイトスクレイパーボットは、通常、一連のHTTP GETリクエストを送信し、Webサーバーが応答として送信するすべての情報を複製して保存し、Webサイトの階層を通過してすべてのコンテンツを複製します。
さらに高度なスクレイパーボットは、JavaScriptを使って、たとえばWebサイト上のすべてのフォームに自動入力し、制限付きコンテンツ(ゲーテッドコンテンツ)にアクセスしてダウンロードすることも可能です。「ブラウザ自動化」プログラムやAPIを利用すれば、ボットはあたかも従来のウェブブラウザを使用しているかのようにWebサイトやAPIと自動的にやり取りし、Webサイト側のサーバーに人間のユーザーがアクセスしていると思わせることができます。
もちろん、個人が代わりにWebサイト全体を手動でコピーして貼り付けることもできますが、ボットは、数百または数千の個別の製品ページがある大規模なeコマースサイトであっても、Webサイト上のすべてのコンテンツをほんの数秒でクロールしてダウンロードできます。
ボットは、テキスト、画像、HTMLコード、CSSコードなど、インターネット上に公開されているものをすべてスクレイピングできます。攻撃者は、スクレイピングされたデータをさまざまな目的に使用できます。たとえば、別のWebサイトでテキストを再利用して、最初のWebサイトの検索エンジンランキングを盗んだり、ユーザーをだますことがあります。攻撃者は、WebサイトのHTMLおよびCSSコードを使用して、正当なWebサイトの外観または別の会社のブランディングを複製することもできます。サイバー犯罪者は、盗まれたコンテンツを使用して、フィッシングWebサイトを作成し、別のWebサイトの実際のバージョンのように見せかけてユーザーをだまし、個人情報を入力させます。
Webスクレイピングの結果として発生するビジネス上の損害は、いくつかあります。
価格スクレイピングとは、多くの場合競合会社が提供する、Webサイト上の価格情報をすべてダウンロードすることを指します。これは、競合他社がより有利な価格を調整し、消費者がオリジナルの(スクレイピングされた)Webサイトではなく競合他社から購入するように仕向ける場合に有害である可能性があります。
連絡先スクレイピングは、電話番号やメールアドレスなどの連絡先情報についてWebサイトをスキャンし、その情報をダウンロードすることを指します。この種のスクレイピングは、多くの場合、スパムの新しいターゲットを見つける目的で行われます。
データスクレイピングとは?を参照してください。
ボット管理ソリューションは、多くの場合、機械学習の助けを借りて、ボットの行動パターンを識別し、ボットスクレイピングアクティビティを軽減できます。レート制限は、コンテンツスクレイピングを防止するのにも役立ちます。実際のユーザーが数秒または数分で数百ページのコンテンツをリクエストすることはまずありません。また、そのようなリクエストを迅速に行う「ユーザー」はボットである可能性があります。さらに、ボットが解決できないはずのインタースティシャルチャレンジを導入することで、正規のユーザーとボットを区別することができます。
Cloudflare Bot Managementは、コンテンツスクレイピングボットを寄せ付けないように設計されており、悪意のあるボットトラフィックからWebサイトを保護します。機械学習ベースのCloudflare Bot Managementは、行動パターンに基づいてボットを特定できるため、ユーザーにとっての摩擦が減り、誤検知も少なくなります。スクレイピングに対する堅牢な軽減アプローチとして、ボット検出は、レート制限リクエストおよびTurnstileによるチャレンジ管理と組み合わせて機能することができます。
小規模な組織では、Cloudflare ProおよびBusinessプランで利用できるSuper Bot Fightモードで、スクレイピング攻撃をブロックし、ボットトラフィックを可視化することもできます。
コンテンツスクレイピング(Webスクレイピングとも呼ばれます)は、ボットがWebサイトからコンテンツの一部または全部をダウンロードする自動化された仕組みのことです。検索エンジンのデータ集約などの正当な目的に使用される一方、悪意を持って使用されることも少なくありません。
スクレイパーボットは通常、Webサイトのサーバーに対してHTTPのGETリクエストを繰り返し送信し、返された情報をコピーして保存します。さらに高度なボットになると、ブラウザーを使用する人間のようにサイトを操作して、フォームに入力して制限されたコンテンツにアクセスし、ダウンロードすることもできます。
攻撃者は、著作権侵害、Webサイトの検索順位を不正に得るための文章の再利用、説得力のあるフィッシングサイトを作成するためのサイトのHTMLやCSSの複製、スパムキャンペーンのための連絡先情報の窃取など、さまざまな悪意のある目的でコンテンツをスクレイピングします。
コンテンツスクレイピングは、いくつかの点で事業活動に悪影響を与える可能性があります。例えば競合他社が価格情報をスクレイピングして、自社の価格を低く抑えて売上を奪う可能性があります。また、スクレイピング活動によって使用状況の分析結果が歪められたり、サーバーリソースを消費してWebサイトのパフォーマンスが低下させられたり、帯域幅コストが大幅に増加する可能性があります。
価格スクレイピングとは、Webサイトからすべての価格情報をダウンロードすることに特化したコンテンツスクレイピングのことです。これは多くの場合、競合他社が自社の価格を有利なものに調整して消費者を誘導するために行われます。
コンテンツスクレイピングは、いくつかの方法で防ぐことができます。多くの「ボット管理ソリューション」は、機械学習を用いてボットの挙動を検出し、スクレイピング活動を特定して軽減することができます。また、短時間に大量のページリクエストを行う「訪問者」をブロックするレート制限も有効です。