「取得できる」と「取得してよい」は別問題
技術的にはほとんどのWebページからデータを取得できてしまいますが、それは「何をしてもよい」ことを意味しません。具体的な技術に入る前に、次の点を必ず押さえておきましょう。
- そのサイトの利用規約に、スクレイピングを禁止・制限する記載がないか確認する
- 取得したデータの著作権は多くの場合サイト側にある。個人の学習・分析目的と、再配布・商用利用はまったく別の話
- ログインが必要なページや、個人情報を含むページの取得は特に慎重に判断する
robots.txtを確認する
多くのサイトには「https://サイトのドメイン/robots.txt」というURLに、「どこを自動巡回してよいか」のルールを書いたファイルが用意されています。Disallow(禁止)と書かれている場所にはアクセスしないのがマナーです。
⚠️ 注意:このカテゴリで紹介する技術は、あくまで自分自身のサイトなど、取得してよいことが明確なページで練習してください。判断に迷う場合は、そのサイトの運営者に問い合わせるのが確実です。