スクレイピング 初級

79. 始める前に知っておきたいルールとマナー

「取得できる」と「取得してよい」は別問題

技術的にはほとんどのWebページからデータを取得できてしまいますが、それは「何をしてもよい」ことを意味しません。具体的な技術に入る前に、次の点を必ず押さえておきましょう。

  • そのサイトの利用規約に、スクレイピングを禁止・制限する記載がないか確認する
  • 取得したデータの著作権は多くの場合サイト側にある。個人の学習・分析目的と、再配布・商用利用はまったく別の話
  • ログインが必要なページや、個人情報を含むページの取得は特に慎重に判断する

robots.txtを確認する

多くのサイトには「https://サイトのドメイン/robots.txt」というURLに、「どこを自動巡回してよいか」のルールを書いたファイルが用意されています。Disallow(禁止)と書かれている場所にはアクセスしないのがマナーです。

⚠️ 注意:このカテゴリで紹介する技術は、あくまで自分自身のサイトなど、取得してよいことが明確なページで練習してください。判断に迷う場合は、そのサイトの運営者に問い合わせるのが確実です。

サンプルコード

# robots.txtはブラウザで直接開いて内容を確認できます
# 例:https://www.pynyumon.com/robots.txt
robots.txtは特別なツールがなくても、URLをブラウザで開くだけで中身を読めます。スクレイピングを始める前の最初の確認先として覚えておきましょう。

📝 練習問題

練習問題:このサイト(pynyumon.com)のrobots.txtをブラウザで開いて、どんな内容が書かれているか確認し、気づいたことをコメントに書いてください。