スクレイピング 初級

81. レスポンスの中身を確認する

status_codeで成功・失敗を確認する

response.status_codeには、リクエストが成功したかを表す番号が入っています。200なら成功、404ならページが見つからない、500ならサーバー側のエラーです。取得したデータをいきなり使わず、まずstatus_codeを確認する習慣をつけましょう。

textでHTMLの中身を取得する

response.textには、ページのHTMLがそのまま1つの長い文字列として入っています。次のレッスン以降で使うBeautifulSoupには、このtextを渡して解析します。

⚠️ 注意:status_codeが200以外の場合、textの中身は本来欲しかったページではなく、エラーページの内容になっていることがあります。必ず200であることを確認してから先に進みましょう。

サンプルコード

import requests

response = requests.get('https://example.com')
print(response.status_code)
print(response.text[:100])
status_codeで200かどうかを確認し、text[:100]でHTMLの先頭100文字だけを確認しています。ページ全体はとても長いため、確認のときは一部だけ表示するのがコツです。

📝 練習問題

練習問題:requests.get()の結果のstatus_codeが200かどうかをif文で判定し、「取得成功」または「取得失敗」と表示してください。