スクレイピング
初級
78. Webスクレイピングとは?
Webページの情報を自動的に取得する「Webスクレイピング」の基本的な考え方を学びます。
requestsでWebページを取得し、BeautifulSoupでHTMLを解析する、Webスクレイピングの基本を学びます。始める前に必ず知っておきたいルールとマナー、取得したデータをCSVに保存する方法まで扱います。
全14件
Webページの情報を自動的に取得する「Webスクレイピング」の基本的な考え方を学びます。
スクレイピングを行う前に必ず確認すべき、法律的・マナー的な注意点を学びます。
requestsライブラリを使って、指定したURLのページを取得する方法を学びます。
requestsで取得したレスポンスから、成功したかどうかとページの中身を確認する方法を学びます。
取得したHTMLを扱いやすい形に変換するBeautifulSoupの基本を学びます。
指定した条件に一致する最初のタグを取得するfind()の使い方を学びます。
条件に一致するすべてのタグをまとめて取得するfind_all()の使い方を学びます。
同じタグ名の中から、class属性を使ってさらに絞り込んで検索する方法を学びます。
CSSセレクタの書き方でタグを検索できるselect()とselect_one()の使い方を学びます。
取得したタグから、中身の文字列だけを取り出す方法をあらためて整理して学びます。
リンク先のURLや画像のパスなど、タグの属性の値を取得する方法を学びます。
取得したリンクが相対パスだった場合に、完全なURLへ変換するurljoinの使い方を学びます。
複数のページを順番に取得するときの書き方と、相手のサーバーへの配慮の仕方を学びます。
取得したデータを、Excelでも開けるCSVファイルとして保存する方法を学びます。