AI 中級

74. 機械学習の基本的な流れ

学習用とテスト用にデータを分ける理由

機械学習では、データを「学習用」と「テスト用」の2つに分けるのが基本です。すべてのデータを学習に使ってしまうと、そのモデルが「見たことのある問題を覚えているだけ」なのか、「本当に新しい問題にも対応できる」のかを確かめられません。テスト用データは、モデルが見たことのないデータに対してどれだけ正しく予測できるかを確認するために取っておきます。

fit()とpredict()という2つの動作

scikit-learnのモデルは、fit()でデータを学習させ、predict()で新しいデータに対する予測をさせる、というシンプルな2ステップで使えます。次のレッスンで、実際にこの流れをコードで体験します。

⚠️ 注意:練習用のサンプルデータはごく少量です。実際のAI開発では、もっと大量かつ質の良いデータを用意することが、精度を左右する重要なポイントになります。

サンプルコード

# このレッスンではまだコードは書きません。
# 次のレッスンで、実際にfit()とpredict()を使ってみます。
コードを書く前に、まず「何のためにデータを分けるのか」という考え方を理解しておくことが大切です。

📝 練習問題

練習問題:データを学習用とテスト用に分ける理由を、自分の言葉でコメントに書いてください。