学習用とテスト用にデータを分ける理由
機械学習では、データを「学習用」と「テスト用」の2つに分けるのが基本です。すべてのデータを学習に使ってしまうと、そのモデルが「見たことのある問題を覚えているだけ」なのか、「本当に新しい問題にも対応できる」のかを確かめられません。テスト用データは、モデルが見たことのないデータに対してどれだけ正しく予測できるかを確認するために取っておきます。
fit()とpredict()という2つの動作
scikit-learnのモデルは、fit()でデータを学習させ、predict()で新しいデータに対する予測をさせる、というシンプルな2ステップで使えます。次のレッスンで、実際にこの流れをコードで体験します。
⚠️ 注意:練習用のサンプルデータはごく少量です。実際のAI開発では、もっと大量かつ質の良いデータを用意することが、精度を左右する重要なポイントになります。