はじめに
機械学習を学び始めると、「教師あり学習」と「教師なし学習」という2つの方法がよく登場します。どちらもデータから規則性を学ぶ方法ですが、使うデータと解決したい課題が異なります。
大きな違いは、学習時に「この入力に対する正解」となるラベルを使うかどうかです。教師あり学習はラベル付きデータから入力と正解の対応関係を学び、教師なし学習はラベルを使わずにデータの構造やパターンを探します。
この記事では、両者の違いを学習データ・目的・評価方法・代表的なタスクから整理し、どのような場面で使い分けるのかを解説します。
教師あり学習と教師なし学習の違い
教師あり学習と教師なし学習の違いは、次のように整理できます。
| 比較項目 | 教師あり学習 | 教師なし学習 |
|---|---|---|
| 学習データ | 正解ラベルあり | 正解ラベルなし |
| 主な目的 | 未知データの値やクラスを予測する | データの構造やパターンを見つける |
| 代表的なタスク | 分類、回帰 | クラスタリング、PCAなどの次元削減 |
| 評価の考え方 | 予測結果を正解ラベルと比較できる | 正解ラベルとの直接比較は基本的にできない |
| 例 | スパム判定、価格予測 | 顧客のグループ分け、特徴の圧縮 |
ポイントは、教師あり学習と教師なし学習に優劣があるのではなく、解決したい課題が違うことです。既知の正解を手がかりに予測したい場合と、正解を決めずにデータの特徴を探したい場合では、選ぶ学習方法が変わります。
教師あり学習とは
教師あり学習(Supervised Learning)は、入力データと正解ラベルの組み合わせを使って学習する方法です。モデルは入力と正解の対応関係を学び、新しいデータに対する予測に利用します。
たとえば、住宅の面積や築年数から価格を予測する場合、過去の住宅データに「実際の価格」が正解として必要です。また、メールをスパムか通常メールか判定する場合は、各メールに「スパム」「通常」といった正解ラベルを用意して学習します。
正解ラベルを付ける作業は、アノテーションの代表的な例です。大量のデータへ正確なラベルを付けるには手間やコストがかかるため、教師あり学習ではモデルだけでなく学習データの作り方も重要です。
代表的なタスクは分類と回帰
教師あり学習の代表的なタスクは、分類と回帰です。
分類は、入力データをあらかじめ決められたクラスへ分ける問題です。スパム判定や製品の良品・不良品判定などが例です。
回帰は、連続した数値を予測する問題です。住宅価格、売上、需要量などの予測に使われます。
決定木やニューラルネットワークなどのアルゴリズムは、設定や目的に応じて分類や回帰へ利用できます。この記事では各アルゴリズムの詳細ではなく、教師あり学習の役割を理解するための例として扱います。
教師なし学習とは
教師なし学習(Unsupervised Learning)は、正解ラベルを使わずにデータから構造やパターンを見つける方法です。「このデータはどのグループか」という正解を事前に与えるのではなく、データ同士の似方やばらつきなどをもとに特徴を整理します。
たとえば、顧客の年齢や購入履歴などから似た顧客を自動的にまとめる場合、あらかじめ「顧客Aはグループ1」という正解を用意する必要はありません。データの特徴からグループを作り、その結果を顧客分析などに利用します。
代表的なタスクはクラスタリングと次元削減
クラスタリングは、似た特徴を持つデータをグループに分ける方法です。k-meansや階層クラスタリングなどがあります。あらかじめ決めたクラスを当てる分類とは役割が異なり、クラスター分析と分類モデルの違いを理解すると整理しやすくなります。
次元削減は、多数の特徴量が持つ情報を、できるだけ保ちながら少ない軸へまとめる方法です。主成分分析(PCA)などが代表例です。
教師なし学習では正解ラベルがないため、教師あり学習のように予測結果と正解をそのまま照合することはできません。そこで、クラスタのまとまり方を示す指標や、分析目的に対して得られた構造が役立つかといった観点で結果を評価します。
どちらを使うかは目的とデータで決める
教師あり学習と教師なし学習のどちらを使うかは、まず「何を知りたいのか」を考えます。
既知の正解をもとに、新しいデータの値やクラスを予測したい場合は教師あり学習が候補になります。反対に、正解ラベルがなく、データをグループ分けしたり全体の構造を把握したりしたい場合は教師なし学習が候補になります。
実務では、最初に教師なし学習でデータの特徴を調べ、その後にラベル付きデータを用意して教師あり学習へ進むこともあります。そのため、2つを完全に別々の技術として考えるより、目的に応じて使い分けたり組み合わせたりする学習方法として捉えると分かりやすくなります。
よくある誤解
教師なし学習は「正解ラベルがないので精度が低い学習方法」という意味ではありません。教師あり学習とは目的が異なるため、同じ基準で単純に性能を比較するものではありません。
機械学習には、この2つ以外にも半教師あり学習や強化学習などがあります。まず教師あり学習と教師なし学習の違いを理解すると、ほかの学習方法の位置づけも整理しやすくなります。
まとめ
教師あり学習は、正解ラベル付きのデータから入力と正解の対応関係を学び、新しいデータの分類や数値予測に利用する方法です。教師なし学習は、正解ラベルを使わず、データの構造やパターンを見つける方法です。
違いを判断するときは、「ラベルがあるか」だけでなく、「予測したいのか、データの特徴を見つけたいのか」という目的も確認することが重要です。両者は優劣で選ぶものではなく、課題とデータに応じて使い分けます。