はじめに
線形回帰とロジスティック回帰は名前が似ていますが、予測する対象と使い方は異なります。線形回帰は価格や売上のような連続した数値を予測する回帰モデルです。一方、ロジスティック回帰は名前に「回帰」と付いていても、機械学習ではクラスを判定する分類モデルとして使われます。
この記事では、両者の違いを予測対象・出力・具体例から比較し、どちらを選べばよいか判断できるように解説します。
この記事で分かること
- 線形回帰とロジスティック回帰の最も重要な違い
- それぞれが予測する対象と出力
- 具体例から見た使い分け
- 0.5の閾値や標準化に関する注意点
線形回帰とロジスティック回帰の違い
最も大きな違いは、線形回帰は連続値を予測し、ロジスティック回帰は分類に使うことです。
| 比較項目 | 線形回帰 | ロジスティック回帰 |
|---|---|---|
| 主な目的 | 数値の予測 | クラスの分類 |
| 目的変数 | 連続値 | カテゴリ |
| 主な出力 | 実数の予測値 | 各クラスに属する確率 |
| 代表例 | 売上額、価格、点数 | 購入する・しない、正常・異常 |
| モデルの役割 | 数値の大きさを推定する | 確率からクラスを判断する |
たとえば「来月の売上はいくらか」を予測するなら線形回帰、「この顧客が購入するか」を判定するならロジスティック回帰が候補になります。
線形回帰とは
線形回帰は、目的変数を説明変数の線形な組み合わせで表し、連続した数値を予測する方法です。
基本形は次のように表せます。
予測値 = 切片 + 係数1 × 説明変数1 + 係数2 × 説明変数2 + …
一般的な最小二乗の線形回帰では、実際の値と予測値の差である残差の二乗和が小さくなるように係数を求めます。
連続値を予測する
線形回帰が向いているのは、結果を数値そのものとして予測したい場合です。
たとえば、住宅の広さから価格を予測する、広告費から売上額を予測する、勉強時間からテスト点数を予測するといった用途があります。
予測値は実数で出力する
線形回帰の出力は実数です。モデルによっては0未満や想定範囲外の値も出るため、目的変数の性質に合うか確認する必要があります。
単回帰の最小二乗法や回帰係数、標準誤差、決定係数については、単回帰分析の基本:最小二乗法、回帰係数、標準誤差、決定係数で詳しく解説しています。
ロジスティック回帰とは
ロジスティック回帰は、説明変数からクラスに属する確率を求め、その確率を使って分類するモデルです。
二値分類では、説明変数の線形結合をロジスティック関数に通し、0から1の範囲の確率へ変換する考え方が基本です。実装によっては3クラス以上の多クラス分類にも利用できます。
分類確率を求める
たとえば「購入する確率が0.8」「異常である確率が0.2」のように、各クラスに属する確率を求めます。そのうえで判断基準を使って最終的なクラスを決めます。
名前に「回帰」と付いても分類に使われる
ロジスティック回帰は名称に「回帰」とありますが、機械学習では分類モデルとして扱われます。
「連続値を予測する回帰」と「カテゴリを予測する分類」の違いを整理したい場合は、回帰と分類の違いとは?機械学習での用途と使い分けを解説も参考にしてください。
線形回帰とロジスティック回帰の使い分け
両者を選ぶときは、まず「最終的に何を予測したいか」を確認します。
数値そのものを予測するなら線形回帰
売上額、気温、価格、点数など、結果を連続した数値として予測したい場合は線形回帰が候補になります。
説明変数が複数ある線形回帰については、重回帰分析の基礎:偏回帰係数や決定係数を解説で扱っています。
クラスを判定するならロジスティック回帰
購入する・しない、正常・異常、合格・不合格など、結果をカテゴリとして判定したい場合はロジスティック回帰が候補になります。
確率を出せるため、単にクラスを返すだけでなく「どの程度そのクラスらしいか」を判断材料にできます。
具体例で選び方を確認する
- 住宅価格を予測する → 線形回帰
- 来月の売上額を予測する → 線形回帰
- 顧客が購入するか判定する → ロジスティック回帰
- メールがスパムか判定する → ロジスティック回帰
モデルを作った後の評価方法は、RMSE、MAE、MAPE、決定係数:評価指標の違いと選び方で整理しています。
よくある混同と注意点
0.5は絶対的な閾値ではない
二値分類では「確率が0.5以上なら1、それ未満なら0」とする例がよく使われますが、0.5が必ず最適とは限りません。
見逃しと誤検知のどちらを重く見るか、クラスの偏りがあるかなどによって、判断閾値を変える場合があります。
標準化は常に必須というわけではない
説明変数のスケールをそろえる標準化は便利ですが、すべての線形回帰やロジスティック回帰で必須というわけではありません。
特にロジスティック回帰では、正則化や最適化アルゴリズムによってスケールの影響が大きくなる場合があります。必要性は使用するモデルや実装条件と合わせて判断します。
回帰結果だけで因果関係を判断しない
説明変数と目的変数に強い関係が見えても、それだけで一方が他方の原因だとは判断できません。
また、説明変数を増やしすぎると過適合につながる場合があります。モデルの評価では、学習に使ったデータだけでなく未知データでの性能も確認することが重要です。
まとめ
線形回帰とロジスティック回帰の違いは、何を予測するかを見ると整理しやすくなります。
- 連続した数値を予測する → 線形回帰
- クラスを分類する → ロジスティック回帰
線形回帰は実数の予測値を出し、ロジスティック回帰はクラスに属する確率を求めて分類に使います。名前だけで判断せず、目的変数が数値なのかカテゴリなのかを確認すると使い分けやすくなります。