ディープラーニングと機械学習の歴史

第1章:機械学習の古典(1950s〜1990s)

トランスフォーマー以前の伝統的な機械学習手法。データからパターンを学習するが、「深い」階層構造は持たない。

代表的な手法

手法登場年特長苦手なこと
線形回帰19世紀最もシンプル。連続値の予測。解釈性が高い非線形な関係。複雑なパターン
ロジスティック回帰1958年分類問題(YES/NO)に使う。確率を出力複雑な決定境界。高次元データ
決定木(CART)1984年ツリー構造で判断。人間にも理解しやすい過学習しやすい。少しの変化で結果が変わる
ランダムフォレスト2001年たくさんの決定木の多数決。安定して強いメモリ消費大。画像認識は苦手
SVM1995年マージン最大化。強い理論的裏付け。カーネルで非線形大規模データに弱い。パラメータ調整が難しい
k-means1957年教師なし学習。クラスタリング。シンプルクラスタ数の指定が必要。初期値に敏感
PCA1933年次元削減。データの圧縮・可視化非線形構造を捉えられない
ナイーブベイズ1763年(ベイズ)確率ベース。シンプルで高速。テキスト分類に強い特徴量の独立性仮定が現実と合わない
勾配ブースティング(XGBoost)2014年決定木を順番に学習。Kaggleで最強の伝統手法ハイパーパラメータ調整が難しい

第2章:ニューラルネットワークの黎明(1943〜1986)

パーセプトロン(1957年)

  • Frank Rosenblatt が開発。単純なニューロンの数学モデル
  • 特長: 入力×重みの合計を閾値で判定。単純だが画期的
  • 限界: XOR(排他的論理和)が解けない(Minsky & Papert, 1969)

バックプロパゲーション(1986年)

  • Rumelhart, Hinton, Williams が確立
  • 特長: 誤差を逆方向に伝播させて重みを学習。これで多層ニューラルネットが学習可能に
  • 意義: パーセプトロンの限界を突破。ニューラルネット復活のきっかけ

第3章:ディープラーニングの夜明け(2006〜2012)

Deep Belief Network(2006年)

  • Hinton らが提唱。層ごとに事前学習する方法
  • 特長: 深いネットワークでも学習が可能になった
  • 意義: 「ディープラーニング」という言葉が広まるきっかけ

AlexNet(2012年)

  • Krizhevsky, Sutskever, Hinton が開発
  • 画像認識コンペImageNetで圧勝(エラー率25%→15%)
  • 特長: ReLU(活性化関数)、Dropout(過学習防止)、GPU学習
  • 意義: ディープラーニング革命の火付け役。コンピュータビジョンを一変

第4章:ディープラーニングの黄金期(2012〜2017)

CNN(畳み込みニューラルネットワーク)

  • 特長: 画像の局所的なパターン(エッジ・模様)を階層的に学習
  • 代表モデル: VGG(シンプルで深い)、GoogLeNet/Inception(効率的)、ResNet(残差接続で超深層)
  • 貢献: 画像認識・物体検出・画像生成の基盤

LSTM(Long Short-Term Memory、1997年→2010年代に普及)

  • Hochreiter & Schmidhuber が開発
  • 特長: 長期依存関係を学習できる(忘れない記憶)
  • 用途: 翻訳、音声認識、時系列予測
  • 限界: 計算が重い。並列化が難しい

GAN(敵対的生成ネットワーク、2014年)

  • Ian Goodfellow が開発
  • 特長: 生成器(Generator)と識別器(Discriminator)が競い合って学習
  • 用途: 画像生成、超解像、データ拡張
  • 意義: 生成AIの源流。Stable Diffusion等の基盤

Seq2Seq + Attention(2014-2015年)

  • Seq2Seq: 系列を入力して系列を出力。翻訳に革命(Sutskever et al.)
  • Attention: 入力の「どこを見るか」を学習。翻訳品質が劇的向上(Bahdanau et al.)
  • 意義: Transformerへの直接の前身

AlphaGo / AlphaZero(2016-2017年)

  • DeepMind が開発。囲碁で世界王者に勝利
  • 特長: 強化学習 + モンテカルロ木探索
  • 意義: AIの「創造性」を世界に示した

第5章:トランスフォーマーの登場(2017年)

Transformer(2017年)

  • 「Attention Is All You Need」(Vaswani et al.)
  • 特長: RNN(LSTM)を使わず、Attentionだけで系列を処理
    • 並列計算が可能(RNNのように逐次処理不要)
    • 長距離依存関係を直接学習
    • スケールしやすい(大規模化に強い)
  • 革新的だった点: 従来の「CNNは画像、RNNは系列」という棲み分けを破壊。統一的なアーキテクチャに
  • 影響: あらゆるAI分野をトランスフォーマーが飲み込む

第6章:トランスフォーマー以降(2018〜2026)

BERT(2018年、Google)

  • 双方向のトランスフォーマー。文脈を両方向から理解
  • 言語理解タスクで人間超え

GPT(2018年、OpenAI)

  • 片方向(左から右)のトランスフォーマー。言語生成に特化
  • GPT-3(2020年)で「大規模化=性能向上」を証明
  • ChatGPT(2022年)で一般普及

Vision Transformer(ViT、2020年)

  • 画像もトランスフォーマーで処理。CNN不要に
  • トランスフォーマーの万能性を証明

Stable Diffusion(2022年)

  • 拡散モデル(トランスフォーマーではないが、U-NetにAttentionを内蔵)
  • 画像生成AIの民主化

GPT-4, Claude, Gemini(2023-2024年)

  • マルチモーダル化(画像も入力)
  • エージェント化(Codex, Claude Code, Hermes Agent)

DeepSeek, Qwen, Kimi(2024-2026年)

  • オープンウェイトLLMの台頭
  • アメリカのクローズドモデルに迫る性能
  • ループエンジニアリング・バイブコーディングの時代へ

古典ML vs ディープラーニング vs トランスフォーマー

観点古典MLディープラーニングトランスフォーマー
データ量数百〜数千数万〜数百万数千万〜数十億
計算資源CPUで十分GPUが必要大規模クラスタ必須
特徴量設計人間が手動で設計自動で階層学習完全自動+Attention
解釈性高い(決定木等)低い非常に低い
並列性高い中程度非常に高い
得意分野表形式データ画像・音声すべて(統一)