ディープラーニングと機械学習の歴史
第1章:機械学習の古典(1950s〜1990s)
トランスフォーマー以前の伝統的な機械学習手法。データからパターンを学習するが、「深い」階層構造は持たない。
代表的な手法
| 手法 | 登場年 | 特長 | 苦手なこと |
|---|
| 線形回帰 | 19世紀 | 最もシンプル。連続値の予測。解釈性が高い | 非線形な関係。複雑なパターン |
| ロジスティック回帰 | 1958年 | 分類問題(YES/NO)に使う。確率を出力 | 複雑な決定境界。高次元データ |
| 決定木(CART) | 1984年 | ツリー構造で判断。人間にも理解しやすい | 過学習しやすい。少しの変化で結果が変わる |
| ランダムフォレスト | 2001年 | たくさんの決定木の多数決。安定して強い | メモリ消費大。画像認識は苦手 |
| SVM | 1995年 | マージン最大化。強い理論的裏付け。カーネルで非線形 | 大規模データに弱い。パラメータ調整が難しい |
| k-means | 1957年 | 教師なし学習。クラスタリング。シンプル | クラスタ数の指定が必要。初期値に敏感 |
| PCA | 1933年 | 次元削減。データの圧縮・可視化 | 非線形構造を捉えられない |
| ナイーブベイズ | 1763年(ベイズ) | 確率ベース。シンプルで高速。テキスト分類に強い | 特徴量の独立性仮定が現実と合わない |
| 勾配ブースティング(XGBoost) | 2014年 | 決定木を順番に学習。Kaggleで最強の伝統手法 | ハイパーパラメータ調整が難しい |
第2章:ニューラルネットワークの黎明(1943〜1986)
パーセプトロン(1957年)
- Frank Rosenblatt が開発。単純なニューロンの数学モデル
- 特長: 入力×重みの合計を閾値で判定。単純だが画期的
- 限界: XOR(排他的論理和)が解けない(Minsky & Papert, 1969)
バックプロパゲーション(1986年)
- Rumelhart, Hinton, Williams が確立
- 特長: 誤差を逆方向に伝播させて重みを学習。これで多層ニューラルネットが学習可能に
- 意義: パーセプトロンの限界を突破。ニューラルネット復活のきっかけ
第3章:ディープラーニングの夜明け(2006〜2012)
Deep Belief Network(2006年)
- Hinton らが提唱。層ごとに事前学習する方法
- 特長: 深いネットワークでも学習が可能になった
- 意義: 「ディープラーニング」という言葉が広まるきっかけ
AlexNet(2012年)
- Krizhevsky, Sutskever, Hinton が開発
- 画像認識コンペImageNetで圧勝(エラー率25%→15%)
- 特長: ReLU(活性化関数)、Dropout(過学習防止)、GPU学習
- 意義: ディープラーニング革命の火付け役。コンピュータビジョンを一変
第4章:ディープラーニングの黄金期(2012〜2017)
CNN(畳み込みニューラルネットワーク)
- 特長: 画像の局所的なパターン(エッジ・模様)を階層的に学習
- 代表モデル: VGG(シンプルで深い)、GoogLeNet/Inception(効率的)、ResNet(残差接続で超深層)
- 貢献: 画像認識・物体検出・画像生成の基盤
LSTM(Long Short-Term Memory、1997年→2010年代に普及)
- Hochreiter & Schmidhuber が開発
- 特長: 長期依存関係を学習できる(忘れない記憶)
- 用途: 翻訳、音声認識、時系列予測
- 限界: 計算が重い。並列化が難しい
GAN(敵対的生成ネットワーク、2014年)
- Ian Goodfellow が開発
- 特長: 生成器(Generator)と識別器(Discriminator)が競い合って学習
- 用途: 画像生成、超解像、データ拡張
- 意義: 生成AIの源流。Stable Diffusion等の基盤
Seq2Seq + Attention(2014-2015年)
- Seq2Seq: 系列を入力して系列を出力。翻訳に革命(Sutskever et al.)
- Attention: 入力の「どこを見るか」を学習。翻訳品質が劇的向上(Bahdanau et al.)
- 意義: Transformerへの直接の前身
AlphaGo / AlphaZero(2016-2017年)
- DeepMind が開発。囲碁で世界王者に勝利
- 特長: 強化学習 + モンテカルロ木探索
- 意義: AIの「創造性」を世界に示した
第5章:トランスフォーマーの登場(2017年)
- 「Attention Is All You Need」(Vaswani et al.)
- 特長: RNN(LSTM)を使わず、Attentionだけで系列を処理
- 並列計算が可能(RNNのように逐次処理不要)
- 長距離依存関係を直接学習
- スケールしやすい(大規模化に強い)
- 革新的だった点: 従来の「CNNは画像、RNNは系列」という棲み分けを破壊。統一的なアーキテクチャに
- 影響: あらゆるAI分野をトランスフォーマーが飲み込む
第6章:トランスフォーマー以降(2018〜2026)
BERT(2018年、Google)
- 双方向のトランスフォーマー。文脈を両方向から理解
- 言語理解タスクで人間超え
GPT(2018年、OpenAI)
- 片方向(左から右)のトランスフォーマー。言語生成に特化
- GPT-3(2020年)で「大規模化=性能向上」を証明
- ChatGPT(2022年)で一般普及
- 画像もトランスフォーマーで処理。CNN不要に
- トランスフォーマーの万能性を証明
Stable Diffusion(2022年)
- 拡散モデル(トランスフォーマーではないが、U-NetにAttentionを内蔵)
- 画像生成AIの民主化
GPT-4, Claude, Gemini(2023-2024年)
- マルチモーダル化(画像も入力)
- エージェント化(Codex, Claude Code, Hermes Agent)
DeepSeek, Qwen, Kimi(2024-2026年)
- オープンウェイトLLMの台頭
- アメリカのクローズドモデルに迫る性能
- ループエンジニアリング・バイブコーディングの時代へ
古典ML vs ディープラーニング vs トランスフォーマー
| 観点 | 古典ML | ディープラーニング | トランスフォーマー |
|---|
| データ量 | 数百〜数千 | 数万〜数百万 | 数千万〜数十億 |
| 計算資源 | CPUで十分 | GPUが必要 | 大規模クラスタ必須 |
| 特徴量設計 | 人間が手動で設計 | 自動で階層学習 | 完全自動+Attention |
| 解釈性 | 高い(決定木等) | 低い | 非常に低い |
| 並列性 | 高い | 中程度 | 非常に高い |
| 得意分野 | 表形式データ | 画像・音声 | すべて(統一) |