415.tech
シリコンバレー発、AIとテックの最前線
Google、元の10%未満のトークンでGemma 4をテキスト拡散モデルに転用

Google、元の10%未満のトークンでGemma 4をテキスト拡散モデルに転用

Google DeepMindは、元の学習トークンの10分の1未満を使用して、Gemma-4-26B-A4BをDiffusionGemmaに変換した。同モデルは、H100上で毎秒約1,500トークンの速度で256トークンのブロックを並列に処理する。真の成果はモデルそのものではなく、この転用手法にある。Hugging Faceで公開されたApache 2.0ライセンスの重みにより、既存のチェックポイントを持つ誰もが低コストで拡散モデルの実験を行えるようになった。ただし、品質は自己回帰型のGemma 4に及ばず、スループットの優位性も同時リクエスト数が32件に近づくと消失する。

出典: the-decoder.com

Xでポストメール

DiffusionGemmaは、答えと推論を並行して開発するため、出力が最終決定される前に間違いを修正できる。

Google DeepMind 技術レポート

なぜ重要か

  • → Diffusionモデルは既存のチェックポイントをretrofitでき、数十億トークンの再学習を回避する。
  • → 双方向のrefinementは、自己回帰型ワンパスモデルと異なり、出力前に推論エラーを修正する。
  • → 負荷がかかると速度の優位性は消える。シングルユーザーでの利点は本番ワークロードにはスケールしない。
retrofit、retrainではない