探索的モデリング、K個の候補から最良だけを学習
Alexi Gladstone、Heng Ji、Yilun Duは、各学習ステップでK個の生成候補を作り、正解に最も近い候補だけを更新するExplorative Modelingを提案しました。画像・動画・マスク型言語モデルで探索量に伴う改善を報告し、制御タスクでは拡散型手法と同等の結果を16〜256分の1の推論ステップで得た例を示しています。最大実験はフロンティア学習より小さく、自己回帰LLMでの効果はまだ限定的です。
生成時の反復計算を学習時の探索へ移せれば、動画、ロボット制御、世界モデルの推論コストを変えられる可能性があります。現時点では小規模実験なので、再現性と大規模化での伸びを分けて評価すべきです。
- 読むべき人
- 生成モデル研究者、MLエンジニア、ロボティクス開発者
- HN
- 108 points / 26 comments