今週の注目トピック

学習時にK個の候補を生成し、正解に最も近い候補だけを更新して平均化を避ける
生成モデル学習手法Diffusion評価

探索的モデリング、K個の候補から最良だけを学習

Alexi Gladstone、Heng Ji、Yilun Duは、各学習ステップでK個の生成候補を作り、正解に最も近い候補だけを更新するExplorative Modelingを提案しました。画像・動画・マスク型言語モデルで探索量に伴う改善を報告し、制御タスクでは拡散型手法と同等の結果を16〜256分の1の推論ステップで得た例を示しています。最大実験はフロンティア学習より小さく、自己回帰LLMでの効果はまだ限定的です。

なぜ重要か

生成時の反復計算を学習時の探索へ移せれば、動画、ロボット制御、世界モデルの推論コストを変えられる可能性があります。現時点では小規模実験なので、再現性と大規模化での伸びを分けて評価すべきです。

読むべき人
生成モデル研究者、MLエンジニア、ロボティクス開発者
HN
108 points / 26 comments
flowchart LR
  C[Client request] --> L[Load balancer]
  L --> S1[MCP server A]
  L --> S2[MCP server B]
  C -. explicit handle .-> A[Application state]
MCPAI AgentProtocolObservability

MCP 2026-07-28、セッションを外して水平分散しやすく

これは何?MCPは、AIアプリが外部データやツールへ接続するためのオープンプロトコルです。

MCPの2026-07-28仕様は、初期化ハンドシェイクとMcp-Session-Idを取り除き、各要求が必要な情報を持つステートレスな中核へ移行しました。Tasksは公式拡張へ、途中入力は再送型のMulti Round-Trip Requestsへ再設計され、一覧のキャッシュやOpenTelemetry連携も明確化されています。既存のセッション、通知、Tasks、エラーコードに依存する実装には破壊的変更です。

なぜ重要か

リモートMCPサーバーを通常のHTTP基盤で分散・監視しやすくなる一方、互換性境界が大きく変わります。クライアントとサーバーの対応版を確認し、段階的なバージョン交渉と移行テストが必要です。

読むべき人
AIエージェント基盤開発者、MCPサーバー運用者、プラットフォームチーム
推論履歴を保持し、古い文脈を圧縮すると公開課題の得点が13.3%から38.3%へ改善
OpenAICodexARC-AGI評価Context Engineering

ARC-AGI-3、推論保持と圧縮で得点3倍・出力6分の1

OpenAIは、ARC-AGI-3の公式ハーネスで捨てられていた推論履歴を保持し、古い履歴の単純削除をcompactionへ変えると、GPT-5.6 Solの公開課題スコアが13.3%から38.3%へ上がり、出力トークンが約6分の1になったと報告しました。これはモデル単体の能力差ではなく、評価ハーネスの記憶設計が結果を左右する実例です。OpenAI自身のモデルと公開セットでの結果なので、他モデルや非公開課題への一般化は未確認です。

なぜ重要か

エージェント評価ではモデル名だけでなく、推論履歴、コンテキスト切り捨て、圧縮、ツール応答の保持条件を固定・公開する必要があります。製品側でも、長時間タスクの失敗をモデル品質だけで判断しないことが重要です。

読むべき人
AI評価担当者、エージェント開発者、Codex/API利用者
ツール呼び出しの前後に検査フックを置き、総トークン上限と定期実行で管理型エージェントを制御
GeminiAI AgentHooksSandboxAutomation

Gemini Managed Agents、フック・予算上限・定期実行を追加

これは何?Gemini APIのManaged Agentsは、コード実行やファイル操作を隔離クラウド環境で動かす管理型エージェントです。

GoogleはManaged Agentsの既定モデルをGemini 3.6 Flashへ更新し、ツール実行前後に拒否・lint・監査を行うenvironment hooksを追加しました。総トークン予算、無料枠、cron型の定期実行、環境管理APIも加わり、上限到達時は状態を残して停止・再開できます。既定モデルが自動で変わるため、再現性が必要な処理は明示的なモデル固定と回帰評価が必要です。

なぜ重要か

エージェントの自律実行を、外部オーケストレーターなしで定期化・予算制御・検査できます。安全性と再現性のため、フックの失敗モード、モデル固定、サンドボックスの保存境界を運用設計へ含めるべきです。

読むべき人
Gemini API利用者、AIエージェント開発者、セキュリティ・運用チーム
Lunaは80%、Terraは20%値下げし、Solは2倍の価格で最大2.5倍速いFastモードを追加
OpenAIGPT-5.6CodexPricingInference

GPT-5.6、Lunaを80%値下げしてCodexクレジットも軽量化

OpenAIはGPT-5.6 Lunaを80%、Terraを20%値下げし、CodexとChatGPT Workでも両モデルのクレジット消費を軽くしました。Solには標準処理の最大2.5倍速く価格が2倍のFastモードを追加し、工程ごとに品質・速度・費用を選べる幅を広げています。社内や顧客の効率値は発表元の測定なので、自社タスクでの評価が必要です。

なぜ重要か

低価格モデルがツール利用と複数ステップ処理を担えると、常駐エージェントや大量評価の採算が変わります。価格改定だけで移行せず、工程別の成功率・遅延・総コストを比較すべきです。

読むべき人
Codex/API利用者、AIプロダクト責任者、FinOps担当者