今日の注目トピック

GPT-5.6は、モデル階層、ツール内の中間処理、並列サブエージェントを組み合わせ、長時間タスクの単価と待ち時間を下げようとしている
OpenAIGPT-5.6CodexAI AgentTool Calling

GPT-5.6、並列エージェントとツール内プログラム実行を標準化

OpenAIは7月9日、Sol、Terra、Lunaの3階層から成るGPT-5.6を一般提供しました。Responses APIでは、途中結果をモデルの外へ全て戻さずに処理するProgrammatic Tool Callingと、同時にサブエージェントを走らせるmulti-agent betaを提示しています。性能値は発表元の評価を含むため、そのまま比較表として受け取るより、長いツール利用を少ない往復で進める実装が製品要件になった点が重要です。

なぜ重要か

エージェントの費用と待ち時間は、モデル選定だけでなくツール往復、コンテキスト量、並列化の設計で大きく変わります。評価は再現可能な自社タスクで、単一エージェントと分割後の品質・コスト・監査性を比較すべきです。

読むべき人
AI基盤チーム、エージェント開発者、Codex/API利用者
HN
883 points / 658 comments
ChatGPT Workは、ファイル・アプリ接続、長時間実行、利用者の承認を組み合わせて、コーディングエージェントの仕組みを一般業務へ拡張する
OpenAIChatGPT WorkCodexAI AgentEnterprise

ChatGPT WorkがCodexを一般業務の長時間エージェントへ広げる

OpenAIはChatGPT Workを、アプリやファイルを横断して情報を集め、資料・表・Webアプリなどの成果物まで作り、複雑な案件を数時間継続できるエージェントとして発表しました。Codex技術を組み込み、進捗確認、質問への応答、重要操作の承認、Scheduled Tasksによる継続実行を掲げています。コーディングエージェント由来の能力を、部門横断の業務実行へ拡張する会社戦略です。

なぜ重要か

エージェントの対象がコードから日常業務へ広がるほど、アクセス権と承認の設計が製品価値そのものになります。PoCでは便利さを測るだけでなく、誤操作時の停止・復旧・説明責任まで試すべきです。

読むべき人
業務AI導入担当、情報システム部門、プロダクトマネージャー、Codex利用チーム
HN
299 points / 145 comments
Cursor 3.11は、主会話を継続したまま調査を分岐し、エージェントの重要イベントをhookで観測・制御するための更新
CursorAI AgentCloud AgentObservabilityDeveloper Tools

Cursor 3.11、主エージェントを止めずに調査を分岐・観測する設計へ

Cursor 3.11は、主会話の文脈を引き継ぐ持続的なSide Chat、会話本文まで対象にするローカル検索、Cloud Agentの会話・thinking・subagent・compaction・終了を対象とした新しいhookを追加しました。エージェントが長く走るほど、作業の枝分かれと後からの説明可能性が課題になります。今回の更新は、その運用面をIDEの中心機能へ寄せています。

なぜ重要か

AIコーディングのボトルネックは生成速度から、長時間タスクの観測・分岐・レビューへ移りつつあります。チームはhookの記録範囲、保持期間、停止条件を先に決めると、導入後の監査コストを抑えられます。

読むべき人
Cursor利用チーム、開発生産性担当、AIエージェント基盤担当
Robostral Navigateは、単眼RGB画像上の移動先と向きを予測し、深度センサーなしでロボット導航を行うモデル
MistralRoboticsEmbodied AIComputer VisionNavigation

MistralのRobostral Navigate、単眼カメラでロボットの長距離導航を狙う

Mistralは、RGBカメラ1台と自然言語指示からロボットを動かす80億パラメータのRobostral Navigateを発表しました。未見環境のR2R-CE validationで76.6%の成功率を報告し、深度センサーやLiDARを使わず、画像上の移動先を指す方針でカメラ条件やロボットの大きさの違いへ適応すると説明しています。数値は発表元による評価ですが、センサーを増やさずに embodied AI を成立させる方向性は注目に値します。

なぜ重要か

ロボティクスでは高価なセンサー構成を前提にしない知覚・行動モデルが、導入コストを左右します。ただし実運用の評価軸はベンチマーク成功率だけではなく、安全停止と例外処理です。

読むべき人
ロボティクス開発者、物流・製造のAI導入担当、embodied AI研究者
HN
369 points / 88 comments
Muse Spark 1.1は、長いコンテキスト、MCPを含むツール利用、サブエージェント、コンピューター操作をまとめ、Meta Model APIから提供する
MetaMuse SparkMCPAI AgentModel API

Meta、Muse Spark 1.1と公開プレビューAPIで個人向けエージェント競争へ

Metaは7月9日、ツール利用、コンピューター操作、コーディング、マルチモーダル理解を対象にしたMuse Spark 1.1と、Meta Model APIの公開プレビューを発表しました。公式説明では、未見のnative tool、MCP server、custom skillへのzero-shot適応、100万tokenのコンテキスト管理、並列サブエージェントの調停を掲げています。モデル性能の主張はMeta自身の報告なので独立検証は今後必要ですが、消費者向けアプリだけでなく開発者APIを同時に出した戦略は明確です。

なぜ重要か

MCP・長文脈・サブエージェントを一体で扱うモデルが増えるほど、ツール側は権限の最小化と入力の信頼境界を明確にする必要があります。新APIは、まず限定データと可逆な操作で評価するのが安全です。

読むべき人
AIプロダクト開発者、MCP提供者、エージェント基盤チーム、技術戦略担当
HN
293 points / 162 comments