EDITION
ROLLING EDITION
AOIFUTURE News — エージェントを「制度」と「失敗」で評価する
委任の来歴を追う安全設計と、難しい環境でのエージェント評価を深掘りし、AI利用計測、IDE、モデル、CMS更新を短報で追う。
SOURCE-FIRST SIGNALS
Signals
マルチエージェント安全性を「制度設計」として検証する
Source fact
POLIS研究は5,280エピソードの試験群を報告し、事前指定の委任実験では詳細な憲法プロンプトと来歴対応ガードが各0/384の実現違反だった。来歴対応ガードは51/384件を遮断し、その後44件が安全に完了したと著者らは報告する。
Why this signal matters
Why selected
単体モデルの善し悪しではなく、委任、来歴、制約開示を制度として試す設計を具体化している。
選定方針AOI note
権限委任では、最終状態だけでなく操作の来歴を実行時ポリシーへ残す。
Dark Souls全22ボスを、視覚エージェントの難関ベンチマークにする
Source fact
DSLEはDark Souls: Remasteredの全22ボス戦をGymnasium形式で公開するコンテナ型環境を提案する。DSLE-5では専門家システムと進化的手法がAsylum Demonで最高63%と43%の勝率を報告した一方、他4体は倒せなかった。
Why this signal matters
Why selected
成功率だけでは見えない、生存時間や与ダメージを含むエージェント評価の難しさを示す。
選定方針AOI note
ゲーム評価でも、勝敗の二値だけでなく部分的進歩と失敗様式を記録する。
CopilotのAI利用量を、モデル別・トークン種別で分解できる
Source fact
GitHubはAI usage reportにモデル別の入力、出力、キャッシュ読み取り、キャッシュ書き込みトークンの内訳を追加した。
Why this signal matters
Why selected
AIコストを総額だけでなく、モデル選択とキャッシュ挙動へ分解して改善できる。
選定方針AOI note
モデル別の品質指標とトークン内訳を同じ運用レポートで比較したい。
ChatGPTのGPT-5.6 Solを更新、無料版はLunaの無制限テキストへ
Source fact
OpenAIはChatGPT向けGPT-5.6 Solを更新し、Plus/Pro利用者に思考量スライダーを追加した。内部評価では、事実誤りを1件以上含む回答がGPT-5.5 Instant比でGPT-5.6 Solは約68%少なかったと報告している。無料利用者にはGPT-5.6 Lunaの無制限テキストチャットとThinkボタンを順次提供する。
Why this signal matters
Why selected
ChatGPTの回答品質、思考量の選択、無料利用者への提供範囲が同時に変わる具体的な更新だから。
選定方針AOI note
モデル更新は平均的な改善だけでなく、評価条件、提供面、利用者層を分けて確認する。
JetBrains版Copilotに永続メモリとローカルモデル接続
Source fact
GitHubはCopilot for JetBrainsへ永続メモリ、Ollamaによるローカルモデル接続、企業向け制御を追加し、MCP関連を含む信頼性改善も案内した。
Why this signal matters
Why selected
クラウド支援、ローカル推論、継続コンテキストをIDE内で組み合わせる運用が現実的になる。
選定方針AOI note
永続メモリは便利さではなく、保存対象、削除、監査、プロジェクト分離から設計する。
WordPress 7.0.4は即時更新推奨のセキュリティリリース
Source fact
WordPress.orgは7.0.4をセキュリティリリースとして公開し、サイト管理者へ直ちに更新するよう推奨した。
Why this signal matters
Why selected
AIサイトやコンテンツ基盤も、生成機能より先に公開CMSの既知リスクを閉じる必要がある。
選定方針AOI note
公開基盤の緊急更新は、バックアップ、段階適用、疎通確認、ロールバックを一組にする。