EDITION
ROLLING EDITION
AIの評価・検索・記憶を「信じられる工程」に変える
二重盲検のモデル評価と、自動ファクトチェックの検索限界を深掘り。モデル統制、医療時系列、実行前ガード、長期記憶を短報で追う。
SOURCE-FIRST SIGNALS
Signals
モデル評価を「事前に見せない」仕組みで守る
Source fact
Google DeepMindは、機密ベンチマークを暗号学的な環境に隔離し、モデル提供者が評価内容を事前に見られない二重盲検評価のパイロットを発表した。Gemini Flash Liteを対象に、Singapore AI Safety Institute、OpenMined、AVERI、MLCommonsと検証する。
Why this signal matters
Why selected
ベンチマーク汚染を契約だけでなく技術境界でも抑える、評価ガバナンスの具体例になる。
選定方針AOI note
評価前の秘密保持、実行時の隔離、結果の監査を分け、第三者が再現できる証跡を残す。
自動ファクトチェックは、検索段階で大きくつまずく
Source fact
著者らは9モデルを4データセットで比較し、最良モデルがSciFactのmacro-F1 0.70からClimateCheckでは0.31へ低下したと報告した。取得証拠を正解注釈へ置き換えると検証精度が14〜22ポイント改善し、検索が主要なボトルネックだと結論づけた。
Why this signal matters
Why selected
検索と真偽判定を一つの精度でまとめず、ドメイン移動時の崩れを測る必要性を示す。
選定方針AOI note
検索、証拠の質、最終判定を別々に測り、単一ベンチマークの順位を運用品質へ直結させない。
GitHub Copilotのモデル既定方針、段階的な強制へ
Source fact
GitHubはCopilot BusinessとEnterpriseの一般提供モデルに対するglobal model policyの強制を段階的に開始し、9月1日までに展開すると発表した。未設定および新規の一般提供モデルはglobal policyの状態を継承する。
Why this signal matters
Why selected
モデル追加のたびに個別設定が抜ける問題を、組織既定値で抑える変更になる。
選定方針AOI note
既定値を確認したうえで、例外モデルだけを明示管理し、展開期間中の組織差を監視する。
GlucoFM、血糖の長短期変動を分けて学習
Source fact
Google Researchは、連続血糖モニタリングの遅い傾向と短期偏差を別ストリームで扱う軽量・自己教師あり基盤モデルGlucoFMを紹介し、糖尿病リスクやインスリン抵抗性など複数の代謝予測へ転用可能だと報告した。
Why this signal matters
Why selected
時系列の異なる変化を分離して表現学習する設計は、医療以外のセンサーデータにも示唆がある。
選定方針AOI note
臨床導入では、対象集団ごとの外部検証、欠測や機器差、意思決定への影響をモデル性能と分けて確認する。
StepGuard、ツール実行前に危険な一手を検査
Source fact
著者らはエージェントの各ツール操作を実行前に検査するStepGuardを提案し、AgentDojoとAgentDynで無防御時に比べ平均攻撃成功率を77.3%相対削減、平均utility低下を2.8ポイントに抑えたと報告した。
Why this signal matters
Why selected
完了後の軌跡監査だけでなく、危険な操作の直前に止める制御を評価できる。
選定方針AOI note
実環境では許可リスト、承認、ロールバック、監査ログと組み合わせ、未知のツールや文脈での誤検知を測る。
長期タスクの記憶を、失敗証拠から局所更新
Source fact
著者らは作業記憶と経験記憶を結び、実行証拠からSkill Memoryを検証付きで局所更新するRecurisを提案した。4ベンチマーク・10モデルで、完了した37組中35組の成功率が改善したと報告している。
Why this signal matters
Why selected
長い履歴を丸ごと抱える代わりに、現在状態と再利用スキルを分けて改善する設計案になる。
選定方針AOI note
更新対象を局所化し、変更前後の評価、ロールバック、汚染された経験の隔離を必須にする。