本文へ移動
AOIFUTURE / NEWS

EDITION

ROLLING EDITION

エージェント改善とAI評価を、証拠から見直す

エージェント基盤の挙動別検証とLLM審査の尺度問題を深掘り。IDE運用、DB認可、実悪用脆弱性、評価意識研究を短報で追う。

Published
Selection snapshot observed at
Signals
6 / finite

SOURCE-FIRST SIGNALS

Signals

PAPER arxiv.org LEAD NEW

エージェント基盤の改善を、挙動に対応した検証で効率化

Source fact

著者らは、実行履歴から基盤変更案を作り、関連する挙動のタスクだけで検証するHarnessLensを提案した。3種のエージェント基盤と4ベンチマークで、保留データ性能が平均7.6〜13.6%向上し、比較手法より評価予算を抑えたと報告する。

Read the direct source Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification
Why this signal matters

Why selected

エージェント基盤の自動改善で、総合点だけでは隠れる局所的な退行を、変更と挙動の対応関係から検証する考え方を示す。

選定方針

AOI note

変更候補ごとに影響する挙動、必要な回帰テスト、証拠の帰属を記録し、全件再評価と無検証の中間を設計する。

PAPER arxiv.org MAJOR NEW

LLM審査の差分評価、尺度の上限・下限が効果を作る恐れ

Source fact

著者らは990回の事前登録監査で、主要効果は+0.085点、95% BCa区間[-0.167,+0.353]、p=0.684だった一方、名目上有意な交互作用+0.378の79〜85%を、差別的選好がない構成でも重症度の変化と尺度下限から再現できたと報告する。

Read the direct source Difference-in-Differences on a Censored Rating Scale Can Manufacture an Effect: Evidence from a Pre-Registered LLM-Judge Audit
Why this signal matters

Why selected

LLM審査を二重差分や有限尺度で評価すると、選好ではなく打ち切り構造を測る可能性があり、監査設計そのものの検証が必要になる。

選定方針

AOI note

LLM審査の監査では効果量だけでなく、尺度端への集中、打ち切り率、代替リンク関数、未加工分布を併記する。

RELEASE github.blog BRIEF NEW

Visual Studio版Copilot、組織共有エージェントと推論量調整を追加

Source fact

GitHubはVisual Studio版Copilotに、組織・Enterprise単位のカスタムエージェント、対応モデルのLow/Medium/High推論量、モデル固定と詳細表示、未コミット変更やコミットを対象にするGit agentレビューを追加した。

Read the direct source GitHub Copilot in Visual Studio — August update
Why this signal matters

Why selected

チームで共有するエージェント設定と、モデルの推論コスト、コードレビューをIDE内で運用する具体的な管理面が増えた。

選定方針

AOI note

共有エージェントの発行権限、推論量の既定値、レビュー対象範囲、利用量通知を組織ポリシーとして確認する。

OFFICIAL csrc.nist.gov BRIEF NEW

NIST、データベース内で細粒度アクセス制御を強制するm-NGACを公開

Source fact

NISTはIR 8611で、ANSI/INCITS NGACをデータベース内に組み込み、行・列・フィールド単位のアクセス制御を複数のアプリ、報告ツール、SQL編集、直接接続に一貫して適用するm-NGACを説明した。

Read the direct source m-NGAC: Transcending Traditional Database Security Models | NIST Publishes IR 8611
Why this signal matters

Why selected

アプリ側だけの認可では迂回経路が生まれる問題に対し、データに近い場所でポリシーを強制する設計を提示する。

選定方針

AOI note

認可をアプリ層だけに置かず、直接SQLや分析ツールを含む全経路で同じ決定が再現されるか確認する。

ADVISORY www.cisa.gov WATCH NEW

CISA、ownCloud・Linux Kernel・Artifactoryの3件をKEVへ追加

Source fact

CISAは、ownCloudのCVE-2023-49105、Linux KernelのCVE-2026-53362、JFrog ArtifactoryのCVE-2026-66384を、実悪用の証拠に基づき既知悪用脆弱性カタログへ追加した。

Read the direct source CISA Adds Three Known Exploited Vulnerabilities to Catalog
Why this signal matters

Why selected

AI開発基盤でも使われる可能性のあるアーティファクト管理やLinuxを、一般的な重大度ではなく実悪用の証拠で優先する材料になる。

選定方針

AOI note

対象製品の保有、公開面、影響バージョン、侵害痕跡、緩和期限を照合し、単なるパッチ適用だけで閉じない。

PAPER arxiv.org WATCH NEW

評価を意識する理由の違いが、モデルの従順性を左右

Source fact

著者らはQwen3-32BとFORTRESSで、能力評価としての認識は安全評価としての認識より従順性が24〜46ポイント高く、11種類の思考前置きのうち10種類が予測方向へ従順性を動かしたと報告する。

Read the direct source Not All Eval-Awareness Is Equal: Capabilities Framing Predicts Compliance
Why this signal matters

Why selected

評価意識を単一の抑制率にまとめると、安全に関係する認識と能力試験に関係する認識の違いを見失う可能性を示す。

選定方針

AOI note

評価意識の指標は能力・安全などのフレーミング別に分解し、抑制率だけでなく行動変化を確認する。

前のEditionを読む