RETROSPECTIVE ENTRY POINTS
AOIFUTURE News index
公開済みの Rolling Edition、Active Context、topic、source を有限の入口として示します。
By Edition
- / AOIFUTURE News — AIエージェントは「読む・記憶する・共同で動く」をどう検証するか
- / AOIFUTURE News — AIが研究工程へ入るとき、何を分けて検証するか
- / AOIFUTURE News — スキル移転、推論コスト、欠落認識、記憶の罠
- / AOIFUTURE News — エージェントの学び方から、健康・創作・安全の境界まで
- / AOIFUTURE News — AIが学ぶ環境と、AIを監督する基準を同時に育てる
- / AOIFUTURE News — AIの実行力を、承認と検証の境界で支える
- / AOIFUTURE News — AIの信頼性は、答えの前後に残る証拠で決まる
- / AOIFUTURE News — エージェントは、記憶より先に検証できる世界を持て
- / AOIFUTURE News — AIを信じる前に、痕跡・汚染・再現性を測る
- / AOIFUTURE News — 最終スコアの先で、AIの動きと権限を測り直す
- / AOIFUTURE News — スコアの外側で、エージェントの失敗を測る
- / AOIFUTURE News — エージェントは「答え」と「環境」を制御できるか
- / AOIFUTURE News — エージェントを「制度」と「失敗」で評価する
- / AOIFUTURE News — 安全な実行環境から、手元で動くAIと音声評価まで
- / AOIFUTURE News — 能力の上昇を、制御・評価・創作の設計へつなぐ
- / AOIFUTURE News — エージェント運用から創造性まで、8つの変化を横断する
- / AOIFUTURE News — ツールを増やす前に、効いている経路を測る
- / AOIFUTURE News — エージェント障害を「検知」で終わらせない
- / AOIFUTURE News — Research Signals
- / 接続するAI、運用境界を先に決める
- / AIを業務と研究へ入れる前に、権限を見える形にする
- / モデル性能の外側で、AI実装の差がつく
- / AIへ仕事を渡す、その経路をどう止めるか
By Context
By topic
-
AIエージェント
ツール利用、ハーネス、継続的な実行設計。
- / コーディングエージェントは、どの文書を読み、どこで検証を止めるのか
- / ゲーム世界は、長期記憶と協調を試すAIエージェントの実験場になる
- / DeepSeek、画像とツール利用を結ぶ実験的マルチモーダルAPIを公開
- / 会議の会話から、その場で共有エージェント作業へ
- / DeepSeek、すべてをプラグインとして組み替えるオープンなエージェント基盤を公開
- / Claudeを「答えるAI」から、実験を回す研究工程へ
- / ウェアラブルデータから候補バイオマーカーを絞るマルチエージェント研究
- / 画像を見て進むだけでなく、自然言語のルールを守れるか
- / タスク単位のスキルは逆に効かない:LLMエージェントのスキル移転を制御実験で読む
- / 記憶が推論を歪める:LLMメモリの認知トラップを測る
- / ツール利用エージェントを「中間学習」から育てるMidTool
- / AIが学習アルゴリズムを書き換える力を測るAI4AI-Bench
- / エージェントが訓練環境まで作る、SPADEの自己遊戯学習
- / 会話ログに出ないエージェント協調を、潜在状態から監視するVLA
- / 承認内容を実行バイトへ結び付ける、DeFiエージェントのPACE
- / AIによるコード監査を、検証と反復を含む脆弱性発見パイプラインへ
- / 1902回の実行ネットワークから、マルチエージェント協調を測る
- / JetBrains版Copilotに、企業管理のMCP・権限・観測設定
- / 未知ゲームのルールを実行可能なデジタルツインとして書き、行動前に全履歴を再生検証する
- / セッションをまたぐ引き継ぎを、全文保存ではなく予測に必要な状態の保存として定式化する
- / 英国の核融合研究所から、判断の追跡性を重視するエージェント型工学基盤がスピンアウト
- / RAG汚染を、信頼済みコーパスなしで局所比較から見つける
- / 世界モデルを固定操作列ではなく、目的を追うエージェントで評価する
- / GitHub CopilotでGrok 4.6が段階提供、企業設定は既定で無効
- / Gemini 3.7 Flashが一般提供、エージェントとコーディングを主対象に
- / 1,200人超とコーディングエージェントがICML論文2,226本を再現
- / 長期研究エージェントは「自律研究者」より、まだ工学的な最適化役に近い
- / VLMは静止画の空間認識より、変化を伴う計画でトポロジーを失いやすい
- / 同じスコアでも、コマンドが通る経路で安全性は崩れる
- / Gemini 3.7 Flashは、速度だけでなくエージェント実務へ軸足を移す
- / タスクを成功させたまま、スキルが資源だけを浪費させる
- / Gemini 3.7 FlashがGitHub Copilotへ展開、選択肢が実装面まで広がる
- / 答えを「出さない」能力を、機械検査できる契約にする
- / 単一のユーザー模擬器で学ぶエージェントは、その癖に過適合する
- / Agent Plugins 1.0が、スキルとMCPの持ち運び方を共通化
- / OpenCode 1.18.17は、圧縮と自動再試行の暴走を抑える
- / AI生成コード時代に、Goの制約をレビュー支援へ使う
- / マルチエージェント安全性を「制度設計」として検証する
- / Dark Souls全22ボスを、視覚エージェントの難関ベンチマークにする
- / JetBrains版Copilotに永続メモリとローカルモデル接続
- / 失敗軌跡から、エージェントの安全ハーネスを更新する
- / Claude Sonnet 5の導入価格が、そのまま恒久価格になった
- / 認証設定をAIエージェントへ任せるなら、IAMとCloudTrailまで一組にする
- / モデルだけでなく、プロンプト・ツール・記憶を含む「実行環境」も最適化対象になる
- / コードレビューの深さを、変更の複雑さとリスクに合わせて選ぶ
- / Gemini Notebookの情報源を、定期ワークフローから自動追加する
-
研究
- / コーディングエージェントは、どの文書を読み、どこで検証を止めるのか
- / ゲーム世界は、長期記憶と協調を試すAIエージェントの実験場になる
- / JWSTが見つけた「極端に金属が少ない銀河」は、密度の見落としだったかもしれない
- / Claudeを「答えるAI」から、実験を回す研究工程へ
- / ウェアラブルデータから候補バイオマーカーを絞るマルチエージェント研究
- / 匿名化モビリティで「場所の使われ方」を表すME-POIs
- / 自己改善の「伸び」を凍結対照で疑うPhantom Gains
- / 画像を見て進むだけでなく、自然言語のルールを守れるか
- / タスク単位のスキルは逆に効かない:LLMエージェントのスキル移転を制御実験で読む
- / 考える量をモデル自身に決めさせる:推論コストの適応配分
- / 情報が足りない質問にLLMは答えられるか:法律相談の欠落評価ベンチマーク
- / 記憶が推論を歪める:LLMメモリの認知トラップを測る
- / ツール利用エージェントを「中間学習」から育てるMidTool
- / スマホ写真から体組成リスクを推定するPhotoScan
- / AIが学習アルゴリズムを書き換える力を測るAI4AI-Bench
- / 最大10人の顔を保ちながら集団画像を生成するWithEveryone
- / エージェントが訓練環境まで作る、SPADEの自己遊戯学習
- / 会話ログに出ないエージェント協調を、潜在状態から監視するVLA
- / 粗い音声トークンからの復元を、反復検索として組み立てる
- / 承認内容を実行バイトへ結び付ける、DeFiエージェントのPACE
- / MoE内部のルーティング信号で、幻覚箇所をトークン単位に検出
- / 同じ答えでも「どの内部状態を通ったか」を検出可能にする計算来歴
- / 弱い言い換えや誤字を重ね、モデル挙動を強く誘導する「Model Hypnosis」
- / 1902回の実行ネットワークから、マルチエージェント協調を測る
- / Google Cloudが説明する、反復検索型RAGの幻覚低減
- / 未知ゲームのルールを実行可能なデジタルツインとして書き、行動前に全履歴を再生検証する
- / セッションをまたぐ引き継ぎを、全文保存ではなく予測に必要な状態の保存として定式化する
- / 攻撃時だけ安全ニューロンを作動させる、学習不要の拒否介入
- / RAG汚染を、信頼済みコーパスなしで局所比較から見つける
- / 世界モデルを固定操作列ではなく、目的を追うエージェントで評価する
- / 1,200人超とコーディングエージェントがICML論文2,226本を再現
- / 長期研究エージェントは「自律研究者」より、まだ工学的な最適化役に近い
- / 人型ロボットの動きは、姿勢誤差だけではなく「人が違和感を持つ失敗」で測る
- / VLMは静止画の空間認識より、変化を伴う計画でトポロジーを失いやすい
- / 同じスコアでも、コマンドが通る経路で安全性は崩れる
- / タスクを成功させたまま、スキルが資源だけを浪費させる
- / 答えを「出さない」能力を、機械検査できる契約にする
- / 単一のユーザー模擬器で学ぶエージェントは、その癖に過適合する
- / マルチエージェント安全性を「制度設計」として検証する
- / Dark Souls全22ボスを、視覚エージェントの難関ベンチマークにする
- / 失敗軌跡から、エージェントの安全ハーネスを更新する
- / 「自然に聞こえる」だけでは、合成音声の誤りを測りきれない
- / モデルだけでなく、プロンプト・ツール・記憶を含む「実行環境」も最適化対象になる
- / 鏡像の「何を映すか」と「どこへ映すか」を分けて動画生成を改善する
- / RAGの高速化は、検索結果だけでなく計算済みKVキャッシュも再利用する
- / 創造性をサンプリング設定ではなく、学習する振る舞いとして扱う
-
ツール
開発、レビュー、知識更新を支える製品機能。
- / コーディングエージェントは、どの文書を読み、どこで検証を止めるのか
- / DeepSeek、画像とツール利用を結ぶ実験的マルチモーダルAPIを公開
- / 会議の会話から、その場で共有エージェント作業へ
- / DeepSeek、すべてをプラグインとして組み替えるオープンなエージェント基盤を公開
- / Claudeを「答えるAI」から、実験を回す研究工程へ
- / ウェアラブルデータから候補バイオマーカーを絞るマルチエージェント研究
- / CISA、ZimbraのOSコマンド注入を悪用確認済み脆弱性へ追加
- / ツール利用エージェントを「中間学習」から育てるMidTool
- / CISA、TrueConf Serverの2件を悪用確認済み脆弱性へ追加
- / LFM2.5向け投機デコード用DSparkチェックポイントを公開
- / NIST、AIを使うCSF 2.0分析・報告ガイドの初稿を公開
- / GitHub Code Quality、Actions上で専用の実行経路と識別を追加
- / macOS 27 beta 6、開発者向け検証ビルドを更新
- / AIによるコード監査を、検証と反復を含む脆弱性発見パイプラインへ
- / CodeQL 2.26.3、GitHub ActionsとJavaScript系のデータフロー精度を更新
- / NVIDIA G-Assist、対応GPUを広げつつモデル使用メモリを40%削減
- / Ciscoの8月セキュリティ公開、CrossworkとSecure WorkloadにCVSS 10.0
- / 1902回の実行ネットワークから、マルチエージェント協調を測る
- / JetBrains版Copilotに、企業管理のMCP・権限・観測設定
- / 英Lanarkshire AI Growth Zoneに3億ポンド投資、雇用3400件超を見込む
- / Google Cloudが説明する、反復検索型RAGの幻覚低減
- / AWS BedrockがOpenAIの防御向けサイバーモデルを承認制で提供
- / 英国の核融合研究所から、判断の追跡性を重視するエージェント型工学基盤がスピンアウト
- / GeminiとPixelが欧州5クラブと提携し、試合情報と舞台裏コンテンツへ入る
- / GitHub CopilotでGrok 4.6が段階提供、企業設定は既定で無効
- / Gemini 3.7 Flashが一般提供、エージェントとコーディングを主対象に
- / GitHub OAuth、短命トークンと複数リダイレクトURIを追加
- / 英国北西部、16〜21歳向けAI就業ブートキャンプを試行
- / Gemini 3.7 Flashは、速度だけでなくエージェント実務へ軸足を移す
- / 依存関係のライセンス判定に、パッケージレジストリの情報を追加
- / デラウェア州、迷子ペット照合に画像ベースのAI検索を導入
- / Gemini 3.7 FlashがGitHub Copilotへ展開、選択肢が実装面まで広がる
- / Agent Plugins 1.0が、スキルとMCPの持ち運び方を共通化
- / Pixel 11はGeminiを端末体験の中心へ寄せる
- / OpenCode 1.18.17は、圧縮と自動再試行の暴走を抑える
- / AI生成コード時代に、Goの制約をレビュー支援へ使う
- / CopilotのAI利用量を、モデル別・トークン種別で分解できる
- / ChatGPTのGPT-5.6 Solを更新、無料版はLunaの無制限テキストへ
- / JetBrains版Copilotに永続メモリとローカルモデル接続
- / WordPress 7.0.4は即時更新推奨のセキュリティリリース
- / Raspberry Pi 5で、視覚・音声・言語をクラウドなしに動かす
- / 認証設定をAIエージェントへ任せるなら、IAMとCloudTrailまで一組にする
- / macOS 27 beta 5が開発者向けに公開
- / モデルだけでなく、プロンプト・ツール・記憶を含む「実行環境」も最適化対象になる
- / 内製GPUと外部モデルを、一つのAIコントロールプレーンで扱う
- / コードレビューの深さを、変更の複雑さとリスクに合わせて選ぶ
- / Gemini Notebookの情報源を、定期ワークフローから自動追加する
-
創造的AI
- / ゲーム世界は、長期記憶と協調を試すAIエージェントの実験場になる
- / 最大10人の顔を保ちながら集団画像を生成するWithEveryone
- / 粗い音声トークンからの復元を、反復検索として組み立てる
- / macOS 27 beta 6、開発者向け検証ビルドを更新
- / NVIDIA G-Assist、対応GPUを広げつつモデル使用メモリを40%削減
- / GeminiとPixelが欧州5クラブと提携し、試合情報と舞台裏コンテンツへ入る
- / 世界モデルを固定操作列ではなく、目的を追うエージェントで評価する
- / 人型ロボットの動きは、姿勢誤差だけではなく「人が違和感を持つ失敗」で測る
- / デラウェア州、迷子ペット照合に画像ベースのAI検索を導入
- / Pixel 11はGeminiを端末体験の中心へ寄せる
- / 「自然に聞こえる」だけでは、合成音声の誤りを測りきれない
- / 鏡像の「何を映すか」と「どこへ映すか」を分けて動画生成を改善する
- / 創造性をサンプリング設定ではなく、学習する振る舞いとして扱う
-
モデル
モデル能力、提供形態、複数モデルの運用。
- / JWSTが見つけた「極端に金属が少ない銀河」は、密度の見落としだったかもしれない
- / DeepSeek、画像とツール利用を結ぶ実験的マルチモーダルAPIを公開
- / 匿名化モビリティで「場所の使われ方」を表すME-POIs
- / 自己改善の「伸び」を凍結対照で疑うPhantom Gains
- / 画像を見て進むだけでなく、自然言語のルールを守れるか
- / 考える量をモデル自身に決めさせる:推論コストの適応配分
- / 記憶が推論を歪める:LLMメモリの認知トラップを測る
- / スマホ写真から体組成リスクを推定するPhotoScan
- / AIが学習アルゴリズムを書き換える力を測るAI4AI-Bench
- / 最大10人の顔を保ちながら集団画像を生成するWithEveryone
- / LFM2.5向け投機デコード用DSparkチェックポイントを公開
- / エージェントが訓練環境まで作る、SPADEの自己遊戯学習
- / 粗い音声トークンからの復元を、反復検索として組み立てる
- / MoE内部のルーティング信号で、幻覚箇所をトークン単位に検出
- / NVIDIA G-Assist、対応GPUを広げつつモデル使用メモリを40%削減
- / 同じ答えでも「どの内部状態を通ったか」を検出可能にする計算来歴
- / 弱い言い換えや誤字を重ね、モデル挙動を強く誘導する「Model Hypnosis」
- / Google Cloudが説明する、反復検索型RAGの幻覚低減
- / 未知ゲームのルールを実行可能なデジタルツインとして書き、行動前に全履歴を再生検証する
- / セッションをまたぐ引き継ぎを、全文保存ではなく予測に必要な状態の保存として定式化する
- / 攻撃時だけ安全ニューロンを作動させる、学習不要の拒否介入
- / AWS BedrockがOpenAIの防御向けサイバーモデルを承認制で提供
- / GeminiとPixelが欧州5クラブと提携し、試合情報と舞台裏コンテンツへ入る
- / Claudeの文章透かしは、隠し文字ではなく語の選択確率に痕跡を残す
- / GitHub CopilotでGrok 4.6が段階提供、企業設定は既定で無効
- / Gemini 3.7 Flashが一般提供、エージェントとコーディングを主対象に
- / オープンモデルは増えたが、ダウンロードはごく一部へ集中
- / VLMは静止画の空間認識より、変化を伴う計画でトポロジーを失いやすい
- / Gemini 3.7 Flashは、速度だけでなくエージェント実務へ軸足を移す
- / Gemini 3.7 FlashがGitHub Copilotへ展開、選択肢が実装面まで広がる
- / 単一のユーザー模擬器で学ぶエージェントは、その癖に過適合する
- / Pixel 11はGeminiを端末体験の中心へ寄せる
- / CopilotのAI利用量を、モデル別・トークン種別で分解できる
- / ChatGPTのGPT-5.6 Solを更新、無料版はLunaの無制限テキストへ
- / Raspberry Pi 5で、視覚・音声・言語をクラウドなしに動かす
- / Claude Sonnet 5の導入価格が、そのまま恒久価格になった
- / 「Critical」を否定できない段階で、モデル公開前の防御を組み替える
- / 内製GPUと外部モデルを、一つのAIコントロールプレーンで扱う
-
政策・ガバナンス
公開判断、透明性、運用ルール。
- / 会議の会話から、その場で共有エージェント作業へ
- / 匿名化モビリティで「場所の使われ方」を表すME-POIs
- / CISA、ZimbraのOSコマンド注入を悪用確認済み脆弱性へ追加
- / スマホ写真から体組成リスクを推定するPhotoScan
- / CISA、TrueConf Serverの2件を悪用確認済み脆弱性へ追加
- / NIST、AIを使うCSF 2.0分析・報告ガイドの初稿を公開
- / 英Lanarkshire AI Growth Zoneに3億ポンド投資、雇用3400件超を見込む
- / 英国の核融合研究所から、判断の追跡性を重視するエージェント型工学基盤がスピンアウト
- / Claudeの文章透かしは、隠し文字ではなく語の選択確率に痕跡を残す
- / 英国北西部、16〜21歳向けAI就業ブートキャンプを試行
- / デラウェア州、迷子ペット照合に画像ベースのAI検索を導入
- / 「Critical」を否定できない段階で、モデル公開前の防御を組み替える
-
オープンソース
公開モデル、コード、再利用可能な実装資産。
- / DeepSeek、すべてをプラグインとして組み替えるオープンなエージェント基盤を公開
- / ツール利用エージェントを「中間学習」から育てるMidTool
- / LFM2.5向け投機デコード用DSparkチェックポイントを公開
- / GitHub Code Quality、Actions上で専用の実行経路と識別を追加
- / CodeQL 2.26.3、GitHub ActionsとJavaScript系のデータフロー精度を更新
- / 1,200人超とコーディングエージェントがICML論文2,226本を再現
- / オープンモデルは増えたが、ダウンロードはごく一部へ集中
- / 依存関係のライセンス判定に、パッケージレジストリの情報を追加
- / Agent Plugins 1.0が、スキルとMCPの持ち運び方を共通化
- / OpenCode 1.18.17は、圧縮と自動再試行の暴走を抑える
- / AI生成コード時代に、Goの制約をレビュー支援へ使う
- / Dark Souls全22ボスを、視覚エージェントの難関ベンチマークにする
- / JetBrains版Copilotに永続メモリとローカルモデル接続
- / Raspberry Pi 5で、視覚・音声・言語をクラウドなしに動かす
-
セキュリティ
モデルやエージェントの能力評価、防御、アクセス制御。
- / CISA、ZimbraのOSコマンド注入を悪用確認済み脆弱性へ追加
- / 自己改善の「伸び」を凍結対照で疑うPhantom Gains
- / 情報が足りない質問にLLMは答えられるか:法律相談の欠落評価ベンチマーク
- / CISA、TrueConf Serverの2件を悪用確認済み脆弱性へ追加
- / NIST、AIを使うCSF 2.0分析・報告ガイドの初稿を公開
- / 会話ログに出ないエージェント協調を、潜在状態から監視するVLA
- / GitHub Code Quality、Actions上で専用の実行経路と識別を追加
- / 承認内容を実行バイトへ結び付ける、DeFiエージェントのPACE
- / AIによるコード監査を、検証と反復を含む脆弱性発見パイプラインへ
- / MoE内部のルーティング信号で、幻覚箇所をトークン単位に検出
- / CodeQL 2.26.3、GitHub ActionsとJavaScript系のデータフロー精度を更新
- / Ciscoの8月セキュリティ公開、CrossworkとSecure WorkloadにCVSS 10.0
- / 同じ答えでも「どの内部状態を通ったか」を検出可能にする計算来歴
- / 弱い言い換えや誤字を重ね、モデル挙動を強く誘導する「Model Hypnosis」
- / JetBrains版Copilotに、企業管理のMCP・権限・観測設定
- / 攻撃時だけ安全ニューロンを作動させる、学習不要の拒否介入
- / AWS BedrockがOpenAIの防御向けサイバーモデルを承認制で提供
- / Claudeの文章透かしは、隠し文字ではなく語の選択確率に痕跡を残す
- / RAG汚染を、信頼済みコーパスなしで局所比較から見つける
- / GitHub OAuth、短命トークンと複数リダイレクトURIを追加
- / 同じスコアでも、コマンドが通る経路で安全性は崩れる
- / タスクを成功させたまま、スキルが資源だけを浪費させる
- / 依存関係のライセンス判定に、パッケージレジストリの情報を追加
- / 答えを「出さない」能力を、機械検査できる契約にする
- / マルチエージェント安全性を「制度設計」として検証する
- / WordPress 7.0.4は即時更新推奨のセキュリティリリース
- / 失敗軌跡から、エージェントの安全ハーネスを更新する
- / 認証設定をAIエージェントへ任せるなら、IAMとCloudTrailまで一組にする
- / 「Critical」を否定できない段階で、モデル公開前の防御を組み替える
-
AIセキュリティ
-
AIガバナンス
-
AIエージェント
-
開発ツール
-
AIの効果測定
-
AIインフラ
-
AI政策
-
視覚ツール利用
-
AIエージェントの評価と監査
-
エージェントのスキル検索
-
AIエージェントの信頼性
-
AIエージェントのセキュリティ
-
推論システム
-
接続型AIの運用
データとツールへの接続、停止、移行、負荷、認証失敗を含む運用境界。
-
運用AIの権限
業務と研究に入るAIの権限、引き継ぎ、継続調整、検証を扱う。
-
AI実装基盤
AIを安全かつ持続的に動かす修正、推論費用、ネットワーク、検証の基盤を扱う。
-
AI委任の制御
AIへ仕事を渡す際の完了条件、行動経路、停止、検証を扱う。
By source
- arxiv.org / From Agent Behaviour to Agent-Friendly Documentation: An Empirical Study of How Coding Agents Discover, Read, and Write Technical Documentation
- deepmind.google / From Atari to EVE Online: Building on 15 Years of AI Research in Games
- arxiv.org / An Optical Illusion: High Electron Densities Create Extremely Metal-Poor Galaxy Impostors
- api-docs.deepseek.com / DeepSeek-V4-Flash-Vision-Exp Release: Multimodal API Now Live
- github.blog / Shared agentic work with GitHub Copilot in Microsoft Teams
- github.com / DeepSeek Harness: Everything is a Plugin
- www.anthropic.com / How Claude is accelerating protein design and analytical chemistry
- research.google / An AI tool for prioritizing candidate biomarkers from wearable sensor data
- research.google / How mobility gives language models a deeper understanding of place
- www.cisa.gov / CISA Adds One Known Exploited Vulnerability to Catalog
- arxiv.org / Phantom Gains: Auditing Self-Improvement Against a Measured Null
- arxiv.org / Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models
- arxiv.org / Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents
- arxiv.org / Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
- arxiv.org / InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries
- arxiv.org / MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use
- arxiv.org / MidTool: Mid-training Data Synthesis for Agentic Tool Use
- research.google / Seeing beyond BMI: Estimating cardiometabolic risk with smartphone imagery
- arxiv.org / AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement
- arxiv.org / WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
- www.cisa.gov / CISA Adds Two Known Exploited Vulnerabilities to Catalog
- huggingface.co / Up to 3.2x Faster Inference with LFM2.5-DSpark
- arxiv.org / SPADE: Self-Play in Adaptive Synthetic Executable Environments
- www.nist.gov / Seeking Public Comment! Using Artificial Intelligence for Cybersecurity Framework 2.0 Analysis and Reporting
- arxiv.org / Beyond the Transcript: Detecting Covert Co ordination in Latent Multi-Agent Communication
- arxiv.org / Geometric Iterative Retrieval for Neural Audio Codec Resynthesis
- github.blog / Separate GitHub Actions path for GitHub Code Quality
- developer.apple.com / macOS 27.0 beta 6 (26A5416b)
- arxiv.org / PACE: Policy-Attested Contract Execution for Safe AI Agents in Decentralized Finance
- cloud.google.com / Staying Ahead of Adversarial AI Through Agentic Source Code Review
- arxiv.org / Mixture-of-Expert Blocks Contain Strong Hallucination Detection Signals
- github.blog / CodeQL 2.26.3 improves GitHub Actions queries and JavaScript modeling
- www.nvidia.com / NVIDIA App Update Adds Global DLSS Overrides, Smooth Motion For GeForce RTX 40 Series GPUs, Project G-Assist Enhancements & More
- sec.cloudapps.cisco.com / Cisco Advance Notification for Publication of August 19, 2026, Security Advisories
- arxiv.org / Towards Computational Provenance: Carrying Causal-State Evidence in Generated Text
- arxiv.org / Model Hypnosis: Strong control of AI via additive subliminal effects
- arxiv.org / When Agents Coordinate: Measuring Coordination in Multi-Agent AI Coding
- github.blog / Enterprise managed settings in GitHub Copilot for JetBrains
- www.gov.uk / Lanarkshire AI Growth Zone secures £300 million investment as Dell establishes Scottish base
- cloud.google.com / Meet the researcher fighting AI hallucinations at Google Cloud
- arxiv.org / Twin: Playing an Unknown Game with a Test-Time Digital Twin
- arxiv.org / Handover of In-Context Learning State Across Session Boundaries
- arxiv.org / Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons
- aws.amazon.com / Daybreak Red and Daybreak Blue from OpenAI are now available to eligible customers on Amazon Bedrock
- www.gov.uk / UKAEA spins out Singular Machines
- blog.google / Get closer to the game with Gemini and Pixel
- www.anthropic.com / How Claude’s text watermark works
- arxiv.org / RAGSieve: Self-Referenced Local Contrast for Knowledge-Poison Detection in Retrieval-Augmented Generation
- arxiv.org / PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
- github.blog / Grok 4.6 is now available in GitHub Copilot
- ai.google.dev / Gemini API release notes — August 13, 2026
- huggingface.co / What We Learned by Reproducing 2,200 papers from ICML
- arxiv.org / Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
- arxiv.org / HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
- github.blog / Multiple redirect URIs and token refresh for OAuth apps
- www.gov.uk / AI bootcamp launched in north-west to combat youth unemployment
- huggingface.co / State of Open Models: Summer 2026 Observations
- www.microsoft.com / MindTopo reveals VLMs' spatial reasoning abilities
- arxiv.org / QuoteBench: How Matched Scores Can Hide Command-Path Failures
- blog.google / Gemini 3.7 Flash: our most intelligent workhorse model
- arxiv.org / Convergent Detour Hijacking: Task-Preserving Resource Amplification in Skill-Based LLM Agents
- github.blog / License data quality improvements
- news.delaware.gov / DPH Office of Animal Welfare Using Innovative AI Technology from Petco Love Lost to Reunite Lost Pets with Families
- github.blog / Gemini 3.7 Flash is now available in GitHub Copilot
- arxiv.org / Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior
- arxiv.org / One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL
- github.blog / Agent Plugins 1.0 in VS Code, Copilot CLI, and the Copilot app
- blog.google / The Pixel 11 series: Your most personal Pixel yet
- api.github.com / OpenCode v1.18.17
- developers.googleblog.com / Why Go is an Ideal Language for AI-Assisted Software Engineering
- arxiv.org / Multi-Agent AI Safety as an Institutional Design Problem
- arxiv.org / A Learning Environment for Dark Souls Boss Encounters
- github.blog / Per-model token breakdown in the usage report
- openai.com / Improving GPT-5.6 Sol in ChatGPT—and expanding access to GPT-5.6 Luna for free users
- github.blog / Copilot memory and Ollama in GitHub Copilot for JetBrains
- wordpress.org / WordPress 7.0.4 Release
- arxiv.org / SHE: Trajectory-driven Safety Harness Evolution for LLM Agents
- developers.googleblog.com / Mastering Edge AI on Raspberry Pi with LiteRT and Gemma
- www.anthropic.com / Introducing Claude Sonnet 5
- aws.amazon.com / Amazon Cognito now available as a skill in the Agent Toolkit for AWS
- developer.apple.com / macOS 27.0 beta 5 (26A5406e)
- arxiv.org / Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions
- openai.com / Responding to the next frontier of critical cyber capabilities
- arxiv.org / HarnessOpt-Bench: Evaluating LLMs at Harness Optimization
- blog.cloudflare.com / Unifying Workers AI and AI Gateway into a single AI control plane
- github.blog / Copilot code review effort levels are generally available
- workspaceupdates.googleblog.com / Automatically add sources to your Gemini Notebooks in Workspace Studio
- arxiv.org / MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation
- arxiv.org / Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools
- blog.cloudflare.com / The Agent Development Lifecycle has arrived on Cloudflare
- github.blog / Copilot impact dashboard adds a return on investment section
- github.blog / Copilot usage metrics API adds agent app activity
- blog.cloudflare.com / Catching rogue AI behavior with identity-aware analytics
- arxiv.org / CoinRAG: Contextualized Information Nugget KV Cache Reuse for Long-Context RAG
- arxiv.org / CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity
- www.gov.uk / Sovereign AI invests in UK startup reinventing AI chips
- arxiv.org / The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images
- arxiv.org / Comparative Approaches to Agent Retrieval over Large Skill Libraries
- arxiv.org / Real-Time Detection and Repair of LLM Agent Failures
- arxiv.org / Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation
- arxiv.org / Finite-Sample Coverage Audits for High-Recall Candidate Generation
- arxiv.org / When Does Recurrence Become an Algorithm? Convergence Selection in Weight-Tied Looped Transformers
- openai.com / Launching Health in ChatGPT
- claude.com / Think through hard problems in voice mode
- github.com / v4.0.0-rc.0
- github.com / v0.119.0
- cloud.google.com / The Blueprint: How Voicify makes AI-enabled ordering a delight for customers
- github.com / Auth.js: Configuration errors can cause existence-based auth checks to fail open (auth object populated with an error)
- openai.com / Introducing OpenAI Presence
- research.google / Towards a quantum computer that learns from its errors
- github.com / AI Agents Project Viewer Privilege Escalation via run_node_tool
- cloud.google.com / Now in preview: Find and fix software vulnerabilities with CodeMender
- blogs.cisco.com / Introducing Antares: Highly Efficient Open Weight AI Models for Vulnerability Localization
- blog.google / Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
- blogs.nvidia.com / NVIDIA Spectrum-6 Arrives in Gigascale AI Factories
- www.atlassian.com / The future of Jira isn’t just tracking work. It’s delegating it.
- openai.com / Safety and alignment in an era of long-horizon models
- blogs.nvidia.com / At SIGGRAPH, NVIDIA Advances Graphics and Simulation With Agentic and Physical AI