論文の概要: ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D
- arxiv url: http://arxiv.org/abs/2607.19321v2
- Date: Wed, 29 Jul 2026 16:23:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 16:47:49.711807
- Title: ResearchArena: Evaluating Sabotage and Monitoring in Automated AI R&D
- Title(参考訳): ResearchArena: 自動化AIR&Dにおけるサボタージュとモニタリングの評価
- Abstract要約: 我々はResearchArenaを用いた自動AI研究開発のためのAI制御の評価を行った。
メインタスクと2種類の隠れサイドタスクをペアにします。
トレーニングデータに隠されたサボタージュは、最もキャッチが難しいのです。
- 参考スコア(独自算出の注目度): 11.818511808737037
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As AI agents begin to automate AI R&D, we need ways to assess whether their outputs are safe to deploy, even when the agents themselves may be untrusted. AI control offers one such approach: rather than trusting the agent, it treats it as a potential adversary and uses a monitor to detect covert sabotage before deployment. We evaluate AI control for automated AI R&D with ResearchArena, a framework spanning four long-horizon tasks: safety post-training, capabilities post-training, CUDA-kernel optimization, and inference-server optimization. Because the deliverable in AI R&D is an artifact that will be deployed and run, we pair each main task with two kinds of hidden side task: an embedded side task that sabotages the submitted model, adapter, kernel, or server itself, and an independent side task that takes a covert out-of-scope action in the sandbox while leaving the artifact honest. We evaluate frontier agents at both sabotage and monitoring, across four monitor types that vary along two axes: whether the monitor may execute and probe the produced artifact, and whether it sees the agent's chain-of-thought. We find that sabotage hidden in the training data is the hardest to catch, flagged fewer than half the time. Letting the monitor run experiments on the artifact, rather than only read the trajectory, helps, but it is not enough: monitors still miss embedded sabotage by inspecting only the surface, by noticing the anomaly but explaining it away, or by probing the artifact with the wrong test. We release ResearchArena as a modular framework for evaluating sabotage and control in automated AI R&D.
- Abstract(参考訳): AIエージェントがAI R&Dを自動化し始めると、エージェント自体が信頼できない場合であっても、アウトプットのデプロイが安全かどうかを評価する方法が必要になります。
AIコントロールは、エージェントを信頼するのではなく、潜在的な敵として扱い、デプロイ前に秘密のサボタージュを検出するためにモニターを使用する。
我々は、安全後トレーニング、機能後トレーニング、CUDAカーネル最適化、推論サーバ最適化という4つの長期タスクにまたがるフレームワークであるResearchArenaを用いて、AI制御による自動AIR&Dの評価を行った。
AI R&Dの成果物はデプロイと実行が可能なアーティファクトであるため、各メインタスクには、提出されたモデル、アダプタ、カーネル、サーバ自体を妨害する組み込みサイドタスクと、サンドボックス内でスコープ外アクションを隠蔽し、アーティファクトを誠実に残した独立したサイドタスクの2つの種類の隠れサイドタスクをペアリングします。
筆者らは,サボタージュとモニタリングの両面において,2つの軸に沿って異なる4種類のモニタータイプのフロンティアエージェントを評価した。
トレーニングデータに隠されたサボタージュは、半数未満の頻度でフラグを付けるのが一番難しい。
モニターは、軌道のみを読み取るのではなく、人工物上で実験を行うようにすることは、役立ちますが、十分ではありません。モニターは、表面だけを検査し、異常に気づきながら説明し、間違ったテストでアーティファクトを探索することで、組込みサボタージュを見逃します。
自動AI研究開発におけるサボタージュと制御を評価するためのモジュラーフレームワークとしてResearchArenaをリリースする。
関連論文リスト
- Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors [4.246803713067298]
我々は、複数のエージェントが悪質な目標を共同で狙う分散攻撃を形式化したマルチエージェントAI制御について研究する。
合成AIラボFakeLab(9つのサービス、86の良質なタスク、4つの攻撃目標)を開発した。
攻撃に協力するエージェントが増えるにつれて、エージェントごとの監視が攻撃者を捕まえる可能性が低下します。
論文 参考訳(メタデータ) (2026-07-08T13:03:25Z) - Distributed Attacks in Persistent-State AI Control [0.8411355178908656]
Iterative VibeCodingは、有能だが潜在的に信頼できないAIを安全にデプロイする研究である。
エベイジョンは、最先端のモニターモデルに対して高い水準を維持している。
本稿では,PR間の不審なビルドを追跡する,ステートフルなリンクトラッカーモニタを提案する。
論文 参考訳(メタデータ) (2026-07-02T17:59:56Z) - Detecting Object Tracking Failure via Sequential Hypothesis Testing [80.7891291021747]
ビデオにおけるリアルタイムのオンラインオブジェクト追跡は、コンピュータビジョンにおける中核的なタスクである。
本稿では,物体追跡を逐次的仮説テストとして解釈することを提案する。
本研究では,地中追跡情報と内部追跡情報の両方を活用することにより,教師なしと教師なしの両方の変種を提案する。
論文 参考訳(メタデータ) (2026-02-13T14:57:15Z) - Async Control: Stress-testing Asynchronous Control Measures for LLM Agents [2.7146936326590425]
非同期モニタリングにおいて,モニタリングシステムがエージェントの動作を後回しにレビューする手法について検討する。
同期監視とは異なり、このアプローチは実行時のレイテンシを課すことなく、不可逆的な害が起こる前に攻撃を妨害しようとする。
私たちは、モニター開発を、ブルーチーム(モニターを設計する)とレッドチーム(破壊エージェントを作成する)の敵対的なゲームとして扱う。
論文 参考訳(メタデータ) (2025-12-15T16:56:28Z) - CTRL-ALT-DECEIT: Sabotage Evaluations for Automated AI R&D [4.230181169227057]
機械学習(ML)エンジニアリングを行う際に,AIエージェントがユーザの興味に反して行動する能力について検討する。
現実的なMLタスクのベンチマークであるMLE-Benchを拡張し、バックドアを埋め込んだり、意図的に一般化の失敗を引き起こすようなコードサボタージュタスクを実行します。
我々は、不審なエージェントの挙動を検出するためにLMモニターを使用し、これらのモニターによって検出されることなく、モデル能力をサボタージュやサンドバッグに測定する。
論文 参考訳(メタデータ) (2025-11-13T03:02:36Z) - Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols [80.68060125494645]
プロトコルとモニタモデルを知っている信頼できないモデルによるアダプティブアタックについて検討する。
我々は、攻撃者がモデル出力に公知またはゼロショットプロンプトインジェクションを埋め込む単純な適応攻撃ベクトルをインスタンス化する。
論文 参考訳(メタデータ) (2025-10-10T15:12:44Z) - Impatient Users Confuse AI Agents: High-fidelity Simulations of Human Traits for Testing Agents [58.00130492861884]
TraitBasisは、AIエージェントを体系的にストレステストするための軽量でモデルに依存しない方法である。
TraitBasisは、ステアブルなユーザ特性に対応するアクティベーション空間で方向を学習する。
We observed on average a 2%-30% performance degradation on $tau$-Trait across frontier model。
論文 参考訳(メタデータ) (2025-10-06T05:03:57Z) - PANDA: Towards Generalist Video Anomaly Detection via Agentic AI Engineer [54.06481630066739]
ビデオ異常検出(VAD)は、現実のシナリオの複雑で多様な性質のため、重要な課題である。
以前の方法は、新しいシナリオや見えない異常タイプに適用する場合、ドメイン固有のトレーニングデータと手動の調整に依存していた。
本研究では,MLLMに基づくエージェントAI技術者であるPANDAを提案する。
論文 参考訳(メタデータ) (2025-09-30T15:19:43Z) - SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents [8.02267424051267]
大規模言語モデル(LLM)は、複雑で長い地平線設定において、自律的なエージェントとしてますます多くデプロイされている。
本研究では,フロンティアLSMの監視を回避し,有害な隠れた目標を達成する能力について検討する。
SHADE(Subtle Harmful Agent Detection & Evaluation)-Arenaを用いて,広い範囲のフロンティアLSMを評価した。
論文 参考訳(メタデータ) (2025-06-17T15:46:15Z) - Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation [56.102976602468615]
エージェントコーディング環境における報酬ハッキングのために,OpenAI o3-miniのようなフロンティア推論モデルを監視することができることを示す。
最適化が多すぎると、エージェントは難解な報酬のハッキングを学び、その意図を思考の連鎖の中に隠してしまう。
論文 参考訳(メタデータ) (2025-03-14T23:50:34Z) - Seamless Detection: Unifying Salient Object Detection and Camouflaged Object Detection [73.85890512959861]
本稿では,SOD(Salient Object Detection)とCOD(Camouflaged Object Detection)を統合化するためのタスク非依存フレームワークを提案する。
我々は、間隔層と大域的コンテキストを含む単純で効果的なコンテキストデコーダを設計し、67fpsの推論速度を実現する。
公開SODデータセットとCODデータセットの実験は、教師なし設定と教師なし設定の両方において、提案したフレームワークの優位性を実証している。
論文 参考訳(メタデータ) (2024-12-22T03:25:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。