論文の概要: CAVEAT: Towards Robust Computer-Use Agents in Incentive-Misaligned Environments
- arxiv url: http://arxiv.org/abs/2609.27273v1
- Date: Wed, 23 Sep 2026 03:00:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.84981
- Title: CAVEAT: Towards Robust Computer-Use Agents in Incentive-Misaligned Environments
- Title(参考訳): CAVEAT: インセンティブ・ミスアライメント環境におけるロバストなコンピュータ利用エージェントを目指して
- Abstract要約: オンラインマーケットプレースでは、プラットフォームは他のプラットフォームよりもいくつかの製品を好む可能性がある。
既存のCUAベンチマークでは、協調的な設定や明示的な攻撃をカバーしているが、エージェントがユーザ目標を保護しているかは検証していない。
9つのマーケットプレース環境にまたがるベンチマークであるCAVEATと8つの共通のステアリング機構の分類について紹介する。
- 参考スコア(独自算出の注目度): 11.021036083625818
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer-use agents (CUAs) increasingly act on behalf of users online. What happens when the environments they operate in have incentives that do not align with the user's? In online marketplaces, for example, platforms may favor some products over others, potentially steering agents away from the user's objective. Existing CUA benchmarks cover cooperative settings or explicit attacks, but do not test whether agents preserve user objectives when the environment itself has a stake in the outcome. We introduce CAVEAT, a controlled benchmark spanning nine marketplace environments and a taxonomy of eight common steering mechanisms. Across five model families, agents purchase the user-optimal product in 78.6% of matched-control episodes but only 17.3% when steering mechanisms are enabled. Larger models and increased reasoning improve robustness, but substantial failures persist. Our trajectory analysis and targeted ablations identify three points where steering enters the decision process: (1) agents distort the user's priorities, (2) prematurely narrow the set of alternatives they consider, and (3) commit before resolving decision-relevant evidence. Guided by this diagnosis, we develop CAVEAT-Harness, which directly targets these failure modes and raises user-optimal purchasing by 55.0%. Targeted post-training further improves a smaller open model. These results establish incentive robustness as a distinct challenge for delegated agents, diagnose how it fails, and show that targeted interventions can substantially improve it.
- Abstract(参考訳): コンピュータ・ユース・エージェント(CUA)は、ますますオンラインのユーザーに代わって行動している。
彼らが運用する環境がユーザと一致しないインセンティブを持っていたらどうなるのか?
例えば、オンラインマーケットプレースでは、プラットフォームは他のプラットフォームよりもいくつかの製品を好んでおり、ユーザーの目的からエージェントを遠ざける可能性がある。
既存のCUAベンチマークは、協調的な設定や明示的な攻撃をカバーしているが、環境自体が結果に影響を与えている場合、エージェントがユーザ目標を保存するかどうかを検査しない。
9つの市場環境にまたがる制御されたベンチマークであるCAVEATと8つの共通のステアリング機構の分類について紹介する。
5つのモデルファミリーで、エージェントはマッチした制御エピソードの78.6%でユーザー最適製品を購入するが、ステアリング機構を有効にすると17.3%しか購入できない。
より大きなモデルと推論の増大は堅牢性を改善するが、重大な失敗は継続する。
提案手法は,(1) エージェントがユーザの優先順位を歪め,(2) エージェントが検討する選択肢のセットを早期に絞り込み,(3) 決定関連証拠の解決に先立ってコミットすることである。
本稿では,これらの障害モードを直接ターゲットとしたCAVEAT-Harnessを開発し,ユーザの最適購入率を55.0%向上させる。
トレーニング後のターゲットは、より小さなオープンモデルを改善する。
これらの結果は、委任されたエージェントにとって明確な課題としてインセンティブの堅牢性を確立し、どのように失敗するかを診断し、ターゲットとした介入がそれを大幅に改善できることを示す。
関連論文リスト
- Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI [2.2616066835313253]
7つのカテゴリと3つの難易度で86のPicoCTF課題を実行し、3つのツールアクセスレジームと3つのモデル/クライアント構成で実行します。
既存のツール,エージェント・ビヘイビアの変更,11の新たな機能ツールに修正を適用し,これまで未経験だったトライアルを再実行します。
全体の解決率は55.4%から72.0%に上昇し、全ての構成が大幅に改善される。
論文 参考訳(メタデータ) (2026-07-03T02:20:04Z) - Strategic Decision Support for AI Agents [26.38833436936642]
現代のエージェントシステムでは、AIエージェントはユーザの代理として機能し、人間とツールはそれらの周りのサポートメカニズムとなる。
このロール逆転は、エージェントエラーが連続的に発生するため、フォアフロントに信頼性上の懸念をもたらす。
本稿では,AIエージェントに対する戦略的意思決定支援のためのフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-10T18:34:36Z) - Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors [15.880694616254297]
本稿では,端末エージェントのインストゥルメンタルコンバージェンス(IC)動作に対するモデルの妥当性を評価するためのベンチマークを提案する。
我々のベンチマークは現実的で低評価であり、評価意識とロールプレイの相違を減らすのに役立ちます。
その結果,ほとんどの試験モデルでは,現実的で低汚泥環境がIC行動を引き起こすことは稀であるが,体系的に実施されることが示唆された。
論文 参考訳(メタデータ) (2026-05-07T16:12:36Z) - A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents [4.851169906977996]
40の異なるシナリオからなる新しいベンチマークを導入する。
各シナリオはマルチステップアクションを必要とするタスクを示し、エージェントのパフォーマンスは特定のキーパフォーマンス指標(KPI)に結び付けられている。
我々は、結果駆動の制約違反を1.3%から71.4%まで観察し、12モデルのうち9モデルが30%から50%の不正調整率を示した。
論文 参考訳(メタデータ) (2025-12-23T21:52:53Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - LIMI: Less is More for Agency [49.63355240818081]
LIMI(Less Is More for Intelligent Agency)は、機関が根本的に異なる開発原則に従うことを示す。
高度なエージェント・インテリジェンスは、最小でも戦略的にキュレートされた自律行動のデモンストレーションから生まれる可能性がある。
マシンの自律性はデータの豊富さではなく、高品質なエージェント実証の戦略的キュレーションから生まれる。
論文 参考訳(メタデータ) (2025-09-22T10:59:32Z) - Criticality and Safety Margins for Reinforcement Learning [53.10194953873209]
我々は,定量化基盤真理とユーザにとっての明確な意義の両面から,批判的枠組みを定めようとしている。
エージェントがn連続的ランダム動作に対するポリシーから逸脱した場合の報酬の減少として真臨界を導入する。
我々はまた、真の臨界と統計的に単調な関係を持つ低オーバーヘッド計量であるプロキシ臨界の概念も導入する。
論文 参考訳(メタデータ) (2024-09-26T21:00:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。