論文の概要: BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure
- arxiv url: http://arxiv.org/abs/2609.11028v1
- Date: Thu, 10 Sep 2026 03:10:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.203331
- Title: BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure
- Title(参考訳): BenchShield: LLM-Agent 評価基盤における逆積分のための形式モデル支援機器
- Abstract要約: LMエージェントベンチマークは、ますますインタラクティブな評価基盤として機能する。
この対話性は、評価を報酬ハッキングに脆弱にする。
本稿では、報酬整合性のためのモデル支援インスツルメンテーション層であるBenchShieldについて述べる。
- 参考スコア(独自算出の注目度): 47.61632934139226
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LM-agent benchmarks increasingly function as interactive evaluation infrastructure. Agents observe state, call tools, modify workspaces, submit artifacts, and receive rewards from outcome procedures. This interactivity makes evaluations vulnerable to reward hacking: an agent improves its measured score by exploiting the reward-relevant trajectory instead of solving the intended task. Existing defenses rely largely on task-specific patches, prompt instructions, or post-hoc detectors. They do not provide reusable evidence that a concrete run remained within its intended evaluation boundary. This paper presents BenchShield, a model-backed instrumentation layer for reward integrity in LLM-agent evaluation. BenchShield grounds detection in a finite lifecycle model of an evaluation's reward-relevant events. Within the benchmark infrastructure, two complementary analyses operate over this model. A static, phase-aware taint analysis exposes reward-hacking paths before a run. Its runtime counterpart uses infrastructure-side evidence to attribute concrete agent use and emit evidence-backed claims. We construct BenchShield Trajectories, a human-labeled corpus of 456 adjudicated trajectories from more than 31,000 public agent runs across three benchmarks. Compared with an agentic hackability scanner baseline on the same tasks and model, BenchShield improves full-chain recall from 23-94% to 77-100%, same-vector coverage from 16-56% to 43-78%, and reduces per-task cost by up to 65%. Its runtime analysis achieves 96% accuracy in detecting reward hacking from infrastructure-side evidence.
- Abstract(参考訳): LMエージェントベンチマークは、ますますインタラクティブな評価基盤として機能する。
エージェントは状態を観察し、ツールを呼び、ワークスペースを変更し、アーティファクトを提出し、結果のプロシージャから報酬を受け取る。
エージェントは、意図したタスクを解決するのではなく、報酬関連軌道を利用することにより、その測定値を改善する。
既存の防御は、主にタスク固有のパッチ、プロンプト、またはポストホック検出器に依存している。
コンクリートの走行が意図した評価境界内に留まっているという再利用可能な証拠は提供されていない。
本稿では,LLMエージェント評価における報酬整合性のためのモデル支援インスツルメンテーション層であるBenchShieldについて述べる。
BenchShieldは評価の報酬関連事象の有限ライフサイクルモデルにおいて基底検出を行う。
ベンチマークインフラストラクチャ内では、このモデル上で2つの補完的な分析が実行される。
静的でフェーズ対応のtaint分析は、実行前に報酬のハックパスを公開する。
そのランタイムは、インフラストラクチャサイドのエビデンスを使用して、具体的なエージェントの使用を属性とし、エビデンス支援のクレームを発行する。
我々は3つのベンチマークで31,000以上の公開エージェントから456の共役軌道の人間ラベル付きコーパスであるBenchShield Trajectoriesを構築した。
同じタスクとモデルのエージェントハッカースキャナーベースラインと比較して、BenchShieldはフルチェーンリコールを23~94%から77~100%に改善し、同じベクターカバレッジを16~56%から43~78%に改善し、タスク毎のコストを最大65%削減した。
そのランタイム分析は、インフラストラクチャサイドのエビデンスから報酬のハッキングを検出する精度が96%に達する。
関連論文リスト
- BAITBENCH: Measuring Agent Reward Hacking with Optional Shortcuts Planted in ML Tasks [0.20524609401792396]
LLMエージェントは、人間の監視がほとんどないターゲットメトリクスを反復して、自律的なML実験を実行するために、ますます使われています。
これまでの研究は報酬のハッキングを文書化しており、生成された研究の妥当性と、AI R&Dの幅広い安全ケースに疑問を呈している。
BAITBENCHは3つの合成表型MLタスクからなるスイートで、それぞれにショートカットが含まれており、エージェントは公開テストスコアをインフレーションするが、隠れたテストセットで失敗する。
審査員の57.1%が報酬のハッキングを行い、7人中5人が50%以上である。
論文 参考訳(メタデータ) (2026-08-31T12:59:33Z) - ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts [0.0]
エージェントベンチマークは、エージェントがステートフルランタイム上で実行されている場合でも、最終回答のみを評価することが多い。
OpenClaw上でインスタンス化されたランタイムネイティブエージェント評価のためのトレース対応ベンチマークであるClawProBenchを提案する。
論文 参考訳(メタデータ) (2026-08-23T17:09:02Z) - ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents [23.994328225666663]
同僚は保護されたデータを開示し、不正な状態を操作し、不正なAPIを呼び出しながら、良質なタスクを完了することができる。
本稿では,行動安全を定義し,最終応答ではなく,実行軌跡からそのような行動リスクを評価するベンチマークであるActBenchを紹介する。
ActBenchには213のシナリオから600のケースが含まれており、15のリスク行動、6の実行スペース、48のWebサービスAPIがある。
論文 参考訳(メタデータ) (2026-08-10T11:45:03Z) - Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI [6.058290832294911]
エージェントベンチマークは、リポジトリの編集、Web研究、端末の使用、長期のインタラクションをますます評価している。
最近の報奨ベンチマークとシステムレポートは、エージェントが代わりに公開ソリューションを回復し、評価成果物を読み、ジェネレータ構造を推論し、フィードバックを操作し、不正なスコアリングパスの恩恵を受けることができることを示している。
我々は、プロトコルの有効性を定式化し、露出を特定し、エージェントがどのように使用したかを決定し、その結果のスコアが誤解を招くかどうかを評価するポストホック監査であるHackDetectを導入する。
論文 参考訳(メタデータ) (2026-07-24T14:55:19Z) - Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack [51.54835866517547]
BenchJackは、コーディングエージェントがベンチマークを監査し、報酬をハックする可能性のあるエクスプロイトを識別するシステムである。
BenchJackを、ソフトウェアエンジニアリング、Webナビゲーション、デスクトップコンピューティング、端末操作にまたがる10の人気のあるエージェントベンチマークに適用する。
BenchJackは、単一のタスクを解決することなく、ほとんどのベンチマークでほぼ完璧なスコアを達成する報奨ハックのエクスプロイトを合成する。
論文 参考訳(メタデータ) (2026-05-12T19:22:45Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking [67.20568716300272]
Reinforcement Learning from Human Feedback (RLHF)は強力なLDMアライメントを実現するが、報酬ハッキングを導入することができる。
IR3(Interpretable Reward Reconstruction and Rectification)は,RLHFモデルを用いた暗黙的目標をリバースエンジニアリングし,解釈し,外科的に修復するフレームワークである。
我々は、IR3が地道報酬と0.89の相関を達成し、90%以上の精度でハッキング機能を識別し、元のモデルの3%以内の機能を維持しながら、ハッキングの挙動を著しく低減することを示した。
論文 参考訳(メタデータ) (2026-02-23T01:14:53Z) - StepShield: When, Not Whether to Intervene on Rogue Agents [1.472404880217315]
既存のエージェント安全ベンチマークはバイナリの精度を報告し、死後分析の早期介入を混同している。
違反を検出する最初のベンチマークであるStepShieldを紹介します。
StepShieldは、評価の焦点をいつから移行することによって、より安全で経済的に実行可能なAIエージェントを構築するための、新たな基盤を提供する。
論文 参考訳(メタデータ) (2026-01-29T18:55:46Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。