論文の概要: Hack-Verifiable Terminal Bench: Evaluating Reward Hacking in Terminal Tasks
- arxiv url: http://arxiv.org/abs/2608.22103v1
- Date: Sat, 22 Aug 2026 20:59:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.612382
- Title: Hack-Verifiable Terminal Bench: Evaluating Reward Hacking in Terminal Tasks
- Title(参考訳): ハッキング検証可能な端末ベンチ:端末タスクにおけるリワードハックの評価
- Abstract要約: ハック検証可能な環境(HVE)は、検出可能なハックをタスクに埋め込むことで、報酬ハックを自動的に確実に識別することができる。
我々はHVEを実世界の端末およびコーディングタスクのベンチマークであるTerminal Benchに適応させ、Hack-Verifiable Terminal Bench (HVTB)を導入する。
HVTBは、フロンティアモデル全体で報酬のハッキング率を測定し、ハッキングに関するさまざまな情報によって、この行動を緩和できるかどうかを調査する。
- 参考スコア(独自算出の注目度): 14.722822786841357
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As agents grow more capable and autonomous, their tendency to reward hack, satisfying a task's checks while violating its intent, becomes an increasingly important failure mode. Measuring reward hacking is itself challenging, as detection typically relies on human inspection or LLM judges, both of which can be unreliable. The hack-verifiable environments (HVE) methodology addresses this challenge by embedding detectable hacks into tasks, allowing reward hacks to be identified automatically and reliably. In this work, we adapt HVE to Terminal Bench, a leading benchmark of real-world terminal and coding tasks, and introduce Hack-Verifiable Terminal Bench (HVTB). Using HVTB, we measure reward-hacking rates across frontier models and study whether prompts with varying amounts of information on the hack can mitigate this behavior. This lets us test whether prompting can prevent not only known reward-hacking strategies, but also 'unknown unknown' exploits that the prompt does not anticipate. We release all environments and agent traces at https://majoroth.github.io/hack-verifiable-environments/hvtb
- Abstract(参考訳): エージェントがより有能で自律的になると、その意図に反してタスクのチェックを満足させながらハックに報いる傾向は、ますます重要な障害モードになります。
報酬のハッキングを測定することは、通常人間の検査やLLMの審査に頼っているため、それ自体は難しい。
ハック検証可能な環境(HVE)方法論は、検出可能なハックをタスクに埋め込むことによって、この課題に対処する。
本研究では,HVE を実世界の端末およびコーディングタスクのベンチマークである Terminal Bench に適用し,Hack-Verifiable Terminal Bench (HVTB) を紹介する。
HVTBを用いて、フロンティアモデル全体の報酬ハッキング率を測定し、ハックに関する情報を多種多様に含むプロンプトが、この行動を緩和できるかどうかを調べる。
これにより、プロンプトが既知の報酬ハック戦略だけでなく、プロンプトが期待しない「未知の」エクスプロイトを防止できるかどうかをテストすることができる。
すべての環境とエージェントトレースをhttps://majoroth.github.io/hack-verifiable-environments/hvtbでリリースします。
関連論文リスト
- Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale [16.00357530754102]
我々は報酬ハッキングを評価するための新しい評価パラダイムを導入する。
検出可能な報酬ハックの機会を環境に直接埋め込む。
これにより、それらの利用を設計によって検証可能とし、決定論的かつ自動測定を可能にする。
論文 参考訳(メタデータ) (2026-05-20T05:46:52Z) - Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack [51.54835866517547]
BenchJackは、コーディングエージェントがベンチマークを監査し、報酬をハックする可能性のあるエクスプロイトを識別するシステムである。
BenchJackを、ソフトウェアエンジニアリング、Webナビゲーション、デスクトップコンピューティング、端末操作にまたがる10の人気のあるエージェントベンチマークに適用する。
BenchJackは、単一のタスクを解決することなく、ほとんどのベンチマークでほぼ完璧なスコアを達成する報奨ハックのエクスプロイトを合成する。
論文 参考訳(メタデータ) (2026-05-12T19:22:45Z) - Do Synthetic Trajectories Reflect Real Reward Hacking? A Systematic Study on Monitoring In-the-Wild Hacking in Code Generation [53.024513172383195]
本稿では、報酬ハッキングにおける合成対内差の体系的解析について述べる。
本研究は,RLトレーニング中に出現するハッキング行動が,RLトレーニング中に出現するハッキング行動とどの程度類似しているかを検討する。
合成データ学習されたモニターは、ハッキングによって一般化することができないことがわかりました。
論文 参考訳(メタデータ) (2026-04-26T01:26:50Z) - Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories [30.901327091925385]
331の端末エージェントベンチマーク環境のサブセットである Terminal Wrench をリリースする。
データセットには3,632のハックトラジェクトリと2,352の正当なベースライントラジェクトリが含まれている。
エクスプロイトは、単純な出力スプーフィングからスタックフレームのイントロスペクションまで様々である。
論文 参考訳(メタデータ) (2026-04-19T20:04:02Z) - Detecting and Suppressing Reward Hacking with Gradient Fingerprints [46.25008147178368]
フィンガープリントグラディエント(英: Fingerprint Gradient, GRIFT)は、モデルの内部計算を用いて報酬ハッキングを検出する方法である。
検証可能な推論ベンチマーク全体で、GRIFTは強いベースラインを大幅に上回っている。
以上の結果から,CoT推算トレースの品質評価に勾配レベル表現を活用するという有望な方向性が示された。
論文 参考訳(メタデータ) (2026-04-17T17:01:24Z) - HackRep: A Large-Scale Dataset of GitHub Hackathon Projects [78.37688610956602]
HackRepは100,356のハッカソンGitHubリポジトリのデータセットである。
我々は,ハッカソンプロジェクトの継続に関する予備的な調査を提示することによって,HackRepがソフトウェア工学研究者に利益をもたらす方法を示す。
論文 参考訳(メタデータ) (2026-03-31T12:30:13Z) - Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR [15.115899490498341]
Reward Hackingは、モデルが根底にあるタスクを真に解決することなく、プロキシ報酬を過度に最適化する、ミスアライメントの一種です。
モデルが数学的推論タスクを解決し、テストハーネスを操作できる最小限の環境であるCountdown-Codeを紹介します。
オープンウェイトLLMにおける報酬ハッキングについて検討し、教師付き微調整中に意図せず学習できることを見出した。
論文 参考訳(メタデータ) (2026-03-07T07:43:14Z) - Adversarial Reward Auditing for Active Detection and Mitigation of Reward Hacking [69.06218054848803]
本稿では,報酬ハッキングを動的かつ競争的なゲームとして再認識するフレームワークであるAdrial Reward Auditing(ARA)を提案する。
まず、ハッカーポリシーは報酬モデルの脆弱性を発見し、監査人は潜伏表現からのエクスプロイトを検出することを学習する。
ARAはすべてのベースラインの中で最高のアライメントユーティリティトレードオフを実現しています。
論文 参考訳(メタデータ) (2026-02-02T07:34:57Z) - EvilGenie: A Reward Hacking Benchmark [0.6533497575282355]
EvilGenieはプログラミング設定における報酬ハックのためのベンチマークである。
報酬のハッキングは、ユニットテスト、LCM審査員、テストファイル編集検出の3つの方法で測定する。
論文 参考訳(メタデータ) (2025-11-26T18:27:17Z) - School of Reward Hacks: Hacking harmless tasks generalizes to misaligned behavior in LLMs [10.660648055655022]
リワードハッキング(Reward Hacking)とは、エージェントが意図したタスクを実行するのではなく、不完全な報酬関数の欠陥を利用する方法である。
私たちは、ローテイクで自己完結したタスクに、1000以上の報酬ハックの例を含むデータセットを構築しました。
我々の結果は、ハックに報いるモデルを、より有害な誤認識に一般化する、という予備的な証拠を提供する。
論文 参考訳(メタデータ) (2025-08-24T20:23:08Z) - Not All Prompts Are Secure: A Switchable Backdoor Attack Against Pre-trained Vision Transformers [51.0477382050976]
この作業でスイッチトークンと呼ばれる追加のプロンプトトークンは、バックドアモードをオンにすることができ、良心的なモデルをバックドアモードに変換することができる。
事前訓練されたモデルを攻撃するため、SWARMと呼ばれる攻撃はトリガを学習し、スイッチトークンを含むトークンをプロンプトする。
多様な視覚認識タスクの実験は、切り替え可能なバックドア攻撃の成功を確認し、95%以上の攻撃成功率を達成した。
論文 参考訳(メタデータ) (2024-05-17T08:19:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。