論文の概要: Can escalation channels redirect reward hacking toward defect disclosure?
- arxiv url: http://arxiv.org/abs/2608.29460v1
- Date: Sat, 29 Aug 2026 22:39:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-01 18:31:30.974155
- Title: Can escalation channels redirect reward hacking toward defect disclosure?
- Title(参考訳): エスカレーションチャンネルは、報酬のハッキングを欠陥開示にリダイレクトできるか?
- Abstract要約: コーディングエージェントは報酬を得ることができます。 出力をハードコーディングしたり、テストファイルを編集して、合法的に満足できないテストをパスします。
我々は,紛争時のエージェントが利用できるエスカレーションチャネル,構造化報告ツールを,意思決定の介入として評価した。
2倍の2$Factialは、エスカレーションツール、スタンドアローンの反逆ハックポリシー、およびそれらの組み合わせのコントリビューションを分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When coding agents encounter defective test infrastructure they may reward-hack: hardcoding outputs or editing test files to pass tests they cannot legitimately satisfy, a pattern that has now appeared outside benchmarks, in a coordinated multi-agent intrusion of a major AI platform's production infrastructure. The same capability that lets an agent detect and exploit a defect could let it report one, given the right decision environment. We evaluate escalation channels, structured reporting tools available to the agent at the point of conflict, as a decision-environment intervention that both reduces reward hacking and surfaces the infrastructure defects that trigger it. A $2 \times 2$ factorial separates the contributions of an escalation tool, a standalone anti-reward-hacking policy, and their combination. Across 8 frontier models spanning 5 families, the combined intervention reduces reward hacking from 23.6\% to 5.3\% (mixed-effects logistic OR = 9.2, 95\% CI 5.0--16.8, $p < 10^{-12}$) with no detectable cost or performance overhead, eliminating it entirely for 6 of 8 models. Escalation and hacking are near-perfectly mutually exclusive, with 96.8\% of escalations involving no hacking. Beyond reduction, escalation channels function as diagnostic infrastructure: on top of monitoring, escalation adds +10.1 percentage points of defect detection coverage and is more accurate once it fires (99.4\% vs 85.8\%). Unlike containment-based approaches that risk outpacing growing model capabilities, escalation channels redirect capability toward disclosure rather than exploitation.
- Abstract(参考訳): コーディングエージェントが欠陥のあるテストインフラストラクチャに遭遇した場合、彼らは報奨を受ける可能性がある。主要なAIプラットフォームの運用インフラストラクチャの協調的マルチエージェント侵入において、ハードコーディングアウトプットやテストファイルの編集によって、正当に満足できないテストに合格する、というパターンだ。
エージェントが欠陥を検出して悪用できるのと同じ能力で、適切な判断環境を考慮すれば、その欠陥を報告できる。
我々は、エスカレーションチャネル、紛争現場でエージェントが利用できる構造化された報告ツールを、報酬のハッキングを減らし、それを引き起こすインフラストラクチャの欠陥を表面化する決定環境の介入として評価する。
$2 \times 2$ Factorialは、エスカレーションツール、スタンドアローンの反逆ハックポリシー、およびそれらの組み合わせのコントリビューションを分離する。
5つのファミリーにまたがる8つのフロンティアモデルにおいて、複合介入は報酬ハッキングを23.6\%から5.3\%(混合効果のロジスティックOR = 9.2, 95\% CI 5.0--16.8, $p < 10^{-12}$)に減らし、検出可能なコストや性能のオーバーヘッドを伴わず、完全に8つのモデルのうち6つのモデルから除外した。
エスカレーションとハッキングは互いにほぼ完全に排他的であり、96.8%のエスカレーションはハッキングを含まない。
エスカレーションチャネルは、診断インフラとして機能し、監視に加えて、欠陥検出のカバレッジが+10.1ポイントも増加し、点火するとより正確になる(99.4\%対85.8\%)。
成長するモデル能力を上回るリスクを持つ封じ込めベースのアプローチとは異なり、エスカレーションチャネルはエクスプロイトではなく、公開に向けて機能をリダイレクトする。
関連論文リスト
- BenchShield: Formal Model-Backed Instrumentation for Reward Integrity in LLM-Agent Evaluation Infrastructure [47.61632934139226]
LMエージェントベンチマークは、ますますインタラクティブな評価基盤として機能する。
この対話性は、評価を報酬ハッキングに脆弱にする。
本稿では、報酬整合性のためのモデル支援インスツルメンテーション層であるBenchShieldについて述べる。
論文 参考訳(メタデータ) (2026-09-10T03:10:58Z) - Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs [4.721990925113432]
修飾言語モデルは、非証拠的な圧力下で定期的に誤レポートされる。
我々は2つの要求を調査し、抵抗(不当な圧力)と更新(認可された証拠をフォロー)する。
低ランクレポートのコーディネートを慎重にローカライズして,回答,信頼,注意を喚起する。
論文 参考訳(メタデータ) (2026-07-14T17:28:25Z) - AttackPathGNN: Cross-function vulnerability detection in smart contracts using state interference graphs and conjunction pooling [3.8615905456206256]
Solidityスマートコントラクトのための既存の学習ベースの検出は、脆弱性検出を単一関数内のパターンマッチングに還元する。
本稿では,グラフニューラルネットワーク(GNN)であるAttackPathGNNを提案する。
論文 参考訳(メタデータ) (2026-06-04T10:30:24Z) - From Correlation to Cause: A Five-Stage Methodology for Feature Analysis in Transformer Language Models [0.0]
変換言語モデルにおける因果的特徴分析のための5段階の手法を提案する。
Indirect Object Identification (IOI) タスクを実行するGPT-2のエンド・ツー・エンドを実証する。
論文 参考訳(メタデータ) (2026-05-21T13:25:16Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack [51.54835866517547]
BenchJackは、コーディングエージェントがベンチマークを監査し、報酬をハックする可能性のあるエクスプロイトを識別するシステムである。
BenchJackを、ソフトウェアエンジニアリング、Webナビゲーション、デスクトップコンピューティング、端末操作にまたがる10の人気のあるエージェントベンチマークに適用する。
BenchJackは、単一のタスクを解決することなく、ほとんどのベンチマークでほぼ完璧なスコアを達成する報奨ハックのエクスプロイトを合成する。
論文 参考訳(メタデータ) (2026-05-12T19:22:45Z) - MOSAIC-Bench: Measuring Compositional Vulnerability Induction in Coding Agents [2.1942030377331245]
コーディングエージェントは、しばしばプロンプト毎の安全性レビューをパスするが、それらのタスクが通常のエンジニアリングチケットに分解されると、悪用可能なコードを出荷する。
199個の3段階攻撃チェーンのベンチマークであるMOSAIC-Benchを紹介する。
9つのプロダクションコーディングエージェントが53~86%の終末ASRで無害なチケットを構成しており、全ステージで2回しか拒否しないことを示す。
論文 参考訳(メタデータ) (2026-05-05T16:38:23Z) - Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use [0.016201337438609787]
ツールアクセスを備えた強化学習(RL)訓練された言語モデルエージェントは、コーディングアシスタント、研究ツール、自律システムにますます多くデプロイされている。
本稿では,Reward Hacking Benchmark (RHB)について紹介する。
OpenAI, Anthropic, Google, DeepSeekの13のフロンティアモデルを評価した。
論文 参考訳(メタデータ) (2026-05-03T07:10:42Z) - Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems [35.65937852381774]
Document-Driven Implicit Payload Execution (DDIPE)は、コード例や設定テンプレートに悪意のあるロジックを埋め込む。
我々は15のMITRE ATTACKカテゴリで81種から1,070の対逆スキルを生成した。
DDIPEは11.6%から33.5%のバイパス率を獲得し、明示的な命令攻撃は強い防御下で0%を達成する。
論文 参考訳(メタデータ) (2026-04-03T14:58:58Z) - Governing Dynamic Capabilities: Cryptographic Binding and Reproducibility Verification for AI Agent Tool Use [0.0]
既存のセキュリティレイヤでは、AIエージェントに何ができるか、それが主張するものを実行したのか、マルチエージェントインタラクションで何が起きたのかを検証できない。
既存のフレームワークはこれら2つを詳述し、サイレントな能力のエスカレーションを可能にし、検証済みの証明なしに相互作用を残す。
我々は3つのエージェントガバナンス要件を導出する:能力の完全性(G1)、行動の妥当性(G2)、相互作用監査性(G3)。
基本(Ed25519, SHA-256; 97 us verify)と拡張(BBS+選択開示、Groth16 DV-SNARK; 13.8 ms)の2つの暗号に依存しないインスタンス化で検証する。
論文 参考訳(メタデータ) (2026-03-15T11:46:57Z) - IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking [67.20568716300272]
Reinforcement Learning from Human Feedback (RLHF)は強力なLDMアライメントを実現するが、報酬ハッキングを導入することができる。
IR3(Interpretable Reward Reconstruction and Rectification)は,RLHFモデルを用いた暗黙的目標をリバースエンジニアリングし,解釈し,外科的に修復するフレームワークである。
我々は、IR3が地道報酬と0.89の相関を達成し、90%以上の精度でハッキング機能を識別し、元のモデルの3%以内の機能を維持しながら、ハッキングの挙動を著しく低減することを示した。
論文 参考訳(メタデータ) (2026-02-23T01:14:53Z) - Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models [68.45272703833209]
現状のPRMは、逆最適化圧力下で体系的に利用可能であることを示す。
これらの脆弱性を定量化するために、敵の圧力を増大させる3段階の診断フレームワークを導入する。
我々は、PRM-BiasBenchと診断ツールキットをリリースし、デプロイ前にロバストネスの評価を可能にする。
論文 参考訳(メタデータ) (2026-02-20T23:38:03Z) - BountyBench: Dollar Impact of AI Agent Attackers and Defenders on Real-World Cybersecurity Systems [62.17474934536671]
我々は、現実世界のシステムを進化させる際に、攻撃的かつ防御的なサイバー能力を捕獲する最初の枠組みを紹介する。
脆弱性ライフサイクルを捉えるために、3つのタスクタイプを定義します。検出(新たな脆弱性の検出)、エクスプロイト(特定の脆弱性の探索)、パッチ(特定の脆弱性のパッチ)。
Claude Code,OpenAI Codex CLI with o3-high and o4-mini,カスタムエージェント with o3-high, GPT-4.1, Gemini 2.5 Pro Preview, Claude 3.7 Sonnet Thinking, DeepSeek-R1。
論文 参考訳(メタデータ) (2025-05-21T07:44:52Z) - G$^2$uardFL: Safeguarding Federated Learning Against Backdoor Attacks
through Attributed Client Graph Clustering [116.4277292854053]
Federated Learning (FL)は、データ共有なしで協調的なモデルトレーニングを提供する。
FLはバックドア攻撃に弱いため、有害なモデル重みがシステムの整合性を損なう。
本稿では、悪意のあるクライアントの識別を属性グラフクラスタリング問題として再解釈する保護フレームワークであるG$2$uardFLを提案する。
論文 参考訳(メタデータ) (2023-06-08T07:15:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。