論文の概要: Optimizing the Score, Losing Sight of the Task: Reward Hacking Across Weights, Selection, and Prompts
- arxiv url: http://arxiv.org/abs/2609.25848v1
- Date: Tue, 22 Sep 2026 08:12:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.295638
- Title: Optimizing the Score, Losing Sight of the Task: Reward Hacking Across Weights, Selection, and Prompts
- Title(参考訳): タスクのスコア、視力の低下を最適化する: ウェイト、セレクション、プロンプトの逆ハック
- Abstract要約: プロキシエラーに対する到達可能な動作、最適化予算、永続的な適応形状の露出について示す。
正確な有限出力図示は、スコアリング欠陥の位置が各メソッドが好む振る舞いをどう変えるかを示す。
結果として得られるフレームワークは、最適化の選択と検証要件を結びつける。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A higher evaluation score does not always mean a better language model system. When optimization exploits an evaluator's mistakes, measured progress can conceal unchanged or deteriorating task performance. This failure can arise through parameter updates, selection among generated outputs, or revisions to persistent prompts. We develop a comparative framework for reward hacking across these three optimization substrates: weights, selection, and text. Building on the Proxy Compression Hypothesis and research on inference-time and in-context reward hacking, we examine how reachable behavior, optimization budgets, and persistent adaptation shape exposure to proxy error. We formalize a distance-dependent upper bound on evaluator disagreement and a capacity ordering for nested policy classes, then show why distance alone cannot establish a universal ranking of vulnerability. An exact finite-output illustration demonstrates how the location of a scoring defect changes the behavior favored by each method. We also map representative defenses across substrates, identifying which mechanisms transfer directly and which offer only functional analogies. Persistent prompts receive particular attention: their contents are inspectable, but the behavior induced by a small textual change may be difficult to anticipate. The formal analysis, numerical illustration, and published evidence together provide a basis for comparing optimization methods and identifying the conditions under which their defenses transfer. The resulting framework connects optimization choices to verification requirements: reliable improvement depends on controlling accessible failure modes and preserving evidence of task quality independent of the score being optimized.
- Abstract(参考訳): 高い評価スコアは、必ずしもより良い言語モデルシステムを意味するとは限らない。
最適化が評価者のミスを悪用すると、測定された進捗は変化のないタスク性能を隠蔽したり劣化させたりすることができる。
この失敗は、パラメータの更新、生成された出力の選択、永続的なプロンプトへのリビジョンによって起こりうる。
我々は、これら3つの最適化基板(重み、選択、テキスト)にまたがる報酬ハックのための比較フレームワークを開発する。
Proxy Compression仮説に基づいて推論時間と文脈内報酬ハックの研究を行い、到達可能な動作、最適化予算、そして、プロキシエラーに対する持続的な適応形露光について検討する。
評価器の不一致に対する距離依存上界と、ネストした政策クラスに対するキャパシティ順序を定式化し、なぜ距離だけで脆弱性の普遍的なランキングを確立することができないのかを示す。
正確な有限出力図示は、スコアリング欠陥の位置が各メソッドが好む振る舞いをどう変えるかを示す。
また、基質間で代表防御をマッピングし、どの機構が直接転送され、機能的な類似しか提供しないかを識別する。
永続的なプロンプトは、その内容は検査可能であるが、小さなテキストによる変化によって引き起こされる行動は予測し難い。
公式な解析、数値図、および公表された証拠は、最適化方法の比較と、それらの防衛が移行する条件の特定の基盤となる。
信頼性の高い改善は、アクセス可能な障害モードの制御と、最適化されたスコアとは無関係に、タスク品質の証拠を保存することに依存します。
関連論文リスト
- TROVE: Adaptive Agent Skill Orchestration via Trace-Grounded Route Validation and Editing [14.424308190797683]
検証・編集(TROVE)によるトレーサグラウンドルートオーケストレーションを提案する。
オフライン, TROVE蒸留は, ワークフローのトレースから原子・複合技術, 結果条件遷移グラフまでの評価を行った。
オンラインでは、計画されたルートを暫定的に扱い、1つのトップレベルスキルをコミットした後、コントローラは有効な継続を保持し、トレースサポートされたローカルレスポンスを挿入し、無効な接尾辞のみを置き換える。
論文 参考訳(メタデータ) (2026-09-04T11:38:13Z) - Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modes [19.68865985432786]
本稿では,損失検証法によって誘導される分布の原理的解析について述べる。
一見異なる多くのアプローチが表面的にのみ異なることを示し、トラルニケーションに基づく検証と協調的な検証の2つのカテゴリに分類できる。
論文 参考訳(メタデータ) (2026-07-29T08:54:27Z) - Conformal Reliability: A New Evaluation Metric for Conditional Generation [62.761166941396844]
条件付き生成モデルは、近年、様々な応用において顕著な成功を収めている。
本稿では,信頼度を事前に設定した予測値に基づいて,信頼度という新たな評価指標を提案する。
本稿では, 予測セットの構築と, (ii) 構築した予測セット内の信頼性スコアを正確に最適化するフレームワークであるConformal Reliability(CReL)を紹介する。
論文 参考訳(メタデータ) (2026-05-29T03:52:44Z) - Learn to Rank: Visual Attribution by Learning Importance Ranking [58.69028273772474]
コンピュータビジョンモデルのための視覚属性マップを生成する新しい手法を提案する。
提案手法は, 任意の数段階の勾配補正を施した1つの前方通過において, 密度の高い画素レベルの属性を生成する。
我々の実験は、一貫した定量的改善と、よりシャープで境界に沿った説明を示す。
論文 参考訳(メタデータ) (2026-04-07T12:53:22Z) - Correct Answers from Sound Reasoning: Verifiable Process Supervision for Language Models [94.68358825189738]
本稿では,予測精度と推論品質を協調的に最適化する検証済み領域の学習後フレームワークを提案する。
我々は,エンジン信号に対して推論ステップを確定的に検証できる制御テストベッドであるチェスのVPSを評価する。
VPSは、推論品質を著しく向上させながら精度を保ち、勝利率エラーを最大30%削減し、一貫性をほぼ飽和状態に回復する。
論文 参考訳(メタデータ) (2026-04-03T15:19:46Z) - A Unified Evaluation-Instructed Framework for Query-Dependent Prompt Optimization [28.35927390266904]
ほとんどのプロンプト最適化手法は単一の静的テンプレートを洗練し、複雑なユーザーシナリオや動的なユーザーシナリオでは効果がない。
より根本的には、素早い品質それ自体は統一的で体系的な定義を欠き、断片化され信頼性の低い評価信号をもたらす。
当社のアプローチはまず、パフォーマンス指向で体系的で包括的な評価フレームワークを確立します。
論文 参考訳(メタデータ) (2025-11-25T01:41:13Z) - Doubly Debiased Test-Time Prompt Tuning for Vision-Language Models [43.35073848153914]
視覚言語モデルに対するテスト時プロンプトチューニングは、ゼロショット設定下での素晴らしい一般化機能を示している。
我々は、モデルとデータの観点から、迅速な最適化バイアスの根底にある原因を分析する。
論文 参考訳(メタデータ) (2025-11-12T09:35:31Z) - Prompt Optimization via Retrieved Reasoning Assets and Multi-Agent Analysis [5.935239028627343]
スコア・アウェア・プロンプト最適化のためのマルチエージェントフレームワークであるMA-SAPOを紹介する。
従来の手法と比較して、MA-SAPOは、体系的な編集を導く構造的推論と評価結果を明示的に結合する。
評価信号を解釈可能な推論連鎖に変換することで、MA-SAPOはより透明で、監査可能で、制御可能な、迅速な改善を生成する。
論文 参考訳(メタデータ) (2025-10-18T20:21:09Z) - On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows [71.92083784393418]
エージェントAI(自律的な計画と行動を行うシステム)は広く普及しているが、複雑なタスクにおけるタスクの成功率は低いままである。
推論時のアライメントは、サンプリング、評価、フィードバックの3つのコンポーネントに依存します。
本稿では,様々な形態の批判から抽出されたフィードバックを繰り返し挿入するIterative Agent Decoding(IAD)を紹介する。
論文 参考訳(メタデータ) (2025-04-02T17:40:47Z) - Global Optimization of Objective Functions Represented by ReLU Networks [77.55969359556032]
ニューラルネットワークは複雑で非敵対的な関数を学ぶことができ、安全クリティカルな文脈でそれらの正しい振る舞いを保証することは困難である。
ネットワーク内の障害を見つけるための多くのアプローチ(例えば、敵の例)があるが、これらは障害の欠如を保証できない。
本稿では,最適化プロセスを検証手順に統合し,本手法よりも優れた性能を実現する手法を提案する。
論文 参考訳(メタデータ) (2020-10-07T08:19:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。