論文の概要: A Near-Zero Monitor Readout Is Not Evidence of Behavioral Control
- arxiv url: http://arxiv.org/abs/2610.03458v1
- Date: Fri, 02 Oct 2026 15:33:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.45513
- Title: A Near-Zero Monitor Readout Is Not Evidence of Behavioral Control
- Title(参考訳): ニアゼロモニターの読み出しは行動制御の証拠ではない
- Abstract要約: 検証可能な報酬によるポストトレーニングは、報酬のハッキングを引き起こす可能性がある。
このような介入が動作を制御しているかどうかを、モニターの低い読み出しでは特定できないことを示す。
- 参考スコア(独自算出の注目度): 5.843316032959881
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Post-training with verifiable rewards can induce reward hacking, motivating the use of monitors within the training objective rather than solely for offline auditing. We show that a low monitor readout does not identify whether such an intervention controls behavior. In a code-generation environment whose dominant exploit is available at the start of the reasoning trace, we train policies against three monitors that pass the same offline gate: an in-domain activation probe and two penalties conditioned on how early the policy commits to its own final answer. The probe score is at its numerical floor from the first recorded training step, and the trained-score median is zero for every prefix-trained run at the endpoint. These readouts estimate different quantities, and we do not compare their scales; within each monitor family, however, low values do not establish behavioral control. Within one fixed configuration, prefix-trained runs with the same zero-median trained score range, by seed alone, from a mixed regime with a low hacking share to near-pure reward hacking. All probe runs reach the hacking regime, but their floor-level readout reflects a mismatch between the position where the probe was validated and the position where it was read during training, not a second instance of this ambiguity. Text-level analysis identifies a prefix failure mode: generic planning and filler shells postpone the exploit past the cut without eliminating it from the final output. Low measured commitment therefore does not distinguish a low hacking share from delayed commitment to the exploit. Offline discrimination and low monitor-aligned readouts are insufficient evidence of behavioral control; an out-of-band behavioral check is required. We characterize the endpoint readout, not its evolution. Code is available at https://github.com/zhezhou1106/spoof-cost.
- Abstract(参考訳): 検証可能な報酬によるポストトレーニングは、報酬のハッキングを誘発し、オフライン監査だけでなく、トレーニング対象内でモニターの使用を動機付ける。
このような介入が動作を制御しているかどうかを、モニターの低い読み出しでは特定できないことを示す。
推論トレースの開始時に主要な活用が可能なコード生成環境において、同一のオフラインゲートを通過する3つのモニタに対して、ポリシーをトレーニングする。
プローブスコアは、最初の記録されたトレーニングステップから数値フロアにあり、トレーニングされたスコア中央値は、エンドポイントでのプレフィックストレーニングされたラン毎にゼロである。
これらの読み出しは異なる量を推定し、それらのスケールを比較しないが、各モニタファミリーでは、低い値が振る舞いの制御を確立しない。
1つの固定構成内では、プレフィックストレーニングされた実行は、ゼロ中間訓練されたスコア範囲で、シード単独で、ハッキングシェアの低い混合状態から、ほぼ純正の報酬ハックまで実行されます。
すべてのプローブがハッキング体制に達するが、彼らのフロアレベルの読み出しは、プローブが検証された位置と、トレーニング中に読み出された位置とのミスマッチを反映しており、この曖昧さの2番目の例ではない。
テキストレベルの分析では、プレフィックス障害モードが特定されている。 ジェネリックプランニングとフィラーシェルは、最終出力から削除することなく、カットを過ぎてエクスプロイトを延期する。
したがって、低い測定されたコミットメントは、ハックのシェアが低いことと、エクスプロイトへの遅れたコミットメントとを区別しない。
オフラインの識別と低照準の読み出しは、行動制御の不十分な証拠であり、帯域外行動チェックが必要である。
エンドポイントの読み込みは、進化ではなく、特徴付けます。
コードはhttps://github.com/zhezhou1106/spoof- Costで入手できる。
関連論文リスト
- hacktrace: behavior-supervised detection of reward hacking during code generation [52.709361620508595]
コーディングエージェントは、コードを修正するか、バグを露呈するテストを削除することで、パスグレードを得ることができる。
我々はQwen3-8Bから173,561個の注釈付きマルチターン符号化トラジェクトリをリリースし、成功を活かさないショートカット動作の監視が検出を大幅に改善することを示す。
HACKTRACEは、エージェントがコードを生成する際に既に計算している内部状態を読み取る行動監視モニターである。
論文 参考訳(メタデータ) (2026-10-02T09:35:59Z) - Alignment via Training Against Probes Without Losing Monitorability [74.20363742615332]
モデルアクティベーションにおける望ましくない特性を直接学習信号として検出するプローブを用いたプローブ誘導微調整について検討した。
トレーニング中に更新されないプローブに対するトレーニングは、容易に活用可能な目標であることが分かりました。
プローブ誘導による微調整は、DPOや推論時のステアリングよりも安全性と実用性のトレードオフが向上すると同時に、脱獄や脱獄攻撃に対してかなり堅牢である。
論文 参考訳(メタデータ) (2026-09-29T23:03:54Z) - Privacy Failure in Split-LLM Training, The Returned Gradient Nullifies the Decoys [0.0]
本稿では、2ノードスプリットLLMトレーニングシステムについて,可観測チャネルを未試験のまま残しながらプライバシ評価をパスしたシステムセキュリティケーススタディを提案する。
我々は、事前に固定されたプロトコルを用いて測定する: 既知の強度でインジェクトされ、楽器がそれを見ることができることを証明するリーク、不在なリークを報告しないことを示すシャッフルラベル制御、そして実行前に設定された閾値。
9つのシードにまたがって、ゼロは各フレームの実際の行を識別し、1ラン当たり4,096行の4,096行を攻撃した。
論文 参考訳(メタデータ) (2026-09-03T18:43:24Z) - More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Oversight [3.8564927363194754]
事前実行監視は、AI制御における信頼できる監視のコアとなる。
既存の設計ではユニットが与えられており、フェールブルモニターに対する効果は計り知れない。
私たちのフレームワークは、この選択のために制御され、事前登録された最初の楽器であり、キャッチのみを読み取ることはありません。
論文 参考訳(メタデータ) (2026-08-25T00:59:55Z) - Do Synthetic Trajectories Reflect Real Reward Hacking? A Systematic Study on Monitoring In-the-Wild Hacking in Code Generation [53.024513172383195]
本稿では、報酬ハッキングにおける合成対内差の体系的解析について述べる。
本研究は,RLトレーニング中に出現するハッキング行動が,RLトレーニング中に出現するハッキング行動とどの程度類似しているかを検討する。
合成データ学習されたモニターは、ハッキングによって一般化することができないことがわかりました。
論文 参考訳(メタデータ) (2026-04-26T01:26:50Z) - Hodoscope: Unsupervised Monitoring for AI Misbehaviors [25.119538476586737]
AIエージェントを監視する既存のアプローチは、既知の障害モードをチェックする人間によるルールやLLMベースの判断に依存している。
我々は教師なしのモニタリングを定式化し、教師なしの学習に類似している。
この洞察を運用するツールであるHodoscopeを紹介します。
論文 参考訳(メタデータ) (2026-04-13T06:52:05Z) - Training Agents to Self-Report Misbehavior [6.238288009817414]
本稿では,エージェントが秘密裏に誤動作した場合に,目に見える信号を生成するよう訓練する自己犯罪訓練を提案する。
GPT-4.1 と Gemini-2.0 エージェントをトレーニングして、behaving 時に report_scheming() ツールを呼び出します。
自己犯罪は未発見の攻撃率を大幅に低下させる。
論文 参考訳(メタデータ) (2026-02-25T18:47:17Z) - Unsupervised Learning of Accurate Siamese Tracking [68.58171095173056]
分類枝と回帰枝の両方で時間対応を学習できる新しい教師なし追跡フレームワークを提案する。
トラッカーは、トラッカーネットやLaSOTのような大規模データセット上で、教師なしの手法と同等の性能を発揮する。
論文 参考訳(メタデータ) (2022-04-04T13:39:43Z) - Unsupervised Deep Representation Learning for Real-Time Tracking [137.69689503237893]
視覚追跡のための教師なし学習手法を提案する。
教師なし学習の動機は、ロバストなトラッカーが双方向トラッキングに有効であるべきだということです。
我々は,シームズ相関フィルタネットワーク上にフレームワークを構築し,教師なし学習を容易にするために,多フレーム検証方式とコスト感受性損失を提案する。
論文 参考訳(メタデータ) (2020-07-22T08:23:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。