論文の概要: Option-Order Randomisation Reveals a Distributional Position Attractor in Prompted Sandbagging
- arxiv url: http://arxiv.org/abs/2604.26206v1
- Date: Wed, 29 Apr 2026 01:23:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-30 15:59:36.211573
- Title: Option-Order Randomisation Reveals a Distributional Position Attractor in Prompted Sandbagging
- Title(参考訳): プロンプテッドサンドバッグにおける配電位置トラクタのオプション次ランダム化
- Abstract要約: 前任のパイロットは、ラマ-3-8Bが回避に答えるよりも、位置の崩壊としてサンドバッグの実施を促したことを知った。
このフォローアップは、臨界制御として巡回的なオプションオーダーのランダム化を加えた。
正解が優先位置Eを同時に占有すると、精度は72.1%に急上昇し、A位で4.3%に低下した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A predecessor pilot (Cacioli, 2026) found that Llama-3-8B implements prompted sandbagging as positional collapse rather than answer avoidance. However, fixed option ordering in MMLU-Pro left open whether this reflected a model-level position-dominant policy or dataset-level distractor structure. This pre-registered follow-up (3 models, 2,000 MMLU-Pro items, 4 conditions, 24,000 primary trials) added cyclic option-order randomisation as the critical control. The pre-registered item-level same-letter diagnostic did not confirm deterministic position-tracking (same-letter rate 37.3%, below the 50% threshold). However, pre-specified supporting analyses revealed that the response-position distribution under sandbagging was highly stable under complete content rotation (Pearson r = 0.9994; Jensen-Shannon divergence = 0.027, compared to 0.386 between honest and sandbagging conditions). Accuracy spiked to 72.1% when the correct answer coincidentally occupied the preferred position E, and fell to 4.3% at position A. The data provide strong evidence for a soft distributional attractor: under sandbagging instruction, the model enters a low-entropy response-position basin centred on E/F/G that is highly stable and largely content-invariant at the aggregate level. Qwen-2.5-7B served as a negative control (non-compliant, no distributional shift). These results provide evidence, at the 7-9 billion parameter scale, that response-position entropy is a promising black-box behavioural signature of this sandbagging mode.
- Abstract(参考訳): 前任のパイロット (Cacioli, 2026) は、ラマ-3-8B の実装は、答えの回避よりも位置の崩壊を招いた。
しかし、MMLU-Proの固定されたオプション順序付けは、モデルレベルの位置支配ポリシーやデータセットレベルのイントラクタ構造を反映するかどうかを放置した。
この事前登録されたフォローアップ(3モデル,2,000 MMLU-Pro項目,4条件,24,000 一次試験)は、臨界制御として巡回的オプションオーダーランダム化を加えた。
登録済みの項目レベルの同一文字診断では、決定論的位置追跡(サメレターレート37.3%、50%未満)は確認されなかった。
しかし, サンドバッグング条件下での応答位置分布は, 完全含量回転下で非常に安定であった(ピアソン r = 0.9994, Jensen-Shannon divergence = 0.027, 正当性およびサンドバッグング条件間の0.386)。
その結果, 正解が優先位置Eを同時に占有すると, 精度は72.1%に急上昇し, 4.3%に低下した。
Qwen-2.5-7Bは負の制御(非準拠、分布シフトなし)として機能した。
これらの結果は、7-90億のパラメータスケールにおいて、応答位置エントロピーがこのサンドバッグモードの有望なブラックボックスの挙動シグネチャであることを示す。
関連論文リスト
- SCOPE-OPSD: Fisher-Conditioned Privileged Subspaces for On-Policy Self-Distillation [22.56867206175605]
SCOPE-OPSDは、特権教師の残余を冷凍ランク64因子に投影する。
OPSDがすでに必要としているフォワードを再利用し、ロールアウトも推論時モジュールも追加しない。
Qwen3-1.7B、4B、8Bの完全な25/50/75/100ステップの軌道は、Structuredは純粋なOPSD以下ではない。
論文 参考訳(メタデータ) (2026-09-11T08:33:52Z) - Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores [31.709549159768727]
多様な推論ベンチマーク間で一貫した読み出しギャップを観察する。
隠れ状態プローブは、ネイティブシークエンススコアが完全に崩壊しても正解を復号することに成功した。
以上の結果から,無作為な内部論理を隠蔽する表現障害が明らかにゼロショット推論の欠点であることが明らかとなった。
論文 参考訳(メタデータ) (2026-08-31T16:43:55Z) - Cross-Fitted Residual Utility for Primary-Preserving Cognitive Decision Correction in Automatic Modulation Classification [1.547549252134621]
本稿では,クロスフィット型残効ユーティリティとプライマリ保存型認知決定ポリシーを用いて,推論後の問題について検討する。
構造化されたkan-Fourier分類器はデフォルトの確率を提供し、ニューラルおよび非ニューラル候補は観測可能な証拠を提供する。
RMLA、RMLB、HISARでは、完全なシステムは全体の精度を63.632%から66.332%、65.161%から66.168%、77.769%から79.867%に改善している。
論文 参考訳(メタデータ) (2026-08-03T11:07:37Z) - Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning [33.56197101721029]
非同期強化学習は、最適化からロールアウト生成を分離することでスループットを向上させる。
結果として生じる不安定さは必然的な副産物であり、ポリシーラグ、エンジン遅延、およびエキスパートの混合ルーティングによって共同で合成される。
本稿では,分割されたサンプルログ比を実用的な安定化プロキシとして利用するStaleness-Adaptive Trust Region (SAT)を紹介した。
論文 参考訳(メタデータ) (2026-07-21T05:27:50Z) - Online Shift Detection and Conformal Adaptation for Deployed Safety Classifiers [0.0]
デプロイされた安全分類器における分散シフトのオンラインモニタリングシステムを提案する。
検出後、共形吸収層は、目標誤差を回復する決定に適応する。
このシステムは平均遅延39.5800ステップで86.6%の検知を実現している。
論文 参考訳(メタデータ) (2026-06-10T11:24:25Z) - Beyond Point Estimates: Benchmarking Uncertainty Quantification Methods on the AION-1 Astronomical Foundation Model [47.71489969727656]
Conformalized Quantile Regression (CQR)は、最も貧弱なモデル予測で、ビン内で最高のカバレッジを提供する。
局所的妥当性判別(Locally Valid and Discriminative, LVD)フレームワークのみが、有限サンプルの局所的妥当性を提供する。
論文 参考訳(メタデータ) (2026-06-05T18:29:19Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Adaptive Consensus in LLM Ensembles via Sequential Evidence Accumulation: Automatic Budget Identification and Calibrated Commit Signals [0.0]
DASEは、ベンチマークをまたいで一般化するコミット型ルーティングパーティションを生成する。
インジェクション帯域ではなく、適応的な停止が正確さを駆動する。
インジェクションベースの手法は、逆Uの精度-vs-推論軌道を示す。
論文 参考訳(メタデータ) (2026-05-05T19:24:10Z) - Below-Chance Blindness: Prompted Underperformance in Small LLMs Produces Positional Bias Rather than Answer Avoidance [0.0]
我々は, 強制選択項目上でのBCBによるサンドバッグの識別が, 症状妥当性試験ロジックで可能かどうかを検証した。
12個のモデルドメインの細胞のうち0個がサンドバッグ指導下において有意に低い性能を示した。
本研究では, 位置分布シフトは, このモデルスケールでのインジェクションアンダーパフォーマンスの検出において, 精度以下よりも効果的な行動シグネチャである可能性が示唆された。
論文 参考訳(メタデータ) (2026-04-28T05:57:23Z) - Shuffle the Context: RoPE-Perturbed Self-Distillation for Long-Context Adaptation [86.62036852878354]
大規模言語モデル(LLM)は、信頼性の高い長文理解を必要とする設定でますます運用される。
位置ロバスト性を向上させるトレーニングレギュレータであるRoPE-Perturbed Self-Distillationを提案する。
Llama-3-8BとQwen-3-4Bの長文適応実験は、長文ベンチマークにおいて一貫した利得を示す。
論文 参考訳(メタデータ) (2026-04-15T18:46:35Z) - The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation [1.8345614451086532]
RLHF 対応言語モデルは TruthfulQA 上で応答均質化を示す。
40-79%の質問は、10のi.i.d.サンプルに対して単一のセマンティッククラスタを生成する。
論文 参考訳(メタデータ) (2026-03-25T09:35:15Z) - Entropy trajectory shape predicts LLM reasoning reliability: A diagnostic study of uncertainty dynamics in chain-of-thought [0.0]
本研究は,ステップごとの解答完了をサンプリングし,正当性を予測することによって,推論ステップ間の不確実性のダイナミクスの形状を把握できるかどうかを考察する。
エントロピー-軌道単調性(Entropy-trajectory monotonicity)を導入する。
論文 参考訳(メタデータ) (2026-03-19T14:17:16Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Bayesian Transformer for Probabilistic Load Forecasting in Smart Grids [0.0]
本研究では,3つの相補的不確実性機構をPatchTSTバックボーンに統合したベイズ変圧器フレームワークを提案する。
7段階のマルチクエンタリーピンボールロス予測ヘッドと、訓練後の等音波回帰キャリブレーションにより、鋭く、ほぼ一意にカバーされた予測間隔が生成される。
主要なベンチマーク(PJM, H=24h)では、BTは0.0289のCRPSを達成し、Deep Ensemblesより7.4%、決定論的LSTMより29.9%改善した。
論文 参考訳(メタデータ) (2026-03-09T02:39:51Z) - Evidence-based Distributional Alignment for Large Language Models [58.65469623911573]
LLM分布推定の忠実度とロバスト性を改善する証拠に基づくアライメント手法であるEvi-DAを提案する。
対象国が与えられた場合、Evi-DAは関連するWorld Values Survey項目とその回答分布を検索し、オプション毎に粗いヴェルツェル値シグネチャを予測し、国条件の回答分布を構造化形式で推測する。
論文 参考訳(メタデータ) (2026-03-03T03:34:06Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z) - Eliminating Position Bias of Language Models: A Mechanistic Approach [119.34143323054143]
位置バイアスは現代言語モデル (LM) の一般的な問題であることが証明されている。
我々の力学解析は、ほぼ全ての最先端のLMで使われている2つのコンポーネント(因果的注意と相対的位置エンコーディング)に位置バイアスが関係している。
位置バイアスを排除することによって、LM-as-a-judge、検索強化QA、分子生成、数学推論など、下流タスクのパフォーマンスと信頼性が向上する。
論文 参考訳(メタデータ) (2024-07-01T09:06:57Z) - Shortcomings of Top-Down Randomization-Based Sanity Checks for
Evaluations of Deep Neural Network Explanations [67.40641255908443]
モデルランダム化に基づく正当性チェックの限界を,説明書の評価のために同定する。
トップダウンモデルランダム化は、フォワードパスアクティベーションのスケールを高い確率で保存する。
論文 参考訳(メタデータ) (2022-11-22T18:52:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。