論文の概要: Wrong Before Right: Late Rescue and Interface Failure in Aligned Language Models
- arxiv url: http://arxiv.org/abs/2607.04640v1
- Date: Mon, 06 Jul 2026 03:51:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.031046
- Title: Wrong Before Right: Late Rescue and Interface Failure in Aligned Language Models
- Title(参考訳): 正しくない: 言語モデルにおける遅返りとインターフェースの失敗
- Authors: Jiaqi Deng,
- Abstract要約: コーディネート言語モデル内での正確性について検討する。
極性制御された最小対上の層間差差分法(DiD)トラジェクトリを用いて、誤差を同定する。
このことは17モデル、3ファミリー、64倍スケール(0.5B-32B)のパッチスコープ型活性化移植による検証である。
- 参考スコア(独自算出の注目度): 2.1291393112295935
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study how correctness is assembled inside aligned language models, not only whether the final answer is right. Using layer-wise difference-in-differences (DiD) trajectories over polarity-controlled minimal pairs, we identify the wrong-dip: in mid layers (25-90% depth), internal preference transiently commits to the incorrect answer and is rescued only by late-layer correction. We verify this causally with patchscope-style activation transplantation across 17 models, three families, and 64x scale (0.5B-32B). Four findings follow. (1) Alignment amplification of the causal wrong-dip is recipe-specific and emergent: it emerges at 3B in Qwen2.5, remains high, and peaks at 32B (paired t up to 9.7), reverses in Llama-3-8B (t=-2.31), and sits between for Mistral-7B. (2) The dip predicts real compression failures: high-dip items are 3-7x more likely to flip under late-layer low-rank compression, block dropping, or structured pruning, while quantization flips are dip-blind, a double dissociation confirmed by late-layer ablation. (3) The dip is trainable: a LoRA fine-tune with a mid-layer wrong-margin penalty matches output-only SFT accuracy while cutting the causal dip by 67-70% and improving compression robustness; output-only SFT worsens the causal dip by up to 2.8x at perfect surface accuracy. (4) With controlled readouts, the phenomenon survives natural-language I/O: dip stratification of structural-damage failures is significant on naturalistic vignettes, and free-form fragility separates into a dip-auditable late-rescue layer and a dip-blind interface layer. Together, output-level correctness can hide a late-rescue process that governs compression risk, post-training quality, and evaluation distortion.
- Abstract(参考訳): 最終回答が正しいかどうかだけでなく、アライメントされた言語モデルの中でどのように正しさが組み立てられるかを研究する。
極性制御された最小対上の層間差差分法(DiD)トラジェクトリを用いて、中間層(25~90%の深さ)では、内部の嗜好が不正確な解に過度にコミットし、遅延層補正によってのみ救済される。
本研究は,17モデル,3ファミリー,64倍スケール (0.5B-32B) のパッチスコープ型活性化移植による検証を行った。
以下の4つの発見がある。
1)Qwen2.5の3Bで出現し,32B(paired t up 9.7)でピークに達し,Llama-3-8B(t=-2.31)で逆転し,Mistral-7Bの中間に位置する。
2) 量子化フリップは薄層アブレーションによって確認された二重解離であり, 遅延層圧縮, ブロックダウン, 構造化プルーニングの下では, ハイディップアイテムが3~7倍の確率でフリップし, 量子化フリップは薄層アブレーションによって確認される。
(3) このディップはトレーニング可能である: 中間層が不正なペナルティを持つLoRAファインチューンは、因果ディップを67〜70%カットし、圧縮堅牢性を向上させながら出力のみのSFT精度と一致し、出力のみのSFTは、因果ディップを2.8倍まで完璧表面精度で悪化させる。
(4) 制御された読み出しでは, この現象は自然言語I/Oを生き残り, 構造物損傷の層状化は自然主義的なヴィグネットにおいて重要であり, 自由形態の不安定性は, ディップ・オーディタブル・レイト・レスキュート層とディップ・ブラインド・インタフェース層に分離される。
出力レベルの正確さは、圧縮リスク、トレーニング後の品質、評価歪みを管理する遅延救助プロセスを隠すことができる。
関連論文リスト
- A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms [0.0]
拡散学生は50~1-8のネットワーク評価からテキスト・ツー・イメージ・推論を減らした。
我々はスカラーを3つの層に沿って制御された摂動を注入する分解可能なプローブで置き換える。
Inception機能に対するブートストラップ中間のBures W22選択率について報告する。
論文 参考訳(メタデータ) (2026-07-03T12:18:24Z) - Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning [48.438568700670835]
モデルから潜在的知識を読み出す標準的な方法は、視覚言語モデルがイメージに根ざしたものを体系的に上書きすることができる。
本研究では,空間的推論において,一直線因果制御によって露呈した探究と操舵の両方に誤差が見えないことを示す。
論文 参考訳(メタデータ) (2026-06-30T07:33:18Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Layer Collapse in Diffusion Language Models [54.880703002010144]
拡散言語モデル (DLM) は自己回帰言語モデル (AR) の代替として登場した。
DLMの層崩壊は, 過度なトレーニングによるものではなく, 過度なトレーニングによるものであることを示す。
私たちの発見は、非常に実践的な意味を持っている。
論文 参考訳(メタデータ) (2026-05-07T14:39:40Z) - Architectural Observability Collapse in Transformers [0.0]
トレーニングは、出力信頼が露呈しない内部的な意思決定品質のシグナルを保持します。
信頼制御は、平均60.3%の生プローブ信号を6つのファミリーの14モデルで吸収する。
Llama 3.1 8Bは、同じ32層、32頭、4096面の形状で崩壊する。
論文 参考訳(メタデータ) (2026-04-27T02:39:02Z) - Disposition Distillation at Small Scale: A Three-Arc Negative Result [0.0]
内部ドラフトでは、Qwen3-0.6Bの学生に+33.9ポイントのMCASと+15.3ポイントのHumanEvalを報告している。
コンテントを損なうことなく, 判断された配置をスタイル的な模倣に転換するオペレータは見つからない。
我々は, 線形H_lastプローブに対する3つのアーク負の結果, 線形H_lastプローブに対する2つの欠陥モード分類, および, 自分たちが生成した偽陽性のクラスを, 公開可能な負に変換する正直なファルシフィケーションパイプラインを寄与する。
論文 参考訳(メタデータ) (2026-04-13T17:40:31Z) - Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbations [2.7946918847372277]
大規模言語モデルは、数学的推論ベンチマークにおいて強い性能を示すが、意味を保存する表面摂動に対して驚くほど脆弱である。
我々は677 GSM8K問題に対して,3つのオープンウェイトLLM(Mistral-7B,Llama-3-8B,Qwen2.5-7B)を意味論的に等価な変種と組み合わせて評価した。
3つのモデルはいずれも相当な解答フリップ率(28.8%-45.1%)を示し、数字のパラフレーズは名前スワップよりも一貫して破壊的である。
論文 参考訳(メタデータ) (2026-04-02T05:30:20Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - Token-Level Inference-Time Alignment for Vision-Language Models [58.41370989069588]
VLM(Vision-Language Models)は、現代のマルチモーダルインテリジェンスの重要なバックボーンとなっている。
本稿では,基本VLMを凍結し,その分布を近似する報酬モデルをトレーニングする軽量フレームワークTITAを提案する。
推測中、暗黙の選好信号は報酬モデルと目標VLMの対数確率比として抽出され、密集した自己回帰フィードバックが得られる。
論文 参考訳(メタデータ) (2025-10-20T09:58:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。