論文の概要: Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets
- arxiv url: http://arxiv.org/abs/2607.08173v1
- Date: Thu, 09 Jul 2026 07:19:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.436202
- Title: Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets
- Title(参考訳): 再考:学習した秘密を抽出するための推論のウェイトを増幅する
- Authors: Jack Hopkins, Dipika Khullar, Fabien Roger,
- Abstract要約: 言語モデルのブラックボックス監査は、必要不可欠な事前デプロイツールであるが、微妙な調整ミスや隠された情報を見逃す可能性がある。
推論モデルから大声で思考する確率を増幅するために、推論タスクベクトルを使用するプロセスであるEmphoverthinkingを紹介します。
我々は,2B-32Bモデルにまたがる4つの実験環境において,過度に検討したモデルが隠れた情報を明らかにする可能性が示唆された。
- 参考スコア(独自算出の注目度): 2.6399393935427216
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Black box auditing of language models is an essential pre-deployment tool, but it may miss subtle forms of misalignment and hidden information. To better elicit hidden information during an auditing process, we introduce \emph{overthinking}: the process of using reasoning task vectors to amplify the propensity to think out loud of reasoning models. Given the parameters of a non-reasoning instruct model $M$ and reasoning-distilled model $R$, we define the \emph{overthinking model} as $\boldsymbolθ_{\mathcal{O}_α} = \boldsymbolθ_{\mathcal{M}} + α(\boldsymbolθ_{\mathcal{R}} - \boldsymbolθ_{\mathcal{M}})$, where $α> 1$ amplifies reasoning beyond the pure reasoning model $R$. Additionally, we introduce new layer-wise attenuation strategies that selectively amplify reasoning without losing quality and coherence of model outputs. We demonstrate that overthinking models are more likely to reveal hidden information across four experimental settings, across 2B-32B models. Our findings suggest that reasoning amplification may surface secrets or unintended behaviors acquired during training up to $10\times$ more frequently than the original reasoning model. How secrets surface depends on the secret type: some require perturbation along the reasoning direction, while others yield to any sufficiently large weight perturbation.
- Abstract(参考訳): 言語モデルのブラックボックス監査は、必要不可欠な事前デプロイツールであるが、微妙な調整ミスや隠された情報を見逃す可能性がある。
監査過程において隠れた情報をよりよいものにするために、推論タスクベクトルを用いて推論モデルの大声で思考する確率を増幅するプロセスである「emph{overthinking}」を紹介した。
非合理的な命令モデル $M$ と推論蒸留モデル $R$ のパラメータを考慮し、 \emph{overthinking model} を $\boldsymbolθ_{\mathcal{O}_α} = \boldsymbolθ_{\mathcal{M}} + α(\boldsymbolθ_{\mathcal{R}} - \boldsymbolθ_{\mathcal{M}})$と定義する。
さらに、モデル出力の品質やコヒーレンスを損なうことなく、推論を選択的に増幅する新しいレイヤワイド減衰戦略を導入する。
我々は,2B-32Bモデルにまたがる4つの実験環境において,過度に検討したモデルが隠れた情報を明らかにする可能性が示唆された。
本研究は, 学習中に得られた秘密や意図しない行動が, 従来の推論モデルよりも10\times$以上の頻度で表されることを示唆している。
秘密は秘密のタイプに依存し、あるものは推論方向に沿って摂動を必要とするが、あるものは十分な質量摂動をもたらす。
関連論文リスト
- Stateful Reasoning via Insight Replay [51.85629502016196]
CoT(Chain-of-Thought)推論は,大規模言語モデルにおける多段階推論の基盤となっている。
この現象の主な原因は、CoTが成長するにつれて、トレースの早期に生成された重要な洞察に対するモデルの注意が徐々に弱まることである。
提案手法は、モデルがその推論トレースから定期的に重要な洞察を抽出し、アクティブな世代フロンティア付近で再生するステートフル推論手法である。
論文 参考訳(メタデータ) (2026-05-14T06:52:59Z) - DIO: Refining Mutual Information and Causal Chain to Enhance Machine Abstract Reasoning Ability [4.017760528208121]
我々は、パターン、推論、問題解決知能のベンチマークであるRaven's Progressive Matrices (RPM)に取り組む。
完全な因果連鎖イメージ$rightarrow$属性$rightarrow$プログレッシブパターンをモデル化し、ベースラインDIOを構築します。
しかし、DIOの低境界目的には人間の論理が組み込まれていないため、3つの改良点が提示される。
論文 参考訳(メタデータ) (2025-08-21T09:23:51Z) - The Price of a Second Thought: On the Evaluation of Reasoning Efficiency in Large Language Models [54.88805865447848]
モデルが全体の効率を向上し,問題の難しさが効率に影響を及ぼすことを示す。
インストラクションモデルが簡単なアウトラインをドラフトし,思考モデルがそれを拡張する,シンプルな2段階パイプラインであるCOTHINKを提案する。
GSM8K、MATH500、AIME24では、COTHINKはトークンの使用量を21.1%削減し、4つの思考モデルの精度を維持し、強力な効率のベースラインと競争し続ける。
論文 参考訳(メタデータ) (2025-05-28T06:24:45Z) - Language models can learn implicit multi-hop reasoning, but only if they have lots of training data [51.92147944576878]
暗黙の推論は、言語モデルが単一のフォワードパスでマルチホップ推論タスクを解く能力である。
このようなモデルでは暗黙的な$k$-hop推論を学べるが、必要なトレーニングデータは$k$で指数関数的に増加する。
論文 参考訳(メタデータ) (2025-05-23T14:01:56Z) - Do Larger Language Models Generalize Better? A Scaling Law for Implicit Reasoning at Pretraining Time [73.22651918134808]
この研究は、モデルサイズのスケーリングによる直感的効果を示し、言語モデル(LM)におけるスケーリングと推論の関係に関する新たな洞察を提供する。
我々は,実世界の大規模知識グラフの構造と分布を再現する合成暗黙のマルチホップ推論環境において,ゼロからLMを事前学習する。
次に、実世界の事前学習における暗黙的推論の単純化とみなすことができるマルチホップ推論を必要とする、グラフの欠落したエッジを完遂するLMの能力を評価する。
論文 参考訳(メタデータ) (2025-04-04T17:57:22Z) - ThinkEdit: Interpretable Weight Editing to Mitigate Overly Short Thinking in Reasoning Models [25.870593499694092]
推論モデルの隠れ表現に、推論の長さがどのように埋め込まれているかを検討する。
我々は、過剰に短い推論の問題を軽減するために、シンプルだが効果的な重み付けアプローチであるThinkEditを紹介した。
論文 参考訳(メタデータ) (2025-03-27T23:53:45Z) - Reasoning with Latent Thoughts: On the Power of Looped Transformers [52.84192961524481]
多くの合成推論問題に対して、$k$層変換器が$L$倍ループしたことが、$kL$層非ループモデルの性能にほぼ一致することを示す。
ループ型および非ループ型モデルは、その有効深さに依存するスケーリングの挙動を示す。
論文 参考訳(メタデータ) (2025-02-24T18:49:05Z) - Towards a Theoretical Understanding of the 'Reversal Curse' via Training Dynamics [45.69328374321502]
自動回帰型大言語モデル(LLM)は、多くの複雑な推論タスクを解くのに優れた能力を示す。
LLM は、2つの文が意味的に同一であっても、推論中に '$B get A$' と結論付けることができない。
2つの自己回帰モデルに対する勾配降下のトレーニング力学を用いて、理論的に逆の呪いを解析する。
論文 参考訳(メタデータ) (2024-05-07T21:03:51Z) - Relabeling Minimal Training Subset to Flip a Prediction [20.708004593740004]
トレーニングポイントの2%未満を許容することは、常に予測を覆すことができる。
我々は,$|mathcalS_t|$がトレーニングセットの雑音比と高い相関を示し,$|mathcalS_t|$は予測確率と相関するが相補的であることを示す。
論文 参考訳(メタデータ) (2023-05-22T08:10:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。