論文の概要: Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect
- arxiv url: http://arxiv.org/abs/2607.14111v1
- Date: Fri, 08 May 2026 05:30:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.011852
- Title: Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect
- Title(参考訳): イントロスペクションファインチューニング(IFT: Introspection Fine-Tuning) : 小さなLLMのイントロスペクションへのトレーニング
- Abstract要約: 本研究は,小言語モデルが内的アクティベーションを検出・報告できるかどうかを考察する。
まず,先行研究で使用される二項検出パラダイムが,質問内容に関係なく肯定的応答に偏りを示すため,小さなモデルで構築されていることを示す。
次に、モデル自身の摂動前進パスから構築した文局在化例を教師付き微調整するEmphIntrospection Fine-Tuning(IFT)を導入する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Can small language models detect and report on perturbations their own internal activations? We investigate this question through the lens of activation steering: injecting concept vectors into a model's residual stream and measuring whether the model can accurately report on the perturbation. We first show that the binary detection paradigm used in prior work -- prompting the model to answer Yes'' or No'' to whether it detects an injected thought -- is confounded in small models, as steering biases the model toward affirmative responses regardless of the question content. We therefore propose two confound-free evaluation paradigms: sentence localization (identifying which of $N$ sentences was perturbed, chance $= 1/N$) and strength comparison (identifying which of two sentences received a stronger injection, chance $= 50\%$). Evaluating across six models from two families (Llama-3.2 and Gemma-4), we find that models as small as 2B parameters introspect reliably well above chance, and that introspective ability generally increases with scale. Llama-1B, however, performs at or below chance. We then introduce \emph{Introspection Fine-Tuning} (IFT): supervised fine-tuning on sentence-localization examples constructed from the model's own perturbed forward passes. IFT raises Llama-1B sentence-localization accuracy from $9.6\%$ to $60.6\%$ (a $6\times$ improvement), with gains generalizing zero-shot to the held-out strength-comparison task ($30.2\% \to 52.2\%$). IFT also improves introspection for 3B and 8B models, while inducing negligible degradation on standard capability benchmarks. Our results suggest that introspective ability is not fixed by scale alone: it can be directly trained, and doing so unlocks latent self-monitoring capacity with implications for AI transparency and alignment. Our code is \href{https://anonymous.4open.science/r/IFT-introspection-2092/README.md}{here}.
- Abstract(参考訳): 小言語モデルは自身の内的アクティベーションを検知し、報告することができるか?
モデルの残差ストリームに概念ベクトルを注入し、モデルが摂動を正確に報告できるかどうかを測定する。
まず、先行研究で使用される二項検出パラダイム(「Yes」または「No'」)が、質問内容に関係なく肯定的応答に偏りがあるとして、小さなモデルで構築されることを示し、そのモデルが「Yes」または「No」に応答する」ことを示唆する。
そこで本稿では,文の局所化(N$文の摂動を識別する)と強度比較(2つの文のどちらがより強い注入を受けるか,50\%$か)の2つの相反しない評価パラダイムを提案する。
2つのファミリー(Llama-3.2 と Gemma-4)から6つのモデルを評価すると、2B のパラメータのモデルが確率を確実に上回っており、イントロスペクティブ能力は概してスケールで増加することが分かる。
しかし、Llama-1Bはチャンス以下で作動する。
次に、モデル自身の摂動前進パスから構築した文局在化例を教師付き微調整する「emph{introspection Fine-Tuning} (IFT)」を紹介した。
IFTは、Llama-1Bの文ローカライズ精度を9.6\%から$60.6\%(6.6\times$改善)に引き上げ、持久力比較タスク(30.2\% \to 52.2\%)にゼロショットを一般化する。
IFTはまた、3Bおよび8Bモデルのイントロスペクションを改善し、標準能力ベンチマークで無視できる劣化を誘導する。
我々の結果は、イントロスペクティブ能力はスケールだけでは固定されていないことを示唆している。直接トレーニングできるため、AIの透明性とアライメントに影響を及ぼすことなく、潜伏した自己監視能力をアンロックできる。
我々のコードは \href{https://anonymous.4open.science/r/IFT-introspection-2092/README.md}{here} です。
関連論文リスト
- Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Measuring and Improving Behavioral Consistency in Large Language Models through Fact-Heuristic-Emotion State Enforcement [4.226475360842309]
大規模言語モデル(LLM)は、実行中に同じ決定問題に対して異なる回答を与え、自身の事前回答がコンテキストとして返されるときにその決定を覆す。
モデル重みを変化させることなく、この不安定性を測定・部分的に低減できるかどうかを問う。
我々は,プロンプトレベルの状態強化層であるCognitive Kernel Model (CKM)をテストする。
論文 参考訳(メタデータ) (2026-06-05T12:36:36Z) - The Geometry of Forgetting: Temporal Knowledge Drift as an Independent Axis in LLM Representations [50.43168858368539]
大規模言語モデルは自信を持って時代遅れの回答を生成し、既存の方法では検出できない。
これは工学的な失敗ではなく構造的な失敗であり、時間的ドリフトは、幾何的に残留流の方向として、正確性と不確実性の両方に符号化される。
論文 参考訳(メタデータ) (2026-05-09T22:27:31Z) - The Surprising Universality of LLM Outputs: A Real-Time Verification Primitive [0.0]
CPUのみのスコアリングプリミティブはトークン当たり2.6マイクロ秒で動作する。
トークンのランク周波数分布は同じ2パラメータのMandelbrotランキング分布に収束する。
利用可能な場合にモデルログの確率で構成し、クローズドAPIで使用可能なランクオンリーモードに分解するシングルパススコアリングプリミティブを導出する。
論文 参考訳(メタデータ) (2026-04-28T13:35:31Z) - Beyond the Assistant Turn: User Turn Generation as a Probe of Interaction Awareness in Language Models [3.9351446512514947]
ユーザ・ターン・ジェネレーションはLLMの振る舞いやインタラクション・アウェアネスの次元を捉えており、現在のアシスタント・オンリー・ベンチマークでは探索されていない。
この結果から,ユーザターン生成はLLMの振る舞いやインタラクションの認識の次元を捉えていることがわかった。
論文 参考訳(メタデータ) (2026-04-02T17:57:29Z) - Epistemic Observability in Language Models [0.0]
製造時に高い信頼性を報告できるモデルがあることがわかりました。
正式な仮定では、これは能力ギャップではなく観察的なギャップである。
我々は,計算副産物を輸出することで不合理性から逃れるテンソルインタフェースを構築した。
論文 参考訳(メタデータ) (2026-03-20T21:59:34Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model [70.77691645678804]
非SFT 2Bモデルのみを用いたマルチモーダル推論における創発的特性の再現に成功した最初の例を示す。
本モデルはCVBenchで59.47%の精度を達成し, ベースモデルを約30%, SFT設定を2%以上上回った。
さらに,RLとインストラクションモデルを用いてR1のような推論を行おうとする試みの失敗と知見を共有した。
論文 参考訳(メタデータ) (2025-03-07T04:21:47Z) - S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning [51.84977135926156]
S$2$Rはモデルに推論時の自己検証と自己正当性を教えることによってLLM推論を強化する効率的なフレームワークである。
以上の結果から,Qwen2.5-math-7Bの精度は51.0%から81.6%に向上した。
論文 参考訳(メタデータ) (2025-02-18T13:40:22Z) - Language Model Probabilities are Not Calibrated in Numeric Contexts [16.17638166383352]
言語モデル(LM)の出力は自然分布を捉えるべきだと我々は主張する。
本研究は、LM出力確率がテキストコンテキスト内の数値情報に校正されるかどうかを特に検証する。
論文 参考訳(メタデータ) (2024-10-21T13:41:15Z) - Language models scale reliably with over-training and on downstream tasks [121.69867718185125]
スケーリング法則は、高価なトレーニング実行を引き出すための有用なガイドである。
しかし、現在の研究と言語モデルがどのように訓練されているかには差がある。
対照的に、スケーリング法則は主に推論における損失を予測するが、モデルは通常下流のタスクのパフォーマンスで比較される。
論文 参考訳(メタデータ) (2024-03-13T13:54:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。