論文の概要: What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
- arxiv url: http://arxiv.org/abs/2607.08046v1
- Date: Thu, 09 Jul 2026 01:52:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.390843
- Title: What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulness
- Title(参考訳): LLMのキャリブレーションと誠実さのための内部表現の提案
- Authors: Raphaël Sarfati, Pratyush Ranjan Tiwari, Siddharth Boppana, Christopher J. Earls, Srikar Varadaraj, Eric Ho,
- Abstract要約: 我々は、中間活性化に基づいて表現プーリングプローブを訓練し、キャリブレーションが大幅に向上することを確認した。
我々は,エビデンス・アブレーションとディバータリー・インジェクションを通じて,思想的忠実度を評価する。
単一の事前推論パスは、コミットされた回答と信頼を回復し、この事前設定された回答分布の拡散による質問のルーティングは、生成されたトークンの30~47%を節約する。
- 参考スコア(独自算出の注目度): 3.4789212936038116
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models fine-tuned for forecasting can be accurate yet poorly calibrated, and their chain-of-thought (CoT) reasoning may not faithfully reflect the evidence behind a forecast. We ask whether internal representations offer a more direct window into both. Working with Eternis-Forecaster 8B on OpenForesight, we train representation-pooling probes on intermediate activations and find they achieve substantially better calibration; a result that also holds for GLM-4.7-Flash and GLM-4.5-Air. We then assess CoT faithfulness through evidence ablation and diversionary injection: removing an influential source in the prompt often changes the model's forecast while leaving the reasoning trace untouched. The same probes function as lie detectors: their activations track behavioral shifts far better than the reasoning trace does, and they also predict the direction of change in 84% of cases, including when the CoT conceals the perturbation's influence. Finally, forced answering reveals that forecasts are largely fixed before reasoning begins: a single pre-reasoning pass recovers the committed answer and confidence, and routing questions by the spread of this pre-set answer distribution saves 30-47% of generated tokens, with no loss of accuracy. Together, these results establish probing internal representations as a practical tool for calibrating, auditing, and triaging language model forecasters and reasoning models more broadly.
- Abstract(参考訳): 予測のために微調整された大きな言語モデルは正確だが校正が不十分であり、それらのチェーン・オブ・ソート(CoT)推論は予測の背後にある証拠を忠実に反映していないかもしれない。
内部表現が両方の直接的な窓を提供するかどうかを問う。
OpenForesightのEternis-Forecaster 8Bと共同で、中間活性化の表現プーリングプローブを訓練し、そのキャリブレーションが大幅に向上し、GLM-4.7-FlashとGLM-4.5-Airも実現した。
インプロンプトの影響力のあるソースを取り除くことは、しばしばモデルの予測を変えるが、推論の痕跡は触れられていない。
また、CoTが摂動の影響を隠蔽するなど、ケースの84%で変化の方向を予測する。
最後に、強制的な回答は、予測が推論が始まる前に大半が固定されていることを明らかにしている: 単一の事前推論パスは、コミットされた回答と信頼を回復し、この事前設定された回答分布の拡散によるルーティングは、正確性を失うことなく、生成されたトークンの30~47%を節約する。
これらの結果は、言語モデル予測器や推論モデルをより広範囲に校正、監査、トリアージするための実用的なツールとして、内部表現の探索を確立している。
関連論文リスト
- Does Reasoning Preserve Alignment? On the Trustworthiness of Large Reasoning Models [55.788110316999166]
教師付き微調整, RL を用いた後訓練, および命令調整ベースラインに対する蒸留による推論モデルの比較を行った。
推論モデルはしばしば推論ベンチマークを改善するが、アライメント回帰を示す。
これらの回帰は、KL発散によって測定された命令調整ベースラインからの挙動ドリフトと一致している。
論文 参考訳(メタデータ) (2026-06-09T16:14:27Z) - Understanding and Mitigating Premature Confidence for Better LLM Reasoning [76.16007941549857]
現在の言語モデルからの思考の長い連鎖(CoT)は、しばしば論理的ギャップと不正な跳躍を含んでいる。
このような信号は、モデルの信頼性が推論中にどのように進化するかを示す。
これは、モデルを早期にコミットするのではなく、理由によってモデルの信頼性を更新するように訓練する強化学習の目標です。
論文 参考訳(メタデータ) (2026-05-23T04:42:45Z) - Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought [11.955186033088351]
推論モデルにおける行動連鎖(CoT)の証拠を提供する。
アクティベーションプロービング、早期強制応答、および2つの大きなモデルにわたるCoTモニターを比較した。
難解なマルチホップGPQA-ダイアモンド問題における真の推論とは対照的である。
論文 参考訳(メタデータ) (2026-03-05T18:55:16Z) - How Robustly do LLMs Understand Execution Semantics? [3.2717315277334706]
LLMは驚くべき推論能力を示しているが、それらが内的世界モデルを利用するのか、高度なパターンマッチングに依存しているのかは未解決のままである。
我々は,標準的なプログラム出力予測タスクを用いて,LLMをそのコード理解の堅牢性のレンズを通して研究する。
私たちの発見は、すべてのモデルがコードを理解する方法の限界を示し、コードモデルを評価するために摂動を使うことの価値を確立します。
論文 参考訳(メタデータ) (2026-02-24T19:07:25Z) - Balancing Faithfulness and Performance in Reasoning via Multi-Listener Soft Execution [79.98699884805636]
Reasoning Execution by Multiple Listeners (REMUL) は多人数の強化学習手法である。
REMULは、推論が他の当事者に従えるかがより忠実になるという仮説に基づいている。
スピーカーは、リスナーにとって明らかな推論を生み出すことで報われます。
論文 参考訳(メタデータ) (2026-02-18T02:55:55Z) - Can LLMs Predict Their Own Failures? Self-Awareness via Internal Circuits [17.17286544824839]
大規模言語モデル(LLM)は流動的で複雑な出力を生成するが、しばしば自身の誤りや幻覚を認識できない。
凍結LDMが本質的な自己検証を行うための軽量な自己認識機構であるGnosisを紹介した。
グノーシスは、精度と校正の両面で、強い内部ベースラインと大きな外部判断を一貫して上回る。
論文 参考訳(メタデータ) (2025-12-23T18:21:32Z) - No Answer Needed: Predicting LLM Answer Accuracy from Question-Only Linear Probes [2.6550928535945872]
モデルの今後の回答が正しいかどうかを予測するために線形プローブを訓練する。
3つのオープンソースモデルファミリにわたって、一般的なトリビア問題に基づいて訓練されたこの「緊急時の正当性方向」の予測は、分布の成功を予測する。
I don't know"と応答するモデルでは、プローブのスコアと強く相関し、同じ方向が信頼を捉えることを示している。
論文 参考訳(メタデータ) (2025-09-12T18:09:55Z) - Inducing Faithfulness in Structured Reasoning via Counterfactual Sensitivity [6.908972852063454]
大規模言語モデルは、欠陥や無関係な推論トレースに依存しながら、正しい答えを生成することが多い。
本稿では,新しい学習目標であるtextbfCounterfactual Sensitivity Regularization (CSR)を紹介する。
CSRは、標準的な微調整とプロセスの監督に対する忠実度を最大70パーセント向上させる。
論文 参考訳(メタデータ) (2025-09-01T15:18:46Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。