論文の概要: TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs
- arxiv url: http://arxiv.org/abs/2608.00422v1
- Date: Sat, 01 Aug 2026 03:43:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:56:05.106987
- Title: TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs
- Title(参考訳): TrAC:LLMの高精度不確実性定量のためのトレースコンディションアンサー整合性
- Abstract要約: 大規模言語モデル (LLM) は、しかしながら、誤った答えにつながるような、流動的な推論トレースを生成することができる。
TrACは、ある完了した推論トレースに固定されたアクティブ信号とパッシブ信号を組み合わせた正当性管理の不確実性定量化フレームワークである。
TrACはマクロAUROCを1.8%改善し、AURCを8サンプルの自己一貫性に対して3.4%削減する。
- 参考スコア(独自算出の注目度): 5.676157325165344
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) can generate fluent reasoning traces that nevertheless lead to incorrect answers, making response-level uncertainty estimation important for abstention, human review, and adaptive compute allocation. Existing approaches generally fall into three categories: passive single-trace methods use token-level confidence signals, sampling-based methods compare multiple complete traces at higher generation cost, and active prefix-based methods probe partial traces to study answer stabilization or preference transitions. However, none actively re-elicits an answer from a completed reasoning trace to measure its consistency with and support for the original answer. To address this gap, we introduce Trace-Conditioned Answer Consistency (TrAC), a correctness-supervised uncertainty quantification framework that combines active and passive signals anchored to one completed reasoning trace. Its active component, Prefix-Conditioned Elicitation (PCE), re-elicits a short answer conditioned on the completed trace and represents both its consistency with the original answer and its token-level probabilistic support. Its passive component, Trace Uncertainty Profile (TUP), summarizes how token-level uncertainty evolves throughout the original generation without additional decoding. A lightweight head then integrates the two representations into a response-correctness score. Across five mathematical reasoning benchmarks and three LLM families, TrAC improves macro AUROC by 1.8% and reduces AURC by 3.4% relative to eight-sample self-consistency, while using one complete reasoning trace and a short cached answer probe. When eight samples are already available, augmenting sample consensus with re-elicitation further improves macro AUROC by 4.3% and reduces AURC by 8.3%, without additional full-trace generation.
- Abstract(参考訳): 大規模言語モデル(LLMs)は、不正確な答えにつながるような、流動的な推論トレースを生成することができるため、棄却、人間レビュー、適応的な計算割り当てには応答レベルの不確実性推定が重要である。
既存の手法は一般に3つのカテゴリに分類される: 受動シングルトレース法はトークンレベルの信頼信号を使用し、サンプリングベース法はより高い生成コストで複数の完全トレースを比較し、アクティブプレフィックスベース法は部分トレースを探索して解答安定化や選好遷移を研究する。
しかしながら、元の答えに対する一貫性とサポートを測定するために、完了した推論トレースからの回答を積極的に再評価する人はいません。
このギャップに対処するために、我々は、1つの完了した推論トレースに固定されたアクティブ信号とパッシブ信号を組み合わせた正当性管理の不確実性定量化フレームワークTrAC(Trace-Conditioned Answer Consistency)を導入する。
アクティブなコンポーネントであるPrefix-Conditioned Elicitation (PCE) は、完了したトレースに条件付けされた短い応答を再エリケートし、元の応答との一貫性とトークンレベルの確率的サポートの両方を表現している。
その受動的コンポーネントであるTrace Uncertainity Profile (TUP)は、トークンレベルの不確実性が、追加の復号化なしにオリジナル世代を通してどのように進化するかを要約している。
軽量ヘッドは2つの表現を応答精度スコアに統合する。
5つの数学的推論ベンチマークと3つのLLMファミリーで、TrACはマクロAUROCを1.8%改善し、8サンプルの自己一貫性に対してAURCを3.4%削減する。
8つのサンプルが既に利用可能である場合、再楕円化によるサンプルコンセンサスを増強することで、マクロAUROCをさらに4.3%改善し、AURCを8.3%削減する。
関連論文リスト
- Claim-Level Reliability Assessment for Efficient Test-Time Reasoning [9.168249719115845]
テストタイムスケーリングの原則としてクレームレベルのファルシフィケーションを提案し、Claim-Level Reliability Assessment (CLR) を通じてそれをインスタンス化する。
CLRは、追加のソリューションサンプリングからターゲット検証まで、テスト時間計算を再配置する。
論文 参考訳(メタデータ) (2026-08-12T12:33:05Z) - GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning [61.67411833252235]
本稿では,プロンプトの隠蔽表現と生成された継続の間に,選択したTransformer層に最適化可能な潜在状態を挿入するGradCuitを紹介する。
5つの命令調整されたバックボーン、3つの推論ベンチマーク、2つの回答フォーマットで、GradCuitの平均精度は64.5%である。
解釈可能性について、トークンレベルの勾配属性は、遅延の影響が推論・接続子トークンに集中していることを明らかにする一方、層解析は、初期から中間のトランスフォーマー層を最も効果的な最適化空間として認識する。
論文 参考訳(メタデータ) (2026-08-03T17:55:24Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Measuring Reasoning Quality in LLMs: A Multi-Dimensional Behavioral Framework [9.601233098598456]
本研究では,LLMにおける推論品質を測定するための多次元統合フレームワークを提案する。
4つのベンチマークから975項目にまたがる7つのLCM実験により、このフレームワークは精度のみのメトリクスから見えない振る舞いを明らかにしている。
論文 参考訳(メタデータ) (2026-05-23T17:03:42Z) - When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models [13.891522069967507]
本稿では、推論対応検索フレームワークReaLM-Retrieveを紹介する。
ステップレベルの不確実性検出は、トークンや文レベルではなく、推論ステップで知識ギャップを識別する。
検索介入政策は、外部証拠が進行中の推論に最大限の利益をもたらすことを学習する。
論文 参考訳(メタデータ) (2026-04-29T13:15:44Z) - SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio [0.038379177968040606]
言語モデル推論のための単一パス不確実性フレームワークであるSELFDOUBTを提案する。
私たちのキーシグナルであるHedge-to-Verify Ratio(HVR)は、推論トレースが不確実性マーカーを含むかどうかを検出し、もしそうであれば、明示的な自己チェック行動によってオフセットされているかどうかを検出する。
SELFDOUBTは単一の観測された推論軌道で動作し、任意のプロプライエタリなAPI上でのレイテンシとコスト制約によるデプロイメントに適している。
論文 参考訳(メタデータ) (2026-04-07T19:19:29Z) - Reliability-Aware Adaptive Self-Consistency for Efficient Sampling in LLM Reasoning [20.371912257758634]
自己整合性はマルチサンプルアグリゲーションによる推論信頼性を向上させるが、かなりの推論コストを発生させる。
本稿では,この制限に対処する信頼性適応型自己整合性(ReASC)を提案する。
ReASCは、既存のベースラインと比較して常に最高の精度とコストのトレードオフを達成し、3Bから27Bパラメータのモデルスケールでの推論効率を向上させる。
論文 参考訳(メタデータ) (2026-01-06T12:27:53Z) - Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling [90.87033586963828]
マルチモーダル大言語モデル(MLLM)のステップ・バイ・ステップ推論を洗練させる手段としては,アウトカム・リワード強化学習(RL)が一般的であり,ますます重要になっている。
この問題を修正するために,自己整合サンプリング(SCS)を提案する。
Qwen2.5-VL-7B-インストラクトに基づいて、SCSは、無視できる余分な計算を伴う6つのマルチモーダルベンチマークにおいて、最大7.7ポイントの精度を向上する。
論文 参考訳(メタデータ) (2025-11-13T18:59:57Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Synchronous Faithfulness Monitoring for Trustworthy Retrieval-Augmented Generation [96.78845113346809]
Retrieval-augmented Language Model (RALMs) は、知識集約型タスクにおいて、高い性能と幅広い適用性を示している。
本稿では,非偽文の検出に微細な復号力学を利用する軽量モニタであるSynCheckを提案する。
また、長文検索拡張生成のためのビームサーチによって導かれる忠実度指向の復号アルゴリズムであるFODを導入する。
論文 参考訳(メタデータ) (2024-06-19T16:42:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。