論文の概要: SFAD: Speculative Factuality-Aware Decoding
- arxiv url: http://arxiv.org/abs/2609.00796v2
- Date: Thu, 03 Sep 2026 03:00:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-04 13:51:58.229153
- Title: SFAD: Speculative Factuality-Aware Decoding
- Title(参考訳): SFAD: 投機的ファクチュアリティを意識したデコーディング
- Authors: Guanqiao Chen, Di Wang, Lijie Hu,
- Abstract要約: ConFideは、きめ細かい原子摂動を持つ選好データセットである。
てんかん摩擦は、専門的な確実性によって重み付けられた分布張力の定量化によって潜在的幻覚を検出する。
非対称ロジットステアリングは残基ロジット注入によりターゲット分布を洗練する。
- 参考スコア(独自算出の注目度): 13.350717038599386
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As one of the most critical challenges in large language models, contextual faithfulness directly determines their reliability in knowledge-intensive applications. This task is particularly challenging as it requires balancing factual consistency with generation efficiency. Contrastive decoding methods require dual forward passes (with and without context) to compare model outputs, doubling inference computational overhead, while post-training alignment demands extensive reinforcement learning with substantial computational overhead. To address this challenge, we present SFAD, a speculative decoding framework that enhances contextual faithfulness without inference degradation. We first construct ConFide, a preference dataset with fine-grained atomic perturbations, to train a context-faithful draft model via Direct Preference Optimization. During inference, Epistemic Friction detects potential hallucinations by quantifying distributional tension weighted by specialist certainty. When friction exceeds the threshold, Asymmetric Logit Steering refines the target distribution through residual-based logit injection; otherwise, standard speculation proceeds. Extensive experiments demonstrate that SFAD substantially improves faithfulness while achieving $2.48\times$ speedup, offering a practical solution for efficient LLMs.
- Abstract(参考訳): 大規模言語モデルにおける最も重要な課題の1つとして、文脈的忠実さが知識集約型アプリケーションにおける信頼性を直接決定する。
このタスクは、生成効率と事実整合性のバランスを必要とするため、特に難しい。
対照的な復号法では、モデル出力を比較するために(文脈なしで)二重前方パスを必要とし、推論の計算オーバーヘッドは倍増する一方、訓練後のアライメントは、かなりの計算オーバーヘッドを伴う広範な強化学習を必要とする。
この課題に対処するために、推論劣化を伴わずに文脈的忠実性を高める投機的復号化フレームワークであるSFADを提案する。
まず,微粒な原子摂動を持つ選好データセットであるConFideを構築し,直接選好最適化(Direct Preference Optimization)を通じて,文脈に忠実なドラフトモデルをトレーニングする。
推測中、エピステミック摩擦は、専門的な確実性によって重み付けられた分布張力の定量化によって潜在的幻覚を検出する。
摩擦がしきい値を超えると、非対称ロジットステアリングは残差ベースのロジット注入によって目標分布を洗練する。
大規模な実験により、SFADは2.48ドル以上のスピードアップを実現し、効率的なLCMのための実用的なソリューションを提供する一方で、忠実性を大幅に向上することが示された。
関連論文リスト
- Self-Distilled Trajectory-Aware Boltzmann Modeling: Bridging the Training-Inference Discrepancy in Diffusion Language Models [65.89572755202245]
拡散言語モデル(DLM)は、より強力なグローバル認識と高い並列生成を提供する。
標準負のエビデンス下界(NELBO)に基づく教師付き微調整後のDLMは非効率である。
そこで本研究では,学習を推論の容易かつハードな構造に整合させる,自己蒸留軌道に基づくポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-12T09:39:06Z) - SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition [24.02308757219308]
学習不要なファイングラインド視覚認識のためのサンプルワイド適応型textbfREasoning フレームワーク SARE を提案する。
SAREは高速な候補検索ときめ細かい推論を組み合わせ、必要なときにのみ後者を呼び出す。
推論プロセスでは、SAREは、過去の失敗を活用して、転送可能な差別的ガイダンスを提供する自己反射的な体験メカニズムを取り入れている。
論文 参考訳(メタデータ) (2026-03-18T13:49:27Z) - Verifiable Reasoning for LLM-based Generative Recommendation [106.7765000777685]
大規模言語モデル(LLM)における推論は、最近、生成的レコメンデーションの強化に強い可能性を示している。
本稿では,信頼性の高いフィードバックを提供するために,検証と推論をインターリーブする新しいTextbftextitreason-verify-recommendパラダイムを提案する。
4つの実世界のデータセットの実験は、VRecが効率を損なうことなく、推奨の有効性とスケーラビリティを大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-03-08T16:55:45Z) - Hit-RAG: Learning to Reason with Long Contexts via Preference Alignment [97.55382322103986]
Hit-RAGは認知的ボトルネックを解決するために設計された多段階の優先順位調整フレームワークである。
本手法は,3つの異なる段階を通じて外部証拠の利用を体系的に改善する。
論文 参考訳(メタデータ) (2026-03-07T04:05:27Z) - Efficient and Stable Reinforcement Learning for Diffusion Language Models [59.75789436018925]
拡散型大規模言語モデル(dLLM)の複雑な推論能力を解き放つには強化学習(RL)が不可欠である
dLLMの適用は、効率と安定性において、ユニークな課題に直面します。
本稿では,dLLMに対するRLの効率性と安定性を同時に向上するフレームワークであるスポース・テンポラル・プルーニング(STP)を提案する。
論文 参考訳(メタデータ) (2026-02-09T17:04:23Z) - Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning [16.244366307890832]
textbfDeepLatent Reasoning(DLR)を提案する。
このフレームワークは、試行錯誤コストを、高価なトークンレベルのフルシーケンス生成から連続潜在多様体へシフトさせる。
実験により、DLRはより安定した訓練収束を実現し、より長い水平推論チェーンをサポートし、推論能力の持続的な蓄積を促進することが示されている。
論文 参考訳(メタデータ) (2026-01-24T03:18:22Z) - Sycophancy Mitigation Through Reinforcement Learning with Uncertainty-Aware Adaptive Reasoning Trajectories [58.988535279557546]
適応推論トラジェクトリを用いたtextbf sycophancy Mitigation を提案する。
SMARTは,分布外の入力に対して強い性能を維持しながら,サイコファンティクスの挙動を著しく低下させることを示した。
論文 参考訳(メタデータ) (2025-09-20T17:09:14Z) - READER: Retrieval-Assisted Drafter for Efficient LLM Inference [0.0386965802948046]
自己回帰言語モデルはトークンシーケンスよりも分解された確率をインスタンス化するが、その厳密なシーケンシャルなデコーディングプロセスは、遅延推論に固有の低いバウンドを課す。
このボトルネックは、大規模生成モデルのスケーラブルなデプロイにおける中心的な障害として現れています。
本稿では,補助的ドラフトモデルのトレーニングを回避した投機的復号化フレームワークREADERを提案する。
論文 参考訳(メタデータ) (2025-08-12T16:47:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。