論文の概要: FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness
- arxiv url: http://arxiv.org/abs/2604.10189v1
- Date: Sat, 11 Apr 2026 12:43:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-14 20:13:15.898042
- Title: FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness
- Title(参考訳): FAITH:信頼と誠実性の統合による顔のアライメント
- Authors: Xiaoning Dong, Chengyan Wu, Yajie Wen, Yu Chen, Yun Xue, Jing Zhang, Wei Xu, Bolei Ma,
- Abstract要約: 大規模言語モデル(LLM)は、たとえそれに対応する知識を持っていたとしても、事実的に不正確なコンテンツを生成することができる。
自然言語の不確実性信号と外部知識を統合したファクトアライメントのためのフレームワークであるFAITHを紹介する。
4つの知識集約型ベンチマークの実験により、FAITHはLLMの事実的正確性と真性を高めることが示された。
- 参考スコア(独自算出の注目度): 17.127080581208062
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) can generate factually inaccurate content even if they have corresponding knowledge, which critically undermines their reliability. Existing approaches attempt to mitigate this by incorporating uncertainty in QA prompt during training, but these numerical scores lack the semantic richness for LLM to properly understand its internal states of trustworthiness and honestness, leading to insufficient factuality alignment. We introduce FAITH (Factuality Alignment through Integrating Trustworthiness and Honestness), a post-training framework for factuality alignment that integrates natural-language uncertainty signals with external knowledge. Specifically, we augment training datasets by computing confidence scores and semantic entropy from LLM outputs and mapping them into a knowledge state quadrant that describes the model's internal knowledge possession (trustworthiness) and answering behaviors (honestness) in natural language. Based on this enhanced data, we design a reward function that considers both correctness and uncertainty signals, and fine-tune the LLM using the Proximal Policy Optimization (PPO) algorithm. To further mitigate weakly grounded responses, we design a retrieval-augmented module that retrieves relevant external passages, improving the consistency between internal and external knowledge representations. Extensive experiments on four knowledge-intensive benchmarks demonstrate that FAITH enhances the factual accuracy and truthfulness of LLMs.
- Abstract(参考訳): 大規模言語モデル(LLM)は、たとえそれに対応する知識を持っていたとしても、事実的に不正確なコンテンツを生成することができ、その信頼性を著しく損なう。
既存のアプローチでは、トレーニング中にQAプロンプトの不確実性を取り入れてこれを緩和しようとするが、これらの数値スコアは、LLMが内部の信頼性と誠実さを適切に理解する意味的な豊かさに欠けており、事実上の整合性が不十分である。
FAITH(Factuality Alignment through Integrating Trustworthiness and Honestness)は、自然言語の不確実性信号と外部知識を統合する、事実整合の訓練後フレームワークである。
具体的には、LLM出力からの信頼性スコアとセマンティックエントロピーを計算し、モデルの内的知識保持(信頼)と自然言語の回答行動(正直さ)を記述した知識状態クアドラントにマッピングすることで、トレーニングデータセットを増強する。
この強化されたデータに基づいて、正当性と不確実性信号の両方を考慮した報酬関数を設計し、PPOアルゴリズムを用いてLLMを微調整する。
弱接地応答をさらに緩和するため,検索拡張モジュールを設計し,内部知識表現と外部知識表現との整合性を向上する。
4つの知識集約型ベンチマークの大規模な実験は、FAITHがLLMの事実的正確性と真性を高めることを示した。
関連論文リスト
- Improving Factuality in LLMs via Inference-Time Knowledge Graph Construction [30.381290814338413]
大規模言語モデル(LLM)は、パラメトリックメモリに制限があるため、現実的に一貫した答えを生み出すのにしばしば苦労する。
推論中に知識グラフ(KG)を動的に構築・拡張する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-31T16:36:40Z) - Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models [14.166203096918247]
外部知識の接地応答は、大規模言語モデルにおける幻覚を緩和するための効果的な戦略である。
現在のLLMは、忠実さと表現性を同時に維持しながら、シームレスに知識を統合するのに苦労している。
本稿では,外部知識を伴わずに出力確率を動的に統合する新しい手法である協調復号法を提案する。
論文 参考訳(メタデータ) (2025-08-26T03:48:05Z) - Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models [24.72990207218907]
LLM(Large Language Models)は、畳み込み(confabulation)として知られる、流動的だが不正なコンテンツを生成する傾向にある。
本研究では、文脈内情報がモデル行動にどのように影響するか、LLMが信頼できない応答を識別できるかを検討する。
論文 参考訳(メタデータ) (2025-08-11T16:12:36Z) - ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation [91.20492150248106]
本研究では,不誠実な生成の背後にある内部メカニズムを解明し,不均等に活性化される中深度フィードフォワードネットワーク(FFN)のサブセットを同定する。
本研究では,不信感関連FFNの活性化を抑制することにより,文脈的忠実度を向上させるフレームワークであるParametric Knowledge Mutingを提案する。
実験結果から,ParamMuteはCoFaithfulQAと確立されたConFiQAベンチマークの両方の信頼度を大幅に向上し,パラメトリックメモリへの依存度を大幅に低下させることが示された。
論文 参考訳(メタデータ) (2025-02-21T15:50:41Z) - Towards Fully Exploiting LLM Internal States to Enhance Knowledge Boundary Perception [58.62352010928591]
大きな言語モデル(LLM)は様々なタスクにまたがって優れたパフォーマンスを示すが、しばしば知識境界を正確に測定するのに苦労する。
本稿では,LLMの内部状態を有効利用して,効率性やリスクの観点から知識境界に対する認識を高める方法について検討する。
論文 参考訳(メタデータ) (2025-02-17T11:11:09Z) - Aligning Large Language Models for Faithful Integrity Against Opposing Argument [71.33552795870544]
大規模言語モデル(LLM)は複雑な推論タスクにおいて印象的な機能を示している。
原文が正しい場合でも、会話中に不誠実な議論によって容易に誤解される。
本稿では,信頼度と信頼度を両立させる新しい枠組みを提案する。
論文 参考訳(メタデータ) (2025-01-02T16:38:21Z) - UAlign: Leveraging Uncertainty Estimations for Factuality Alignment on Large Language Models [41.67393607081513]
大きな言語モデル(LLM)は、しばしば、彼らが持っている事実の知識を正確に表現するのに苦労する。
知識境界を表現するために不確実性推定を利用するUAlignフレームワークを提案する。
提案したUAlign は LLM の能力を大幅に向上させ,既知の疑問に自信を持って答えることができることを示す。
論文 参考訳(メタデータ) (2024-12-16T14:14:27Z) - TrustScore: Reference-Free Evaluation of LLM Response Trustworthiness [58.721012475577716]
大規模言語モデル(LLM)は、様々な領域にまたがる印象的な能力を示しており、その実践的応用が急増している。
本稿では,行動整合性の概念に基づくフレームワークであるTrustScoreを紹介する。
論文 参考訳(メタデータ) (2024-02-19T21:12:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。