論文の概要: A Removal Based Approach to Improve LLM Faithfulness at Test-Time
- arxiv url: http://arxiv.org/abs/2609.04343v1
- Date: Thu, 03 Sep 2026 18:09:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.777789
- Title: A Removal Based Approach to Improve LLM Faithfulness at Test-Time
- Title(参考訳): 試験時間におけるLCMの忠実度向上のための除去的アプローチ
- Abstract要約: 大規模言語モデル(LLM)は、逐次決定にますます使われる。
これらの説明は不信であり、モデルの決定の根底にある実際の理由を反映していない。
不完全性を直接ターゲットとするテストタイムアプローチを導入します。
- 参考スコア(独自算出の注目度): 2.6612030624044194
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly used for consequential decisions, making their explanations an important tool for auditing model behavior. Unfortunately, these explanations can be unfaithful, failing to reflect the actual reasoning underlying the model's decisions. We consider a setting in which an LLM provides both an answer and an explanation in response to a question. We identify two distinct dimensions of unfaithful explanations: incompleteness, meaning that the explanation omits factors that influence the answer, and unsoundness, meaning that the explanation cites factors that did not influence the model's answer. Existing approaches to improving LLM faithfulness include training-time methods, which require access to model weights and extensive computational resources, and test-time methods that largely focus on addressing unsoundness. We introduce a test-time approach that directly targets incompleteness. We remove from the input the concepts not credited in the model's explanation and re-query the model on the reduced input. This eliminates unmentioned influences while preserving the influence of mentioned concepts. Across two datasets, multiple model families, and two independent faithfulness metrics, our approach improves explanation faithfulness compared to both standard prompting and prompting to encourage faithfulness. Our method is model-agnostic and can be applied at inference time without modifying model parameters, providing a flexible mechanism for reducing hidden influences and improving the reliability and safety of LLM-assisted decision making.
- Abstract(参考訳): 大規模言語モデル(LLM)は連続的な決定にますます使われており、それらの説明はモデルの振る舞いを監査するための重要なツールとなっている。
残念ながら、これらの説明は不信であり、モデルの決定の根底にある実際の理由を反映していない。
本稿では,LLMが質問に対する回答と説明の両方を提供する環境について考察する。
不完全性(incompleteness)とは、その説明が答えに影響を与える要因を省略することを意味し、不健全性(unsoundness)とは、モデルの答えに影響を与えない要因を引用することを意味する。
LLMの忠実性を改善するための既存のアプローチには、モデルウェイトや広範な計算資源へのアクセスを必要とする訓練時間法や、主に不協和性に対処するテスト時間法がある。
不完全性を直接ターゲットとするテストタイムアプローチを導入します。
我々は、モデルの説明にクレジットされていない概念を入力から取り除き、還元された入力についてモデルを再クエリする。
これにより、前述の概念の影響を保ちながら、未解決の影響を排除できる。
2つのデータセット、複数のモデルファミリー、および2つの独立した忠実度測定値において、我々のアプローチは、標準的プロンプトとプロンプトの両方と比較して、説明忠実度を改善する。
本手法はモデル非依存であり,モデルパラメータを変更することなく推論時に適用可能であり,隠れ影響を低減し,LCM支援意思決定の信頼性と安全性を向上させる柔軟なメカニズムを提供する。
関連論文リスト
- An Empirical Study of Counterfactual Self-Explanations in LLMs [13.093234754814851]
大規模言語モデルは、自身の出力に対する説明を容易に生成できるが、そのような自己説明は必ずしもモデルの振る舞いに忠実ではない。
本稿では,モデルが入力を最小限に編集し,それ自身の予測が変更されるような非現実的な自己説明を通じてこの問題を考察する。
以上の結果から,モデルスケールが説明品質の最大の決定要因であることが示唆された。
論文 参考訳(メタデータ) (2026-09-15T12:47:22Z) - Faithfulness Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance [57.17102098930037]
大規模言語モデル(LLM)は高い性能を達成し、NLPに革命をもたらした。
説明責任の欠如はブラックボックスとして扱われ、透明性と信頼を求めるドメインでの使用を制限する。
本研究では,注意レベルの介入を通じて説明生成を導くことにより,信頼感を高める訓練自由手法を提案する。
論文 参考訳(メタデータ) (2026-04-15T18:32:32Z) - WakenLLM: Evaluating Reasoning Potential and Stability in LLMs via Fine-Grained Benchmarking [34.350505059394536]
大規模言語モデル(LLM)は、推論タスクにおいて未知のラベルを頻繁に出力する。
我々は、モデル非能力に起因する未知の出力の一部を定量化するフレームワーク、WakenLLMを紹介した。
論文 参考訳(メタデータ) (2025-07-22T03:21:48Z) - Walk the Talk? Measuring the Faithfulness of Large Language Model Explanations [0.8949668577519213]
大規模言語モデル(LLM)は、質問に対する答えにどのように到達したかという、もっともらしい説明を生成することができる。
これらの説明はモデルの「合理的な」プロセス、すなわち、不誠実であるということを誤解することができる。
LLM説明の忠実度を測定するための新しい手法を提案する。
論文 参考訳(メタデータ) (2025-04-19T02:51:20Z) - Disentangling Memory and Reasoning Ability in Large Language Models [97.26827060106581]
本稿では、複雑な推論プロセスを2つの異なる明確なアクションに分解する新しい推論パラダイムを提案する。
実験の結果, この分解によりモデル性能が向上し, 推論プロセスの解釈可能性も向上することがわかった。
論文 参考訳(メタデータ) (2024-11-20T17:55:38Z) - Towards Faithful Natural Language Explanations: A Study Using Activation Patching in Large Language Models [29.67884478799914]
大きな言語モデル(LLM)は、その答えを正当化するために説得力のある自然言語説明(NLE)を生成することができる。
近年,NLEの忠実度を測定するための様々な手法が提案されている。
これらのアプローチは、確立された忠実性の定義に従って包括的でも正しくも設計されていない、と我々は主張する。
論文 参考訳(メタデータ) (2024-10-18T03:45:42Z) - Understanding the Relationship between Prompts and Response Uncertainty in Large Language Models [55.332004960574004]
大規模言語モデル(LLM)は意思決定に広く使用されているが、特に医療などの重要なタスクにおける信頼性は十分に確立されていない。
本稿では,LSMが生成する応答の不確実性が,入力プロンプトで提供される情報とどのように関連しているかを検討する。
本稿では,LLMが応答を生成する方法を説明し,プロンプトと応答の不確実性の関係を理解するためのプロンプト応答の概念モデルを提案する。
論文 参考訳(メタデータ) (2024-07-20T11:19:58Z) - Evaluating the Reliability of Self-Explanations in Large Language Models [2.8894038270224867]
このような自己説明の2つのタイプ – 抽出的, 対実的 – を評価した。
以上の結果から,これらの自己説明は人間の判断と相関するが,モデルの決定過程を完全に的確に従わないことが明らかとなった。
このギャップを橋渡しできるのは, 反実的な説明をLCMに促すことによって, 忠実で, 情報的で, 容易に検証できる結果が得られるからである。
論文 参考訳(メタデータ) (2024-07-19T17:41:08Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z) - R-Tuning: Instructing Large Language Models to Say `I Don't Know' [66.11375475253007]
大きな言語モデル(LLM)は、優れたパフォーマンスで多くのドメインに革命をもたらしたが、それでもその課題に直面している。
事前の指導チューニング方法は、モデルが知識を知っているかどうかに関わらず、モデルに文章を完成させるよう強制する。
我々はRefusal-Aware Instruction Tuning (R-Tuning)と呼ばれる新しいアプローチを提案する。
実験の結果、R-Tuningは、既知の質問に答えたり、未知の質問に答えるのを控えるモデルの能力を効果的に改善することを示した。
論文 参考訳(メタデータ) (2023-11-16T08:45:44Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。