論文の概要: How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation
- arxiv url: http://arxiv.org/abs/2606.28358v1
- Date: Tue, 09 Jun 2026 07:06:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-05 17:01:29.595825
- Title: How Do LLMs Cite? A Mechanistic Interpretation of Attribution in Retrieval-Augmented Generation
- Title(参考訳): LLMはどのように沈み込むか? : 再検索型世代における属性の機械論的解釈
- Abstract要約: ファクトイドの質問に答えながらインライン・引用を付加するかを,大規模言語モデルがどう判断するかを示す。
以上より,PopQAでは,これらの臨界頭部のみを増幅または減衰させ,解答精度を損なうことなく69%の急激な頭部を除去できることが示唆された。
結果は、モデルが明らかな推論と内部の計算経路を切断する可能性を明らかにした。
- 参考スコア(独自算出の注目度): 3.4562767039451674
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Retrieval-Augmented Generation (RAG) aims to enhance the trustworthiness of Large Language Models (LLMs) by grounding their outputs in external documents, often using inline citations for verifiability. However, the faithfulness of these citations -- whether the model genuinely uses a source to generate an answer -- remains a critical, unverified assumption. This paper offers the first mechanistic account of how a large language model decides whether to attach an inline citation while answering a factoid question. Using the Llama-3.1-8B-Instruct model in a controlled experimental environment based on the PopQA dataset, we employ an activation patching approach. We map the underlying mechanism responsible for citation, discovering that it is not a single, localized component but a distributed, multi-stage "attributional ensemble" of attention heads and MLP layers. We show that amplifying or attenuating only those critical heads and MLPs repairs over 90% of missed citations and eliminates 69% of spurious ones on PopQA without harming answer accuracy. Although gains on the multi-document HotpotQA benchmark are modest, the same component set still moves citation rates in the intended direction, indicating that the underlying mechanism is not dataset-specific. The results reveal a potential disconnect between the model's apparent reasoning and its internal computational pathway, suggesting that inline citations can create a false sense of security.
- Abstract(参考訳): Retrieval-Augmented Generation (RAG) は、大規模言語モデル(LLM)の信頼性を高めることを目的として、アウトプットを外部文書に基盤として、しばしば検証性のためのインライン引用を使用する。
しかしながら、これらの引用の忠実さ -- モデルが真にソースを使って回答を生成するかどうか -- は、批判的で証明されていない仮定のままである。
本稿では,大言語モデルがファクトイドの質問に答えながらインラインの引用を付けるかどうかをどう判断するかについて,最初の力学的考察を行う。
PopQAデータセットに基づく制御実験環境におけるLlama-3.1-8B-インストラクトモデルを用いて,アクティベーションパッチ方式を用いる。
提案するメカニズムは,1つの局所化コンポーネントではなく,アテンションヘッドとMLP層からなる分散多段階の「属性アンサンブル」であることから,引用に責任を負うメカニズムをマッピングする。
我々は,これらの臨界頭部とMLPのみを増幅または減衰させることで,90%以上の誤引用を修復し,回答精度を損なうことなく,PopQA上の急激な頭部の69%を除去することを示した。
マルチドキュメントのHotpotQAベンチマークのゲインは控えめだが、同じコンポーネントセットが依然として意図した方向に引用レートを移動しており、基盤となるメカニズムがデータセット固有のものではないことを示している。
結果は、モデルが明らかな推論と内部の計算経路を切断する可能性を明らかにし、インラインの引用が誤ったセキュリティ感覚を生み出すことを示唆している。
関連論文リスト
- Who is the Agent to Blame? Localizing Faithfulness and Citation Mistakes in Agentic Deep Research [75.8770212601511]
ディープリサーチ(DR)システムは、Webから情報を検索して合成する複数のエージェントを編成することで、長い形式の引用レポートを生成する。
循環はこれらの報告の忠実さを評価するための主要なメカニズムであるが、現在のDRシステムでは引用のリコールが不十分である。
そこで本稿では,エージェントが各エラーをローカルにテストすることで,各エラーをピンポイントで検出する手法を提案する。
論文 参考訳(メタデータ) (2026-08-25T09:34:18Z) - Verified Misguidance: Measuring Structural Citation Failures in Search-Augmented LLMs [8.721564756242431]
CITETRACEは、ユーザクエリから取得したソースから生成された回答まで、完全な引用チェーンをトレースするデータセットである。
我々は,意図的アライメント,ソース適合性,回答ソースの忠実度に基づいて各引用をスコアする3次元評価フレームワークを設計する。
プールの向こう側では、引用の30.6%がソースを歪めており、27.1%はドメイン不適切なソースから来ている。
論文 参考訳(メタデータ) (2026-05-27T14:54:05Z) - Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation [75.27453112832093]
その結果, 微粒化は, 最も優れた粒度に比べて, 属性品質を16~276%低下させることがわかった。
分析の結果,詳細な(文レベルの)引用は,主張に答えるために証拠を帰属させるために必要な意味的依存関係を阻害することがわかった。
厳密には、引用-最適粒度は、回答の正しさを保ったり改善したりしながら、帰属品質を大幅に向上させる。
論文 参考訳(メタデータ) (2026-04-01T22:16:23Z) - CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era [51.63024682584688]
大規模言語モデル (LLM) は新たなリスクを導入している。
本稿では,科学文献における幻覚的引用のための総合的なベンチマークおよび検出フレームワークについて紹介する。
我々のフレームワークは、精度と解釈可能性の両方において、先行手法を著しく上回っている。
論文 参考訳(メタデータ) (2026-02-26T19:17:39Z) - Probing for Knowledge Attribution in Large Language Models [45.47366023067617]
大規模言語モデル(LLM)は、しばしば流動的だが根拠のないクレームや幻覚を生成する。
適切な緩和は、モデルの答えがプロンプトまたは内部の重みに基づいているかどうかを知ることに依存する。
モデル隠れ表現に基づいて訓練された単純な線形分類器であるプローブは、帰納的帰属を確実に予測できることを示す。
論文 参考訳(メタデータ) (2026-02-26T09:21:12Z) - VeriCite: Towards Reliable Citations in Retrieval-Augmented Generation via Rigorous Verification [107.75781898355562]
証拠を厳格に検証し,回答の帰属性を高めるために設計された,VeriCiteと呼ばれる新しいフレームワークを紹介する。
我々は,5つのオープンソースLCMと4つのデータセットを対象とした実験を行い,VeriCiteが回答の正しさを維持しつつ,引用品質を大幅に向上できることを実証した。
論文 参考訳(メタデータ) (2025-10-13T13:38:54Z) - Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models [44.31597857713689]
最初の段階でActive Indexingを導入し、一般化可能なソースアンコールバインディングを作成します。
Qwen-2.5-7B&3Bの実験は、アクティブインデックスがパッシブインデックスのベースラインを一貫して上回っていることを示している。
内部の引用は、モデルを検索ノイズに対してより堅牢にすることで、外部の引用を補完する。
論文 参考訳(メタデータ) (2025-06-21T04:48:05Z) - SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models [51.90867482317985]
SelfCiteは、生成されたレスポンスの文に対して、きめ細かい文レベルの引用を生成する、自己教師型アプローチである。
SelfCiteの有効性は、LongBench-Citeベンチマークにおいて、引用F1を5.3ポイントまで増やすことによって示される。
論文 参考訳(メタデータ) (2025-02-13T18:55:13Z) - On the Capacity of Citation Generation by Large Language Models [38.47160164251295]
Retrieval-augmented Generation (RAG) は、大規模言語モデル(LLM)における「ハロシン化」問題を緩和するための有望な方法として現れる。
論文 参考訳(メタデータ) (2024-10-15T03:04:26Z) - Model Internals-based Answer Attribution for Trustworthy Retrieval-Augmented Generation [8.975024781390077]
MIRAGE --Model Internals-based RAG Explanations -- このモデル内部を用いたプラグアンドプレイアプローチは、質問応答アプリケーションにおける忠実な回答属性である。
提案手法を多言語QAデータセット上で評価し,人間の回答属性と高い一致性を見いだした。
論文 参考訳(メタデータ) (2024-06-19T16:10:26Z) - ALiiCE: Evaluating Positional Fine-grained Citation Generation [54.19617927314975]
本稿では,微細な引用生成のための最初の自動評価フレームワークであるALiiCEを提案する。
我々のフレームワークはまず、文のクレームを依存性分析によって原子クレームに解析し、次に原子クレームレベルでの引用品質を計算する。
複数大言語モデルの2つの長文QAデータセット上での位置的きめ細かな引用生成性能を評価する。
論文 参考訳(メタデータ) (2024-06-19T09:16:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。