論文の概要: Information Discernment in Large Language Models
- arxiv url: http://arxiv.org/abs/2607.19355v1
- Date: Fri, 22 May 2026 12:13:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.128219
- Title: Information Discernment in Large Language Models
- Title(参考訳): 大規模言語モデルにおける情報識別
- Abstract要約: Learn2Discernは、解釈可能なメトリクスを持つ3つの規範的公理に基礎を置いている実験的なフレームワークであり、ベンチマークである。
モデルはソースと真実の識別にほぼ近い確率で実行し、ソースの信頼性の2倍のソースの人気を頼りにし、クレームが地上の真実に対してその位置を改善または悪化させるかどうかをほぼ等しく更新する。
- 参考スコア(独自算出の注目度): 4.277461007196155
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLMs are increasingly used with external knowledge sources like the internet. Do they weigh information appropriately -- updating more for reliable sources (source discernment) and more when claims bring priors closer to the truth (truth discernment)? We formalize this as information discernment and introduce Learn2Discern (L2D), an experimental framework and benchmark grounded in three normative axioms with interpretable metrics. To establish external validity, a pre-registered, quota-matched user study (n=299) confirms that real LLM users endorse all three axioms and report that violations reduce their trust and usage intent. Across 13 models and nearly 670K trials, we find consistent failures across both dimensions: models perform near chance on source and truth discernment, rely on source popularity twice as much as source reliability, and update roughly equally whether a claim improves or worsens their position relative to the ground truth. Models integrate external knowledge most effectively on datasets where their priors are already the most accurate. Newer and larger models improve truth discernment but not source discernment, a blind spot that model complexity does not address. We identify simple inference-time interventions that improve both forms of discernment. We release our dataset and survey as a testbed for a core alignment property that scales in importance as LLMs replace traditional search.
- Abstract(参考訳): LLMはインターネットのような外部の知識ソースでますます使われている。
信頼できる情報源(情報源の識別)やクレームが真実(真実の識別)に近づくと、より多くを更新する。
我々はこれを情報識別として形式化し、解釈可能なメトリクスを持つ3つの規範的公理を基礎とした実験的なフレームワークとベンチマークであるLearner2Discern (L2D)を紹介する。
外部の妥当性を確立するために、登録済みのクォータマッチングユーザスタディ(n=299)は、実際のLLMユーザが3つの公理をすべて支持していることを確認し、違反が信頼と使用意図を減少させると報告する。
13のモデルと670K近い試行で、両方の次元で一貫した失敗が見つかります。モデルがソースと真実の識別にほぼ近い確率で実行し、ソースの信頼性の2倍のソースの人気に依存し、クレームが根拠の真実に対してその位置を改善または悪化させるかどうかをほぼ等しく更新します。
モデルは、これまでで最も正確だったデータセットに対して、最も効果的に外部知識を統合する。
より新しいモデルとより大規模なモデルは、真実の識別を改善するが、情報源の識別は改善しない。
両形態の識別を改善するための単純な推論時間介入を同定する。
LLMが従来の検索に取って代わるにつれて重要となるコアアライメント特性のテストベッドとして、データセットとサーベイをリリースする。
関連論文リスト
- How Large Language Models Balance Internal Knowledge with User and Document Assertions [14.45011438097133]
大きな言語モデル(LLM)は、内部のパラメトリック知識と外部情報のバランスをとる必要があることが多い。
モデルがこれらのソースを確実に処理できる能力は、システムの安全性の鍵となる。
論文 参考訳(メタデータ) (2026-04-24T03:43:44Z) - Leveraging LLM Parametric Knowledge for Fact Checking without Retrieval [60.25608870901428]
信頼性は、大規模言語モデル(LLM)上に構築されたエージェントAIシステムの中核研究課題である
本研究では,任意の自然言語クレームの検証に焦点をあて,検索なしで事実チェックを行うタスクを提案する。
論文 参考訳(メタデータ) (2026-03-05T18:42:51Z) - Whose Facts Win? LLM Source Preferences under Knowledge Conflicts [4.587118047944915]
そこで本研究では,言語間知識の衝突による大言語モデル(LLM)の解決にソースの嗜好がどのような影響を及ぼすかを検討する。
LLMは、人やソーシャルメディアの情報よりも、制度的に協調した情報を好む。
これらのソースの好みは、信頼性の低いソースからの情報を単に繰り返すことで逆転することができる。
論文 参考訳(メタデータ) (2026-01-07T09:35:35Z) - Can Large Language Models Express Uncertainty Like Human? [71.27418419522884]
我々は,人間に注釈を付けた信頼スコアを持つヘッジ式の最初の多種多様な大規模データセットをリリースする。
現代大言語モデルにまたがる言語信頼に関する最初の体系的研究を行う。
論文 参考訳(メタデータ) (2025-09-29T02:34:30Z) - Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers [59.168391398830515]
我々は,14のファクトチェックベンチマークのサンプルを用いて,12の事前学習LDMと1つの特殊ファクト検証器を評価した。
データセットにおけるアノテーションエラーとあいまいさに対処することの重要性を強調します。
最上位のパフォーマンスを実現するために、前作でしばしば見落とされがちな、数ショットのインコンテキストの例を持つフロンティアLSM。
論文 参考訳(メタデータ) (2025-06-16T10:32:10Z) - Evaluating open-source Large Language Models for automated fact-checking [0.13499500088995461]
大規模言語モデル(LLM)は、自動ファクトチェックの潜在的なツールとして登場した。
本研究は,異なるレベルの文脈情報を用いてクレームを評価する能力に焦点をあてる。
論文 参考訳(メタデータ) (2025-03-07T16:45:33Z) - S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning [51.84977135926156]
S$2$Rはモデルに推論時の自己検証と自己正当性を教えることによってLLM推論を強化する効率的なフレームワークである。
以上の結果から,Qwen2.5-math-7Bの精度は51.0%から81.6%に向上した。
論文 参考訳(メタデータ) (2025-02-18T13:40:22Z) - LLMs as Repositories of Factual Knowledge: Limitations and Solutions [1.7764955091415962]
本研究では,事実知識のリポジトリとしてのLarge Language Models(LLMs)の妥当性について検討する。
時間に敏感な事実質問に応答する際の信頼性を評価する。
本稿では,モデルの性能向上を図るため,ENAF(ENtity-Aware Fine-tuning)を提案する。
論文 参考訳(メタデータ) (2025-01-22T10:16:53Z) - Re-Search for The Truth: Multi-round Retrieval-augmented Large Language Models are Strong Fake News Detectors [38.75533934195315]
大きな言語モデル(LLM)はその顕著な推論と生成能力で知られている。
クレーム検証のための Web ソースからキーエビデンスを自動的に戦略的に抽出する,新たな LLM フレームワークについて紹介する。
我々の枠組みは十分な証拠の取得を保証し、性能を向上させる。
論文 参考訳(メタデータ) (2024-03-14T00:35:39Z) - The Earth is Flat? Unveiling Factual Errors in Large Language Models [89.94270049334479]
ChatGPTのような大規模言語モデル(LLM)は、事前学習や微調整の知識が豊富にあるため、様々な応用がある。
それにもかかわらず、医療、ジャーナリズム、教育といった重要な分野に懸念を抱き、事実と常識の誤りを引き起こす傾向にある。
LLMにおける事実不正確な事実を明らかにすることを目的とした,新しい自動テストフレームワークであるFactCheckerを紹介する。
論文 参考訳(メタデータ) (2024-01-01T14:02:27Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。