論文の概要: LODESTAR: Robust Entropy-Based Answer Selection in Retrieval-Augmented Generation for Question Answering -- Directing Frozen-LLM Entropy with a Reinforcement-Learned Prompt Polarizer under Misleading Passages
- arxiv url: http://arxiv.org/abs/2608.11922v2
- Date: Thu, 20 Aug 2026 00:36:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.299084
- Title: LODESTAR: Robust Entropy-Based Answer Selection in Retrieval-Augmented Generation for Question Answering -- Directing Frozen-LLM Entropy with a Reinforcement-Learned Prompt Polarizer under Misleading Passages
- Title(参考訳): LODESTAR: 探索型質問応答生成におけるロバストエントロピーに基づく解答選択 -- 解答経路下での強化学習型プロンプト偏光器による凍結-LLMエントロピーの誘導
- Abstract要約: 予測分布エントロピー(英: Predictive-Distribution Entropy)は、質問応答のための検索強化生成(RAG)における強力な解選択規則である。
LODESTAR: サードパーティ製凍結応答体に誘導される不確実性によってテキスト介入をスコアする最初の方法について紹介する。
- 参考スコア(独自算出の注目度): 4.237636935341204
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Predictive-distribution entropy is a strong answer-selection rule in retrieval-augmented generation (RAG) for question answering: across five QA benchmarks, selecting the answer a frozen respondent LLM produces with the lowest answer-token entropy lifts mean $F_1$ from 0.4769 to 0.5148 over the retriever's top-ranked passage, without gold answers. Yet this rule, which prior entropy-based selectors adopt, fails: a misleading passage makes the respondent confidently wrong, driving entropy down where the uncertainty signal looks most trustworthy. The failure comes from the passage the respondent reads, and the context it is read in is an input we can intervene on. We introduce LODESTAR: to our knowledge the first method to score a text intervention by the uncertainty it induces in a third-party frozen respondent, compared within one question. LODESTAR uses reinforcement learning (GRPO) to train, once and offline, a polarizer -- a short fixed natural-language string inserted into the respondent's prompt and never into its weights, directing entropy so that entropy-based answer selection stays robust to misleading passages; training labels are built from gold answers and two LLM judges, and inference reads neither. With every competing selector under the same frozen respondent and candidate pools on 5,008 questions, LODESTAR attains the highest mean $F_1$ of any inference-ready selector (0.5339), the highest macro exact match (0.4136), and the highest GPT-4o judge score of the frozen-respondent configurations judged (0.6435); its three-seed mean wins all 70 $F_1$ cells against fourteen published configurations and is paired-significant on $F_1$ against every one. The gain holds in-domain on NQ-Open and out-of-domain over SQuAD, TriviaQA, EntityQuestions and WebQuestions. Ablating the polarizer shows it is what makes the respondent read a misleading passage less often (26.0% vs 30.3%).
- Abstract(参考訳): 予測分布エントロピー(英: Predictive-Distribution entropy)は、検索増強世代(RAG)における質問応答のための強力な解選択ルールである: 5つのQAベンチマークにおいて、凍結応答LDMが生成する解を、最も低い解答トーケンエントロピーリフトで選択する平均$F_1$から0.4769から0.5148まで、ゴールドの解答なしで、検索者の最上位通過に対して平均$F_1$となる。
しかし、前回のエントロピーベースのセレクタが採用したこのルールは失敗する: 誤解を招くパスは、応答者を自信を持って誤ったものにし、不確実性信号が最も信頼できる場所にエントロピーを誘導する。
失敗は、応答者が読み込むパスから来ており、それが読み込まれるコンテキストは、私たちが介入できるインプットである。
我々はLODESTARについて、サードパーティ製凍結応答剤で引き起こされる不確実性によってテキスト介入をスコアする最初の方法について、1つの質問で比較した。
LODESTARは強化学習(GRPO)を使用して、応答者のプロンプトに挿入された短い固定された自然言語文字列である偏光器を訓練し、エントロピーベースの回答選択が誤解を招く経路に頑健であるようにエントロピーを指示する。
競合する全てのセレクタが5,008の質問に対して同じフリーズ応答と候補プールの下で、LODESTARは推論可読セレクタ(0.5339)の最高平均$F_1$、最大マクロ完全一致(0.4136)、最高GPT-4o判定スコア(0.6435)を獲得し、3シード平均は全70ドルF_1$セルを14の公開構成に対して獲得し、F_1$にペア付き符号を持つ。
このゲインは、SQuAD、TriviaQA、EntityQuestions、WebQuestionsよりも、NQ-Openとout-of- domainのドメイン内にある。
偏光剤を非難すると、反応剤は誤解を招く通路をあまり読まない(26.0%対30.3%)。
関連論文リスト
- FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect [69.8983512616053]
大規模な言語モデルは、しばしばユーザによる暗黙のスタンスと一致する微妙な言い換えに応答を変更する。
これによってユーザーは、根拠となる事実ではなく、どのようにして質問を言い表したかというアドバイスをユーザーに残すことができる。
FramingQAは、法律、医学、ファイナンス、ロボットシミュレーションにまたがるフレーミングに疑問を呈するモデル感度を測定するベンチマークである。
論文 参考訳(メタデータ) (2026-09-07T12:56:44Z) - Candidate supply and answer selection shape the value of LLM judging in multi-agent systems [4.178517265499193]
正しい答えは、しばしば生成された候補の中に存在しているが、システムは依然として収束し、間違った答えを報告することができる。
筆者らは,(1) LLM判事がマルチエージェントシステムで生成した候補に対して,回答正解の信号を供給することによって,効果的な選択圧を与える場合,(2)その信号を用いることで回答が向上する場合の2つの質問について検討した。
論文 参考訳(メタデータ) (2026-08-26T15:52:20Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - A Triple-Robustness Analysis of Retrieval-Augmented Generation for Multi-Hop Requirements Traceability [0.0]
GraphRAG対ベクトルRAGに関する報告された評決は一致せず、その証拠は典型的には1つのコーパス、埋め込み器、および裁判官と結びついている。
本稿では,5ピペリンアーキテクチャ行列を固定し,組込み器を可変させる3重ロバスト性解析について述べる。
我々は、RAGアーキテクチャのクレームが信頼される前に、このレベルの堅牢性でテストされるべきであると主張している。
論文 参考訳(メタデータ) (2026-08-01T15:05:45Z) - DreamQAS: Learning a Decision-Useful World Model for VQE-Efficient Quantum Architecture Search [9.679776057194056]
Reinforcement-learning-based quantum architecture search (RL-QAS) は、回路を拡張した後、繰り返し変動量子固有解器 (VQE) を最適化する。
本稿では、正確な回路力学を保存し、VQE後の高価なフィードバックのみを学習するモデルベースのRLフレームワークであるDreamQASを紹介する。
論文 参考訳(メタデータ) (2026-07-31T14:58:23Z) - Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs [4.476374205849672]
ブラックボックス言語モデルの言語的信頼度は、検索ルーティングのための実用的な信号として機能する。
6つのQAベンチマーク、3つのモデルファミリー、3つの検索ポリシーで27,000のポリシーインスタンスを評価した。
論文 参考訳(メタデータ) (2026-07-28T11:30:25Z) - LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation [79.03892269184145]
LivingArenaは自動汚染耐性評価フレームワークである。
モデルは質問を交互に提案し、相手が正しく答えられないアイテムを提示する。
質問者は、相手の知識境界を積極的に特定し、活用することが奨励される。
論文 参考訳(メタデータ) (2026-06-19T06:20:58Z) - Boosting Self-Consistency with Ranking [56.38798757709555]
自己整合性は、複数の推論パスをサンプリングし、最も頻繁な回答を選択することで、大きな言語モデルを改善する。
この制限は、自己整合性における解答選択をランク付け問題として再構成する、ランク付け改善自己整合性(RISC)に対処する。
論文 参考訳(メタデータ) (2026-06-03T16:12:30Z) - The Chain Holds, the Answer Folds: Trace-Answer Dissociation in Reasoning Models Under Adversarial Pressure [8.86745721473138]
推論モデルはシングルターンベンチマークで評価されるが、マルチターンダイアログにデプロイされる。
われわれはこの不信な降伏(UC)を2ドル(約2万2000円)のラテント・ヴァース・ビヘイビア・フレームワークで分離し、指標のフリップレートとシングルターンプローブの両方を見逃す。
論文 参考訳(メタデータ) (2026-05-27T20:41:08Z) - Step-wise Rubric Rewards for LLM Reasoning [72.17879367869503]
RLVR(Reinforcement Learning with Verifiable Rewards)は、大規模言語モデルの推論を改善するために広く使われている。
正しい回答の18.2%は間違っているが、肯定的な報酬がある。
6つの数学的推論ベンチマークで、SRaRはRaRの平均精度を3.57ポイント改善した。
論文 参考訳(メタデータ) (2026-05-17T07:08:14Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - High Accuracy, Less Talk (HALT): Reliable LLMs through Capability-Aligned Finetuning [84.52940628494879]
大規模言語モデル(LLM)は現在、すべてのプロンプトに応答する。
LLMは、知識や能力の欠如によって、誤った答えを生み出すことができる。
本稿では,その正確性に自信を持った場合にのみコンテンツを生成するためのLCMのポストトレーニングを提案する。
論文 参考訳(メタデータ) (2025-06-04T15:16:21Z) - Language Models Prefer What They Know: Relative Confidence Estimation via Confidence Preferences [62.52739672949452]
言語モデル(LM)は、ユーザーがアウトプットの誤りを検知し、必要であれば人間の専門家に延期するのに役立つ、信頼性の高い信頼推定を提供する必要がある。
本稿では,相対的信頼度推定法を提案する。そこでは,相互に質問をマッチングし,モデルに信頼度を相対的に判断するよう求める。
各質問を、他の質問に対する「プレイヤー」として扱い、モデルの選好を一致結果として扱うことで、モデルの信頼性選好を信頼スコアに変換するために、Elo評価やBradley-Terryのようなランクアグリゲーション手法を使うことができる。
論文 参考訳(メタデータ) (2025-02-03T07:43:27Z) - LLM Robustness Against Misinformation in Biomedical Question Answering [50.98256373698759]
探索拡張生成(RAG)アプローチは,質問応答のための大規模言語モデル(LLM)の折り畳みを低減するために用いられる。
バイオメディカル質問に対する誤報に対する4つのLDMの有効性とロバスト性を評価した。
論文 参考訳(メタデータ) (2024-10-27T16:23:26Z) - Reranking Overgenerated Responses for End-to-End Task-Oriented Dialogue
Systems [71.33737787564966]
エンド・ツー・エンド(E2E)タスク指向対話システム(ToD)は、いわゆる「いいね!
本稿では,システムによって当初過剰に生成された応答リストから高品質な項目を選択する方法を提案する。
本研究では,最先端のE2E ToDシステムを2.4BLEU,3.2ROUGE,2.8 METEORで改善し,新たなピーク値を得た。
論文 参考訳(メタデータ) (2022-11-07T15:59:49Z) - No Answer is Better Than Wrong Answer: A Reflection Model for Document
Level Machine Reading Comprehension [92.57688872599998]
本稿では,全ての回答型を体系的に扱う新しい手法を提案する。
特に,2段階の訓練手法を応用し,非解答事例と誤答事例を識別する反射ネットという新しい手法を提案する。
F1スコアはそれぞれ77.2点,64.1点であった。
論文 参考訳(メタデータ) (2020-09-25T06:57:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。