論文の概要: Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding
- arxiv url: http://arxiv.org/abs/2608.24024v2
- Date: Thu, 27 Aug 2026 18:44:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.071955
- Title: Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding
- Title(参考訳): Beyond Confidence: Retrieval GroundingによるマルチTurn検索エージェントのテスト時間スケーリング
- Abstract要約: 信頼度に基づく投票は、現代のマルチターン検索エージェントには不十分であることを示す。
本稿では,最終回答と得られた文書との語彙重なりで各ロールアウトをスコアするRGVを提案する。
RGVは、信頼性に基づく投票を一貫して上回り、得票率は最大で5.4%、少数で正しい質問では+35%である。
- 参考スコア(独自算出の注目度): 27.33127942086487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Confidence-based voting aggregates parallel LLM rollouts by weighting each with internal signals such as token log probabilities, and has been actively studied for single-turn reasoning. However, modern LLMs increasingly act as multi-turn search agents that retrieve and condition on external documents. In this paper, we show that confidence-based voting transfers poorly to this multi-turn setting, and identify the underlying failure reason as copy inflation: when retrieved documents are appended to an agent's context, tokens copied from those documents receive systematically inflated log probabilities. This flattens confidence scores within each question and weakens the resulting weighted vote. To address this issue, we propose Retrieval-Grounded Voting (RGV), which scores each rollout by the lexical overlap between its final answer and the documents it retrieved. By computing the signal outside the contaminated context, RGV sidesteps both token log probabilities and additional LLM calls. Across four search-agent benchmarks and five LLMs, RGV consistently outperforms confidence-based voting, with gains of up to +5.4% accuracy and +35% on minority-correct questions, where the correct answer appears in only 1-2 of 8 rollouts.
- Abstract(参考訳): 信頼度に基づく投票は、トークンログ確率などの内部信号の重み付けによって並列LLMロールアウトを集約し、シングルターン推論のために積極的に研究されている。
しかし、現代のLLMは、外部文書の検索と条件付けを行うマルチターン検索エージェントとしての役割をますます高めている。
本稿では,このマルチターン設定に対して信頼性に基づく投票の転送が不十分であることを示すとともに,その基盤となる障害原因をコピーインフレーションとして同定する。
これは各質問の信頼スコアをフラットにし、結果の重み付け投票を弱める。
この問題に対処するために、最終回答と検索した文書の語彙重なり合いによって各ロールアウトをスコアするRetrieval-Grounded Voting (RGV)を提案する。
汚染されたコンテキスト外の信号を計算することで、RGVはトークンログの確率と追加のLLM呼び出しの両方をサイドステップする。
4つの検索エージェントのベンチマークと5つのLDMで、RGVは信頼に基づく投票を一貫して上回り、正確さは+5.4%、マイノリティーな質問では+35%まで向上し、正しい答えは8つのロールアウトのうち1-2にしか現れない。
関連論文リスト
- LLM-as-a-Verifier: A General-Purpose Verification Framework [74.40111651545979]
本稿では,汎用検証フレームワーク LLM-as-a-Verifier を紹介する。
追加のトレーニングを必要とせずに、エージェントタスクに対してきめ細かいフィードバックを提供する。
いくつかのベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-07-06T17:59:35Z) - CAR: Query-Guided Confidence-Aware Reranking for Retrieval-Augmented Generation [26.57845149504473]
本稿では,文書有用性信号としてジェネレータの信頼性変化を利用する,クエリ誘導型,トレーニング不要,プラグアンドプレイリグレードフレームワークを提案する。
車はスパースと密集したレトリバー間でNDCG@5を継続的に改善する。
ランキングは、下流世代F1の改良と強く相関し、Spearman rho = 0.964を達成している。
論文 参考訳(メタデータ) (2026-05-06T04:51:28Z) - Prism-Reranker: Beyond Relevance Scoring -- Jointly Producing Contributions and Evidence for Agentic Retrieval [0.0]
Qwen3.5上に4つのサイズ(0.8B, 2B, 4B, 9B)で構築されたリランカーモデルのファミリーであるPrism-Rerankerを紹介する。
標準のye/no関連判断に加えて、評決がYesであるたびに、モデルはドキュメントがクエリをどのように助けるかを要約したコントリビューションステートメントを発行する。
同じレシピが既存のLCMベースのリランカーを拡張し、Qwen3-Reranker-4Bのコントリビューションとエビデンス機能を強化している。
論文 参考訳(メタデータ) (2026-04-26T14:28:48Z) - How do LLMs Compute Verbal Confidence [20.456986780602964]
言語的信頼感は、自己評価の自動化を反映しており、ポストホック再建ではないことを示す。
これらの知見は, LLMにおけるメタ認知の理解とキャリブレーションの改善に影響を及ぼす。
論文 参考訳(メタデータ) (2026-03-18T15:31:43Z) - Test-Time Strategies for More Efficient and Accurate Agentic RAG [58.44913384057518]
Retrieval-Augmented Generation (RAG) システムは複雑なマルチホップ問題に直面している。
このような手法は、以前に処理された情報の反復的な検索を含む非効率性を導入することができる。
本稿では,これらの問題を軽減するために,サーチ-R1パイプラインに対するテスト時間修正について検討する。
論文 参考訳(メタデータ) (2026-03-12T19:18:59Z) - Reading Between the Lines: Abstaining from VLM-Generated OCR Errors via Latent Representation Probes [79.36545159724703]
隠れ状態や注目パターンの軽量プローブを学習するためのLRP(Latent Representation Probing)を提案する。
LRPは、ベストベースラインよりも吸音精度を7.6%向上させる。
これにより、デプロイメント対応AIシステムを構築するための原則化されたフレームワークが確立される。
論文 参考訳(メタデータ) (2025-11-25T00:24:42Z) - PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading [24.52586571116556]
大規模言語モデル (LLMs) は研究助手としての役割を担っているが、学術的なタスクに対する信頼性は低い評価のままである。
本研究では,4つの主要な研究課題を対象としたLCMを体系的に評価するベンチマークであるPaperAskを紹介する。
引用検索は48~98%のマルチ参照クエリで失敗し、セクション固有のコンテンツ抽出は72~91%のケースで失敗し、トピックの論文発見ではF1スコアが0.32未満となり、関連する文献の60%以上が失われている。
論文 参考訳(メタデータ) (2025-10-25T10:11:29Z) - Document Attribution: Examining Citation Relationships using Large Language Models [62.46146670035751]
そこで本研究では,帰属を簡単なテキスト・エンタテインメント・タスクとみなすゼロショット・アプローチを提案する。
また,アトリビューションプロセスの強化におけるアテンションメカニズムの役割についても検討する。
論文 参考訳(メタデータ) (2025-05-09T04:40:11Z) - Retrieval-Augmented Generation with Conflicting Evidence [57.66282463340297]
大規模言語モデル (LLM) エージェントは、応答の事実性を改善するために、検索強化世代 (RAG) をますます採用している。
実際には、これらのシステムは曖昧なユーザクエリを処理し、複数のソースからの情報に衝突する可能性がある。
RAMDocs(Retrieval with Ambiguity and Misinformation in Documents)は,ユーザクエリのエビデンスを矛盾させるような,複雑で現実的なシナリオをシミュレートする新しいデータセットである。
論文 参考訳(メタデータ) (2025-04-17T16:46:11Z) - Attribute or Abstain: Large Language Models as Long Document Assistants [58.32043134560244]
LLMは人間が長い文書を扱うのを助けることができるが、幻覚で知られている。
既存の属性に対するアプローチはRAG設定でのみ評価されている。
これは、検索が不要な長いドキュメント設定とは大きく異なるが、助けになる可能性がある。
そこで本研究では,6種類の多種多様文書タスクのベンチマークであるLABと,異なる大きさの5つのLLMに対する属性に対する異なるアプローチの実験を行う。
論文 参考訳(メタデータ) (2024-07-10T16:16:02Z) - CONFLARE: CONFormal LArge language model REtrieval [0.0]
Retrieval-augmented Generation (RAG)フレームワークは、大規模言語モデル(LLM)が知識ベースから関連する情報を検索し、応答を生成するコンテキストに組み込むことを可能にする。
RAGは、検索が必要な情報を応答生成のコンテキストとして識別できない場合、有効な応答を保証しない。
本稿では,RAGフレームワークにおける検索不確実性を定量化するために,共形予測を適用するための4段階のフレームワークを提案する。
論文 参考訳(メタデータ) (2024-04-04T02:58:21Z) - Reconfidencing LLMs from the Grouping Loss Perspective [56.801251926946485]
大規模言語モデル(LLM)は、自信のある音調で幻覚的な答えを生じさせる可能性がある。
近年の研究では、不確実性制御はキャリブレーションを超えて行わなければならないことが示されている。
そこで我々は,MistralとLLaMAの回答に対する信頼度を評価するために,知識ベースから導出した新しい評価データセットを構築した。
論文 参考訳(メタデータ) (2024-02-07T15:40:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。