論文の概要: Amortising Bayesian Experimental Design for Sequential Information Gathering in LLMs
- arxiv url: http://arxiv.org/abs/2607.03426v1
- Date: Fri, 03 Jul 2026 15:38:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.609488
- Title: Amortising Bayesian Experimental Design for Sequential Information Gathering in LLMs
- Title(参考訳): LLMにおける逐次情報収集のためのベイズ実験設計
- Authors: Jakob Hartmann, James Harvey, Jhonathan Navott, Erik Y. Wang, Luckeciano C. Melo, Flaviu Cipcigan, Cheng Zhang, Alessandro Abate,
- Abstract要約: A SIG(Amortated Sequential Information Gathering)は,ベイズ実験設計(BED)を大規模言語モデル(LLM)に変換する微調整手法である。
SIGは7Bベースモデルの成功率を2倍以上にし、BED-LLMと比較して推論コストを25ドル以上削減する。
トレーニング中に見えない診断ベンチマークであるMediQに適用すると、SIGは7Bスケールで情報検索のパフォーマンスを改善する。
- 参考スコア(独自算出の注目度): 46.337528012183476
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) exhibit strong reasoning and world-knowledge capabilities, yet often struggle to gather information effectively across the multi-turn interactions required in sequential decision-making settings. We introduce Amortised Sequential Information Gathering (ASIG), a fine-tuning approach that amortises Bayesian Experimental Design (BED) into LLM policies via a multi-turn extension of Group Relative Policy Optimisation with an Expected Information Gain reward. Evaluated on the 20 Questions task, ASIG more than doubles the success rate of the 7B base model and reduces inference cost by over $25\times$ relative to BED-LLM, a competitive inference-time baseline. Applied to MediQ, a medical diagnosis benchmark unseen during training, ASIG improves information-seeking performance at the 7B scale, suggesting that the learned strategies can transfer out of distribution. Our findings show that amortising BED into LLM policies provides an effective and computationally efficient approach to sequential information gathering.
- Abstract(参考訳): 大規模言語モデル(LLM)は、強い推論と世界知識能力を示すが、シーケンシャルな意思決定設定に必要なマルチターンインタラクションを効果的に収集するのに苦労することが多い。
Amortised Sequential Information Gathering (ASIG) はベイズ実験設計(BED)をLLMポリシーに適合させる微調整手法であり,グループ相対政策最適化の多ターン拡張と期待情報ゲイン報酬によって導入する。
20質問タスクに基づいて、ASIGは7Bベースモデルの成功率を2倍以上にし、競合する推論時間ベースラインであるBED-LLMと比較して、推論コストを25\times$以上削減する。
トレーニング中に見えない医療診断ベンチマークであるMedQに応用すると、ASIGは7Bスケールで情報検索のパフォーマンスを改善し、学習した戦略が配布から移行できることを示唆している。
以上の結果から, BED を LLM ポリシーに改定することは, 逐次情報収集に効果的かつ効率的な手法であることがわかった。
関連論文リスト
- A Regression Framework for Understanding Prompt Component Impact on LLM Performance [0.0]
本稿では,大規模言語モデル(LLM)の性能に対する特定のプロンプト機能の影響を理解するための統計的枠組みを提案する。
本研究では,2つのオープンソースモデルであるMistral-7B と GPT-OSS-20B を比較し,簡単な算術問題を実行するためのプロンプトを利用する方法を提案する。
論文 参考訳(メタデータ) (2026-03-27T04:13:39Z) - IB-GRPO: Aligning LLM-based Learning Path Recommendation with Educational Objectives via Indicator-Based Group Relative Policy Optimization [20.87328464098245]
学習経路勧告(LPR)は、長期学習効果を最大化する学習項目のパーソナライズされたシーケンスを生成することを目的としている。
LLMは、自由形式のレコメンデーションにリッチなセマンティック理解を提供し、それを長期のLPRに適用することは困難である。
LLMに基づくLPRのためのインジケータ誘導アライメント手法であるIB-GRPOを提案する。
論文 参考訳(メタデータ) (2026-01-21T06:03:05Z) - Ensemble Privacy Defense for Knowledge-Intensive LLMs against Membership Inference Attacks [21.852575873751917]
推論攻撃は、プライバシーと機密ドメインへの信頼に深刻な脅威をもたらす。
我々は、新しいモデルに依存しない防衛フレームワーク、Ensemble Privacy Defense (EPD)を導入する。
EPDは、推理時間ベースラインと比較して、SFTで27.8%、RAGで526.3%のMIA成功を減少させる。
論文 参考訳(メタデータ) (2025-12-01T18:12:18Z) - BED-LLM: Intelligent Information Gathering with LLMs and Bayesian Experimental Design [20.03498575187842]
本稿では,ユーザや外部ソースから情報を知的かつ適応的に収集するLarge Language Models (LLM) の能力向上のための汎用的アプローチを提案する。
BED-LLMと呼ばれる我々のアプローチは、期待される情報獲得を最大化する質問を反復的に選択することに基づいている。
BED-LLMは,20の質問ゲームに基づいて,様々なテストにおいて,大幅な性能向上を実現している。
論文 参考訳(メタデータ) (2025-08-28T19:51:43Z) - GainRAG: Preference Alignment in Retrieval-Augmented Generation through Gain Signal Synthesis [30.185213495829164]
Retrieval-Augmented Generation (RAG)フレームワークは、検索モジュールを導入し、検索された情報を大きな言語モデル(LLM)の入力コンテキストに動的に注入する。
提案手法は,入力パスが正しい出力にどの程度寄与するかを計測する新たな指標である「ゲイン」を定義することで,レトリバーとLLMの好みを整合させる新しい手法であるGainRAGを提案する。
実験結果はGainRAGの有効性を6つのデータセットで検証した。
論文 参考訳(メタデータ) (2025-05-24T14:14:57Z) - Reinforcing Question Answering Agents with Minimalist Policy Gradient Optimization [80.09112808413133]
Mujicaは、質問をサブクエストの非循環グラフに分解するプランナーであり、検索と推論を通じて質問を解決するワーカーである。
MyGOは、従来のポリシー更新を勾配的いいねりの最大推定に置き換える、新しい強化学習手法である。
複数のデータセットにまたがる実験結果から,マルチホップQA性能向上における MujicaMyGO の有効性が示された。
論文 参考訳(メタデータ) (2025-05-20T18:33:03Z) - Modality-Balancing Preference Optimization of Large Multimodal Models by Adversarial Negative Mining [75.14823970163685]
LMMにおけるモダリティの不均衡に対処するため、新しい選好学習フレームワークMBPOを提案する。
MBPOは、強い負の反応、すなわちLLMバイアスによって誤った反応を生成することによって、より効果的なオフライン嗜好データセットを構築する。
視覚言語課題におけるLMM性能を高め、幻覚を効果的に軽減することができる。
論文 参考訳(メタデータ) (2025-05-20T03:59:05Z) - Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning [55.96599486604344]
本稿では,Large Language Models (LLMs) の推論能力向上を目的とした,反復的な選好学習プロセスによるアプローチを提案する。
我々は、MCTS(Monte Carlo Tree Search)を用いて好みデータを反復的に収集し、そのルックアヘッド機能を利用して、インスタンスレベルの報酬をよりきめ細かいステップレベルの信号に分解する。
提案アルゴリズムはDPO(Direct Preference Optimization)を用いて,新たに生成されたステップレベルの優先度データを用いてLCMポリシーを更新する。
論文 参考訳(メタデータ) (2024-05-01T11:10:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。