論文の概要: Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
- arxiv url: http://arxiv.org/abs/2605.25831v1
- Date: Mon, 25 May 2026 13:29:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-26 19:50:20.138274
- Title: Clarify, Abstain or Answer? Strategising in Conversation with Belief-Augmented Generation
- Title(参考訳): 明確化・不可解・解答 : 発展的世代との対話をめざして
- Abstract要約: 大規模言語モデル(LLM)はテキスト上の分布を定義し、不確実性の確率的表現と見なすことができる。
提案するBelief-Augmented Generation (BAG) は,これらのKサンプルに対して,会話戦略を決定するための理由を与える。
BAGは6つのモデルのQA精度を改善し、即時のみのベースラインよりも信条に忠実な戦略決定を下す。
- 参考スコア(独自算出の注目度): 38.81368744366676
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) define a distribution over text, which can be viewed as a probabilistic representation of uncertainty: sampling K responses yields a belief state - responses a model deems plausible. Existing work exploits this representation for narrow tasks like either decoding or selective prediction, and often requires manual interventions, not controlling generation directly. We propose Belief-Augmented Generation (BAG): grounding LLMs in their own belief state via the prompt and letting them reason over these K samples to decide on a conversational strategy: answer, clarify, or abstain. In a multi-turn ambiguous QA setting, we find that LLMs by default rarely clarify or abstain, ignoring uncertainty about the input or facts. BAG improves QA accuracy across six models and yields strategy decisions more faithful to the belief state than prompt-only baselines. Disentangling when to clarify from when to abstain, however, remains challenging.
- Abstract(参考訳): 大規模言語モデル(LLM)はテキスト上の分布を定義し、不確実性の確率論的表現と見なすことができる。
既存の作業では、デコードや選択的予測といった狭いタスクのためにこの表現を利用しており、しばしば手動による介入を必要とし、生成を直接制御しない。
提案するBelief-Augmented Generation (BAG) は,各自の信念状態にLLMを接地し,これらのKサンプルに対して,回答,明確化,棄却という対話的戦略を決定するための理由を与える。
マルチターンあいまいなQA設定では、LLMが入力や事実の不確実性を無視して、デフォルトでは滅多に明確あるいは無視されることが分かる。
BAGは6つのモデルのQA精度を改善し、即時のみのベースラインよりも信条に忠実な戦略決定を下す。
しかし、いつ退去するかを明確にするのは難しい。
関連論文リスト
- CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement [50.91045324738942]
CLAIMは、オープンドメイン環境でのアクティブな明確化学習のための不確実性駆動フレームワークである。
本研究では,不確実性推定とセマンティッククラスタリングと推論に基づく判断を統合したエントロピー駆動型合成データ生成パイプラインを提案する。
実験の結果,手動でラベル付けしたデータに頼ることなく,CLAIMが安定かつ一般化可能な明確化戦略を学習できることが確認された。
論文 参考訳(メタデータ) (2026-08-12T04:27:45Z) - Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty [70.43119366710778]
本稿では,Agens-BRACE: Agent Belief state Representation by Abstraction and Confidence Estimationを紹介する。
LLMエージェントを信頼状態モデルと政策モデルに分離し、強化学習を通じて協調的に最適化する手法である。
長期にわたる部分的に観察可能な言語環境において、平均して+14.5%の絶対的な改善を実現している。
論文 参考訳(メタデータ) (2026-05-12T02:37:04Z) - Elicitation Matters: How Prompts and Query Protocols Shape LLM Surrogates under Sparse Observations [0.0]
スパース観測により, LLMから抽出した代理的信念について検討した。
我々は、構造的プロンプトが効果的な先行として機能し、POSINTWISEとJOINTクエリは異なる信念を誘導し、シーケンシャルなエビデンスによって非単調で秩序に敏感な信頼度が更新されることを示した。
論文 参考訳(メタデータ) (2026-05-06T11:10:58Z) - Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems [52.83669998269706]
テキストのみの設定で研究されてきたが、まだマルチモーダルに探索されていない。
現在のベンチマークでは、未解決性を無視するか、現実的な障害モードを見逃す粗末なメソッドに依存している。
MM-AQAは、2つの軸に沿った変換によって解答不能なインスタンスを解答可能なインスタンスから構築するベンチマークである。
論文 参考訳(メタデータ) (2026-04-16T09:23:22Z) - I-CALM: Incentivizing Confidence-Aware Abstention for LLM Hallucination Mitigation [2.688126466709795]
大規模言語モデル(LLM)は、自信はあるが誤った答えをしばしば生み出す。
モデルを変更することなく、即時のみの介入が幻覚リスクを低減できるかどうかを検討する。
結果から,本フレームワークは質問に対する選択的な回答を,再学習なしに改善できることが示された。
論文 参考訳(メタデータ) (2026-04-05T00:15:41Z) - The Illusion of Certainty: Uncertainty quantification for LLMs fails under ambiguity [48.899855816199484]
そこで本研究では,第1の曖昧な質問応答(QA)データセットであるMAQA*とAmbigQA*を紹介する。
予測分布とアンサンブルに基づく推定器は、あいまいさの下では基本的に限定的であることを示す。
論文 参考訳(メタデータ) (2025-11-06T14:46:35Z) - Teaching Language Models to Faithfully Express their Uncertainty [8.022069644392786]
大きな言語モデル(LLM)は、しばしば不確実性を誤解する。
本稿では,FUT(Fithful Uncertainity Tuning)を導入し,不確かさを忠実に表現する指導用LLMを指導する。
論文 参考訳(メタデータ) (2025-10-14T14:42:40Z) - Variability Need Not Imply Error: The Case of Adequate but Semantically Distinct Responses [7.581259361859477]
不確実性定量化ツールは、モデルが不確実である場合の応答を拒否するために使用できます。
我々は、モデルがAdequate Responses (PROBAR)に割り当てる確率を推定する。
ProBARはアンビグニティ/オープンエンディエントネスの異なるプロンプトでセマンティックエントロピーを上回ります。
論文 参考訳(メタデータ) (2024-12-20T09:02:26Z) - Understanding the Relationship between Prompts and Response Uncertainty in Large Language Models [55.332004960574004]
大規模言語モデル(LLM)は意思決定に広く使用されているが、特に医療などの重要なタスクにおける信頼性は十分に確立されていない。
本稿では,LSMが生成する応答の不確実性が,入力プロンプトで提供される情報とどのように関連しているかを検討する。
本稿では,LLMが応答を生成する方法を説明し,プロンプトと応答の不確実性の関係を理解するためのプロンプト応答の概念モデルを提案する。
論文 参考訳(メタデータ) (2024-07-20T11:19:58Z) - Do Large Language Models Exhibit Cognitive Dissonance? Studying the Difference Between Revealed Beliefs and Stated Answers [13.644277507363036]
Revealed Beliefは,不確実性を考慮した推論を必要とするタスクに対して,Large Language Models (LLMs)を評価する評価フレームワークである。
以上の結果から,LSMは正しい回答をしばしば述べるが,Revealed Beliefは確率質量を不整合に割り当てることが多く,体系的な偏見を示し,新しい証拠が提示された時にその信念を適切に更新することができないことが示唆された。
論文 参考訳(メタデータ) (2024-06-21T08:56:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。