論文の概要: Uncertainty Decomposition for Clarification Seeking in LLM Agents
- arxiv url: http://arxiv.org/abs/2606.19559v1
- Date: Wed, 17 Jun 2026 19:59:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-19 18:23:39.516916
- Title: Uncertainty Decomposition for Clarification Seeking in LLM Agents
- Title(参考訳): LLM剤における不確かさ分解の解明
- Authors: Gregory Matsnev,
- Abstract要約: 近年の研究では,対話型大規模言語モデル (LLM) エージェントには,古典的アレタリック/エピステミック不確実性フレームワークが不十分であると主張している。
我々は、要求の不確実性(u)からアクションの信頼性を分離する単純なプロンプトベースの分解でこの呼び出しに答える。
5つのバックボーンで平均化され、提案された分解は、ReAct+UEで73%、UAMで36%、明確化F1で改善する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent position papers argue that the classical aleatoric/epistemic uncertainty framework is insufficient for interactive large language model (LLM) agents and call for underspecification-aware, decomposed, and communicable uncertainty representations that can unlock new agent capabilities such as proactive clarification seeking and shared mental-model building. Practical deployment constraints -- black-box APIs, interactive latency budgets, and the absence of labeled trajectories -- rule out logprob-based, multi-sampling, and training-based methods, leaving prompt-based estimation as the most viable family for surfacing such signals at deployment time. We answer this call with a simple prompt-based decomposition that separates action confidence from request uncertainty (u), enabling the agent to ask for clarification when the task specification is ambiguous. To evaluate it, we introduce two clarification-augmented benchmarks (WebShop-Clarification and ALFWorld-Clarification) in which 50% of tasks are deliberately underspecified, and systematically compare the proposed decomposition against ReAct+UE and Uncertainty-Aware Memory (UAM) across five LLM backbones (GPT-5.1, DeepSeek-v3.2-exp, GLM-4.7, Qwen3.5-35B, GPT-OSS-120B) on these variants together with the standard WebShop, ALFWorld, and REAL benchmarks for fault detection. Averaged across the five backbones, the proposed decomposition improves clarification F1 on ALFWorld-Clarification by 73% over ReAct+UE and by 36% over UAM, and leads clarification F1 on every backbone on WebShop-Clarification and on four of five backbones on ALFWorld-Clarification, indicating that the gains generalize beyond a single LLM.
- Abstract(参考訳): 最近のポジション・ペーパーでは、対話型大規模言語モデル(LLM)エージェントには古典的アレタリック/エピステミック不確実性フレームワークが不十分であり、不特定性を認識し、分解し、コミュニケーション可能な不確実性表現を呼びかけている。
実際のデプロイメント制約 -- ブラックボックスAPI、インタラクティブなレイテンシ予算、ラベル付きトラジェクトリの欠如 -- は、ログプロブベース、マルチサンプリング、トレーニングベースのメソッドを除外し、デプロイ時にそのような信号を監視するための最も実行可能なファミリーとしてプロンプトベースの見積もりを残している。
要求不確実性(u)からアクションの信頼性を分離する単純なプロンプトベースの分解でこの呼び出しに答え、タスク仕様が曖昧である場合、エージェントが明確化を求めることができる。
WebShop-Clarification と ALFWorld-Clarification の2つのベンチマークを導入し、50%のタスクが意図的に未特定であり、提案されたReAct+UE と Uncertainty-Aware Memory (UAM) に対する分解を5つの LLM バックボーン (GPT-5.1, DeepSeek-v3.2-exp, GLM-4.7, Qwen3.5-35B, GPT-OSS-120B) で比較した。
5つのバックボーンで平均化され、提案された分解は、ALFWorld-Clarificationの明確化F1をReAct+UEで73%、UAMで36%改善し、WebShop-ClarificationのすべてのバックボーンでF1を、ALFWorld-Clarificationの5つのバックボーンでF1を導く。
関連論文リスト
- Decoupled Smart Contract Audits: Lightweight LLM Framework via Distillation and Aggregation [0.5649790777986989]
軽量で高度に最適化されたオープンソース LLM を利用した,効率的なエンドツーエンドのスマートコントラクトセキュリティ監査フレームワークを提案する。
我々のフレームワークは、総合的な監査タスクを、脆弱性検出、説明、重度分類、修正推奨の4つの相互接続されたコンポーネントに分離する。
実験結果から、我々の軽量パイプラインは、最先端のオープンソースコーダの高密度LLMよりも一貫して優れています。
論文 参考訳(メタデータ) (2026-06-02T04:13:43Z) - OmniISR: A Unified Framework for Centralized and Federated Learning via Intermediate Supervision and Regularization [58.03221830946145]
我々は、純粋なCL、純粋なFL、ハイブリッドCL-FLトレーニングモードを融合する統合フレームワークであるOmniISRを提案する。
我々は,OmniISRが集中型パラダイムとフェデレーション型パラダイムの両方において,モデル性能を一貫して改善していることを示す。
論文 参考訳(メタデータ) (2026-05-19T04:13:27Z) - DiscoUQ: Structured Disagreement Analysis for Uncertainty Quantification in LLM Agent Ensembles [5.647839536820347]
著者間の不一致構造を抽出し活用し,信頼度を良好に推定するフレームワークであるDiscoUQを紹介する。
DiscoUQ-LLM の平均 AUROC は 0.802 であり、最高のベースラインを上回っている。
学習した機能は、ほぼゼロに近いパフォーマンス劣化を伴うベンチマークで一般化される。
論文 参考訳(メタデータ) (2026-03-21T23:24:12Z) - Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation [3.23600523782706]
CRYSTAL (Clear Reasoning via Yielded Steps, Traceability, and Logic)は6,372インスタンスの診断ベンチマークである。
本稿では,意味的類似性マッチングによるステップレベルの精度とリコールをスコアするMatch F1と,乱れた推論連鎖をペナルティ化するOrdered Match F1の2つの相補的指標を提案する。
CPR-CurriculumはGRPOによるMatch F1の32%の改善を実現している。
論文 参考訳(メタデータ) (2026-03-13T15:48:15Z) - MC-Search: Evaluating and Enhancing Multimodal Agentic Search with Structured Long Reasoning Chains [79.14584837105808]
MC-Searchは5つの代表的推論構造にまたがる長いステップワイドなアノテート推論チェーンを持つエージェントMM-RAGの最初のベンチマークである。
回答精度以外にも、MC-Searchは、品質、段階的検索、計画精度を推論するための新しいプロセスレベルメトリクスを導入している。
エージェントMM-RAGパイプラインを統一的に開発することにより、6つのMLLMをベンチマークし、過剰検索や過度検索、モダリティミスアライメント計画などの体系的な問題を明らかにする。
論文 参考訳(メタデータ) (2026-03-01T02:25:57Z) - ReLoop: Structured Modeling and Behavioral Verification for Reliable LLM-Based Optimization [6.572539312871392]
大規模言語モデル(LLM)は、自然言語を最適化コードに変換することができるが、サイレント障害は重大なリスクをもたらす。
2つの相補的な方向からサイレント障害に対処するReLoopを紹介します。
論文 参考訳(メタデータ) (2026-02-17T20:20:33Z) - Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements [78.87065404966002]
既存のベンチマークは、主に質問レベルで質問をキュレートする。
ベンチマーク構築をゼロから再考するステートメントベースのベンチマークであるEncyclo-Kを提案する。
論文 参考訳(メタデータ) (2025-12-31T13:55:54Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。