論文の概要: Don't Let Me Ask for It: LLMs Show Deficiencies in Active Multi-Turn Information Acquisition for Abductive Inference
- arxiv url: http://arxiv.org/abs/2608.03388v1
- Date: Tue, 04 Aug 2026 09:39:24 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.11538
- Title: Don't Let Me Ask for It: LLMs Show Deficiencies in Active Multi-Turn Information Acquisition for Abductive Inference
- Title(参考訳): 質問するな: LLMsは帰納的推論のためのアクティブマルチTurn情報取得の欠陥を示す
- Abstract要約: 帰納的推論は、観察された証拠を説明し、新しい証拠が利用可能になるにつれてそれらを修正する仮説を形成する必要がある。
本稿では、異なる相互作用モード下でこれらの振る舞いを研究するための対話型プローブであるAlien Abductionを紹介する。
- 参考スコア(独自算出の注目度): 15.768100289136392
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Abductive reasoning requires forming hypotheses that explain observed evidence and revising them as new evidence becomes available. While large language models (LLMs) are often evaluated on whether they solve abductive reasoning tasks correctly, less is known about how they acquire evidence, update their hypotheses, and decide when to stop. We introduce Alien Abduction game, an interactive probe for studying these behaviours under different interaction modes. The modes vary in whether evidence is provided upfront or across turns, and whether queries are selected by the model or examples are provided by the oracle. Across models, providing evidence upfront leads to higher success rates than distributing it across turns. In multi-turn settings, some models commit before using the available evidence, while others exhaust the turn budget without converging. Models also achieve higher success rates when examples are provided by the oracle than when they select their own queries, although their final hypotheses are more consistent with the evidence they selected. These findings suggest that models may form hypotheses that fit self-selected evidence without sufficiently distinguishing them from alternatives, and may struggle to validate and refine their hypotheses or determine when to stop.
- Abstract(参考訳): 帰納的推論は、観察された証拠を説明し、新しい証拠が利用可能になるにつれてそれらを修正する仮説を形成する必要がある。
大きな言語モデル(LLM)は、誘因的推論タスクを正しく解くかどうかでしばしば評価されるが、どのように証拠を取得し、仮説を更新し、いつ停止するかは、あまり知られていない。
本稿では,異なる相互作用モード下での動作を研究するための対話型プローブであるAlien Abductionゲームを紹介する。
モデムは、エビデンスを前向きに、または全ターンで提供し、クエリがモデルによって選択されるか、または、例がオラクルによって提供されるかによって異なる。
モデル全体にわたって、前もって証拠を提供すると、ターンに分散するよりも成功率が高くなります。
マルチターン設定では、利用可能なエビデンスを使用する前にコミットするモデルもあれば、収束せずにターン予算を浪費するモデルもある。
モデルは、自分のクエリを選択する場合よりも、神託によって提供された例の方が、より高い成功率を達成するが、最終的な仮説は、彼らが選択した証拠とより一致している。
これらの結果は、モデルが、選択肢と十分に区別することなく、自己選択された証拠に適合する仮説を形成し、仮説を検証・洗練したり、いつ停止するかを決定するのに苦労する可能性があることを示唆している。
関連論文リスト
- Tri-PvP: Exposing Modality Bias in Omni-Modal Large Language Models through Perceptual-Propositional Evidence Conflicts [49.97842835825998]
既存のベンチマークでは、知覚信号と命題信号の2つの形態の証拠が記述されている。
本稿では,視覚,音声,テキストを交叉するベンチマークであるTri-PvPを紹介する。
多くのモデルとエビデンス型条件で頑健な視覚バイアスが見つかり、重要なことはエビデンス型バイアスの系統的な非対称性を明らかにすることである。
論文 参考訳(メタデータ) (2026-09-05T10:33:58Z) - DERELAB: Probing Defeasible Reasoning and Confirmation Bias in LLMs with a Generative Benchmark [6.835919520017402]
決定的推論(Dedefeasible reasoning)とは、推定が妥当な現在の証拠から引き出されるが、新しい証拠の導入によって取り除くことができる推論の一種である。
本稿では,パラメータ化されたグラフ構造から多ターンの信念更新会話を生成する生成フレームワークであるDeReLabを紹介する。
我々は9つのオープンかつプロプライエタリな大規模言語モデルを評価し、ほぼ全員が一貫性のない更新に抵抗しながら、一貫性のある証拠を受け入れる体系的な傾向を示した。
論文 参考訳(メタデータ) (2026-08-31T08:10:29Z) - EVAR: Evidence-Validated Hypothesis Admission for Budget-Aware Narrative Reasoning [6.590648135605556]
EVARは、予算を考慮した物語推論のためのエビデンス検証仮説解釈フレームワークである。
EVARは、制御可能な推論コストを維持しながら、タスク性能とエビデンス忠実性の両方を改善していることを示す。
論文 参考訳(メタデータ) (2026-08-30T15:07:27Z) - Twin Worlds: Equivariance-Based Abstention for Evidence-Grounded Reasoning [38.63002496590365]
本稿では,知識集約的推論における信頼性向上のための枠組みを提案する。
重要な要因は、文脈における実体の言及が記憶された関連を活性化し、モデルが証拠に埋もれていないプラウシブルな応答を生成することである。
我々は、パラメトリックな先行値を減らしながら関係構造を保ちつつ、元の入力の型付き置換によって複数の世界を構築する。
論文 参考訳(メタデータ) (2026-08-28T07:33:29Z) - FALSIFYBENCH: Evaluating Inductive Reasoning in LLMs with Rule Discovery Games [2.959715295394151]
従来のWason 2-4-6タスクに触発された仮説駆動推論のための評価フレームワークであるFALSIFYBENCHを紹介する。
このタスクは、仮説の生成、証拠収集、そして証拠の確認と不確認の両方に対応する信念の修正という、科学的推論の重要な要素を捉えている。
モデルファミリとスケールをまたいだ12 LLM の評価は、推論モデルが命令調整モデルよりも一般的に強力な科学的推論モデルであることを示しているが、最適性能に近づくモデルはない。
論文 参考訳(メタデータ) (2026-06-03T11:33:17Z) - VITED: Video Temporal Evidence Distillation [49.38292490256531]
そこで我々は,チェーン・オブ・エビデンス推論による複雑なビデオ質問応答について検討した。
モデルは、固定数のフレームを均一にサンプリングするため、多段階の推論に苦労する。
本稿では,既存のビデオQAデータセットをエビデンス・アソシエーション・チェーンで拡張するフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-17T06:30:02Z) - Rethinking LLM Uncertainty: A Multi-Agent Approach to Estimating Black-Box Model Uncertainty [47.95943057892318]
ブラックボックスLSMの不確実性の定量化は、信頼性の高い応答とスケーラブルな監視に不可欠である。
本研究では,不確実性推定にマルチエージェント相互作用を用いた新しい理論的基礎手法であるDiverseAgentEntropyを紹介する。
論文 参考訳(メタデータ) (2024-12-12T18:52:40Z) - A Belief Model for Conflicting and Uncertain Evidence -- Connecting
Dempster-Shafer Theory and the Topology of Evidence [8.295493796476766]
本稿では,不一致,不完全,不確実な証拠に基づいて,信念の度合いを測定する新しいモデルを提案する。
このモデルによる信念の計算次数は一般に#P完全であることが示される。
論文 参考訳(メタデータ) (2023-06-06T09:30:48Z) - Read it Twice: Towards Faithfully Interpretable Fact Verification by
Revisiting Evidence [59.81749318292707]
本稿では,証拠の検索とクレームの検証を行うためにReReadという名前の事実検証モデルを提案する。
提案システムは,異なる設定下での最良のレポートモデルに対して,大幅な改善を実現することができる。
論文 参考訳(メタデータ) (2023-05-02T03:23:14Z) - Uncertain Evidence in Probabilistic Models and Stochastic Simulators [80.40110074847527]
我々は、不確実性を伴う観測を伴う確率論的モデルにおいて、ベイズ的推論を行うという問題について考察する。
我々は、不確実な証拠をどう解釈するかを探求し、潜伏変数の推論に関連する適切な解釈の重要性を拡大する。
我々は、不確実な証拠を説明するための具体的なガイドラインを考案し、特に一貫性に関する新しい洞察を提供する。
論文 参考訳(メタデータ) (2022-10-21T20:32:59Z) - Revealing Unfair Models by Mining Interpretable Evidence [50.48264727620845]
機械学習の人気は、不公平なモデルがハイリスクなアプリケーションにデプロイされるリスクを高めている。
本稿では,解釈可能な証拠をマイニングすることで不公平なモデルを明らかにする新しい課題に取り組む。
本手法は,訓練されたモデルの不公平性を効果的に明らかにするために,極めて解釈可能な確固たる証拠を見出す。
論文 参考訳(メタデータ) (2022-07-12T20:03:08Z) - Distantly-Supervised Evidence Retrieval Enables Question Answering
without Evidence Annotation [19.551623461082617]
オープンドメインの質問応答は、大きなコーパスから取得した証拠に基づいて質問に答える。
本稿では,大規模コーパスからモデルが証拠の発見を学べるかどうかを,モデル学習のための回答ラベルからのみ遠ざかって検討する。
我々は,最新のモデルから証拠を交互に発見し,最も可能性の高い証拠を学習するよう促すことにより,弱いレトリバーよりも反復的に改善する新しいアプローチ(DistDR)を提案する。
論文 参考訳(メタデータ) (2021-10-10T20:01:27Z) - Is My Model Using The Right Evidence? Systematic Probes for Examining
Evidence-Based Tabular Reasoning [26.168211982441875]
ニューラルモデルは、推論を含むNLPタスク全体での最先端のパフォーマンスを定期的に報告する。
実験の結果, BERTをベースとした現在の最先端モデルでは, 以下の数値を適切に判断できないことがわかった。
論文 参考訳(メタデータ) (2021-08-02T01:14:19Z) - Topic-Aware Evidence Reasoning and Stance-Aware Aggregation for Fact
Verification [19.130541561303293]
本稿では,事実検証のための新たな話題認識型証拠推論とスタンス認識型アグリゲーションモデルを提案する。
2つのベンチマークデータセットで実施されたテストは、事実検証のためのいくつかの最先端アプローチよりも提案モデルの方が優れていることを示す。
論文 参考訳(メタデータ) (2021-06-02T14:33:12Z) - AmbiFC: Fact-Checking Ambiguous Claims with Evidence [57.7091560922174]
実世界の情報ニーズから10kクレームを抽出したファクトチェックデータセットであるAmbiFCを提示する。
アンビFCの証拠に対する主張を比較する際に,曖昧さから生じる不一致を分析した。
我々は,このあいまいさをソフトラベルで予測するモデルを開発した。
論文 参考訳(メタデータ) (2021-04-01T17:40:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。