論文の概要: LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos
- arxiv url: http://arxiv.org/abs/2607.12733v1
- Date: Tue, 14 Jul 2026 13:03:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.146191
- Title: LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos
- Title(参考訳): LLMは煙が見えるが火は見えない:Elenchosによる誘惑的推論の評価
- Authors: Julius Steiglechner, Lucas Mahler, Gabriele Lohmann,
- Abstract要約: 大規模言語モデル(LLM)はパターン認識やテキスト生成に優れるが、帰納的推論の能力はいまだによく分かっていない。
本稿では,構造的逆問題として帰納的推論を計測する生成的評価フレームワークであるElenchosを紹介する。
予備的な証拠は、推論時間推論の増加によるリターンの減少を示唆している。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models (LLMs) excel at pattern recognition and text generation, but their capacity for abductive inference - inferring latent hypotheses that explain observed behavior - remains poorly understood. Here, we introduce Elenchos (named after the Socratic method of cross-examination), a generative evaluation framework that measures abductive reasoning as a structural inverse problem. Given a reference formal system, such as the lambda-calculus, and a potentially mutated counterpart, agents must determine whether a mutation has occurred and infer the rule modifications responsible for the resulting behavioral differences. Evaluating frontier and mid-tier LLMs reveals a consistent detection-attribution dissociation: models often recognize that a system has been altered but struggle to identify the latent mutations causing the observed discrepancies. Performance degrades substantially under interacting mutations, where models frequently recover only a subset of the underlying mutations. Preliminary evidence also suggests diminishing returns from increased inference-time reasoning, with only modest improvements under larger reasoning budgets, though this finding requires further validation.
- Abstract(参考訳): 大規模言語モデル(LLM)はパターン認識やテキスト生成に優れるが、帰納的推論能力(観察された振る舞いを説明する潜在仮説を推論する能力)はいまだに理解されていない。
本稿では,構造的逆問題として帰納的推論を測る生成的評価フレームワークであるElenchosを紹介した。
ラムダ計算(lambda-calculus)のような参照形式体系や、潜在的に変異した候補が与えられた場合、エージェントは突然変異が発生したかどうかを判断し、結果として生じる行動の違いの原因となる規則の修正を推測しなければならない。
モデルはしばしば、システムが変更されていると認識するが、観察された不一致の原因となる潜伏変異を特定するのに苦労する。
性能は相互作用する突然変異の下で著しく低下し、モデルはしばしば基礎となる突然変異のサブセットだけを回復する。
予備的な証拠は、推論時間推論の増加によるリターンの減少を示唆している。
関連論文リスト
- ProtoX-AD: Self-Explainable Time Series Anomaly Detection and Characterization [22.20993136241034]
ProtoX-ADは、自制TSADのためのプロトタイプベースの自己説明可能なフレームワークである。
解釈可能なプロトタイプとともに変換対応の潜伏表現を学習する。
ProtoX-ADはブラックボックスに匹敵する検出性能を達成する。
論文 参考訳(メタデータ) (2026-06-11T12:30:40Z) - Plausibility Is Not Prediction: Contrastive Evidence for LLM-Based Cellular Perturbation Reasoning [27.902219493068824]
摂動実験は細胞機構の理解の中心である。
それらは高価で疎いままであり、保存されていない状態に対する遺伝子発現応答の予測を動機付けている。
証拠を関連摂動から肯定的・否定的な結果に整理することで,予測を比較課題として再編成するCOREを導入する。
論文 参考訳(メタデータ) (2026-05-31T06:13:26Z) - Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs [68.58207076756237]
本稿では,結果評価からメカニズム診断へ移行する摂動に基づく評価プロトコルProCauEvalを紹介する。
因果推論において,ビデオコンテンツは体系的に過小評価されている。
教師のネガティブなアライメントに基づく強化学習フレームワークであるADPOを提案する。
論文 参考訳(メタデータ) (2026-05-10T08:48:58Z) - Decoding the Critique Mechanism in Large Reasoning Models [50.821607345799386]
大規模推論モデル(LRM)は、バックトラックと自己検証メカニズムを示し、中間ステップを修正して正しい解に到達できるようにする。
中間推論ステップに算術ミスを挿入することにより,現在のLEMがエラーからどのように回復するかを検討する。
チェーン・オブ・シークレットを伝播する誤りにもかかわらず、モデルは依然として正しい最終解に達している。
論文 参考訳(メタデータ) (2026-03-17T10:03:30Z) - Causality is Key for Interpretability Claims to Generalise [35.833847356014154]
大規模言語モデル(LLM)の解釈可能性の研究は、モデル行動に関する重要な洞察をもたらした。
繰り返し発生する落とし穴: 一般化しない発見と、証拠を突破する因果解釈。
パールの因果的階層は、解釈可能性の研究が正当化できることを明確にする。
論文 参考訳(メタデータ) (2026-02-18T18:45:04Z) - Scaling Reasoning Hop Exposes Weaknesses: Demystifying and Improving Hop Generalization in Large Language Models [66.36240676392502]
CoT(Chain-of- Thought)推論は、LLM(Large Language Models)が複雑な問題を解決するための標準パラダイムとなっている。
近年の研究では、ホップ一般化シナリオの推論性能が急落している。
推論過程におけるEPヘッドを動的に識別・非活性化する軽量な介入法である推論の試験時間補正を提案する。
論文 参考訳(メタデータ) (2026-01-29T03:24:32Z) - Analyzing Reasoning Consistency in Large Multimodal Models under Cross-Modal Conflicts [74.47786985522762]
テキスト慣性(textual inertia)と呼ばれる重要な障害モードを特定し、矛盾する視覚的証拠を無視しながら、モデルは間違ったテキストに盲目的に固執する傾向がある。
本稿では,多種多様なLMMの推論連鎖に摂動を構造的に注入するLogicGraph摂動プロトコルを提案する。
その結果,10%未満の症例で自己修正が成功し,主に視覚的テキスト誤りの伝播に寄与することが判明した。
論文 参考訳(メタデータ) (2026-01-07T16:39:34Z) - Abductive Inference in Retrieval-Augmented Language Models: Generating and Validating Missing Premises [0.0]
本稿では,帰納的推論をLLMに組み込むフレームワークを提案する。
帰納的推論とマルチホップQAベンチマークの実験結果から,本手法は解答精度と帰納的忠実度の両方を改善することが示された。
この研究は、RAGシステムの堅牢性と説明可能性を高めるための有望な方向として、帰納的推論を強調している。
論文 参考訳(メタデータ) (2025-11-06T03:37:24Z) - Identification of Causal Direction under an Arbitrary Number of Latent Confounders [54.76982125821112]
実世界のシナリオでは、観測された変数は複数の潜伏変数によって同時に影響を受けることがある。
我々は,特定の方法で構築された観測変数の高次累積行列を併用する。
これらの高次累積行列の階数不足特性から,2つの観測変数間の因果非対称性が直接観察可能であることを示す。
論文 参考訳(メタデータ) (2025-10-26T15:10:00Z) - Turning Internal Gap into Self-Improvement: Promoting the Generation-Understanding Unification in MLLMs [46.43090277452948]
MLLMの統一化は、優れた生成の理解と内部的なギャップを生じさせることを示す。
この発見は、シンプルだが効果的な内部ギャップに基づく自己改善フレームワークを提案する動機となっている。
プレトレーニングでよく知られるが,ポストトレーニングでは過小評価されている,このような自己改善の併用効果を実証的に発見する。
論文 参考訳(メタデータ) (2025-07-22T14:56:39Z) - Identifying Weight-Variant Latent Causal Models [82.14087963690561]
推移性は潜在因果表現の識別性を阻害する重要な役割を担っている。
いくつかの軽微な仮定の下では、潜伏因果表現が自明な置換とスケーリングまで特定可能であることを示すことができる。
本稿では,その間の因果関係や因果関係を直接学習する構造的caUsAl変分自動エンコーダを提案する。
論文 参考訳(メタデータ) (2022-08-30T11:12:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。