論文の概要: Correct Chains, Wrong Answers: Dissociating Reasoning from Output in LLM Logic
- arxiv url: http://arxiv.org/abs/2604.13065v1
- Date: Thu, 19 Mar 2026 19:05:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.651825
- Title: Correct Chains, Wrong Answers: Dissociating Reasoning from Output in LLM Logic
- Title(参考訳): 正しい連鎖, 誤答: LLM論理における出力からの推論の解離
- Abstract要約: LLMは、チェーン・オブ・シークレットの推論のすべてのステップを正しく実行し、いまだに間違った最終回答を生成することができる。
我々は、演算子ロジックを演算子名から分離するベンチマークであるNovel Operator Testを紹介する。
既存のベンチマークでは検出できない推論出力を示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: LLMs can execute every step of chain-of-thought reasoning correctly and still produce wrong final answers. We introduce the Novel Operator Test, a benchmark that separates operator logic from operator name, enabling rigorous distinction between genuine reasoning and pattern retrieval. By evaluating Boolean operators under unfamiliar names across depths 1-10 on five models (up to 8,100 problems each), we demonstrate a reasoning-output dissociation that existing benchmarks cannot detect. At Claude Sonnet 4's depth 7, all 31 errors have verifiably correct reasoning yet wrong declared answers; 17/19 errors in mixed-operator chains exhibit the same pattern. The benchmark reveals two failure types: strategy failures at depth 2, where models attempt terse retrieval (+62pp from scaffolding), and content failures at depth 7, where models reason fully but err systematically (+8-30pp, 0/300 errors post-intervention). A Trojan operator (XOR's truth table under a novel name) confirms name alone does not gate reasoning (p >= 0.49), while Llama's novelty gap widens to 28pp at depth 8-9 with the Trojan at 92-100%, isolating genuine difficulty with novel logic from name unfamiliarity.
- Abstract(参考訳): LLMは、チェーン・オブ・シークレットの推論のすべてのステップを正しく実行し、いまだに間違った最終回答を生成することができる。
我々は,演算子ロジックを演算子名から分離するベンチマークであるNovel Operator Testを導入し,真の推論とパターン検索の厳密な区別を可能にする。
ブーリアン作用素を5つのモデル(最大8,100問題)で1-10の深さで不慣れな名前で評価することにより、既存のベンチマークでは検出できない推論と出力の解離を実証する。
Claude Sonnet 4 の深さ 7 では、31 個のエラーがすべて検証可能な正確さを持つが、宣言された答えは誤りであり、混合演算鎖の17/19 個のエラーは同じパターンを示す。
ベンチマークでは、Deep 2での戦略失敗、deep 7でのコンテンツ障害、deep 7での戦略失敗、そして、完全にはなくても体系的に(+8-30pp、0/300エラー)、という2つの障害タイプが明らかになった。
トロイア作用素 (XOR's truth table under a novel name) は名前だけでゲート推論をしない(p >= 0.49)が、ラマの斬新さのギャップは深さ 8-9 で 8-9 まで広がり、トロイアは92-100% で、名前になじみのない新しい論理の難しさを分離している。
関連論文リスト
- BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models [4.264192013842096]
大きな言語モデル(LLM)は、標準ベンチマークで印象的なスコアを得るが、人間が数秒で正しく答えられるような質問を日常的に失敗する。
BrainBenchは、慎重に設計された20のカテゴリにまたがる100のブレインティーザー質問のベンチマークです。
論文 参考訳(メタデータ) (2026-03-16T02:50:43Z) - ChaosBench-Logic: A Benchmark for Logical and Symbolic Reasoning on Chaotic Dynamical Systems [0.0]
大規模言語モデル(LLM)は自然言語処理に優れるが、正確な論理的および記号的推論を必要とする領域では脆弱である。
カオス力学系は、カオスは決定論的であるが、しばしばランダム性や複雑性と誤解されるため、特に要求の高いテストを提供する。
本稿では,30種類の力学系におけるLSM推論を評価するベンチマークであるChaosBench-Logicを紹介する。
論文 参考訳(メタデータ) (2026-01-05T10:36:40Z) - MuSLR: Multimodal Symbolic Logical Reasoning [133.85551954182105]
マルチモーダルな論理的推論は、自律運転や診断などの高度な応用において重要である。
形式論理規則を基礎としたマルチモーダルな記号論理的推論のための最初のベンチマーク Mu SLR を導入する。
我々は,GPT-4.1のChain-of-Thought性能を14.13%向上させるモジュール型フレームワークであるLogiCAMを提案する。
論文 参考訳(メタデータ) (2025-09-30T06:42:20Z) - RuozhiBench: Evaluating LLMs with Logical Fallacies and Misleading Premises [41.39610589639382]
本稿では,677質問を慎重に整理したデータセットであるRuozhiBenchについて紹介する。
我々は,LuozhiBench上の5シリーズから17の大規模言語モデル (LLM) を評価する。
LLMは論理的誤りを検出・推論する能力に限界を示し、最も優れたモデルであるClaude-3-haikuでさえも90%以上のヒトと比較して62%の精度しか達成できなかった。
論文 参考訳(メタデータ) (2025-02-18T18:47:11Z) - Unveiling the Magic of Code Reasoning through Hypothesis Decomposition and Amendment [54.62926010621013]
我々は,大規模言語モデルの推論能力に対する新たな視点を提供するために,新しいタスクであるコード推論を導入する。
論理的推論の確立した形式に基づいて3つのメタベンチマークを要約し、8つの特定のベンチマークタスクにインスタンス化する。
本稿では,人間の複雑な問題解決手法に触発された新たな経路探索パイプラインを提案する。
論文 参考訳(メタデータ) (2025-02-17T10:39:58Z) - LINC: A Neurosymbolic Approach for Logical Reasoning by Combining
Language Models with First-Order Logic Provers [60.009969929857704]
論理的推論は、科学、数学、社会に潜在的影響を与える可能性のある人工知能にとって重要なタスクである。
本研究では、LINCと呼ばれるモジュール型ニューロシンボリックプログラミングのようなタスクを再構成する。
我々は,FOLIOとProofWriterのバランスの取れたサブセットに対して,ほぼすべての実験条件下で,3つの異なるモデルに対して顕著な性能向上を観察した。
論文 参考訳(メタデータ) (2023-10-23T17:58:40Z) - Faithful Chain-of-Thought Reasoning [51.21714389639417]
CoT(Chain-of-Thought)は言語モデル(LM)のパフォーマンスを様々な推論タスクで向上させる。
翻訳と問題解決という2つの段階を含む推論フレームワークであるFithful CoTを提案する。
このことは、推論連鎖が最終回答の忠実な説明を提供することを保証している。
論文 参考訳(メタデータ) (2023-01-31T03:04:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。