論文の概要: From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.10444v2
- Date: Wed, 12 Aug 2026 07:17:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-13 14:28:20.563578
- Title: From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models
- Title(参考訳): 推論深度から推論深度へ:大規模言語モデルにおける多点連想推論の評価
- Abstract要約: MPAR-Benchは多点連想推論によって推論の幅を分離するベンチマークである。
マルチエージェントの手がかり生成パイプライン,埋め込み型多様性フィルタリング,人間による検証を用いて1000項目を構築。
我々は、精度、ANLS、埋め込み類似性、推論トレース検証、および4つの摂動(手がかりマスキング、オーダーシャッフル、インジェクション、マルチステップインジェクション)を用いてモデルを評価する。
- 参考スコア(独自算出の注目度): 18.240441114446607
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large language models (LLMs) have made substantial progress on reasoning tasks that require increasingly long and complex inferential chains. This progress primarily reflects reasoning depth. A complementary and comparatively unexamined capability is reasoning breadth: exploring multiple semantic directions in parallel and integrating the resulting clues into one coherent answer. We introduce MPAR-Bench, a bilingual English-Chinese benchmark that isolates reasoning breadth through multi-point associative reasoning. Inspired by the cooperative game Just One, each item asks a model to recover a hidden target from several independently generated, semantically diverse clues. We construct 1,000 items using a multi-agent clue-generation pipeline, embedding-based diversity filtering, and human verification. Only the answer space is drawn from public word lists, whereas every clue set is generated from scratch. Beyond exact-match accuracy, we evaluate models using accuracy, ANLS, embedding similarity, reasoning-trace verification, and four perturbations: clue masking, order shuffling, distractor injection, and multi-step clues. Across evaluated models, perturbations reduce accuracy by 9-18 percentage points in English and 5-12 percentage points in Chinese. Thinking mode improves standard-setting accuracy, especially in English, but does not consistently reduce sensitivity to perturbations. Case-level analysis also shows that extended reasoning can overturn an initially correct hypothesis. These results indicate that greater reasoning depth does not automatically confer robust reasoning breadth, and that reasoning breadth remains largely uncovered by current benchmarks.
- Abstract(参考訳): 大規模言語モデル(LLM)は、より長く複雑な推論連鎖を必要とする推論タスクに大きく進歩した。
この進歩は、主に推論の深さを反映している。
複数の意味的な方向を並列に探索し、その結果の手がかりを1つの一貫性のある答えに統合する。
MPAR-Benchはバイリンガルな英語と中国語のベンチマークで、多点連想推論によって推論の幅を分離する。
協調ゲームJust Oneにインスパイアされた各アイテムは、独立して生成されたセマンティックに多様な手がかりから隠れたターゲットを復元するモデルを要求する。
マルチエージェントの手がかり生成パイプライン,埋め込み型多様性フィルタリング,人間による検証を用いて1000項目を構築。
答え空間は公用語リストからのみ引き出されるが、すべての手がかり集合はゼロから生成される。
精度、ANLS、埋め込み類似性、推論トレース検証、および4つの摂動(手がかりマスキング、オーダーシャッフル、インジェクション、マルチステップインジェクション)を用いてモデルを評価する。
評価モデル全体では、摂動によって英語では9-18ポイント、中国語では5-12ポイントの精度が低下する。
思考モードは、特に英語では標準設定精度を改善するが、摂動に対する感度を一貫して低下させるわけではない。
ケースレベルの分析は、拡張推論が最初に正しい仮説を覆す可能性があることも示している。
これらの結果から, より深い推論深度は, 頑健な推論幅を自動で求めるものではないことが示唆された。
関連論文リスト
- MUX: Continuous Reasoning via Multiplexed Tokens [17.62611996930725]
言語モデルは、自然言語の中間的推論ステップを明確にすることにより、複雑な問題を解決する。
連続多重化トークンへの離散的推論の蒸留に基づく,高帯域幅かつコンパクトな推論法であるMUXを提案する。
論文 参考訳(メタデータ) (2026-05-19T10:30:32Z) - What Makes Good Multilingual Reasoning? Disentangling Reasoning Traces with Measurable Features [32.31269959716733]
この研究は、多言語設定における効果的な推論を実際に特徴付けるものについて尋ねる。
まず、多言語アライメント、推論ステップ、推論トレースの推論フロー側面にまたがる測定可能な推論機能群を定義した。
次に、多言語トレース上でスパースオートエンコーダをトレーニングし、これらの機能をインスタンス化または拡張する潜在推論概念を自動的に検出する。
論文 参考訳(メタデータ) (2026-04-06T14:40:50Z) - CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution [20.823419395675412]
CrossCheck-Benchは、マルチモーダル入力における矛盾検出を評価するための診断ベンチマークである。
タスクが知覚的マッチングから論理的矛盾検出に移行するにつれて、13の最先端の視覚言語モデルを評価し、一貫した性能低下を観察する。
論文 参考訳(メタデータ) (2025-11-19T12:17:15Z) - Think Clearly: Improving Reasoning via Redundant Token Pruning [57.01254508252785]
推論過程における冗長性を意図的に除去することで、性能が大幅に向上することを示す。
本手法は, 推論集約型ベンチマークにおいて, トレーニングを伴わずに, 全体的な精度を著しく向上することを示した。
論文 参考訳(メタデータ) (2025-06-17T06:04:01Z) - PixelThink: Towards Efficient Chain-of-Pixel Reasoning [70.32510083790069]
PixelThinkは、外部から推定されるタスクの難しさと内部で測定されたモデルの不確実性を統合する、シンプルで効果的なスキームである。
シーンの複雑さと予測信頼度に応じて推論の長さを圧縮することを学ぶ。
実験により,提案手法は推論効率と全体セグメンテーション性能の両方を改善した。
論文 参考訳(メタデータ) (2025-05-29T17:55:49Z) - Revisiting Overthinking in Long Chain-of-Thought from the Perspective of Self-Doubt [74.35891434097053]
RLLM(Reasoning Large Language Models)は、複雑なタスクにおいて素晴らしいパフォーマンスを示す。
彼らはしばしば過度に考え、正しい答えに達した後も不必要な推論ステップを実行します。
本稿では,自己疑念の観点から,過剰思考を定量的に分析する。
本稿では,入力問題に対するモデルの過度信頼度を低減するための,シンプルで効果的なプロンプト手法を提案する。
論文 参考訳(メタデータ) (2025-05-29T14:30:02Z) - Beyond the Last Answer: Your Reasoning Trace Uncovers More than You Think [51.0691253204425]
我々は2つの質問に答えるために中間的推論ステップを解析する: 最終的な答えはモデルの最適結論を確実に表すか?
我々のアプローチは、推論トレースを言語的手がかりに基づくシーケンシャルなサブソートに分割することである。
これらの解答を最も頻繁な解(モード)を選択して集約すると、元の完全トレースから得られる解のみに依存するよりも、はるかに高い精度が得られることが判明した。
論文 参考訳(メタデータ) (2025-04-29T12:39:07Z) - Sketch-of-Thought: Efficient LLM Reasoning with Adaptive Cognitive-Inspired Sketching [64.74765550805024]
Chain-of-Thoughtはステップバイステップの問題解決を促すが、中間出力の過剰な冗長性を犠牲にすることが多い。
我々は,認知にインスパイアされた推論パラダイムを言語制約と統合する促進フレームワークであるSketch-of-Thought(SoT)を提案する。
SoTはトークンを最大84%削減し、18の推論データセットで最小限の精度ロスを達成している。
論文 参考訳(メタデータ) (2025-03-07T06:57:17Z) - Complexity-Based Prompting for Multi-Step Reasoning [72.0057198610614]
大規模言語モデルに対して,多段階推論を行うための課題について検討する。
中心的な疑問は、どの推論例が最も効果的なプロンプトを作るかである。
多段階推論のためのシンプルで効果的な例選択方式である複雑性ベースのプロンプトを提案する。
論文 参考訳(メタデータ) (2022-10-03T05:33:27Z) - Self-Consistency Improves Chain of Thought Reasoning in Language Models [53.45015291520658]
我々は,大規模言語モデルの推論精度を大幅に向上させる,単純なアンサンブル戦略,自己整合性を探究する。
算術的および常識的推論ベンチマークでは、自己整合性は大幅な精度の向上をもたらす。
論文 参考訳(メタデータ) (2022-03-21T17:48:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。