論文の概要: Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners
- arxiv url: http://arxiv.org/abs/2606.01810v1
- Date: Mon, 01 Jun 2026 07:27:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:31.491377
- Title: Token Predictors Are Not Planners: Building Physically Grounded Causal Reasoners
- Title(参考訳): トーケン・プレデクターはプランナーではない:物理的に接地された因果共振器を作る
- Authors: Zheng Lu, Mingqi Gao, Qinlei Xie, Wanqi Zhong, Hanwen Cui, Heng Cao, Zirui Song, Yifan Yang, Chong Luo, Bei Liu, Yiming Li,
- Abstract要約: 我々は、信頼性の高い物理的自律性には、言語的に基底付けられたトークン予測から物理的基底化された因果推論へのシフトが必要であると論じる。
マルチステージ検証により算出した高忠実度診断スイートであるCausal-Plan-Benchを導入し,実施計画を評価する。
また,エゴセントリックなビデオ上で4段階のアノテーションパイプラインによって生成された,100万規模の明確な推論トレースコーパスであるCausal-Plan-1Mを構築した。
- 参考スコア(独自算出の注目度): 30.273509055949162
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current benchmarks for embodied vision-language planning often favor linguistic next-token prediction over physically grounded next-state reasoning. This rewards models that mimic statistical language priors rather than track causal dependencies, reducing physical planning to shallow sequence modeling. We argue that reliable physical autonomy requires a shift from linguistically grounded token prediction toward physically grounded causal reasoning. To this end, we introduce Causal-Plan-Bench, a high-fidelity diagnostic suite curated through multi-stage verification to evaluate embodied planning across four causal dimensions. We also construct Causal-Plan-1M, a million-scale corpus of explicit reasoning traces produced by a four-stage annotation pipeline over egocentric videos. Extensive evaluation shows that leading models still struggle to demonstrate genuine physical agency, with Gemini 3 Pro reaching only 38.18 on our benchmark. In contrast, our training recipe enables Causal Planner, built on Qwen3-VL-8B, to internalize physical logic for more accurate next-state estimation. The model achieves strong in-domain performance and cross-benchmark generalization, and reveals a Causal Scaling Law: scaling causal training data to one million instances yields a 36.3% relative gain, from 33.22 to 45.28. Overall, our work provides a concrete step toward turning agents from superficial token predictors into physically grounded causal reasoners.
- Abstract(参考訳): 視覚言語プランニングを具現化した現在のベンチマークでは、物理的に基底付けられた次状態推論よりも言語的な次状態予測が好まれている。
これは因果関係を追跡するのではなく、統計言語を模倣するモデルに報酬を与える。
我々は、信頼性の高い物理的自律性には、言語的に基底付けられたトークン予測から物理的基底化された因果推論へのシフトが必要であると論じる。
この目的のために,多段階検証によりキュレートされた高忠実度診断スイートであるCausal-Plan-Benchを導入し,4つの因果次元にわたる実施計画を評価する。
また,エゴセントリックなビデオ上に4段階のアノテーションパイプラインによって生成された,100万規模の明確な推論トレースコーパスであるCausal-Plan-1Mを構築した。
大規模な評価では、主要なモデルはまだ真の物理的エージェンシーの実証に苦慮しており、Gemini 3 Proはベンチマークで38.18にしか達していない。
対照的に、トレーニングレシピにより、Qwen3-VL-8B上に構築されたCausal Plannerは、物理論理を内部化し、より正確な次状態推定を可能にする。
因果学習データを100万インスタンスにスケーリングすると、33.22から45.28までの36.3%の相対的なゲインが得られる。
全体として、我々の研究はエージェントを表面トークン予測器から物理的に根拠付けられた因果推論器に変えるための具体的なステップを提供する。
関連論文リスト
- AstroMind: A High-Fidelity Benchmark for Spacecraft Behavior Reasoning Based on Large Language Models [13.088755605299154]
AstroMindはそのギャップを埋めるために設計された物理地上ベンチマークだ。
これは高忠実な天体力学シミュレーションと実際の観測上の制約に基づいている。
評価指標は、物理的制約の下での意味的正当性と量的整合性の両方をキャプチャする。
論文 参考訳(メタデータ) (2026-05-23T13:23:26Z) - Evaluating and Enhancing the Vulnerability Reasoning Capabilities of Large Language Models [15.849480549367684]
本稿では,DAG生成タスクとして脆弱性推論をモデル化する新しいフレームワークであるDAGVulを提案する。
さらにReinforcement Learning with Verifiable Rewards (RLVR)を導入することで、モデル推論トレースをプログラム固有の論理と整合させる。
我々のフレームワークは、すべてのベースラインに対して平均18.9%の推論F1スコアを改善します。
論文 参考訳(メタデータ) (2026-02-06T13:19:45Z) - Structured Reasoning for Large Language Models [59.215789462977206]
本研究では、推論を明示的、評価可能、トレーニング可能なコンポーネントに分解するフレームワークであるStructured Reasoning(SCR)を提案する。
SCRは推論効率と自己検証を大幅に改善する。
既存の推論パラダイムと比較して、出力トークンの長さを最大50%削減する。
論文 参考訳(メタデータ) (2026-01-12T04:04:01Z) - More Than Meets the Eye? Uncovering the Reasoning-Planning Disconnect in Training Vision-Language Driving Models [14.964195894958133]
私たちは、計画整合型チェーン・オブ・ソート(CoT)を備えた大規模運転型視覚質問応答(VQA)コーパスであるDriveMindを構築した。
我々の結果は、残念ながら、推論計画における一貫した因果切断を示している。
本稿では, 因果媒介者というよりは, 習熟推論は補助的副産物である, という仮説を提唱する。
論文 参考訳(メタデータ) (2025-10-06T06:50:16Z) - Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models [6.312798900093575]
大規模言語モデル (LLM) は複雑な数学的ベンチマークでは優れた性能を得るが、基本的な数学的推論では失敗することがある。
本稿では,正確さと過度に考えることの基本的なトレードオフに焦点を当てる。
本研究は,総合モデル評価のための高精度とトークン効率を組み合わせた調和平均計量であるOverthinking Scoreを紹介する。
論文 参考訳(メタデータ) (2025-07-05T12:31:17Z) - ProtoReasoning: Prototypes as the Foundation for Generalizable Reasoning in LLMs [54.154593699263074]
ProtoReasoningは、大規模推論モデルの推論能力を高めるフレームワークである。
ProtoReasoningは問題を対応するプロトタイプ表現に変換する。
ProtoReasoningは論理的推論に基づくベースラインモデルよりも4.7%改善されている。
論文 参考訳(メタデータ) (2025-06-18T07:44:09Z) - PhyX: Does Your Model Have the "Wits" for Physical Reasoning? [49.083544963243206]
既存のベンチマークでは、物理的な推論という、インテリジェンスの重要な側面を捉えられません。
視覚シナリオにおける物理基底推論のモデルキャパシティを評価するために設計された,最初の大規模ベンチマークであるPhyXを紹介する。
論文 参考訳(メタデータ) (2025-05-21T18:33:50Z) - SEAL: Steerable Reasoning Calibration of Large Language Models for Free [58.931194824519935]
大規模言語モデル(LLM)は、拡張チェーン・オブ・ソート(CoT)推論機構を通じて複雑な推論タスクに魅力的な機能を示した。
最近の研究では、CoT推論トレースにかなりの冗長性が示されており、これはモデル性能に悪影響を及ぼす。
我々は,CoTプロセスをシームレスに校正し,高い効率性を示しながら精度を向上する,トレーニング不要なアプローチであるSEALを紹介した。
論文 参考訳(メタデータ) (2025-04-07T02:42:07Z) - MedS$^3$: Towards Medical Slow Thinking with Self-Evolved Soft Dual-sided Process Supervision [42.03114317779815]
Moneは、小規模でデプロイ可能なモデルに堅牢な推論機能を提供する、自己進化型のフレームワークである。
moneは過去の最先端の医療モデルを+6.45の精度で上回り、32Bスケールの汎用推論モデルを+8.57の精度で上回っている。
論文 参考訳(メタデータ) (2025-01-21T11:24:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。