論文の概要: ParallelWorld: Test-Time Scaling for Embodied Reasoning
- arxiv url: http://arxiv.org/abs/2608.22971v1
- Date: Mon, 24 Aug 2026 08:32:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.993766
- Title: ParallelWorld: Test-Time Scaling for Embodied Reasoning
- Title(参考訳): ParallelWorld: 身体的推論のためのテスト時間スケーリング
- Authors: Min Chen, Shengjun Zhang, Yuxin Li, Zhang Zhang, Xin Fei, Chong Xia, Yueqi Duan,
- Abstract要約: 身体的推論(Embodied Reasoning)は、身体環境における自律的な知覚、推論、相互作用の基礎となる。
近年の研究では、エンボディド推論のパラダイムが静的な知覚から動的探索へとシフトしている。
具体的推論のためのマルチホライズンテスト時間スケーリングフレームワークであるParallelWorldを提案する。
- 参考スコア(独自算出の注目度): 34.32623713238244
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Embodied Reasoning constitutes a fundamental capability of embodied intelligence, serving as the basis for autonomous perception, reasoning, and interaction within physical environments. Recent studies have shifted the paradigm of embodied reasoning from static perception toward dynamic exploration, where agents acquire task-relevant information through interactions with the environment. However, existing active reasoning approaches generally generate exploration trajectories incrementally without long-horizon planning. Even recently emerged test-time scaling frameworks often resort to myopic, single-step lookaheads, which struggle to resolve the delayed feedback inherent in complex, occluded spatial environments. To address this limitation, we propose ParallelWorld, a multi-horizon test-time scaling framework for embodied reasoning. Instead of greedy, single-step trials, ParallelWorld empowers agents to simulate and evaluate multi-step future trajectories in parallel before committing to an action. Specifically, we introduce a verifier-guided tree-search paradigm. Starting from the current state, ParallelWorld branches into multiple parallel trajectories and rolls them out continuously across a multi-step horizon. At each simulation step, a verifier agent evaluates the intermediate state transitions, dynamically pruning unpromising branches and prioritizing paths with the highest information gain. Once the multi-step prospective simulation is complete, the agent synthesizes the long-horizon outcomes to commit to the optimal action sequence. Finally, an answer agent performs reasoning over the selected trajectory to produce the final reasoning. Extensive experiments on ESI-Bench demonstrate that ParallelWorld consistently improves active perception and reasoning performance.
- Abstract(参考訳): 身体的推論(Embodied Reasoning)は、身体的環境における自律的知覚、推論、相互作用の基礎となる、インテリジェンスの基本的な能力を構成する。
近年, エージェントが環境との相互作用を通じてタスク関連情報を取得するという, 静的な知覚から動的探索へと, 具体的推論のパラダイムがシフトしている。
しかし、既存の活発な推論手法は、長い水平計画なしで探索軌道を漸進的に生成するのが一般的である。
最近になって登場したテストタイムスケーリングフレームワークは、複雑な、隠された空間環境に固有の遅延フィードバックを解決するのに苦労する、ミオピックでシングルステップのルックアヘッドを頼りにしていることが多い。
この制限に対処するため,具体的推論のためのマルチ水平テスト時間スケーリングフレームワークであるParallelWorldを提案する。
ParallelWorldはgreedyでシングルステップのトライアルではなく、エージェントに対して、アクションにコミットする前に、複数のステップの将来の軌跡を並列にシミュレートし、評価する権限を与える。
具体的には,検証対象木探索パラダイムを導入する。
現在の状態から始めて、ParallelWorldは複数の並列トラジェクトリに分岐し、複数のステップの水平線を越えて継続的にロールアウトする。
各シミュレーションステップにおいて、検証エージェントは、中間状態遷移を評価し、非プロミングブランチを動的に刈り取り、最も情報ゲインの高い経路を優先順位付けする。
多段階予測シミュレーションが完了すると、エージェントは長い水平な結果を合成し、最適なアクションシーケンスにコミットする。
最後に、解答剤が選択された軌道上の推論を行い、最終的な推論を生成する。
ESI-Benchに関する大規模な実験は、ParallelWorldが常にアクティブな知覚と推論性能を改善していることを示している。
関連論文リスト
- World Reasoning Arena [36.28720055069025]
WR-Arenaは、次世代シミュレーションの3つの基本的な次元に沿って世界モデルを評価するためのベンチマークである。
タスク分類を構築し、これらの能力を調査するために設計された多様なデータセットをキュレートします。
その結果、現在のモデルと人間レベルの仮説的推論との間には大きなギャップがあることがわかった。
論文 参考訳(メタデータ) (2026-03-26T20:22:52Z) - Anticipatory Planning for Multimodal AI Agents [77.62643381558613]
予測推論を明示的に訓練する2段階強化学習フレームワークであるTraceR1を紹介する。
TraceR1は、オンラインコンピュータ使用、オフラインコンピュータ使用ベンチマーク、マルチモーダルツール使用推論タスクを含む、7つのベンチマークで評価されている。
以上の結果から,予測軌道推論は,複雑な実環境において効果的に推論,計画,行動が可能なマルチモーダルエージェント構築の鍵となる原理であることが示唆された。
論文 参考訳(メタデータ) (2026-03-17T16:55:11Z) - EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning [63.010793398283134]
本研究では,多モーダルな言語モデルが,エゴセントリックな視点から行動の長期的物理的帰結を確実に推論できるかどうかを考察する。
EXPLORE-Benchは,様々なシナリオにまたがる実の1人称ビデオから算出したベンチマークである。
プロプライエタリでオープンソースのMLLMの実験では、人間にとって大きなパフォーマンスギャップが示される。
論文 参考訳(メタデータ) (2026-03-10T14:33:44Z) - Parallel-Probe: Towards Efficient Parallel Thinking via 2D Probing [76.48164395646019]
Parallel-Probeは、オンライン並列思考を最適化するために設計されたトレーニング不要のコントローラである。
競合精度を維持しつつ、シーケンシャルトークンを最大$textbf35.8$%、トータルトークンコストを$textbf25.8$%まで削減する。
論文 参考訳(メタデータ) (2026-02-03T18:59:41Z) - Parallel Latent Reasoning for Sequential Recommendation [23.624137982116867]
多様な推論軌道を同時に探索するための新しいフレームワークである PLR を提案する。
PLRは連続的な潜在空間における学習可能なトリガートークンを通して並列推論ストリームを構築する。
3つの実世界のデータセットの実験により、PLRは最先端のベースラインを大幅に上回ることを示した。
論文 参考訳(メタデータ) (2026-01-06T16:25:48Z) - Parallel Test-Time Scaling for Latent Reasoning Models [58.428340345068214]
並列テスト時間スケーリング(TTS)は、大規模言語モデル(LLM)の拡張のための重要なアプローチである。
連続ベクトル空間において中間的推論が展開する潜在的推論の最近の進歩は、明示的なチェーン・オブ・サート(Chain-of-Thought)に対するより効率的な代替手段を提供する。
この作業は、上記の問題に対処することで、潜在推論モデルに対する並列TSを可能にする。
論文 参考訳(メタデータ) (2025-10-09T03:33:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。