論文の概要: VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
- arxiv url: http://arxiv.org/abs/2608.15265v2
- Date: Wed, 19 Aug 2026 08:15:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 13:35:39.137226
- Title: VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
- Title(参考訳): VibeWorlding:マルチモーダルエージェントは3Dオープンワールドをエンド・ツー・エンドで構築できるのか?
- Abstract要約: ベンチマークとトレーニングのための統合フレームワークVibeWorldingを提案する。
最初に開発したVWE-BENCHは,2,616の高品質な3Dアセット,323の人間アノテーション付きシード3Dワールド,6,828の逆合成マルチモーダルユーザクエリのベンチマークである。
資産検索,編集,画像レンダリングをMPPツールとして統合したマルチモーダルRLポストトレーニングフレームワークであるVibeWorlding-Gymを開発した。
- 参考スコア(独自算出の注目度): 28.277597008733082
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Constructing an interactive 3D open world from a user query is important. However, existing methods are primarily evaluated on idealized, simple queries, making it difficult to systematically analyze and compare how multimodal agents understand user intent, use 3D tools, and reason over textual and visual 3D world information. To this end, we propose VibeWorlding, a unified framework for benchmarking and training vibe worlding agents: a multimodal agent that can autonomously infer user intent, plan scene layout, invoke 3D tools, and reflect on the multimodal feedback in a multi-turn agent-environment interaction process. To achieve this, we first build VWE-BENCH, a benchmark of 2,616 high-quality 3D assets, 323 human-annotated seed 3D worlds, and 6,828 reverse-synthesized multimodal user queries, split into verified queries with ground-truth and unverified queries with carefully designed rubrics. Moreover, we develop VibeWorlding-Gym, a joint multimodal RL post-training framework that integrates (1) a sandbox environment unifying asset retrieval, editing, and image rendering as MCP tools, and (2) a rubric-based verifier that combines physical feasibility and intent fulfillment verification, supporting both fair model evaluation and scalable multimodal RL reward service. Our experiments show that current frontier MLLMs are far from solving the vibe worlding agent task, with even GPT-5.5 and Qwen3.8-Max reaching below 60% success rate, and trace the bottleneck to precise 3D world editing. We further find that RL training can ease this weakness and enable open-source MLLMs to even surpass closed-source frontiers: our VibeWorlder-8B is comparable to frontier MLLMs, while our flagship VibeWorlder-30B-A3B attains the best overall Pass@1 among all evaluated models.
- Abstract(参考訳): ユーザクエリからインタラクティブな3Dオープンワールドを構築することが重要です。
しかし、既存の手法は主に理想的な単純なクエリに基づいて評価されており、マルチモーダルエージェントがユーザ意図をどのように理解しているかを体系的に分析し比較することは困難である。
マルチターンエージェント-環境相互作用プロセスにおいて,ユーザの意図を自律的に推論し,シーンレイアウトを計画し,3Dツールを起動し,マルチモーダルフィードバックを反映するマルチモーダルエージェントである。
そこで我々はまず,2,616の高品質な3Dアセット,323の人間アノテーション付きシード3Dワールド,6,828の逆合成型マルチモーダルユーザクエリのベンチマークであるVWE-BENCHを構築した。
さらに,(1)資産検索,編集,画像レンダリングをMSPツールとして統合したサンドボックス環境と,(2)物理的実現可能性と意図充足性検証を組み合わせたルーブリックベースの検証ツールを統合し,公正なモデル評価とスケーラブルなマルチモーダルRL報酬サービスの両方をサポートする,共同マルチモーダルRLポストトレーニングフレームワークであるVibeWorlding-Gymを開発した。
GPT-5.5 や Qwen3.8-Max さえも成功率 60% 以下に到達し、そのボトルネックを正確な3Dワールド編集まで遡る。
私たちのVibeWorlder-8Bは、フロンティアのMLLMに匹敵するものであり、私たちの旗艦であるVibeWorlder-30B-A3Bは、すべての評価モデルの中で最高の総合的なPass@1に達しています。
関連論文リスト
- WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark [85.74548332724977]
複数のドメインにまたがって数千の視覚概念の分類を構築します。
我々はフロンティアMLLMが答えられない挑戦的な質問を手動で設計する。
WorldBenchは、既存のさまざまなベンチマークよりも高い視覚的多様性を実現している。
論文 参考訳(メタデータ) (2026-06-04T01:11:21Z) - Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence? [35.30497528897595]
Agentic-MMEはマルチモーダルエージェント能力のプロセス検証ベンチマークである。
6つのドメインにまたがる418の現実世界タスクと3つの困難レベルを含んでいる。
2,000以上のステップワイズなチェックポイントがあり、1タスクあたり平均10時間以上の手動アノテーションがある。
論文 参考訳(メタデータ) (2026-04-03T13:02:01Z) - VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining [49.78591189918702]
VisualToolChain-Bench (VTC-Bench)を導入し,マルチモーダル大言語モデル(MLLM)におけるツール使用の習熟度を評価する。
リアルなコンピュータビジョンパイプラインに合わせるために、我々のフレームワークは32種類のOpenCVベースの視覚操作を備えている。
正確な評価のために、9カテゴリの認知階層にまたがる680のキュレートされた問題を提示する。
論文 参考訳(メタデータ) (2026-03-16T09:31:44Z) - AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios [32.58358574768901]
実世界のマルチモーダルエージェントは、視覚的証拠に根ざしたマルチステップを解決する。
既存のベンチマークは、主にシングルターンの視覚的推論または特定のツールスキルを評価する。
本稿では,汎用マルチモーダルエージェントのベンチマークであるAgentVistaを紹介する。
論文 参考訳(メタデータ) (2026-02-26T16:30:46Z) - TravelBench: A Broader Real-World Benchmark for Multi-Turn and Tool-Using Travel Planning [22.3041021610283]
旅行計画は、大規模言語モデル(LLM)計画とツール使用能力をテストするための自然な現実的なタスクである。
TravelBenchは、完全な現実世界の旅行計画のベンチマークである。
論文 参考訳(メタデータ) (2025-12-27T18:25:14Z) - ToolScope: An Agentic Framework for Vision-Guided and Long-Horizon Tool Use [64.20714385692634]
ToolScopeは、グローバルな計画とローカルなマルチモーダル認識を統合するために設計されたエージェントフレームワークである。
我々は、VQA 2.0、ScienceQA、MAT-Search、MathVistaを含む4つのVQAベンチマークでToolScopeを評価する。
論文 参考訳(メタデータ) (2025-10-31T10:51:27Z) - What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities [56.646832992178105]
我々は、制御可能な複雑性のタスクを合成するための自動パイプラインを備えたクロスプラットフォームグラフベースのベンチマークであるOmniBenchを紹介した。
OmniEvalは、サブタスクレベルの評価、グラフベースのメトリクス、および10機能にわたる包括的なテストを含む多次元評価フレームワークである。
我々のデータセットには、20のシナリオにわたる36万のグラフ構造化タスクが含まれており、人間の受け入れ率は91%に達する。
論文 参考訳(メタデータ) (2025-06-10T15:59:38Z) - MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations [55.022519020409405]
本稿では,マルチモーダルな3Dシーンデータセットと階層型言語アノテーションを用いたベンチマーク,MMScanを構築した。
結果として得られたマルチモーダルな3Dデータセットは、109kオブジェクトと7.7kリージョン上の1.4Mメタアノテーション付きキャプションと、3Dビジュアルグラウンドと質問応答ベンチマークのための3.04M以上の多様なサンプルを含んでいる。
論文 参考訳(メタデータ) (2024-06-13T17:59:30Z) - Steve-Eye: Equipping LLM-based Embodied Agents with Visual Perception in
Open Worlds [37.22688246779871]
大型言語モデル(LLM)は、世界と対話する自己駆動能力を持つエンボディエージェントを装備できる。
LLMはオープン世界の視覚的豊かさを見落とし、インタラクティブなプロセス全体を「目隠しされたテキストベースのゲーム」のように表現する傾向がある。
我々は、この制限に対処するために、エンドツーエンドで訓練された大規模マルチモーダルモデルであるSteve-Eyeを提案する。
論文 参考訳(メタデータ) (2023-10-20T03:22:05Z) - LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset,
Framework, and Benchmark [81.42376626294812]
本稿では,Language-Assisted Multi-Modalインストラクションチューニングデータセット,フレームワーク,ベンチマークを提案する。
我々の目標は、MLLMのトレーニングと評価のための成長するエコシステムとしてLAMMを確立することです。
本稿では,2次元および3次元視覚のための広範囲な視覚タスクをカバーする包括的データセットとベンチマークを提案する。
論文 参考訳(メタデータ) (2023-06-11T14:01:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。