論文の概要: Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents
- arxiv url: http://arxiv.org/abs/2607.19190v2
- Date: Wed, 22 Jul 2026 03:43:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 14:36:03.349218
- Title: Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents
- Title(参考訳): Agentic Real2Sim:ビジョンランゲージエージェントを用いた物理に基づく世界モデリング
- Abstract要約: textitAgentic Real2Simは視覚言語エージェントを用いた物理世界モデリングのためのフレームワークである。
我々は,剛体オブジェクトの操作,変形性オブジェクトのインタラクション,ヒューマノイドモーションシーンにおけるエージェントReal2Simの評価を行った。
フレームワークのエージェント的決定は、フロンティアモデルのコストのごく一部で、オープンウェイトなVLMバックエンドによって駆動される。
- 参考スコア(独自算出の注目度): 41.837395752081896
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Real-to-sim conversion for robotic interaction with objects remains labor-intensive because it requires more than visual reconstruction: a streamlined real2sim process must recover scene geometries and object states, infer physical parameters, and assemble actors, objects, cameras, poses, and trajectories into a runnable physical simulation. Today this process still depends on manual tuning of visual foundation models, mesh cleanup, coordinate-frame alignment, and brittle workflow glue across visual perception tools and simulators. We introduce \textit{Agentic Real2Sim}, a framework for generalized physical world modeling with vision-language agents, converting a real-world recording of object-robot interaction into a simulatable episodic twin which preserves observations, geometries, robot interactions, and object states. We evaluate Agentic Real2Sim on rigid-object manipulation, deformable-object interaction, and humanoid motion scenes, spanning domains that are usually handled by separate Real2Sim pipelines, marking a first step toward scalable conversion. The framework's agentic decisions can be driven by an open-weight VLM backend at a small fraction of the cost of frontier models, while attaining comparable conversion success rate. We aim to use the resulting real-world-aligned twins for downstream robotics tasks, specifically policy learning and evaluation. The project site is available at https://agentic-real2sim.github.io/.
- Abstract(参考訳): リアル2simプロセスは、シーンのジオメトリとオブジェクト状態を復元し、物理的パラメータを推論し、アクター、オブジェクト、カメラ、ポーズ、軌道をランナブルな物理シミュレーションに組み立てなければならない。
今日でもこのプロセスは、視覚基盤モデルの手動チューニング、メッシュのクリーンアップ、座標フレームのアライメント、視覚認識ツールとシミュレータ間の脆いワークフローの接着剤に依存している。
本稿では,視覚エージェントを用いた物理世界モデリングのためのフレームワークである「textit{Agentic Real2Sim}」を紹介する。
我々はAgenic Real2Simを剛体オブジェクト操作、変形可能なオブジェクトインタラクション、ヒューマノイドモーションシーンで評価し、通常別のReal2Simパイプラインで処理されるドメインにまたがって拡張性のある変換に向けた第一歩を示す。
フレームワークのエージェント的決定は、フロンティアモデルのコストのごく一部で、オープンウェイトなVLMバックエンドによって駆動されると同時に、同等の変換成功率を達成することができる。
我々は、現実に整合した双生児を下流ロボットのタスク、特に政策学習と評価に利用することを目指している。
プロジェクトのサイトはhttps://agentic-real2sim.github.io/.comで公開されている。
関連論文リスト
- RoboSnap: One-Shot Real-to-Sim Scene Generation for Generalizable Robot Learning and Evaluation [55.07260698542592]
我々は,1枚のRGB画像をシミュレーション可能なシーンに変換する,リアル・トゥ・シミュレート・フレームワークであるRoboSnapを紹介した。
DROIDシーンと実ロボットタスクの実験は、復元されたシーンでRoboSnapが信頼できる軌道再生を実現することを示している。
DROIDのリアルワールドシーン564から構築したリアル・トゥ・シムデータセットであるDROID-Simを紹介する。
論文 参考訳(メタデータ) (2026-07-07T18:19:10Z) - ArtiTwinSplat: Interactable Digital Twin Reconstruction via Gaussian Splatting from RGB-D videos [47.4010297818512]
ArtiTwinSplatは、RGB-Dビデオからオブジェクトの合成された写真リアルなデジタルツインを自動的に構築するフレームワークである。
本手法は幾何学的忠実度と測光的リアリズムを保存する3次元ガウス格子上に構築されている。
論文 参考訳(メタデータ) (2026-06-23T14:24:07Z) - OASIS: From Simulation Data Collection to Real-World Humanoid Loco-Manipulation [51.37436817948304]
OASISはヒューマノイドのロコ操作のためのシミュレーションデータ駆動のフレームワークである。
3次元生成モデルを用いて実世界の画像から現実的なオブジェクト資産を再構築する。
ゼロショットデプロイメントでは、実際のロボット遠隔操作データでトレーニングされたタスクよりも、ほとんどのタスクで高い成功率を達成する。
論文 参考訳(メタデータ) (2026-06-07T10:01:53Z) - GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors [113.71148915419246]
GRAILは3Dアセット、シミュレーター対応シーン、およびビデオファンデーションモデル(VFM)の先行データで構成され、物理的環境を再構築したりロボットを遠隔操作したりすることなく対話を合成するデジタル生成パイプラインである。
GRAILは、オブジェクト形状、カメラパラメータ、メートル法スケール、環境深度、ロボットが提案する文字がビデオ生成の前に知られ、再構成中に再利用される、完全に定義された3D構成から始まる。
我々は、回復した動作をヒューマノイドロボットに再ターゲティングし、補完的なタスク・ジェネラル・モルフォロジー・トラッカーを訓練する。
GRAILは、ピックアップ、オブジェクト操作、着座にまたがる2万以上のシーケンスを生成する
論文 参考訳(メタデータ) (2026-06-03T17:57:45Z) - URDF-Anything+: Autoregressive Articulated 3D Models Generation for Physical Simulation [45.4820195450296]
本稿では,視覚的観察から実行可能なオブジェクトモデルを直接生成する,エンドツーエンドの自動回帰フレームワークを提案する。
視覚的観察から構築された高忠実度デジタル双生児は、シミュレーションで訓練されたポリシーを、オンライン適応なしで実際のロボットに転送することができる。
論文 参考訳(メタデータ) (2026-03-14T16:23:44Z) - SAGE: Scalable Agentic 3D Scene Generation for Embodied AI [67.43935343696982]
既存のシーン生成システムは、しばしばルールベースまたはタスク固有のパイプラインに依存し、アーティファクトと物理的に無効なシーンを生成する。
本稿では,ユーザが特定した具体的タスクを与えられたエージェントフレームワークであるSAGEについて,その意図を理解し,大規模にシミュレーション可能な環境を自動的に生成する。
得られた環境は現実的で多様性があり、政策訓練のための現代的なシミュレーターに直接デプロイできる。
論文 参考訳(メタデータ) (2026-02-10T18:59:55Z) - Real-to-Sim Robot Policy Evaluation with Gaussian Splatting Simulation of Soft-Body Interactions [27.247431258140463]
本稿では,現実の映像からソフトボディのディジタルツインを構築するための,リアル・トゥ・シミュレート・ポリシー評価フレームワークを提案する。
我々は,ぬいぐるみのパッキング,ロープルーティング,Tブロックプッシュなど,代表的な変形可能な操作タスクに対するアプローチを検証する。
論文 参考訳(メタデータ) (2025-11-06T18:52:08Z) - One-Shot Real-to-Sim via End-to-End Differentiable Simulation and Rendering [20.919046758279205]
プロパティの合同識別を可能にする新しい剛体オブジェクト表現を導入する。
本手法では, 格子型外見場と相まって, 新たな微分可能な点ベース幾何表現を用いる。
本研究では,ロボットのアクションシーケンスのみから,シミュレーションとレンダリング可能な世界モデルの両方を学習可能であることを示す。
論文 参考訳(メタデータ) (2024-11-29T21:02:02Z) - GeoSim: Photorealistic Image Simulation with Geometry-Aware Composition [81.24107630746508]
GeoSimは、新しい都市の運転シーンを合成するジオメトリ認識の画像合成プロセスです。
まず、センサーデータからリアルな形状と外観の両方を備えた多様な3Dオブジェクトのバンクを構築します。
得られた合成画像は、フォトリアリズム、トラフィック認識、幾何学的一貫性があり、画像シミュレーションが複雑なユースケースにスケールできる。
論文 参考訳(メタデータ) (2021-01-16T23:00:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。