論文の概要: GIF: Agentic Generation of Interactive and Functional Object Compositions for Robot Learning
- arxiv url: http://arxiv.org/abs/2609.05927v2
- Date: Thu, 10 Sep 2026 05:59:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 23:53:35.032705
- Title: GIF: Agentic Generation of Interactive and Functional Object Compositions for Robot Learning
- Title(参考訳): GIF:ロボット学習のための対話型・機能型オブジェクト合成のエージェント生成
- Authors: Long Xu, Zhiqi Zhang, Mi Yan, Shengliang Deng, Chong Xia, Mingyu Dong, Jiayi Chen, Jiangran Lyu, Fei Gao, Zhizheng Zhang, He Wang,
- Abstract要約: 本稿では,対話型および関数型オブジェクト合成のためのエージェント生成フレームワークであるGIFを紹介する。
GIFは、アセット品質と関係マッチングの両方を改善し、衝突率を1%以下に下げる。
我々は政策学習のためのデータを合成し、シミュレーションと実世界の展開の両方において多様性のスケーリングを明らかにする。
- 参考スコア(独自算出の注目度): 15.060587346990792
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Robot manipulation foundation models require scalable evaluation and data generation across diverse scenarios, with simulation providing an environment for both. Automated scene generation offers a promising path, yet prior work has largely emphasized coarse-grained scene layouts rather than fine-grained functional object compositions. Motivated by this gap, we present GIF, an agentic Generation framework for Interactive and Functional object compositions. In this framework, we recast this problem as disentangled reconstruction followed by relative pose recovery. CoGen produces instance-disentangled meshes with coarse initial poses leveraging complementary strengths of 2D and 3D generative models. GPRM refines the relative pose under joint geometric and physical guidance, and a VLM verifier selects the candidate that best matches the structured specification. We further construct a benchmark spanning eight representative contact-geometry classes and compare with state-of-the-art generators; GIF improves both asset quality and relation matching, while reducing collision rate to below 1%. Finally, we synthesize data for policy learning, revealing diversity scaling in both simulation and real-world deployment.
- Abstract(参考訳): ロボット操作基盤モデルは、さまざまなシナリオにわたるスケーラブルな評価とデータ生成を必要とし、シミュレーションは両方の環境を提供する。
自動シーン生成は有望な経路を提供するが、以前の作業では、細かな機能オブジェクトの合成ではなく、粗い粒度のシーンレイアウトを強調していた。
このギャップに触発され,対話的および機能的オブジェクト合成のためのエージェント生成フレームワークであるGIFを提案する。
本枠組みでは, この問題を, 相対的なポーズ回復を伴う不整合復元として再考する。
CoGenは、2Dおよび3D生成モデルの相補的な強みを利用する粗い初期ポーズを持つインスタンス異方性メッシュを生成する。
GPRMは、関節幾何学的および物理的ガイダンスの下で相対的なポーズを洗練し、VLM検証器は、構造化された仕様に最もよく適合する候補を選択する。
さらに8つの代表的な接触幾何学クラスにまたがるベンチマークを構築し、最先端のジェネレータと比較し、GIFは衝突率を1%以下に抑えながら、資産品質と関係マッチングの両方を改善した。
最後に、政策学習のためのデータを合成し、シミュレーションと実世界の展開の両方における多様性のスケーリングを明らかにする。
関連論文リスト
- URDF-Anything+: Autoregressive Articulated 3D Models Generation for Physical Simulation [45.4820195450296]
本稿では,視覚的観察から実行可能なオブジェクトモデルを直接生成する,エンドツーエンドの自動回帰フレームワークを提案する。
視覚的観察から構築された高忠実度デジタル双生児は、シミュレーションで訓練されたポリシーを、オンライン適応なしで実際のロボットに転送することができる。
論文 参考訳(メタデータ) (2026-03-14T16:23:44Z) - AGILE: Hand-Object Interaction Reconstruction from Video via Agentic Generation [45.753757870577196]
本稿では,対話学習のためのエージェント生成にパラダイムを転換する,堅牢なフレームワークAGILEを紹介する。
我々はAGILEがグローバルな幾何学的精度でベースラインを上回り、先行技術が頻繁に崩壊する挑戦的なシーケンスに対して、例外的な堅牢性を証明していることを示す。
論文 参考訳(メタデータ) (2026-02-04T15:42:58Z) - UniSH: Unifying Scene and Human Reconstruction in a Feed-Forward Pass [83.7071371474926]
UniSHは、統合されたフィードフォワードフレームワークで、共同でメートルスケールの3Dシーンと人間の再構築を行う。
我々のフレームワークは、シーン再構築とHMRとの違いを強く橋渡しします。
本モデルは,人間中心のシーン再構築における最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2026-01-03T16:06:27Z) - SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge [22.64986854574998]
アーティキュレートされた3Dオブジェクトは、AI、ロボティクス、インタラクティブなシーン理解に不可欠である。
SPARKは1枚のRGB画像から物理的に一貫した運動的部分レベルの調音オブジェクトを再構成するフレームワークである。
論文 参考訳(メタデータ) (2025-12-01T12:51:56Z) - URDF-Anything: Constructing Articulated Objects with 3D Multimodal Language Model [76.08429266631823]
3次元マルチモーダル大言語モデル(MLLM)に基づくエンドツーエンドの自動再構築フレームワークを提案する。
URDF-Anythingは、ポイントクラウドとテキストマルチモーダル入力に基づく自己回帰予測フレームワークを使用して、幾何学的セグメンテーションと運動論的パラメータ予測を協調的に最適化する。
シミュレーションと実世界の両方のデータセットの実験は、我々の手法が既存の手法よりも大幅に優れていることを示した。
論文 参考訳(メタデータ) (2025-11-02T13:45:51Z) - S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR [50.435592120607815]
外科手術のシーングラフ生成(SGG)は、手術室(OR)におけるホモロジー認知知能の増強に不可欠である
これまでの研究は主に多段階学習に依存しており、生成したセマンティックシーングラフはポーズ推定とオブジェクト検出を伴う中間プロセスに依存している。
本研究では,S2Former-OR(S2Former-OR)と呼ばれるORにおけるSGGのための新しいシングルステージバイモーダルトランスフォーマフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-22T11:40:49Z) - Towards a Unified Transformer-based Framework for Scene Graph Generation
and Human-object Interaction Detection [116.21529970404653]
本稿では,Transformerアーキテクチャに基づく一段階統一モデルであるSG2HOI+を紹介する。
本手法では,SGGとHOI検出のタスクをシームレスに統一する2つの対話型階層変換器を用いる。
提案手法は最先端のHOI法と比較して競争性能が向上する。
論文 参考訳(メタデータ) (2023-11-03T07:25:57Z) - Object-Centric Image Generation from Layouts [93.10217725729468]
複数のオブジェクトを持つ複雑なシーンを生成するレイアウト・ツー・イメージ生成法を開発した。
本手法は,シーン内のオブジェクト間の空間的関係の表現を学習し,レイアウトの忠実度の向上につながる。
本稿では,Fr'echet Inception Distanceのオブジェクト中心適応であるSceneFIDを紹介する。
論文 参考訳(メタデータ) (2020-03-16T21:40:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。