論文の概要: COSMI: COmpositional Synthesis of Multi-object Interactions
- arxiv url: http://arxiv.org/abs/2610.03252v1
- Date: Fri, 02 Oct 2026 12:59:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.376999
- Title: COSMI: COmpositional Synthesis of Multi-object Interactions
- Title(参考訳): COSMI:多目的相互作用の共生合成
- Abstract要約: 人間と物体の相互作用の生成モデルは、存在するデータによって境界づけられる。
我々の観察では、相互作用は局所的であるため、単一オブジェクトキャプチャはすでにマルチオブジェクトアクティビティの一部を含んでいる。
単一のインタラクションの接触一貫性のあるクリップ、ハンドバランスのミラー、ボディ間の移動、および言語モデルと幾何学的チェックは、妥当なペアのみを許容する。
COSMIデータセットは、最大5つのオブジェクトを持つ222Kシーケンスと275時間を持ち、最大のマルチオブジェクトキャプチャの約30倍である。
- 参考スコア(独自算出の注目度): 21.958201999417145
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Generative models of human-object interaction are bounded by the data that exists: everyday activities involve several objects, but most captured datasets record one at a time, as multi-object capture is combinatorially expensive. Our observation is that interactions are local, so single-object captures already contain the parts of multi-object activities. We compose them: contact-consistent clips of single interactions, mirrored to balance the hands, transfer between bodies, and a language model and geometric checks admit only the pairings that are plausible, semantically and physically. Therefore, the dataset grows combinatorially with the clips rather than recording time. The COSMI dataset holds 222k sequences and 275 hours with up to five objects, nearly thirty times the largest multi-object capture, and can be extended by adding datasets or even hand-object recordings. On this data we train the COSMI method, a text-to-interaction diffusion transformer that follows how the data is built: weight-shared object slots generate a variable number of objects, predicted relative to the body parts that move them. On a benchmark with an unseen object and unseen interaction combinations, models trained on the dataset generalize to the unseen combinations. COSMI outperforms baselines in text alignment and contact accuracy, where its margin is largest on the unseen object. Code, models, and the dataset pipeline will be released on the project page: https://ptrvilya.github.io/cosmi.
- Abstract(参考訳): 日常的な活動にはいくつかのオブジェクトが含まれるが、ほとんどのキャプチャされたデータセットは、複数のオブジェクトのキャプチャが組合せ的に高価であるため、一度に1つを記録する。
我々の観察では、相互作用は局所的であるため、単一オブジェクトキャプチャはすでにマルチオブジェクトアクティビティの一部を含んでいる。
単一インタラクションの接触一貫性のあるクリップ、ハンドバランスのミラー、ボディ間の移動、および言語モデルと幾何学的チェックは、妥当で意味論的、物理的にペアリングのみを許容する。
したがって、データセットは記録時間ではなく、クリップと組み合わせて成長する。
COSMIデータセットは、最大5つのオブジェクトを持つ222Kシーケンスと275時間を持ち、最大30倍近いマルチオブジェクトキャプチャを持ち、データセットを追加するか、手動オブジェクトの記録を追加することで拡張することができる。
このデータに基づいて、私たちはCOSMI法をトレーニングし、データの構築方法に従うテキスト間拡散変換器をトレーニングした。
目に見えないオブジェクトと目に見えない相互作用の組み合わせのベンチマークでは、データセットでトレーニングされたモデルは、目に見えない組み合わせに一般化される。
COSMIはテキストアライメントと接触精度でベースラインを上回り、そのマージンは目に見えないオブジェクトで最大である。
コード、モデル、データセットパイプラインはプロジェクトページでリリースされる。
関連論文リスト
- Articulated 3D Scene Graphs for Open-World Mobile Manipulation [55.97942733699124]
本報告では, セマンティックな3次元シーングラフを構築するためのフレームワークであるMoMa-SGについて述べる。
新たな統合的ツイスト推定法を用いて調音モデルを推定する。
また,Arti4D-Semanticデータセットについても紹介する。
論文 参考訳(メタデータ) (2026-02-18T10:40:35Z) - Multitwine: Multi-Object Compositing with Text and Layout Control [36.27869996622236]
私たちのモデルでは、シーン内に複数のオブジェクトを追加し、さまざまなインタラクションをキャプチャすることができます。
相互作用が、セルフィーを取るなどの追加のプロップを暗示すると、私たちのモデルは、これらのサポート対象を自律的に生成します。
本稿では,視覚モデルと言語モデルを利用して,マルチモーダル・アライメント・トレーニングデータをシームレスに合成するデータ生成パイプラインを提案する。
論文 参考訳(メタデータ) (2025-02-07T18:48:54Z) - HIMO: A New Benchmark for Full-Body Human Interacting with Multiple Objects [86.86284624825356]
HIMOは、複数のオブジェクトと相互作用するフルボディの人間のデータセットである。
HIMOは3.3K 4D HOIシーケンスと4.08M 3D HOIフレームを含む。
論文 参考訳(メタデータ) (2024-07-17T07:47:34Z) - HOI-M3:Capture Multiple Humans and Objects Interaction within Contextual Environment [43.6454394625555]
HOI-M3は、複数のhumanと複数のオブジェクトの相互作用をモデル化するための、新しい大規模データセットである。
密集したRGBとオブジェクト搭載IMU入力から、人間と物体の両方の正確な3Dトラッキングを提供する。
論文 参考訳(メタデータ) (2024-03-30T09:24:25Z) - Multi-Object Graph Affordance Network: Goal-Oriented Planning through Learned Compound Object Affordances [1.9336815376402723]
Multi-Object Graph Affordance Networkは、オブジェクトと化合物の相互作用を促進するロボットアクションの結果を学ぶことによって、複雑な複合オブジェクトの余裕をモデル化する。
シミュレーションと実環境の両方において,コンケーブ・コンベックス・オブジェクトを含む複合オブジェクトの可利用性をモデル化した。
論文 参考訳(メタデータ) (2023-09-19T08:40:46Z) - ROAM: Robust and Object-Aware Motion Generation Using Neural Pose
Descriptors [73.26004792375556]
本稿では,3次元オブジェクト認識キャラクタ合成における新しいシーンオブジェクトへのロバストさと一般化が,参照オブジェクトを1つも持たないモーションモデルをトレーニングすることで実現可能であることを示す。
我々は、オブジェクト専用のデータセットに基づいて訓練された暗黙的な特徴表現を活用し、オブジェクトの周りのSE(3)-同変記述体フィールドをエンコードする。
本研究では,3次元仮想キャラクタの動作と相互作用の質,および未知のオブジェクトを持つシナリオに対するロバスト性を大幅に向上することを示す。
論文 参考訳(メタデータ) (2023-08-24T17:59:51Z) - BEHAVE: Dataset and Method for Tracking Human Object Interactions [105.77368488612704]
マルチビューのRGBDフレームとそれに対応する3D SMPLとオブジェクトをアノテートしたアノテートコンタクトに適合させる。
このデータを用いて、自然環境における人間と物体を、容易に使用可能なマルチカメラで共同で追跡できるモデルを学ぶ。
論文 参考訳(メタデータ) (2022-04-14T13:21:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。