論文の概要: ArtiMo: Agent-Driven Articulated Mesh Animation
- arxiv url: http://arxiv.org/abs/2608.20699v1
- Date: Fri, 21 Aug 2026 03:08:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-24 14:49:32.355915
- Title: ArtiMo: Agent-Driven Articulated Mesh Animation
- Title(参考訳): ArtiMo: エージェント駆動のArticulated Meshアニメーション
- Abstract要約: ArtiMoはテキスト誘導型メッシュアニメーションのための新しいエージェント駆動フレームワークである。
モデル微調整を必要とせず、因果的に一貫性のある部分運動と相互作用を発生させる。
21の明瞭なオブジェクトカテゴリにまたがる新しいベンチマークデータセットをコントリビュートする。
- 参考スコア(独自算出の注目度): 29.70170507662532
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Animating articulated 3D meshes via text requires satisfying strict kinematic constraints, modeling causal interactions between parts, and achieving instruction fidelity. Due to the absence of task-specific training data and explicit articulation supervision, existing data-driven mesh animation methods are largely inapplicable to this setting. To address this, we propose ArtiMo, a novel agent-driven framework for text-guided articulated mesh animation. Operating in a zero-shot manner, ArtiMo develops an agentic pipeline powered by Large Language and Vision-Language Models (LLMs/VLMs) to orchestrate motion generation. By synergizing the explicit kinematic constraints of URDF with the agent's reasoning and planning capabilities, it effectively produces causally coherent part motions and interactions without requiring model fine-tuning. To ensure motion correctness, the agent additionally utilizes a visual self-improvement mechanism: generated animations are rendered into compact keyframes and motion cues, enabling the VLM to iteratively diagnose and correct errors. Furthermore, we contribute a new benchmark dataset spanning 21 articulated object categories, featuring high-quality motion annotations enriched with causal relationships. Extensive experiments demonstrate that ArtiMo significantly outperforms baselines, particularly on complex, causally driven motions. The project page is available at https://zou-2004.github.io/ArtiMo/.
- Abstract(参考訳): テキストによる3Dメッシュのアニメーションには、厳密なキネマティックな制約を満たすこと、部品間の因果的相互作用をモデル化すること、命令の忠実性を達成することが必要である。
タスク固有のトレーニングデータや明示的な調音監督がないため、既存のデータ駆動型メッシュアニメーション手法は、この設定にはほとんど適用できない。
そこで本研究では,テキスト誘導型メッシュアニメーションのための新しいエージェント駆動フレームワークArtiMoを提案する。
ゼロショット方式で運用するArtiMoは、モーション生成をオーケストレーションするLarge Language and Vision-Language Models (LLMs/VLMs)を利用したエージェントパイプラインを開発する。
URDFの明示的なキネマティック制約をエージェントの推論と計画能力と相乗することにより、モデル微調整を必要とせず、因果的に一貫性のある部分運動と相互作用を効果的に生成する。
生成したアニメーションをコンパクトなキーフレームとモーションキューにレンダリングすることで、VLMが反復的にエラーを診断し、修正することができる。
さらに、21の明瞭なオブジェクトカテゴリにまたがる新しいベンチマークデータセットをコントリビュートし、因果関係に富んだ高品質なモーションアノテーションを特徴付ける。
大規模な実験により、ArtiMoは、特に複雑で因果的に駆動された運動において、ベースラインを著しく上回ることが示された。
プロジェクトページはhttps://zou-2004.github.io/ArtiMo/.comで公開されている。
関連論文リスト
- Follow Your Track: Precise Skeleton Animation Controlled by 3D Trajectories [93.39170866007431]
4Dジェネレーションは、3Dオブジェクトをリアルなモーションでアニメーション化することを目的としており、アプリケーションには大きな可能性を秘めている。
既存の方法は通常、モーション合成から3Dアセット生成を分離する。
トポロジ一般骨格アニメーションのための軌道条件付きフレームワークである textttACT について述べる。
論文 参考訳(メタデータ) (2026-06-24T03:18:10Z) - MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation [66.66098171359995]
MotionMERGEは、モーション言語モデルの粒度のギャップを埋める統合フレームワークである。
まず,詳細な理解と局所的な編集を含む,粒度の細かい言語誘導型モーションコントロールの研究の先駆者となる。
第2に,粒度調整を共同で行う新しい戦略である粒度事前学習を意識したReasoningAware Granularity-Synergyを設計する。
第3に、第1の微細時間補正命令とモーショングラウンドCoTアノテーションを備えた大規模データセットであるMotionFineEditをキュレートする。
論文 参考訳(メタデータ) (2026-05-18T18:00:04Z) - Adaptive Interpolation-Synthesis for Motion In-Betweening on Keyframe-Based Animation [0.0]
モーション・イン・バイ・トゥ・ウィーニング(Motion in-betweening)は、3Dアニメーションの最も芸術的で時間を要するステージの1つである。
そこで本研究では,リズムに基づくアニメーションの動作制約に明示的に適合する手法を提案する。
そこで本手法では,Autodesk Mayaに組み込むと,3.5倍のスピードアップでアニメーションの中間処理を完了させることができる。
論文 参考訳(メタデータ) (2026-05-04T15:41:42Z) - MOSA: Motion-Guided Semantic Alignment for Dynamic Scene Graph Generation [27.7774056956553]
本稿では動的シーングラフ生成(DSGG)のための動作誘導型セマンティックアライメント手法を提案する。
MoSAは、距離、速度、動きの持続性、方向整合性などのオブジェクト対運動特性を符号化する。
クロスモーダルなアクションセマンティックマッチング機構は、視覚的関係特徴と関係カテゴリのテキスト埋め込みを一致させる。
論文 参考訳(メタデータ) (2026-04-21T16:18:26Z) - MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing [53.98607267063729]
MotionVerseは、シングルパーソンとマルチパーソンの両方のシナリオで人間の動作を理解し、生成し、編集するフレームワークである。
我々は、連続的な動き列をマルチストリーム離散トークンに変換する残差量子化を伴う動きトークン化器を用いる。
また、残留トークンストリームの符号化を時間的に停滞させる textitDelay Parallel Modeling 戦略も導入する。
論文 参考訳(メタデータ) (2025-09-28T04:20:56Z) - SILK: Smooth InterpoLation frameworK for motion in-betweening A Simplified Computational Approach [1.7812314225208412]
動きの切り替えはアニメーターにとって重要なツールであり、ポーズごとにポーズレベルの詳細を制御できる。
最近の動きの機械学習ソリューションは、複雑なモデル、スケルトン対応アーキテクチャ、あるいは複数のモジュールとトレーニングステップを必要とする。
本研究では,トランスフォーマーをベースとした単一エンコーダを用いて,現実的な動きを合成するシンプルなフレームワークを提案する。
論文 参考訳(メタデータ) (2025-06-09T19:26:27Z) - GENMO: A GENeralist Model for Human MOtion [64.16188966024542]
本稿では,1つのフレームワークで動作推定と生成を橋渡しする汎用人体運動モデル GENMO を提案する。
我々の重要な洞察は、出力運動が観測された条件信号を正確に満たさなければならないような制約された動き生成として運動推定を再構成することである。
我々の新しいアーキテクチャは、可変長動きと混合マルチモーダル条件(テキスト、オーディオ、ビデオ)を異なる時間間隔で処理し、柔軟な制御を提供する。
論文 参考訳(メタデータ) (2025-05-02T17:59:55Z) - Motion-Agent: A Conversational Framework for Human Motion Generation with LLMs [67.59291068131438]
Motion-Agentは、一般的な人間の動きの生成、編集、理解のために設計された会話フレームワークである。
Motion-Agentはオープンソースの事前学習言語モデルを使用して、モーションとテキストのギャップを埋める生成エージェントであるMotionLLMを開発した。
論文 参考訳(メタデータ) (2024-05-27T09:57:51Z) - CoMo: Controllable Motion Generation through Language Guided Pose Code Editing [57.882299081820626]
本稿では,制御可能なモーション生成モデルであるCoMoについて紹介する。
CoMoは、動きを離散的で意味のあるポーズコードに分解する。
自動的にポーズコードのシーケンスを生成し、それを3Dモーションにデコードする。
論文 参考訳(メタデータ) (2024-03-20T18:11:10Z) - TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models [75.20168902300166]
微粒な軌跡条件の運動制御が可能な新しい映像生成フレームワークであるTrackDiffusionを提案する。
TrackDiffusionの重要なコンポーネントは、複数のオブジェクトのフレーム間の一貫性を明確に保証するインスタンスエンハンサーである。
TrackDiffusionによって生成されたビデオシーケンスは、視覚知覚モデルのトレーニングデータとして使用できる。
論文 参考訳(メタデータ) (2023-12-01T15:24:38Z) - FLAME: Free-form Language-based Motion Synthesis & Editing [17.70085940884357]
FLAMEと呼ばれる拡散型モーション合成・編集モデルを提案する。
FLAMEは、与えられたテキストによく整合した高忠実な動作を生成することができる。
フレームワイドでもジョイントワイドでも、微調整なしで動きの一部を編集できます。
論文 参考訳(メタデータ) (2022-09-01T10:34:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。