論文の概要: SeMoCo: A Semantic-First Motion Codec for Motion Language Modeling
- arxiv url: http://arxiv.org/abs/2608.24334v2
- Date: Fri, 28 Aug 2026 17:17:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 15:11:36.074332
- Title: SeMoCo: A Semantic-First Motion Codec for Motion Language Modeling
- Title(参考訳): SeMoCo: モーション言語モデリングのためのセマンティックファーストモーションコーデック
- Authors: Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng,
- Abstract要約: 本稿では、セマンティックファーストモーションであるSeMoCoと、言語条件のモーション生成のための2軸モーションジェネレータを紹介する。
また、SOMA表現の下で統合された大規模マルチソースヒューマンモーションデータセットである$-MotionVerseを構築した。
- 参考スコア(独自算出の注目度): 16.84657295044791
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Discrete motion representations have substantially advanced autoregressive text-to-motion generation. However, most motion tokenizers are optimized for reconstruction and do not explicitly allocate capacity according to semantic role. Action-level meaning and fine-grained kinematic detail must therefore be encoded through the same reconstruction-driven hierarchy. We introduce SeMoCo, a semantic-first motion codec, together with a dual-axis motion generator for language-conditioned motion generation. Each motion token contains one semantic token and a residual sequence of kinematic tokens. The generator models semantic progression across time and autoregressively refines the residual entries. We also construct $Ω$-MotionVerse, a large-scale, multi-source human-motion dataset unified under the SOMA representation. Across the reported comparisons, SeMoCo achieves the best reconstruction accuracy among the compared codecs, while strong text-to-motion results demonstrate the effectiveness of its motion tokens for downstream generation.
- Abstract(参考訳): 離散的な動き表現は、かなり進歩した自己回帰的テキスト・ツー・モーション生成を持つ。
しかし、ほとんどのモーショントークンライザは再構成に最適化されており、セマンティックロールに従ってキャパシティを明示的に割り当てていない。
したがって、アクションレベルの意味ときめ細かいキネマティックな詳細は、同じ再構成駆動階層を通じてエンコードされなければならない。
本稿では,セマンティックファーストのモーションコーデックであるSeMoCoと,言語条件のモーション生成のための2軸モーションジェネレータを紹介する。
各モーショントークンは、1つのセマンティックトークンと、キネティックトークンの残りのシーケンスを含む。
ジェネレータは時間にわたって意味的な進行をモデル化し、残余のエントリを自己回帰的に洗練する。
また、SOMA表現の下で統合された大規模マルチソースヒューマンモーションデータセットである$Ω$-MotionVerseを構築した。
報告した比較結果全体では、SeMoCoは比較コーデック間で最高の再構成精度を達成し、強いテキスト・ツー・モーションの結果は、下流生成における動作トークンの有効性を示す。
関連論文リスト
- FlowCoMotion: Text-to-Motion Generation via Token-Latent Flow Modeling [3.303238786179896]
FlowCoMotionは、新しいモーション生成フレームワークである。
セマンティックコンテンツと高忠実度モーションの詳細をキャプチャする。
テキスト・ツー・モーションのベンチマークで競争力を発揮する。
論文 参考訳(メタデータ) (2026-04-13T07:04:47Z) - DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding [25.254783224309488]
マスク付きモデリングからテキスト-モーション理解と生成まで拡張した,離散拡散スタイルのフレームワークであるDiMoを提案する。
動きをトークン化し、順次デコードするGPTスタイルの自己回帰アプローチとは異なり、DiMoは繰り返しマスク付きトークン精錬を行う。
HumanML3DとKIT-MLの実験は、強い運動品質と競合する双方向理解を示す。
論文 参考訳(メタデータ) (2026-02-04T04:01:02Z) - IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation [54.36300724708094]
評価と改善のタスクは、理解と生成の間の双方向の知識フローを可能にするために重要なブリッジとして機能する。
動作生成、評価、改善をシームレスにインターリーブし、生成性能を向上させる最初のモデルであるIRG-MotionLLMを紹介する。
論文 参考訳(メタデータ) (2025-12-11T15:16:06Z) - MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing [53.98607267063729]
MotionVerseは、シングルパーソンとマルチパーソンの両方のシナリオで人間の動作を理解し、生成し、編集するフレームワークである。
我々は、連続的な動き列をマルチストリーム離散トークンに変換する残差量子化を伴う動きトークン化器を用いる。
また、残留トークンストリームの符号化を時間的に停滞させる textitDelay Parallel Modeling 戦略も導入する。
論文 参考訳(メタデータ) (2025-09-28T04:20:56Z) - ReCoM: Realistic Co-Speech Motion Generation with Recurrent Embedded Transformer [58.49950218437718]
音声に同期した高忠実で一般化可能な人体動作を生成するための効率的なフレームワークであるReCoMを提案する。
Recurrent Embedded Transformer (RET)は、動的埋め込み正規化(DER)をViT(Vit)コアアーキテクチャに統合する。
モデルロバスト性を高めるため,ノイズ抵抗とクロスドメイン一般化の二重性を持つモデルに,提案したDER戦略を取り入れた。
論文 参考訳(メタデータ) (2025-03-27T16:39:40Z) - VersatileMotion: A Unified Framework for Motion Synthesis and Comprehension [26.172040706657235]
本稿では,VQ-VAEとフローマッチングを組み合わせた新しいモーショントークンと,自動回帰変換器のバックボーンを組み合わせた統合モーションLLMであるVersatileMotionを紹介する。
VersatileMotionは、単一のフレームワークで単一エージェントとマルチエージェントの動作を処理する最初の方法であり、7つのタスクで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-11-26T11:28:01Z) - Executing your Commands via Motion Diffusion in Latent Space [51.64652463205012]
本研究では,動作遅延に基づく拡散モデル(MLD)を提案し,条件付き入力に対応する鮮明な動き列を生成する。
我々のMDDは、広範囲な人体運動生成タスクにおいて、最先端の手法よりも大幅に改善されている。
論文 参考訳(メタデータ) (2022-12-08T03:07:00Z) - MoDi: Unconditional Motion Synthesis from Diverse Data [51.676055380546494]
多様な動きを合成する無条件生成モデルであるMoDiを提案する。
我々のモデルは、多様な、構造化されていない、ラベルなしのモーションデータセットから完全に教師なしの設定で訓練されている。
データセットに構造が欠けているにもかかわらず、潜在空間は意味的にクラスタ化可能であることを示す。
論文 参考訳(メタデータ) (2022-06-16T09:06:25Z) - Unsupervised Motion Representation Learning with Capsule Autoencoders [54.81628825371412]
Motion Capsule Autoencoder (MCAE) は、2レベル階層のモーションをモデル化する。
MCAEは、新しいTrajectory20モーションデータセットと、様々な現実世界の骨格に基づく人間のアクションデータセットで評価されている。
論文 参考訳(メタデータ) (2021-10-01T16:52:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。