論文の概要: OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder
- arxiv url: http://arxiv.org/abs/2605.01506v1
- Date: Sat, 02 May 2026 15:55:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-05 20:33:49.808421
- Title: OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder
- Title(参考訳): OmniEncoder:1つのエンコーダを持つ人間のような連続的な動き
- Authors: Detao Bai, Shimin Yao, Weixuan Chen, Chengen Lai, Yuanming Li, Zhiheng Ma, Xihan Wei,
- Abstract要約: 我々は、共有潜在空間内の25fpsの対称で視覚信号と音声信号を共入力するための統合トランスフォーマーバックボーンであるtextbf Omni-Encoder を提案する。
実験により、モダリティ固有のベースラインであるQwen2.5-Omniと比較して、Omni-Encoderは視覚的連続理解タスクに大きな利益をもたらすことが示された。
これらの結果から,統一全能符号化は全能モデル構築に有望な方向性をもたらすことが示唆された。
- 参考スコア(独自算出の注目度): 17.494692126897434
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent advances in omni-modal large language models have enabled remarkable progress in joint vision-audio understanding. However, prevailing architectures rely on modality-specific encoders with a \emph{video-coarse, audio-dense} design -- sampling visual frames at 1--2 fps while processing audio waveforms at 25 fps -- resulting in systems that perceive video \emph{frame by frame, modality by modality} rather than holistically as humans do. Such a discrepancy leaves models with impoverished cross-modal interaction during encoding and an inability to capture fine-grained visual motion. To bridge this gap, we present \textbf{Omni-Encoder, a unified Transformer backbone designed to co-embed visual and audio signals at a symmetrical 25 fps} within a shared latent space. This architecture leverages three core innovations -- the Omni-Encoder Token Template, Omni-RoPE, and Temporal Window Shifting -- to effectively reconcile the dual challenges of modality disentanglement and computational efficiency. Experiments demonstrate that, compared to the modality-specific baseline Qwen2.5-Omni under the same input token budget to the LLM decoder, Omni-Encoder delivers substantial gains on visual continuous understanding tasks -- such as sign language recognition and fine-grained sports action analysis -- while maintaining competitive performance on established audio-visual benchmarks such as AVQA and Speaker Identification and Localization. These results suggest that unified omnivorous encoding offers a promising direction for building omni-modal models that more closely reflect the integrated nature of human perception.
- Abstract(参考訳): 近年のOmni-modal large language modelの進歩は、共同視覚とオーディオの理解において顕著な進歩をもたらした。
しかし、一般的なアーキテクチャは、映像フレームを25fpsで処理しながら1-2fpsでサンプリングする「emph{video-coarse, audio-dense}」設計のモダリティ固有のエンコーダに依存している。
このような不一致は、符号化中のクロスモーダル相互作用の不足と、きめ細かい視覚的な動きを捉えることができないモデルを残している。
このギャップを埋めるために、共有潜在空間内の対称25fpsで視覚信号と音声信号を共入力する統合トランスフォーマーバックボーンである、textbf{Omni-Encoderを提案する。
このアーキテクチャは、3つのコアイノベーション(Omni-Encoder Token Template、Omni-RoPE、Temporal Window Shifting)を活用して、モダリティの切り離しと計算効率の2つの課題を効果的に解決する。
実験によると、LLMデコーダと同じ入力トークン予算の下で、モダリティ固有のベースラインであるQwen2.5-Omniと比較して、Omni-Encoderは、手話認識やきめ細かいスポーツアクション分析のような視覚的連続的なタスクにおいて、AVQAや話者識別、ローカライゼーションのような既存のオーディオ視覚ベンチマーク上での競合性能を維持しながら、かなりの利益を提供している。
これらの結果から、統一全能符号化は、人間の知覚の一体的な性質をより深く反映した全能モデルを構築する上で、有望な方向性をもたらすことが示唆された。
関連論文リスト
- Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation [108.23557570345356]
Tuna-2はネイティブな統一マルチモーダルモデルであり、ピクセルの埋め込みに基づいて視覚的理解と生成を行う。
実験により、Tuna-2はマルチモーダルベンチマークで最先端のパフォーマンスを達成することが示された。
論文 参考訳(メタデータ) (2026-04-27T17:59:56Z) - AR-Omni: A Unified Autoregressive Model for Any-to-Any Generation [60.02195766025208]
我々は、専門家のデコーダを使わずに、自己回帰パラダイムにおける統一された任意のモデルであるAR-Omniを提案する。
AR-Omniは自動回帰テキストと画像生成をサポートし、ストリーミング音声生成もサポートしている。
タスク認識損失再重み付けによるモダリティ不均衡、画像トークンに対する軽量トークンレベルの知覚的アライメント損失による視覚的忠実度、有限状態復号機構による安定性・創造性トレードオフの3つの実践的問題に対処する。
論文 参考訳(メタデータ) (2026-01-25T09:17:36Z) - EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer [64.69014756863331]
本研究では,外見と人間の動作の同時分布をモデル化するフレームワークであるEchoMotionを紹介する。
また,ビデオトークンとモーショントークンの両方に3次元位置符号化を統一したMVS-RoPEを提案する。
以上の結果から,人間の動きを明示的に表現することは出現することであり,人間中心のビデオ生成のコヒーレンスと妥当性を著しく向上させることが判明した。
論文 参考訳(メタデータ) (2025-12-21T17:08:14Z) - Complementary and Contrastive Learning for Audio-Visual Segmentation [74.11434759171199]
本稿では,ローカル情報とグローバル情報の両方を処理可能な新しいフレームワークであるComplementary and Contrastive Transformer(CCFormer)を提案する。
提案手法は,S4, MS3, AVSSデータセットにまたがる最先端のベンチマークを新たに設定する。
論文 参考訳(メタデータ) (2025-10-11T06:36:59Z) - AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation [24.799628787198397]
AudioGen-Omniは、入力ビデオとコヒーレントに同期した高忠実度オーディオ、音声、歌を生成する。
ジョイントトレーニングパラダイムは、大規模ビデオテキストオーディオコーパスを統合している。
密度フレームレベルの表現は、AdaLNベースのジョイントアテンション機構を用いて融合する。
推測時間は8秒間1.91秒であり、効率と一般性の両方で大幅に改善されている。
論文 参考訳(メタデータ) (2025-08-01T16:03:57Z) - AsynFusion: Towards Asynchronous Latent Consistency Models for Decoupled Whole-Body Audio-Driven Avatars [71.90109867684025]
全体オーディオ駆動型アバターポーズと表現生成は、生命に似たデジタル人間を作るための重要なタスクである。
本稿では,拡散変換器を応用し,結合表現とジェスチャ合成を実現する新しいフレームワークAsynFusionを提案する。
AsynFusionは、リアルタイムで同期された全身アニメーションを生成する際に最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-05-21T03:28:53Z) - Dual Audio-Centric Modality Coupling for Talking Head Generation [4.03322932416974]
音声駆動音声ヘッドビデオの生成は、仮想アバターやデジタルメディアなど、コンピュータビジョンとグラフィックスにおいて重要な課題である。
従来のアプローチは、しばしば音声と顔のダイナミックスの間の複雑な相互作用を捉え、唇の同期と視覚的品質の問題を引き起こす。
音声入力からコンテンツや動的特徴を効果的に統合する新しいNeRFベースのフレームワークであるDual Audio-Centric Modality Coupling (DAMC)を提案する。
論文 参考訳(メタデータ) (2025-03-26T06:46:51Z) - Combined CNN Transformer Encoder for Enhanced Fine-grained Human Action
Recognition [11.116921653535226]
本稿では,CNNビジョンバックボーンとTransformerを組み合わせた2つのフレームワークについて検討する。
実験の結果,トランスフォーマーエンコーダフレームワークはいずれも,潜時的意味論と相互モダリティ関連を効果的に学習していることがわかった。
我々は,両アーキテクチャのFinGymベンチマークデータセットに対して,最先端性能を新たに実現した。
論文 参考訳(メタデータ) (2022-08-03T08:01:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。