論文の概要: HumanOmni-Speaker: Identifying Who said What and When
- arxiv url: http://arxiv.org/abs/2603.21664v1
- Date: Mon, 23 Mar 2026 07:42:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-24 19:11:39.549363
- Title: HumanOmni-Speaker: Identifying Who said What and When
- Title(参考訳): HumanOmni-Speaker:誰が何といつ言ったかを特定する
- Authors: Detao Bai, Shimin Yao, Weixuan Chen, Xihan Wei, Zhiheng Ma,
- Abstract要約: 現在のモデルは、従来のベンチマークにおける視覚バイアスを利用して、真のクロスモーダルアライメントをバイパスしている。
本稿では,視覚登録話者ダイアリゼーションと認識(VR-SDR)とHumanOmni-Speaker Benchmarkを紹介する。
人間のOmni-Speakerは強いマルチモーダルな相乗効果を示し、エンドツーエンドの唇読みと高精度な空間的位置決めを可能にする。
- 参考スコア(独自算出の注目度): 14.108013791864522
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: While Omni-modal Large Language Models have made strides in joint sensory processing, they fundamentally struggle with a cornerstone of human interaction: deciphering complex, multi-person conversational dynamics to accurately answer ``Who said what and when.'' Current models suffer from an ``illusion of competence'' -- they exploit visual biases in conventional benchmarks to bypass genuine cross-modal alignment, while relying on sparse, low-frame-rate visual sampling that destroys crucial high-frequency dynamics like lip movements. To shatter this illusion, we introduce Visual-Registered Speaker Diarization and Recognition (VR-SDR) and the HumanOmni-Speaker Benchmark. By strictly eliminating visual shortcuts, this rigorous paradigm demands true end-to-end spatio-temporal identity binding using only natural language queries. To overcome the underlying architectural perception gap, we propose HumanOmni-Speaker, powered by a Visual Delta Encoder. By sampling raw video at 25 fps and explicitly compressing inter-frame motion residuals into just 6 tokens per frame, it captures fine-grained visemes and speaker trajectories without triggering a catastrophic token explosion. Ultimately, HumanOmni-Speaker demonstrates strong multimodal synergy, natively enabling end-to-end lip-reading and high-precision spatial localization without intrusive cropping, and achieving superior performance across a wide spectrum of speaker-centric tasks.
- Abstract(参考訳): Omni-modal Large Language Modelsは、関節の知覚処理に力を注いでいるが、それらは人間の相互作用の基盤に根本的に苦労している。
従来のベンチマークの視覚バイアスを利用して、真のクロスモーダルアライメントを回避します。一方で、リップムーブメントのような重要な高周波ダイナミクスを破壊する、スパースで低フレームレートのビジュアルサンプリングに依存しています。
視覚登録型話者ダイアリゼーション・認識(VR-SDR)とHumanOmni-Speaker Benchmarkを導入する。
視覚的ショートカットを厳密に排除することで、この厳密なパラダイムは、自然言語クエリのみを使用して、真のエンドツーエンドの時空間IDバインディングを要求する。
基礎となるアーキテクチャ的認識ギャップを克服するために,視覚デルタエンコーダを用いたHumanOmni-Speakerを提案する。
25fpsで生動画をサンプリングし、フレーム間の運動残差をフレームごとにわずか6つのトークンに明示的に圧縮することで、破滅的なトークン爆発を引き起こすことなく、細粒度のヴィセムと話者軌跡を捕捉する。
究極的には、HumanOmni-Speakerは強力なマルチモーダル・シナジーを示し、エンドツーエンドの唇読解をネイティブに実現し、侵入的収穫を伴わずに高精度な空間的局所化を実現し、幅広い話者中心のタスクにおいて優れたパフォーマンスを実現する。
関連論文リスト
- SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection [51.096014381455454]
自己教師付き学習ベースの音声エンコーダは、目に見えない話者を一般化するのに苦労する。
話者の絡み合いは、検出者が人工物に関連する手がかりではなく、話者固有の相関を悪用する原因となる。
我々は、この依存を軽減するために、SNAPという話者無効化フレームワークを紹介した。
論文 参考訳(メタデータ) (2026-03-21T07:05:30Z) - Koopman Regularized Deep Speech Disentanglement for Speaker Verification [6.659299099827954]
DKSD-AE(Deep Koopman Speech Disentanglement Autoencoder)
本稿では,複数ステップのKoopman演算子学習モジュールとインスタンス正規化を組み合わせた構造化オートエンコーダを提案する。
この結果から,コープマンに基づく時間モデルと実例正規化を組み合わせることで,話者中心の表現学習における効率的かつ原理的な解が得られることが示唆された。
論文 参考訳(メタデータ) (2026-03-05T17:30:18Z) - MIBURI: Towards Expressive Interactive Gesture Synthesis [62.45332399212876]
Embodied Conversational Agents (ECA) は、音声、ジェスチャー、表情を通じて人間の対面相互作用をエミュレートすることを目的としている。
既存のECAの解は、人間のような相互作用には適さない剛性で低多様性の運動を生み出す。
MIBURIは,リアルタイム音声対話と同期した表現力のあるフルボディジェスチャーと表情を生成するための,最初のオンライン因果的フレームワークである。
論文 参考訳(メタデータ) (2026-03-03T18:59:51Z) - A$^2$-LLM: An End-to-end Conversational Audio Avatar Large Language Model [39.89874984616492]
A$2$-LLMは、言語、音声の韻律、および3D顔の動きを統一されたフレームワーク内で説明するエンドツーエンドの音声アバターモデルである。
深いセマンティック理解により、A$2$-LLMは単純な唇同期以上の感情的に豊かな顔の動きを生成する。
論文 参考訳(メタデータ) (2026-02-04T02:19:46Z) - MultiVox: A Benchmark for Evaluating Voice Assistants for Multimodal Interactions [70.93364531054273]
音声と視覚を融合させる音声アシスタントの能力を評価する最初のベンチマークであるMultiVoxを紹介する。
具体的には、MultiVoxには、多種多様なパラ言語的特徴を包含する1000の人間の注釈付き音声対話が含まれている。
10の最先端モデルに対する我々の評価は、人間はこれらのタスクに長けているが、現在のモデルは、常に文脈的に接地された応答を生成するのに苦労していることを示している。
論文 参考訳(メタデータ) (2025-07-14T23:20:42Z) - Shushing! Let's Imagine an Authentic Speech from the Silent Video [15.426152742881365]
視覚誘導音声生成は、聴覚信号に頼ることなく、顔の外観や唇の動きから真の音声を生成することを目的としている。
近年の進歩にもかかわらず、既存の手法は視覚的手がかりから意味論、音色、感情的な韻律を横断的に統一するのに苦労している。
ImaginTalkは、視覚入力のみを用いて忠実な音声を生成する新しいクロスモーダル拡散フレームワークである。
論文 参考訳(メタデータ) (2025-03-19T06:28:17Z) - OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis [95.27191872116306]
nameは、一様アライメントと音声生成を統合する2段階のトレーニングフレームワークである。
雑用、視覚言語、音声言語ベンチマークで最先端モデルを上回っている。
nameは、非自己回帰モードで1秒のレイテンシでリアルタイムの音声生成を実現する。
論文 参考訳(メタデータ) (2025-01-08T15:18:09Z) - Generalizable Zero-Shot Speaker Adaptive Speech Synthesis with
Disentangled Representations [12.388567657230116]
一般化可能なゼロショット話者適応音声変換モデルを提案する。
GZS-TVは、話者埋め込み抽出と音色変換のための不整合表現学習を導入した。
実験により、GZS-TVは、目に見えない話者の性能劣化を低減し、複数のデータセットで全てのベースラインモデルより優れていることが示された。
論文 参考訳(メタデータ) (2023-08-24T18:13:10Z) - Learning to Listen: Modeling Non-Deterministic Dyadic Facial Motion [89.01668641930206]
本稿では,対話における対話コミュニケーションをモデル化するための枠組みを提案する。
我々は、対応するリスナー動作の複数の可能性を自動回帰的に出力する。
本手法は,非言語的ダイアド相互作用の多モーダルおよび非決定論的性質を有機的に捕捉する。
論文 参考訳(メタデータ) (2022-04-18T17:58:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。