論文の概要: Face and Voice Cross-modal Association with Learning Convex Feature Embedding
- arxiv url: http://arxiv.org/abs/2607.28129v1
- Date: Thu, 30 Jul 2026 12:37:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.565267
- Title: Face and Voice Cross-modal Association with Learning Convex Feature Embedding
- Title(参考訳): 顔と声のクロスモーダル・アソシエーションと学習凸特徴埋め込み
- Abstract要約: 対人関係学習は、ディープラーニングにおいて最も難しい課題の1つである。
顔と声の関連付けのための,シンプルだが強力なクロスモーダルな特徴埋め込み法を提案する。
我々は,大規模なVoxCelebデータセット上でのクロスモーダル検証,マッチング,検索タスクの手法を徹底的に評価した。
- 参考スコア(独自算出の注目度): 10.494561266360858
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Face-and-voice association learning is one of the most challenging tasks in deep learning. In this paper, we propose a simple but powerful cross-modal feature embedding method for the association of faces and voices. Previous work has studied cross-modal association tasks to establish the correlation between voice clips and facial images. These works have addressed cross-modal discrimination but underestimate the importance of handling heterogeneity in inter-modal features between audio and video, resulting in a lot of false positives and false negatives. To tackle the problem, the proposed method learns the embeddings of cross-modal features by making another feature exist between cross-modal features, facilitating the voice and face features of the same person to be embedded in a convex hull. Moreover, the incorporation of cross-modal attention mechanisms with convex embedding techniques represents a highly effective strategy for the attenuation of false positives and false negatives, accomplished via the minimization of inter-class discrepancies. We exhaustively evaluated our method for cross-modal verification, matching, and retrieval tasks on the large-scale VoxCeleb dataset. Extensive experimental results demonstrate that the proposed method achieves notable improvements over existing state-of-the-art methods.
- Abstract(参考訳): 対人関係学習は、ディープラーニングにおいて最も難しい課題の1つである。
本稿では,顔と声の関連付けのための,シンプルだが強力なクロスモーダルな特徴埋め込み手法を提案する。
従来の研究は、音声クリップと顔画像の相関性を確立するために、モーダル間関連タスクを研究してきた。
これらの研究は、モーダル間差別に対処してきたが、オーディオとビデオ間のモーダル間特徴における不均一性を扱うことの重要性を過小評価しており、多くの偽陽性と偽陰性が生じる。
この問題に対処するため, 提案手法では, クロスモーダル特徴の間に別の特徴を配置することにより, 同一人物の声と顔の特徴を凸内包に埋め込むことを容易にすることで, クロスモーダル特徴の埋め込みを学習する。
さらに, 凸埋込み技術を用いたクロスモーダルアテンション機構の導入は, クラス間差の最小化によって達成された偽陽性と偽陰性の減衰を効果的に抑制する戦略である。
我々は,大規模なVoxCelebデータセット上でのクロスモーダル検証,マッチング,検索タスクの手法を徹底的に評価した。
実験結果から,提案手法は既存の最先端手法よりも顕著に改善されていることが示された。
関連論文リスト
- Implicit Counterfactual Learning for Audio-Visual Segmentation [50.69377287012591]
我々は,非バイアスの相互理解を実現するために,暗黙の対実的枠組み(ICF)を提案する。
意味論の欠如により、異種表現は誤った一致につながる可能性がある。
モダリティ共有空間を確立するために,ビデオ,セグメント,フレームレベルを含む多粒性暗黙テキスト(MIT)をブリッジとして導入する。
論文 参考訳(メタデータ) (2025-07-28T11:46:35Z) - Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment [50.92136296059296]
相互モーダルな相互作用は、意味的に一致した、あるいは不一致した音声視覚イベントを理解するのに不可欠である。
新しいベンチマークと評価指標は、音源定位研究でこれまで見過ごされていた問題を明らかにする。
この研究は、これまでで最も包括的な音源定位解析を提供する。
論文 参考訳(メタデータ) (2024-07-18T16:51:15Z) - Learning Unseen Modality Interaction [54.23533023883659]
マルチモーダル学習は、すべてのモダリティの組み合わせが訓練中に利用でき、クロスモーダル対応を学ぶことを前提としている。
我々は、目に見えないモダリティ相互作用の問題を提起し、第1の解を導入する。
異なるモジュラリティの多次元的特徴を、豊富な情報を保存した共通空間に投影するモジュールを利用する。
論文 参考訳(メタデータ) (2023-06-22T10:53:10Z) - Learning Branched Fusion and Orthogonal Projection for Face-Voice
Association [20.973188176888865]
両モードの相補的手がかりを利用して, リッチなフューズド埋め込みを形成する軽量なプラグアンドプレイ機構を提案する。
その結果,本手法は現在の最先端手法に対して良好に動作することがわかった。
さらに,複数の言語が対面音声アソシエーションに与える影響を分析するために,モーダル間検証とマッチングタスクを活用している。
論文 参考訳(メタデータ) (2022-08-22T12:23:09Z) - Probing Visual-Audio Representation for Video Highlight Detection via
Hard-Pairs Guided Contrastive Learning [23.472951216815765]
効果的なビデオ表現の鍵は、クロスモーダルな表現学習ときめ細かい特徴識別である。
本稿では,表現モデリングにおけるモダリティ内関係とモダリティ間関係の強化について述べる。
コントラスト学習方式によるハードペアによる特徴埋め込みの識別能力を拡大する。
論文 参考訳(メタデータ) (2022-06-21T07:29:37Z) - Noise-Tolerant Learning for Audio-Visual Action Recognition [31.641972732424463]
ビデオデータセットは通常、粗い注釈付きまたはインターネットから収集される。
本稿では,雑音ラベルと雑音対応の両方に対して,反干渉モデルパラメータを求めるための耐雑音性学習フレームワークを提案する。
本手法は,動作認識モデルのロバスト性を大幅に向上し,ベースラインをクリアマージンで越える。
論文 参考訳(メタデータ) (2022-05-16T12:14:03Z) - Unsupervised Voice-Face Representation Learning by Cross-Modal Prototype
Contrast [34.58856143210749]
同一性ラベルを使わずに,音声映像から音声表現を学習する手法を提案する。
これまでの研究では、音声と顔の相関を確立するために、クロスモーダルなインスタンス識別タスクが用いられてきた。
比較手法を生かし, 偽陰性の悪影響に抵抗し, 正の逸脱に抵抗するクロスモーダル・プロトタイプ・コントラッシブ・ラーニング(CMPC)を提案する。
論文 参考訳(メタデータ) (2022-04-28T07:28:56Z) - Dynamic Dual-Attentive Aggregation Learning for Visible-Infrared Person
Re-Identification [208.1227090864602]
Visible-infrared person re-identification (VI-ReID) は、歩行者検索の課題である。
既存のVI-ReID法は、識別可能性に制限があり、ノイズの多い画像に対して弱いロバスト性を持つグローバル表現を学習する傾向にある。
そこで我々は,VI-ReIDのための動的二段階集合(DDAG)学習法を提案する。
論文 参考訳(メタデータ) (2020-07-18T03:08:13Z) - Seeing voices and hearing voices: learning discriminative embeddings
using cross-modal self-supervision [44.88044155505332]
私たちは、ユニモーダルな下流タスクに対してより差別的な埋め込みをトレーニングするための、以前の作業の上に構築しています。
本稿では,モダリティ間のメトリクスを最適化するだけでなく,各モダリティ内でクラス内特徴分離を実施する新しいトレーニング戦略を提案する。
本手法の有効性は,音声-視覚同期で訓練された特徴を用いた唇読解と,クロスモーダルバイオメトリックマッチングで訓練された特徴を用いた話者認識の2つの下流課題において実証された。
論文 参考訳(メタデータ) (2020-04-29T16:51:50Z) - Task-Feature Collaborative Learning with Application to Personalized
Attribute Prediction [166.87111665908333]
本稿では,TFCL(Task-Feature Collaborative Learning)と呼ばれる新しいマルチタスク学習手法を提案する。
具体的には、まず、特徴とタスクの協調的なグループ化を活用するために、不均一なブロック対角構造正規化器を用いたベースモデルを提案する。
実際の拡張として,重なり合う機能と難易度を区別することで,基本モデルを拡張します。
論文 参考訳(メタデータ) (2020-04-29T02:32:04Z) - Audio-Visual Instance Discrimination with Cross-Modal Agreement [90.95132499006498]
本稿では,映像と音声から音声・視覚表現を学習するための自己教師型学習手法を提案する。
モーダル内識別よりも、モーダル間識別を最適化することが、ビデオやオーディオから優れた表現を学ぶ上で重要であることを示す。
論文 参考訳(メタデータ) (2020-04-27T16:59:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。