論文の概要: Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio
- arxiv url: http://arxiv.org/abs/2607.18666v1
- Date: Tue, 21 Jul 2026 03:25:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.302538
- Title: Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio
- Title(参考訳): Fusion Embedding:テキスト、画像、ビデオ、オーディオのための統一埋め込みスペース
- Abstract要約: 視覚言語によるバックボーン上に構築された埋め込みモデルは、テキスト/イメージ/ビデオ検索ベンチマークをリードするが、音声を完全に欠いている。
我々は、パラメータが更新されない凍結視覚言語埋め込みベースにオーディオを追加するFusion Embeddingファミリを提示する。
ベースはテキスト、画像、ビデオにすでに結びついているので、音声とテキストの整列だけでオーディオ画像検索が実現し、ペアのオーディオと視覚のトレーニングデータがゼロになる。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A single embedding space that covers text, images, video, and audio lets one index serve every query a user can pose. Embedding models built on vision-language backbones now lead text/image/video retrieval benchmarks but lack audio entirely, while audio-text retrieval is led by specialist systems that serve no other modality. We present the Fusion Embedding family, which adds audio to a frozen vision-language embedding base whose parameters are never updated: generation 1 (fusion-embedding-1) trains only a 16.4M-parameter connector between a frozen audio tower and the frozen base, and generation 2 (fusion-embedding-2) adds modality-gated deep adapters (44.2M parameters) whose branch never executes on text, image, or video inputs: their outputs are bit-for-bit those of the released base, verified after every training run. Because the base already binds text, images, and video, aligning audio to text alone makes audio-image retrieval emerge, with zero paired audio-visual training data. Alongside the recipe we map its design space with controlled negative results (rewriting training captions with an LLM, substituting a leaderboard-stronger audio tower, and widening the connector each reduce retrieval) and with training-protocol findings that we expect to transfer to any frozen decoder-LM embedding backbone. Both generations train in hours on a single GPU. Weights, code, and the evaluation harness are openly released.
- Abstract(参考訳): テキスト、画像、ビデオ、オーディオを包含する単一の埋め込みスペースにより、1つのインデックスは、ユーザがポーズできるすべてのクエリを提供することができる。
視覚言語によるバックボーン上に構築された埋め込みモデルは、テキスト/イメージ/ビデオ検索のベンチマークをリードするが、音声を完全に欠いている。
生成1 (fusion-embedding-1) は、凍結したオーディオタワーと凍結したベースの間の16.4Mパラメトリックコネクタのみを使用し、生成2 (fusion-embedding-2) 生成2 (fusion-embedding-2) は、テキスト、画像、ビデオ入力で決して実行されない、変調されたディープアダプタ (44.2Mパラメータ) を付加する。
ベースはテキスト、画像、ビデオにすでに結びついているので、音声とテキストの整列だけでオーディオ画像検索が実現し、ペアのオーディオと視覚のトレーニングデータがゼロになる。
レシピと並行して、そのデザイン空間を、制御された負の結果(LDMによるトレーニングキャプションの書き直し、リーダーボード-ストロンガーオーディオタワーの置換、各コネクタの拡張)と、凍結したデコーダ-LM埋め込みバックボーンへの転送を期待するトレーニングとプロトコールの発見とを合わせてマッピングする。
どちらの世代も、1つのGPUで数時間でトレーニングします。
ウェイト、コード、評価ハーネスはオープンにリリースされる。
関連論文リスト
- Unified Audio Intelligence Without Regressing on Text Intelligence [86.55418188552768]
我々は,統一音声テキストLLMであるNemotron-Labs-Audex-30B-A3B(Audex)を紹介する。
Audexは単一のTransformerデコーダで単純な統一設計を採用する。
Audexは最先端の音声理解、音声認識と翻訳、テキスト音声合成、音声生成、音声音声生成を提供する。
論文 参考訳(メタデータ) (2026-07-06T15:11:57Z) - SeeingSounds: Learning Audio-to-Visual Alignment via Text [15.011814561603964]
本稿では,音声,言語,視覚の相互作用を利用した画像生成のためのフレームワークであるSeeingSoundsを紹介する。
音声は凍結言語エンコーダを介して意味言語空間に投影され、視覚言語モデルを用いて文脈的に視覚領域に基底される。
このアプローチは認知神経科学にインスパイアされ、人間の知覚で観察される自然な相互関連を反映している。
論文 参考訳(メタデータ) (2025-10-10T18:42:50Z) - From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data [55.2480439325792]
音声対応の大規模言語モデル(ALLM)は近年,音声入力の理解と処理において大きな進歩を遂げている。
これらのモデルは典型的にはテキストベースの大規模言語モデル(LLM)に適応し、音声関連タスクのさらなるトレーニングを行う。
本研究では、現在と欠落した音を区別するALLMの能力を高めるために、コントラッシブな訓練データを生成するデータ生成フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-26T16:08:41Z) - Large Language Models Implicitly Learn to See and Hear Just By Reading [61.3564313676731]
テキストトークン上で自動回帰LDMモデルをトレーニングすることにより、テキストモデルは本質的に内部で画像や音声を理解する能力を開発する。
本稿では,CIFAR-10とFashion-MNISTの画像分類と画像パッチについて述べる。
論文 参考訳(メタデータ) (2025-05-20T22:20:16Z) - Improving Audio-Visual Speech Recognition by Lip-Subword Correlation
Based Visual Pre-training and Cross-Modal Fusion Encoder [58.523884148942166]
本稿では,事前学習および微調整訓練の枠組みの下で,音声視覚音声認識(AVSR)を改善するための2つの新しい手法を提案する。
まず, マンダリンにおける口唇形状と音節レベルサブワード単位の相関について検討し, 口唇形状から良好なフレームレベル音節境界を確立する。
次に,音声誘導型クロスモーダルフュージョンエンコーダ(CMFE)ニューラルネットワークを提案する。
論文 参考訳(メタデータ) (2023-08-14T08:19:24Z) - Text-to-Video: a Two-stage Framework for Zero-shot Identity-agnostic
Talking-head Generation [16.12424393291571]
本稿では,人別ビデオクローンのための新しい2段階フレームワークを提案する。
最初の段階では、事前訓練されたゼロショットモデルを利用してテキスト音声変換を行う。
第2段階では、説得力のあるビデオを生成するために、音声駆動音声ヘッド生成法が用いられる。
論文 参考訳(メタデータ) (2023-08-12T03:30:49Z) - Exploring the Role of Audio in Video Captioning [59.679122191706426]
本稿では,キャプションの音響モダリティの可能性をフル活用することを目的とした音声視覚フレームワークを提案する。
本稿では,音声とビデオ間の情報交換を改善するため,新たなローカル・グローバル融合機構を提案する。
論文 参考訳(メタデータ) (2023-06-21T20:54:52Z) - DiffAVA: Personalized Text-to-Audio Generation with Visual Alignment [30.38594416942543]
本稿では,遅延拡散モデル,すなわちDiffAVAに基づく視覚アライメントを用いた,新規でパーソナライズされたテキスト・音声生成手法を提案する。
我々のDiffAVAは、ビデオ特徴から時間情報を集約するマルチヘッドアテンショントランスフォーマーと、テキスト埋め込みで時間的視覚表現を融合するデュアルマルチモーダル残差ネットワークを活用している。
AudioCapsデータセットの実験結果から、提案したDiffAVAは、視覚的に整列したテキスト・オーディオ生成において、競合する性能を達成できることが示されている。
論文 参考訳(メタデータ) (2023-05-22T10:37:27Z) - TVLT: Textless Vision-Language Transformer [89.31422264408002]
テキストレス・ビジョン・ランゲージ変換器 (TVLT) では, 同種変換器ブロックが生の視覚・音声入力を行う。
TVLTはテキストベースの様々なマルチモーダルタスクに匹敵するパフォーマンスを実現している。
その結果,低レベルの視覚・音声信号から,コンパクトで効率的な視覚言語表現を学習できる可能性が示唆された。
論文 参考訳(メタデータ) (2022-09-28T15:08:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。