論文の概要: Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation
- arxiv url: http://arxiv.org/abs/2610.02148v1
- Date: Thu, 01 Oct 2026 17:49:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.354423
- Title: Omni-Embed-Mini: Binding Modalities Without Forgetting via Dense Distillation
- Title(参考訳): Omni-Embed-Mini: デンス蒸留を経由しない結合モード
- Abstract要約: Omni-Embed-Miniは、テキスト、音声、音声、画像、ビデオ、視覚的に豊かなドキュメントを単一の共有コサイン空間にマッピングするモデルである。
私たちの重要な洞察は、教師の信号は別の埋め込みモデルを必要としないということです。
教師と生徒は同じ背骨重みを共有しているため、それらはバイト単位の幾何学に生息する。
- 参考スコア(独自算出の注目度): 39.24550460485025
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Extending a text embedding model to new modalities typically degrades text retrieval quality, and existing omni-modal embedders compensate with multi-billion parameters. We present Omni-Embed-Mini, a 0.9B-parameter model that maps text, speech, audio, images, video, and visually-rich documents into a single shared cosine space without updating any text-side parameter. Our key insight is that the teacher signal requires no separate embedding model: each media sample is paired with a dense cascaded caption, and the teacher target is simply the frozen backbone's own embedding of that caption. Because teacher and student share the same backbone weights, they inhabit byte-identical geometry, and lightweight projectors plus phased LoRA adapters on the modality encoders suffice for alignment. Training combines a Matryoshka SigLIP contrastive loss with an online hybrid hard-negative miner whose negatives sharpen as the encoder improves. The recipe carries over to a 2.3B variant by swapping in a native vision-language backbone. Omni-Embed-Mini-0.9B keeps its text weights bit-identical to the backbone, so training cannot regress text retrieval (49.57 nDCG@10 on MTEB-v2 BEIR-8), while extending it to five additional modalities, and is ~2.7x to 9.5x smaller than every open omni embedder we compare against. The 2.3B variant is competitive with the closed gemini-embedding-2, edging ahead of it on the overall-modality average. Models, code, data and evaluation harness are on our project page: https://omniembed.cvmbzuai.com
- Abstract(参考訳): テキスト埋め込みモデルを新しいモダリティに拡張すると、テキスト検索の品質は低下し、既存のOmniモード埋め込みはマルチビリオンパラメータで補償される。
Omni-Embed-Miniはテキスト、音声、音声、画像、ビデオ、視覚的に豊かな文書をテキスト側パラメータを更新することなく単一の共有コサイン空間にマッピングする0.9Bパラメータモデルである。
我々の重要な洞察は、教師の信号は別の埋め込みモデルを必要としないということだ。各メディアサンプルは、密集したキャプションとペアリングされ、教師のターゲットは単に凍結したバックボーン自身のキャプションの埋め込みである。
教師と生徒は同じ背骨重みを共有しているため、それらはバイト単位の幾何学と軽量プロジェクターと、モダリティエンコーダ上のフェーズドのLORAアダプタがアライメントのために十分である。
トレーニングは、Matryoshka SigLIPの対照的な損失と、エンコーダが改善するにつれて負が鋭くなるオンラインハイブリッドなハードネガティブなマイナーを組み合わせる。
レシピは、ネイティブの視覚言語バックボーンで交換することで2.3Bのバリエーションに受け継がれる。
Omni-Embed-Mini-0.9Bはテキストの重みを背骨に固定しているため、トレーニングではテキスト検索(MTEB-v2 BEIR-8で49.57 nDCG@10)はできない。
2.3Bの変種は閉ゲミニ-エンベジン-2と競合し、全体モダリティ平均でそれより先に進化する。
モデル、コード、データ、評価のハーネスは、プロジェクトページにある: https://omniembed.cvmbzuai.com
関連論文リスト
- Kathleen Writes: Autoregressive Generation and Data Scaling Without Attention [0.0]
我々は, 事前学習をせずに, 450-700Kパラメータの分類に基づく強いベースラインと, バイトレベルのアテンションフリーアーキテクチャを一致させることができることを示した。
我々は「テキストのように読む」ための非パラメトリックなゲーム抵抗楽器FORM DISTANCEを紹介する。
また,4つのアーキテクチャ追加が役に立たないことを報告し,その5分の1のパラメータで,学習テーブルのトップ1の精度の94%に達する計算辞書を作成した。
論文 参考訳(メタデータ) (2026-08-05T10:44:26Z) - In-Context Collapse in Vision-Language Models and How to Mitigate it? [16.566047545838938]
マルチショットのインコンテキスト学習により、ビジョン言語モデルは、重み付けをすることなく、画像ラベルによるデモから適応できる。
デモが蓄積されると、モデルのサブセットがemphin-contextの崩壊を起こします。
論文 参考訳(メタデータ) (2026-08-03T19:44:45Z) - UEmbed: Unified Sparse and Dense Multimodal Embeddings [56.1131203949042]
本稿では,デコーダのみのマルチモーダル埋め込みモデルUEmbedを紹介する。
緩やかな語彙と密度の表現を1つの因果前方通過で生成する。
UEmbedを2B、4B、9Bスケールでトレーニングし、公開されているデータに基づいてトレーニングされたマルチモーダル埋め込みモデルよりも優れています。
UEmbedは1つのモデルに密でスパースな埋め込みを統一し、さらにスパース検索を拡張してテキストとマルチモーダル入力を統一する、という新しいパラダイムを提供する。
論文 参考訳(メタデータ) (2026-08-03T17:54:11Z) - BitNet Text Embeddings [104.29781473344813]
BITEMBEDは,符号化効率とベクトル記憶を両立させるLLMベースのテキスト埋め込みのための極低ビットフレームワークである。
BITEMBEDは、トレーニング済みのLLMバックボーンを3次重み、量子化アクティベーション、軽量な正規化改善を備えたBitNetスタイルの埋め込みエンコーダに変換する。
Qwen3-0.6B と Gemma703-2M を用いた MMTEB (eng) の実験では、BITEMBED は完全精度の教師埋め込み器とほぼ同等であることが示された。
論文 参考訳(メタデータ) (2026-06-24T10:37:01Z) - Abjad AI at NADI 2025: CATT-Whisper: Multimodal Diacritic Restoration Using Text and Speech Representations [1.1391158217994781]
アラビア語の方言文に対する多モーダルアプローチを用いたダイアクリティカル・リカバリ(DR)課題に取り組む。
本稿では,CATT という名前の事前学習モデルから抽出したエンコーダを用いて,テキストのモダリティを表すモデルを提案する。
実験の結果,提案手法は, 単語誤り率0.25, 文字誤り率0.9を実現していることがわかった。
論文 参考訳(メタデータ) (2025-10-28T09:58:18Z) - Learning Hyperspectral Images with Curated Text Prompts for Efficient Multimodal Alignment [1.7188280334580195]
我々は、CLIPスタイルのコントラストトレーニングフレームワークを利用して、超スペクトルシーン理解のための視覚言語モデル(VLM)の最適化を試みる。
我々のフレームワークは、視覚バックボーンから凍結した大きな埋め込みモデルの潜在空間へのボクセルレベルの埋め込みをマッピングする。
提案手法は全パラメータの0.07パーセントしか更新していないが、最先端の性能が得られる。
論文 参考訳(メタデータ) (2025-09-20T23:23:04Z) - Nomic Embed: Training a Reproducible Long Context Text Embedder [1.3931054166001273]
nomic-embed-text-v1は、最初の完全再現可能なオープンソース、オープンソース、オープンデータ、8192コンテキスト長の英語テキスト埋め込みモデルである。
トレーニングコードとモデルの重み付けをApache 2.0ライセンスでリリースしています。
論文 参考訳(メタデータ) (2024-02-02T18:23:18Z) - MatFormer: Nested Transformer for Elastic Inference [91.45687988953435]
MatFormerは、多様なデプロイメント制約にまたがる弾性推論を提供するように設計された、新しいTransformerアーキテクチャである。
MatFormerは、標準的なTransformerモデルにネストフィードフォワードネットワーク(FFN)ブロック構造を組み込むことで、これを実現している。
8億5000万デコーダのみのMatFormer言語モデル(MatLM)により,5億2200万から8億5千万のパラメータにまたがる複数の小さなモデルを抽出できることを示す。
論文 参考訳(メタデータ) (2023-10-11T17:57:14Z) - Modality-Aware Triplet Hard Mining for Zero-shot Sketch-Based Image
Retrieval [51.42470171051007]
本稿では,ZES-SBIR(Zero-Shot Sketch-Based Image Retrieval)問題に,クロスモダリティメトリック学習の観点から取り組む。
DMLにおける2つの基本的な学習手法、例えば分類訓練とペアトレーニングを組み合わせることで、ZS-SBIRの強力なベースラインを構築した。
モータリティ・アウェア・トリプルト・ハード・マイニング(MATHM)は3種類のペア・ラーニングによってベースラインを向上することを示す。
論文 参考訳(メタデータ) (2021-12-15T08:36:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。