論文の概要: Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
- arxiv url: http://arxiv.org/abs/2605.27295v1
- Date: Tue, 26 May 2026 17:07:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-27 17:51:42.480916
- Title: Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
- Title(参考訳): Gemini Embedding 2: Geminiのネイティブなマルチモーダル埋め込みモデル
- Authors: Madhuri Shanbhogue, Zhe Li, Shanfeng Zhang, Gustavo Hernández Ábrego, Shih-Cheng Huang, Aashi Jain, Daniel Salz, Sonam Goenka, Chaitra Hegde, Ji Ma, Feiyang Chen, Jiaxing Wu, Tanmaya Dabral, Babak Samari, Kevin Poulet, Daniel Cer, Kaifeng Chen, Paul Suganathan, Hui Hui, Jovan Andonov, Philippe Schlattner, Jay Han, Iftekhar Naim, Wing Lowe, Vladimir Pchelin, Albert Yang, Yi-Ting Chen, Zhongli Ding, Grace Zhang, Georg Heigold, Yichang Chen, Antoine Reveillon, Brendan Mccloskey, Wenlei Zhou, Dahun Kim, Rui Meng, Emma Wang, Jack Zheng, Halley Fede, Zhen Yang, Keegan Mosley, Brian Potetz, Sahil Dua, Henrique Schechter Vera, Shen Gao, Hesen Zhang, Andreas Hess, Hengxuan Ying, Alberto Montes, Karan Gill, Min Choi, Sebastian Russo, Anja Hauth, Jinhyuk Lee, Michael Boratko, Megan Barnes, Vikram Rao, Claudiu Musat, Cyril Allauzen, Ehsan Variani, Shankar Kumar, Tom Bagby, Junyi Jiao, Yang Gu, Tengxin Li, Ayush Agrawal, Roberto Santana, Dev Nath, Stephen Karukas, Shuoxuan Han, Lucia Loher, Alice Twu, Nidhi Vyas, Siddharth Bhai, Frank Palma Gomez, Wangyuan Zhang, Chaoren Liu, Jizheng Yang, Steve Qiu, Shijie Zhang, Sujay Kulkarni, Sascha Rothe, Sean Nakamoto, Raphael Hoffmann, Zach Gleicher, Yunhsuan Sung, Qin Yin, Tom Duerig, Mojtaba Seyedhosseini,
- Abstract要約: 本稿では,映像,音声,画像,テキストのモダリティを統一表現空間に埋め込み可能な,ネイティブなマルチモーダル埋め込みモデルであるGemini Embedding 2を紹介する。
マルチタスク・マルチステージ・トレーニング・セットアップにおける大規模コントラスト学習の適用により,キー埋め込みベンチマークの最先端性能を実現する。
MSCOCOでは62.9 R@1、Vatexでは68.8 NDCG@10、MTEB多言語では69.9、MTEB Codeでは84.0)、特殊モデルでは84.0である。
- 参考スコア(独自算出の注目度): 49.70057706309715
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Gemini Embedding 2, a native multimodal embedding model that allows embedding video, audio, image, and text modalities in a unified representation space. We leverage the multimodal capabilities of Gemini to produce embeddings for arbitrary combinations of interleaved inputs across all these modalities that generalize well across a wide variety of tasks. Applying large-scale contrastive learning in a multi-task multi-stage training setup, we achieve state-of-the-art performance on key embedding benchmarks including unimodal, cross-modal, and multimodal retrieval spanning a diverse set of tasks. We show that our embedding model demonstrates strong performance (with a score of 62.9 R@1 on MSCOCO, 68.8 NDCG@10 on Vatex, 69.9 on MTEB multilingual and 84.0 on MTEB Code) across a variety of tasks surpassing the performance of specialized models. These unified capabilities make Gemini Embedding 2 a promising candidate for downstream use cases such as RAG, recommendation and search. Furthermore, its robust zero-shot performance across distinct fields - from astronomy and bioscience to fine arts and the culinary arts - establishes it as a highly reliable, out-of-the-box representation even for specialized domains.
- Abstract(参考訳): 本稿では,映像,音声,画像,テキストのモダリティを統一表現空間に埋め込み可能な,ネイティブなマルチモーダル埋め込みモデルであるGemini Embedding 2を紹介する。
我々は、Geminiのマルチモーダル機能を活用して、様々なタスクをうまく一般化するこれらすべてのモダリティに対して、インターリーブされた入力の任意の組み合わせのための埋め込みを生成する。
マルチタスク・マルチステージ・トレーニング・セットアップにおける大規模コントラスト学習の適用により,様々なタスクにまたがるユニモーダル,クロスモーダル,マルチモーダル検索を含む,キー埋め込みベンチマークにおける最先端のパフォーマンスを実現する。
MSCOCOでは62.9 R@1、Vatexでは68.8 NDCG@10、MTEB多言語では69.9、MTEB Codeでは84.0)、特殊モデルでは84.0である。
これらの統合された機能により、Gemini Embedding 2は、RAGやレコメンデーション、検索といった下流ユースケースの候補として期待できる。
さらに、天文学や生物科学、美術、料理など、さまざまな分野にまたがる堅牢なゼロショットのパフォーマンスは、専門分野においても非常に信頼性が高く、アウト・オブ・ザ・ボックスの表現として確立している。
関連論文リスト
- One Dinomaly2 Detect Them All: A Unified Framework for Full-Spectrum Unsupervised Anomaly Detection [37.44241182701723]
教師なし異常検出(UAD)は、特殊な単一クラスモデルの構築から、統一された多クラスモデルへと進化してきた。
Dinomaly2はフルスペクトル像UADのための最初の統一されたフレームワークである。
MVTec-AD と VisA では,前例のない 99.9% と 99.3% の画像レベル (I-) AUROC をそれぞれ達成している。
論文 参考訳(メタデータ) (2025-10-20T14:57:52Z) - Gemini Embedding: Generalizable Embeddings from Gemini [24.21178029650299]
Googleの最も有能な大規模言語モデルであるGeminiのパワーを活用した、最先端の組み込みモデルであるGemini Embeddingを紹介した。
Gemini Embeddingは、ジェミニ固有の多言語およびコード理解機能を利用して、多数の言語にまたがるテキストに対する非常に一般化可能な埋め込みを生成する。
論文 参考訳(メタデータ) (2025-03-10T22:16:45Z) - SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation [61.392147185793476]
統一的で汎用的な基礎モデル、すなわちSEED-Xを提案する。
SEED-Xは、理解および生成タスクのための多粒度視覚意味論をモデル化することができる。
我々の研究が、現実世界のアプリケーションで多目的なマルチモーダル基盤モデルによって達成できるものについて、将来の研究に刺激を与えることを期待しています。
論文 参考訳(メタデータ) (2024-04-22T17:56:09Z) - Noise-powered Multi-modal Knowledge Graph Representation Framework [52.95468915728721]
マルチモーダル・プレトレーニングの台頭は、統合されたマルチモーダル知識グラフ表現学習フレームワークの必要性を強調している。
モードレベルのノイズマスキングを備えたトランスフォーマーアーキテクチャを用いた新しいSNAG手法を提案する。
提案手法は10個のデータセットにまたがってSOTA性能を実現し,その汎用性を実証する。
論文 参考訳(メタデータ) (2024-03-11T15:48:43Z) - Generative Multimodal Models are In-Context Learners [60.50927925426832]
我々は37億のパラメータを持つ生成的マルチモーダルモデルであるEmu2を紹介し、大規模マルチモーダルシーケンスで訓練する。
Emu2は、マルチモーダルなインコンテキスト学習能力を示し、オンザフライ推論を必要とするタスクを解決しようとさえしている。
論文 参考訳(メタデータ) (2023-12-20T18:59:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。