論文の概要: F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World
- arxiv url: http://arxiv.org/abs/2603.19223v1
- Date: Thu, 19 Mar 2026 17:59:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.329557
- Title: F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World
- Title(参考訳): F2LLM-v2:多言語世界のための包括的で高性能で効率的な埋め込み
- Abstract要約: F2LLM-v2は80Mから14Bまでの8種類の汎用多言語埋め込みモデルである。
F2LLM-v2では200以上の言語をサポートしている。
- 参考スコア(独自算出の注目度): 19.088644745246373
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We present F2LLM-v2, a new family of general-purpose, multilingual embedding models in 8 distinct sizes ranging from 80M to 14B. Trained on a newly curated composite of 60 million publicly available high-quality data samples, F2LLM-v2 supports more than 200 languages, with a particular emphasis on previously underserved mid- and low-resource languages. By integrating a two-stage LLM-based embedding training pipeline with matryoshka learning, model pruning, and knowledge distillation techniques, we present models that are far more efficient than previous LLM-based embedding models while retaining competitive performances. Extensive evaluations confirm that F2LLM-v2-14B ranks first on 11 MTEB benchmarks, while the smaller models in the family also set a new state of the art for resource-constrained applications. To facilitate open-source embedding model research, we release all models, data, code, and intermediate checkpoints.
- Abstract(参考訳): F2LLM-v2は,80Mから14Bまでの8種類の汎用多言語埋め込みモデルである。
F2LLM-v2は、6000万のパブリックな高品質なデータサンプルを新たにキュレートしたコンポジットで訓練されており、200以上の言語をサポートしている。
2段階のLLM埋め込み訓練パイプラインをマトリシカ学習、モデルプルーニング、知識蒸留技術と統合することにより、競争性能を維持しつつ、従来のLLM埋め込みモデルよりもはるかに効率的なモデルを提示する。
F2LLM-v2-14Bは11のMTEBベンチマークで第1位にランクされ、F2LLM-v2-14Bはリソース制約のあるアプリケーションのための新しい最先端のモデルも設定されている。
オープンソースの埋め込みモデルの研究を容易にするため、我々はすべてのモデル、データ、コード、中間チェックポイントをリリースする。
関連論文リスト
- MiniLingua: A Small Open-Source LLM for European Languages [47.78284815754002]
MiniLinguaは、13のヨーロッパ言語でスクラッチからトレーニングされた10億のパラメータからなる、多言語でオープンソースのLLMである。
データ処理やモデルのトレーニングに使用されるモデルウェイト、トークン、ソースコードをリリースします。
論文 参考訳(メタデータ) (2025-12-15T13:12:42Z) - Llama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasks [4.739000717606982]
llama-embed-nemotron-8bはオープンウェイトテキスト埋め込みモデルである。
これはMultilingual Massive Text Embedding Benchmarkで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2025-11-10T12:13:16Z) - F2LLM Technical Report: Matching SOTA Embedding Performance with 6 Million Open-Source Data [19.088644745246373]
F2LLMは,0.6B,1.7B,4Bの3種類の最先端埋め込みモデルである。
F2LLMは、オープンソースの非合成データセットからキュレートされた600万のクエリドキュメント陰性に関する基礎モデルから直接微調整される。
MTEBの英語リーダーボードでは、F2LLM-4Bは約4Bパラメーターと7番目のモデルで2位、F2LLM-1.7Bは1B-2Bサイズ範囲で1位である。
論文 参考訳(メタデータ) (2025-10-02T17:58:49Z) - Multilingual Machine Translation with Open Large Language Models at Practical Scale: An Empirical Study [13.409987421121405]
GemmaX2-28は、28言語で最上位の多言語翻訳性能を達成する9Bモデルである。
GemmaX2-28 は TowerInstruct や XALMA などの最先端 (SOTA) モデルより一貫して優れている。
論文 参考訳(メタデータ) (2025-02-04T16:57:03Z) - KaLM-Embedding: Superior Training Data Brings A Stronger Embedding Model [27.25688303240741]
KaLM-Embeddingは、よりクリーンで、より多様な、ドメイン固有のトレーニングデータを活用する一般的な多言語埋め込みモデルである。
我々のモデルは、性能を向上させることが証明された重要な技術で訓練されている。
論文 参考訳(メタデータ) (2025-01-02T03:17:51Z) - Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling [191.7830199016589]
InternVL 2.5は、InternVL 2.0上に構築された高度マルチモーダル大規模言語モデル(MLLM)シリーズである。
InternVL 2.5は、GPT-4oやClaude-3.5-Sonnetといった主要な商用モデルと競合する競争力を持つ。
このモデルが、マルチモーダルAIシステムの開発と適用のための新しい標準を設定することで、オープンソースコミュニティに貢献できることを願っています。
論文 参考訳(メタデータ) (2024-12-06T18:57:08Z) - VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks [60.5257456681402]
幅広い下流タスクを扱える普遍的な埋め込みを構築する可能性について検討する。
We build a series of VLM2Vec model on SoTA VLMs like Phi-3.5-V, LLaVA-1.6 and evaluate them on MMEB's evaluation split。
以上の結果から,VLM2Vecは既存のマルチモーダル埋め込みモデルよりも10%から20%の絶対的な平均的改善を実現していることがわかった。
論文 参考訳(メタデータ) (2024-10-07T16:14:05Z) - LLAVADI: What Matters For Multimodal Large Language Models Distillation [77.73964744238519]
本研究では,新しい効率的なモデル構造を提案するのではなく,スクラッチから小規模MLLMを訓練する。
本研究は, 知識蒸留プロセスにおける学習戦略, モデル選択, 蒸留アルゴリズムに関するものである。
異なるベンチマークと適切な戦略を評価することで、2.7Bの小型モデルでも7Bまたは13Bのパラメータを持つ大型モデルと同等に動作することができる。
論文 参考訳(メタデータ) (2024-07-28T06:10:47Z) - Unlocking the Potential of Model Merging for Low-Resource Languages [66.7716891808697]
大規模言語モデルを新しい言語に適応させるには、通常、継続事前訓練(CT)と、教師付き微調整(SFT)が含まれる。
我々は低リソース言語の代替としてモデルマージを提案し、異なる機能を持つモデルを追加トレーニングなしで単一のモデルに組み合わせる。
Llama-2-7Bをベースとした実験により、モデルマージはタスク解決能力の低い低リソース言語に対して、極めて少ないデータを持つシナリオにおいて、CT-then-SFTよりも優れていることが実証された。
論文 参考訳(メタデータ) (2024-07-04T15:14:17Z) - Tele-FLM Technical Report [96.19923831660266]
52Bのオープンソース多言語大言語モデルであるTele-FLM(別名FLM-2)を紹介する。
安定的で効率的な事前訓練のパラダイムと、事実判断能力の強化が特徴である。
これは、Llama2-70BやDeepSeek-67Bのようなより大きな事前学習FLOPを含む強力なオープンソースモデルに匹敵する。
論文 参考訳(メタデータ) (2024-04-25T14:34:47Z) - YAYI 2: Multilingual Open-Source Large Language Models [53.92832054643197]
我々は,300億のパラメータを持つベースモデルとチャットモデルを含むYAYI 2を提案する。
YAYI 2は、トレーニング済みのデータ処理パイプラインによってフィルタされた2.65兆のトークンを含む多言語コーパス上で、スクラッチから事前トレーニングされる。
ベースモデルは、数百万の指示による教師付き微調整と、人間のフィードバックからの強化学習によって、人間の価値と整合する。
論文 参考訳(メタデータ) (2023-12-22T17:34:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。