論文の概要: MTEB-BR: A Text Embedding Benchmark for Brazilian Portuguese
- arxiv url: http://arxiv.org/abs/2607.04581v2
- Date: Tue, 07 Jul 2026 20:54:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 12:30:34.745106
- Title: MTEB-BR: A Text Embedding Benchmark for Brazilian Portuguese
- Title(参考訳): MTEB-BR:ブラジルポルトガル語のテキスト埋め込みベンチマーク
- Authors: Tardelli Ronan Coelho Stekel,
- Abstract要約: MTEB-BRは、7つのカテゴリにわたる22のブラジルとポルトガルのネイティブタスクのベンチマークである。
23Mから27Bのパラメータにまたがる93のモデルを評価する。
すべてのタスク、コード、公開リーダボードを公開していますので、実践者はネイティブエビデンスにポルトガルの埋め込みモデルを選択することができます。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text embeddings for Portuguese have no dedicated benchmark: evaluation rests on translated corpora such as English MS MARCO or on thin multilingual coverage, with native tasks scattered and unconsolidated. We introduce MTEB-BR, a benchmark of 22 native Brazilian-Portuguese tasks across seven categories (classification, multilabel classification, pair classification, semantic textual similarity, clustering, retrieval, and reranking), admitting only data created or found in Portuguese and excluding translations by construction. We evaluate 93 models spanning 23M to 27B parameters: 73 open-weight and 20 closed commercial APIs. Alongside the leaderboard we report a statistical layer for every headline comparison: per-task bootstrap confidence intervals, paired-bootstrap significance, a task- and instance-level discrimination analysis (how sharply each task separates models) adapted from Item Response Theory, and a cross-leaderboard correlation. Three findings stand out. The benchmark cleanly separates about a dozen tiers of models, though the top six are statistically too close to order. An openly licensed, self-hostable model reaches that leading tier, so strong Portuguese embedding quality does not require a commercial API. And a model's rank on the global multilingual leaderboard predicts its Portuguese rank only moderately (Spearman rho = 0.75 over 55 shared models; one model ranks 3rd there and 49th here), so a native benchmark measures something the multilingual boards do not. We release every task, our code, and a public leaderboard, so practitioners can choose Portuguese embedding models on native evidence.
- Abstract(参考訳): ポルトガル語のテキスト埋め込みには専用のベンチマークがない: 英語のMS MARCOのような翻訳コーパスや、ネイティブタスクが散在し、統合されていない、細い多言語カバレッジで評価される。
MTEB-BRは7つのカテゴリ(分類、複数ラベル分類、ペア分類、意味的テキスト類似性、クラスタリング、検索、再分類)にまたがる22のブラジル・ポルトガル語のタスクのベンチマークである。
23Mから27Bのパラメータにまたがる93のモデルを評価し,73のオープンウェイト,20のクローズド商用APIについて検討した。
タスクごとのブートストラップの信頼区間、ペアリングブートストラップの意義、タスクレベルとインスタンスレベルの識別分析(各タスクがモデルを切り離す方法)、およびクロスリーダーボードの相関。
3つの発見がある。
ベンチマークでは1ダース程度のモデルが明確に分離されているが、上位6機種は統計的には注文に近すぎる。
オープンライセンスで自己ホスト可能なモデルが最上位層に達するため、ポルトガルの強力な埋め込み品質は、商用APIを必要としない。
そして、世界規模の多言語リーダーボード上のモデルランクは、ポルトガルのランクを適度にしか予測しない(スピアマンrho = 0.75 over 55 共有モデル; 1モデルランクは3位、49位)。
すべてのタスク、コード、公開リーダボードを公開していますので、実践者はネイティブエビデンスにポルトガルの埋め込みモデルを選択することができます。
関連論文リスト
- Beyond Multilingual Averages: MTEB-PT, a Benchmark for Portuguese Sentence Encoders [42.78591555984395]
ポルトガル語は世界で最も広く話されている言語の一つである。
埋め込みモデルは英語または多言語メトリクスに基づいて選択されることが多いが、ポルトガル語での有効性は不明確である。
MMTEBのサブセットから構築したポルトガルのベンチマークMTEB-PTを提案する。
論文 参考訳(メタデータ) (2026-07-05T01:06:29Z) - MARCA: A Checklist-Based Benchmark for Multilingual Web Search [8.678622777553263]
Web ベースの情報検索において,大規模言語モデル (LLM) を評価するベンチマークである textscMARCA を提案する。
我々は、直接Web検索とスクレイピングを備えたベーシックフレームワークと、委譲サブエージェントによるタスクの分解を可能にするOrchestratorフレームワークの2つのインタラクション設定の下で、14のモデルを評価する。
論文 参考訳(メタデータ) (2026-04-15T21:54:27Z) - CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Context [8.678622777553267]
CAPITUは、ブラジルポルトガル語でLLM(Large Language Models)の命令追従能力を評価するためのベンチマークである。
ベンチマークは59の命令タイプを7つのカテゴリに分類し、すべて自動的に検証できるように設計されている。
シングルターンおよびマルチターン設定における18の最先端モデルを評価する。
論文 参考訳(メタデータ) (2026-03-23T21:16:54Z) - A Multi-Language Object-Oriented Programming Benchmark for Large Language Models [61.267115598083315]
35の既存ベンチマークの調査では、3つの大きな不均衡が明らかになった。
85.7%は単一のプログラミング言語に重点を置いている。
94.3%は関数レベルまたはステートメントレベルのタスクのみを対象としている。
80%以上は平均10件未満のテストケースを含む。
論文 参考訳(メタデータ) (2025-09-30T11:30:08Z) - MMTEB: Massive Multilingual Text Embedding Benchmark [85.18187649328792]
我々はMMTEBベンチマーク(Massive Multilingual Text Embedding Benchmark)を紹介する。
MMTEBは250以上の言語で500以上の品質管理された評価タスクをカバーしている。
我々は複数の多言語ベンチマークを開発し、モデルを代表的に評価する。
論文 参考訳(メタデータ) (2025-02-19T10:13:43Z) - MTEB-French: Resources for French Sentence Embedding Evaluation and Analysis [1.5761916307614148]
本稿では,フランス語の文埋め込みに関する最初のベンチマークを提案する。
51個の埋め込みモデルを大規模に比較した。
すべてのタスクにおいてモデルが最良でない場合でも、文類似性に基づいて事前訓練された大規模多言語モデルは非常によく機能することがわかった。
論文 参考訳(メタデータ) (2024-05-30T20:34:37Z) - DeMuX: Data-efficient Multilingual Learning [57.37123046817781]
DEMUXは、大量の重複しない多言語データからラベルを付けるための正確なデータポイントを規定するフレームワークである。
エンドツーエンドのフレームワークは言語に依存しず、モデル表現を記述し、多言語的ターゲット設定をサポートしています。
論文 参考訳(メタデータ) (2023-11-10T20:09:08Z) - OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource
Language Pair for Low-Resource Sentence Retrieval [91.76575626229824]
文検索タスク用に特別に設計されたアライメントモデルであるOneAlignerを提案する。
大規模並列多言語コーパス(OPUS-100)の全ての言語ペアで訓練すると、このモデルは最先端の結果が得られる。
実験結果から,文アライメントタスクの性能はモノリンガルおよび並列データサイズに大きく依存することがわかった。
論文 参考訳(メタデータ) (2022-05-17T19:52:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。