論文の概要: SEA-CLIP-Tiny: Efficient Multilingual Text-Vision Embedding for Southeast Asian Languages
- arxiv url: http://arxiv.org/abs/2609.30739v1
- Date: Fri, 25 Sep 2026 03:10:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.198054
- Title: SEA-CLIP-Tiny: Efficient Multilingual Text-Vision Embedding for Southeast Asian Languages
- Title(参考訳): SEA-CLIP-Tiny:東南アジア言語のための効率的な多言語テキストビジョン埋め込み
- Abstract要約: 東南アジアにおけるコンパクトな多言語テキストビジョン埋め込みモデルSEA-CLIP-Tinyについて述べる。
我々のモデルは、地域データキュレーションと多言語教師指導を通じて、東南アジアの多言語設定にCLIP-KDスタイルのフレームワークを適用する。
- 参考スコア(独自算出の注目度): 15.458212193718419
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multilingual text-vision embedding models are essential for cross-lingual image-text retrieval, but Southeast Asian languages remain poorly supported due to the region's linguistic diversity and limited data and computing resources. In this paper, we introduce SEA-CLIP-Tiny, a compact multilingual text-vision embedding model for Southeast Asia with fewer than 50M parameters. Our model adapts a CLIP-KD-style framework to Southeast Asian multilingual settings through regional data curation and multilingual teacher guidance. Experiments across seven Southeast Asian languages show that SEA-CLIP-Tiny achieves the strongest average retrieval performance among the evaluated student models, reaching 12.9%, 31.5%, and 42.2% at R@1, R@5, and R@10, respectively. Compared with MobileCLIP2, it improves average R@10 by 12.1 points while using 38.4% fewer parameters and lower measured CPU latency. These results highlight the importance of region-aware training for efficient multilingual text-vision models in Southeast Asia.
- Abstract(参考訳): 多言語テキストビジョン埋め込みモデルは、言語間画像テキスト検索には不可欠であるが、東南アジアの言語は、地域の言語的多様性と限られたデータと計算資源のために、サポートが不十分なままである。
本稿では,5000万パラメータ未満の東南アジア向けコンパクト多言語テキストビジョン埋め込みモデルSEA-CLIP-Tinyを紹介する。
我々のモデルは、地域データキュレーションと多言語教師指導を通じて、東南アジアの多言語設定にCLIP-KDスタイルのフレームワークを適用する。
7つの東南アジア言語での実験では、SEA-CLIP-Tinyは評価された学生モデルの中で最も高い平均検索性能を示し、それぞれR@1、R@5、R@10で12.9%、31.5%、42.2%に達した。
MobileCLIP2と比較すると、平均R@10を12.1ポイント改善し、パラメータは38.4%減少し、CPUのレイテンシも低くなった。
これらの結果は、東南アジアにおける効率的な多言語テキストビジョンモデルのための地域意識トレーニングの重要性を強調している。
関連論文リスト
- Tiny Aya: Bridging Scale and Multilingual Depth [71.20786995660801]
Tiny Aya氏は、小さな多言語言語モデルが達成できることを再定義する。
翻訳品質の最先端、多言語理解の強化、高品質なターゲット言語生成を提供する。
このレポートでは、Tiny Ayaを支えるトレーニング戦略、データ構成、包括的な評価フレームワークについて詳述する。
論文 参考訳(メタデータ) (2026-03-12T03:53:13Z) - SEA-BED: Southeast Asia Embedding Benchmark [43.05386334897603]
約7億人の話者を抱える東南アジア地域では、地域固有の埋め込みベンチマークが欠落している。
SEA-BEDは9つのタスクと10言語にまたがる169のデータセットを備えた最初の大規模埋め込みベンチマークである。
6つの研究にまたがる17の埋め込みモデルの評価,課題および言語課題の分析,ベンチマーク間比較,翻訳トレードオフについて検討した。
論文 参考訳(メタデータ) (2025-08-17T05:10:40Z) - Improving Multilingual Capabilities with Cultural and Local Knowledge in Large Language Models While Enhancing Native Performance [0.0]
Hindi- English bi-lingual LLM textbfMantra-14B with 3% improve in benchmark scores over both languages。
我々は、Qwen-2.5-14B-InstructやPhi-4といったチューニングモデルに、英語とヒンディー語の両方のパフォーマンスを改善するよう指示した。
以上の結果から,文化的・局所的な情報を用いた微調整は,計算オーバーヘッドを伴わずに性能ギャップを埋めることが可能であることが示唆された。
論文 参考訳(メタデータ) (2025-04-13T23:10:13Z) - Bridging the Gap: Enhancing LLM Performance for Low-Resource African Languages with New Benchmarks, Fine-Tuning, and Cultural Adjustments [0.9214083577876088]
本稿では,8つの低リソースアフリカ言語において,約100万の人文翻訳語を新たにベンチマークデータとして生成する。
我々のベンチマークはウィノグランデの翻訳とMMLUの3つのセクション(大学医学、臨床知識、ウイルス学)である。
翻訳されたベンチマークを用いて、英語とアフリカ語におけるSOTA(State-of-the-art LLM)のパフォーマンスギャップについて報告する。
論文 参考訳(メタデータ) (2024-12-16T23:50:21Z) - SeaLLMs 3: Open Foundation and Chat Multilingual Large Language Models for Southeast Asian Languages [77.75535024869224]
東南アジアの言語に合わせたSeaLLMsモデルファミリーの最新版SeaLLMs 3を紹介します。
SeaLLMs 3は、英語、中国語、インドネシア語、ベトナム語、タイ語、タガログ語、マレー語、ビルマ語、クメール語、ラオス語、タミル語、ジャワ語など、この地域で話される言語全般をカバーすることで、このギャップを埋めることを目指している。
我々のモデルは、世界的知識、数学的推論、翻訳、命令の追従といったタスクに優れており、同様の大きさのモデルで最先端の性能を達成する。
論文 参考訳(メタデータ) (2024-07-29T03:26:22Z) - SeaLLMs -- Large Language Models for Southeast Asia [76.50157503379086]
東南アジア(SEA)言語に焦点を当てた,革新的な言語モデルであるSeaLLMを紹介した。
SeaLLMはLlama-2モデルに基づいて構築され、さらに拡張語彙、特殊命令、アライメントチューニングによる事前訓練が継続されている。
包括的評価により,SeaLLM-13bモデルは言語タスクやアシスタントスタイルの指示追従能力に優れた性能を示した。
論文 参考訳(メタデータ) (2023-12-01T17:17:56Z) - Breaking Language Barriers in Multilingual Mathematical Reasoning: Insights and Observations [59.056367787688146]
本稿では, マルチリンガル数学推論 (xMR) LLM の探索と学習の先駆者である。
我々は10の異なる言語を含む最初の多言語数学推論命令データセットMGSM8KInstructを構築した。
翻訳を利用して、10個の異なる言語を含む最初の多言語数学推論命令データセットMGSM8KInstructを構築した。
論文 参考訳(メタデータ) (2023-10-31T08:09:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。