論文の概要: MoganColBERT-TR: A Late-Interaction Multi-Vector Retrieval Model for Turkish
- arxiv url: http://arxiv.org/abs/2608.26344v1
- Date: Wed, 26 Aug 2026 19:26:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.162707
- Title: MoganColBERT-TR: A Late-Interaction Multi-Vector Retrieval Model for Turkish
- Title(参考訳): MoganColBERT-TR:トルコのマルチベクトル検索モデル
- Abstract要約: この研究は第3のモデルであるMoganColBERT-TRを導入している。
MoganColBERT-TRは、768->128プロジェクションを通してトークンレベルで表現し、MaxSim遅延相互作用でスコアするマルチベクトル検索モデルである。
148.9Mパラメータを持つMoganColBERT-TRの総合スコアは37.36である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We previously reported a ModernBERT encoder trained from scratch for Turkish (MoganBERT-TR) and a single-vector embedding model built on top of it (MoganBERT-embed). This work introduces the third model in that lineage: MoganColBERT-TR, a multi-vector retrieval model that, instead of compressing a query or a document into a single vector, represents it at the token level through a 768->128 projection and scores it with MaxSim late interaction. The model is not trained from scratch: the embedding model's encoder is taken as the starting point and adapted to the ColBERT objective with a single-epoch distillation phase. Training data is produced from two sources - title-to-passage pairs carved out of our own pretraining corpus in the character domain and at sentence boundaries, and two Turkish question-based retrieval sets - and is distilled from the soft scores of a cross-encoder teacher (bge-reranker-v2-m3) over one positive and seven mined negatives. We show that in hard negative mining, rank-based skipping alone is insufficient and must be combined with a group mask and a cosine ceiling. Evaluation is carried out with the official pipeline of TurkColBERT, a benchmark built for Turkish late-interaction retrieval (PLAID index, exact MaxSim), on five Turkish BEIR datasets; none of them appears in our training pool, so all five results are clean zero-shot. With 148.9M parameters, MoganColBERT-TR reaches an overall score of 37.36 (35.53 nDCG@100, 31.81 nDCG@10) averaged over the five datasets and finishes second among the five models compared: it outperforms the twice-as-large ColmmBERT-base-TR on four of five datasets and by +3.05 overall, and the benchmark's largest model by +12.30. The gap to the leading model (mLateOn) is concentrated on ArguAna-TR, the dataset with by far the longest queries.
- Abstract(参考訳): 我々は以前、トルコ語(MoganBERT-TR)のスクラッチからトレーニングしたModernBERTエンコーダと、その上に構築された単一ベクトル埋め込みモデル(MoganBERT-embed)を報告した。
マルチベクトル検索モデルであるMoganColBERT-TRは、クエリやドキュメントを単一のベクトルに圧縮するのではなく、768->128のプロジェクションでトークンレベルで表現し、MaxSimの遅延相互作用でスコア付けする。
埋め込みモデルのエンコーダを出発点として、コルバート目標に適応し、単一エポック蒸留相とする。
トレーニングデータは、文字領域と文境界において、我々の事前学習コーパスから彫られたタイトル・ツー・パスのペアと、トルコの質問ベースの検索セットの2つのソースから作成され、1つの正と7つの負の負に対して、クロスエンコーダの教師(bge-reranker-v2-m3)のソフトスコアから蒸留される。
強い負のマイニングでは、ランクベースのスキップだけでは不十分であり、グループマスクとコサイン天井を組み合わせる必要がある。
トルコのレイトアクション検索(PLAIDインデックス、正確にはMaxSim)のためのベンチマークであるTurkColBERTの公式パイプラインを、トルコのBEIRデータセット5つで評価する。
148.9Mパラメータで、MoganColBERT-TRは5つのデータセットの平均37.36(35.53 nDCG@100, 31.81 nDCG@10)に達し、5つのモデルのうち2位に終わる。
リードモデル(mLateOn)とのギャップは、最も長いクエリを持つデータセットであるArguAna-TRに集中している。
関連論文リスト
- MoganBert-TR: A Turkish Encoder Foundation Model Trained from Scratch with a CLM-to-MLM Curriculum [0.0]
MoganBert-TRは237.3Bのトークンを2段階のCLM-to-MLMカリキュラムでトレーニングしている。
MoganBert-TR は TrGLUE で78.41 に達し、トルコのModernBERT モデルの中でも最高である。
論文 参考訳(メタデータ) (2026-08-26T13:12:51Z) - Architecture-Dependent Causal Transfer of Activation States Across Large Language Models [51.56484100374058]
内部言語アクティベーション状態は、異なる大きな言語モデル間で因果的に転送することができる。
生成中に投影された活性化をターゲットモデルに注入すると、統計的に有意で事前登録された因果効果が生じる。
現在実装されているLCM間のエンド・ツー・エンドのアクティベーション・ステート・トランスファーは、ユニバーサルではなくアーキテクチャに依存していると結論付けている。
論文 参考訳(メタデータ) (2026-08-17T09:53:27Z) - Team DACTYL at PAN 2026: Bayesian Data Mixing and Empirical X-risk Minimization for AI-text Detection [0.33842793760651557]
既存の研究では、AIが生成したテキスト検出分類器は、強い非分配(ID)性能を達成しているが、オフ・オブ・ディストリビューション(OOD)テキストでは、同じ性能を維持していないことが示されている。
ベイズ分類ヘッドを用いたBERT-tinyモデルを微調整し、3つの異なるデータセットにまたがるテキストを選択し、統合トレーニングセットとして使用する。
我々の結果は、注意深いデータセットのキュレーションによってOODのパフォーマンスが向上することを示している。
論文 参考訳(メタデータ) (2026-07-19T18:48:59Z) - TabiBERT: A Large-Scale ModernBERT Foundation Model and A Unified Benchmark for Turkish [0.7233065479782755]
TabiBERTはModernBERTアーキテクチャをベースとしたモノリンガルのトルコ語エンコーダである。
8,192トークンのコンテキスト長(16xオリジナルBERT)をサポートし、最大2.65倍のスピードアップを実現し、GPUメモリ使用量を削減する。
タビベンチで77.58を獲得し、BERTurkを1.62ポイント上回り、8つのカテゴリーのうち5つの最先端技術を確立した。
論文 参考訳(メタデータ) (2025-12-28T20:18:22Z) - TurkColBERT: A Benchmark of Dense and Late-Interaction Models for Turkish Information Retrieval [0.0]
我々は、トルコ検索のための高密度エンコーダと遅延相互作用モデルを比較した最初のベンチマークであるTurkColBERTを紹介する。
我々の2段階適応パイプラインは、トルコのNLI/STSタスクで英語と多言語エンコーダを微調整し、ColBERTスタイルのレトリバーに変換する。
我々は、科学的、経済的、議論的な領域をカバーする5つのトルコのBEIRデータセットの10モデルを評価した。
論文 参考訳(メタデータ) (2025-11-20T16:42:21Z) - MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes [60.57770396565211]
強い推論能力は、はるかに少ないデータで実現可能であることを示す。
MobileLLM-R50MのAIMEスコアは15.5であり、OLMo-2-1.48Bは0.6、SmolLM-2-1.7Bは0.3である。
論文 参考訳(メタデータ) (2025-09-29T15:43:59Z) - mmBERT: A Modern Multilingual Encoder with Annealed Language Learning [57.58071656545661]
mmBERTは、多言語テキストの3Tトークンで事前訓練されたエンコーダのみの言語モデルである。
データに1700以上の低リソース言語を追加しています。
分類および検索タスクにおける従来のモデルよりも, mmBERTの方が優れていたことを示す。
論文 参考訳(メタデータ) (2025-09-08T17:08:42Z) - MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm [60.14048367611333]
MonkeyOCRはドキュメント解析のためのビジョン言語モデルである。
SRR(Structure-Recognition-Relation)三重項パラダイムを活用することで、最先端の技術の進歩を図っている。
論文 参考訳(メタデータ) (2025-06-05T16:34:57Z) - Optimized Text Embedding Models and Benchmarks for Amharic Passage Retrieval [49.1574468325115]
トレーニング済みのAmharic BERTとRoBERTaのバックボーンをベースとした,Amharic固有の高密度検索モデルを提案する。
提案したRoBERTa-Base-Amharic-Embedモデル(110Mパラメータ)は,MRR@10の相対的な改善を17.6%達成する。
RoBERTa-Medium-Amharic-Embed (42M)のようなよりコンパクトな派生型は13倍以上小さいまま競争力を維持している。
論文 参考訳(メタデータ) (2025-05-25T23:06:20Z) - Data-Efficient French Language Modeling with CamemBERTa [0.0]
本稿では,DeBERTaV3アーキテクチャとトレーニング目標に基づいて構築された,フランスのDeBERTaモデルであるCamemBERTaを紹介する。
我々は、さまざまなフランス語の下流タスクとデータセットに対して、我々のモデルの性能を評価する。
論文 参考訳(メタデータ) (2023-06-02T12:45:34Z) - Evaluation of Transfer Learning for Polish with a Text-to-Text Model [54.81823151748415]
ポーランド語におけるテキスト・テキスト・モデルの質を評価するための新しいベンチマークを導入する。
KLEJベンチマークはテキスト・トゥ・テキスト、en-pl翻訳、要約、質問応答に適応している。
本稿では,ポーランド語のための汎用テキスト・テキスト・ツー・テキスト・モデルであるplT5について述べる。
論文 参考訳(メタデータ) (2022-05-18T09:17:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。