論文の概要: LAMAR: An Open Language-Aware Multilingual Alignment Reranker
- arxiv url: http://arxiv.org/abs/2607.22042v2
- Date: Tue, 28 Jul 2026 16:54:28 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 14:13:57.663927
- Title: LAMAR: An Open Language-Aware Multilingual Alignment Reranker
- Title(参考訳): LAMAR: オープン言語対応多言語アライメントリランカ
- Abstract要約: マルチランガル・リランカはクエリと同じ言語で書かれた文書を常に優先しないことを示す。
意味的関連性と言語コヒーレンスの両方を考慮するために訓練された多言語クロスエンコーダであるLAMARをリリースする。
- 参考スコア(独自算出の注目度): 24.064060212702838
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In multilingual retrieval augmented generation pipelines, an embedding model can retrieve relevant documents written in multiple languages, which are subsequently reranked before answer generation. However, it remains unclear whether existing multilingual rerankers consider document language when ordering semantically relevant candidates. Our analysis shows that these rerankers do not consistently prioritize documents written in the same language as the query when semantically equivalent documents are available across languages, even though document language can affect answer generation. We release LAMAR, a language aware multilingual cross encoder trained to account for both semantic relevance and language coherence. LAMAR first uses English anchored relevance distillation to establish consistent relevance scoring across multilingual inputs and then applies preference alignment for language coherence to encourage documents written in the same language as the query to receive higher rankings while retaining semantic relevance. In a controlled experiment designed to assess language coherence, LAMAR achieves the best performance overall and across all languages examined individually. LAMAR also remains competitive on established multilingual reranking benchmarks. In practical retrieval settings, LAMAR achieves the best results across all reported metrics when reranking candidates retrieved in the first stage. These results demonstrate that LAMAR accounts for language coherence while achieving strong performance on general multilingual reranking benchmarks.
- Abstract(参考訳): 多言語検索拡張生成パイプラインでは、埋め込みモデルは複数の言語で記述された関連文書を検索でき、その後、回答生成の前に再帰される。
しかし、既存の多言語リランカが意味論的に関連する候補を注文する際に文書言語を考慮しているかは不明である。
分析の結果,文書言語が応答生成に影響を与えても,意味論的に等価な文書が言語間で利用できる場合,これらのリランカは問合せと同じ言語で書かれた文書を常に優先しないことがわかった。
意味的関連性と言語コヒーレンスの両方を考慮するために訓練された多言語クロスエンコーダであるLAMARをリリースする。
LAMARはまず英語のアンカー・レバレンス蒸留を用いて、多言語入力にまたがる一貫した関連性のスコアを確立し、次いで言語コヒーレンスに優先的なアライメントを適用して、クエリと同じ言語で書かれた文書に、セマンティック・レバレンスを保持しながら、より高いランク付けを受けるよう促す。
言語コヒーレンスを評価するために設計された制御実験において、LAMARは、個別に検討された全ての言語で、全体として最高のパフォーマンスを達成する。
LAMARは、確立されたマルチリンガルなベンチマークでも競争力を維持している。
実際の検索設定では、LAMARは、第1段階で検索された候補を再ランク付けする際に、報告されたすべての指標で最高の結果を得る。
これらの結果から,LAMARは言語コヒーレンスに寄与するが,多言語ベンチマークでは高い性能が得られた。
関連論文リスト
- SHIFT: Semantic Harmonization via Index-side Feature Transformation for Multilingual Information Retrieval [26.186599286240362]
MLIR(Multilingual Information Retrieval)は,グローバル情報アクセスにおいて重要な技術である。
最近の多言語密集検索モデルは、クエリと同じ言語で文書を強く好んでいることが多い。
そこで本研究では,インデクシング段階に適用可能なトレーニングフリー手法ShiFTを提案する。
論文 参考訳(メタデータ) (2026-06-17T08:14:51Z) - MLAIRE: Multilingual Language-Aware Information Retrieval Evaluation Protocal [26.186599286240362]
MLAIREは多言語対応情報検索評価プロトコルである。
クエリ言語嗜好から言語間セマンティック検索を分離する。
標準メトリクスが明らかに異なる振る舞いを示す。
論文 参考訳(メタデータ) (2026-05-08T05:10:05Z) - The Cross-Lingual Cost: Retrieval Biases in RAG over Arabic-English Corpora [5.0908395672023055]
言語間検索強化生成(RAG)は、言語間で回答を検索し、生成する重要な能力である。
我々は、実世界の企業データセットから得られたベンチマークを用いて、アラビア語のRAGをドメイン固有の設定で研究する。
両言語から等価な検索を強制したり、クエリを翻訳することで、この失敗の原因に対処する2つの簡単な検索戦略を提案する。
論文 参考訳(メタデータ) (2025-07-10T08:38:31Z) - mFollowIR: a Multilingual Benchmark for Instruction Following in Retrieval [61.17793165194077]
本稿では,検索モデルにおける命令追従能力のベンチマークであるmFollowIRを紹介する。
本稿では,多言語 (XX-XX) と多言語 (En-XX) のパフォーマンスについて述べる。
英語をベースとした学習者による多言語間性能は高いが,多言語設定では顕著な性能低下がみられた。
論文 参考訳(メタデータ) (2025-01-31T16:24:46Z) - Language Fairness in Multilingual Information Retrieval [9.358582006140903]
本研究は,異なる言語にまたがる文書が適切にランク付けされているかどうかを評価するための言語公正度尺度を提案する。
群フェアネスにおける多くの先行研究とは対照的に、いかなる言語も保護されていない群とはみなさない。
提案手法であるPEERは,MLIRシステムの言語フェアネスを捉えるために特別に設計された最初のフェアネス尺度である。
論文 参考訳(メタデータ) (2024-05-02T03:30:15Z) - Modeling Sequential Sentence Relation to Improve Cross-lingual Dense Retrieval [80.43859162884353]
マスク付き文モデル(MSM)と呼ばれる多言語多言語言語モデルを提案する。
MSMは、文表現を生成する文エンコーダと、文書から文ベクトルのシーケンスに適用される文書エンコーダとから構成される。
モデルをトレーニングするために,サンプル負の階層的コントラスト損失によって文ベクトルをマスクし,予測するマスク付き文予測タスクを提案する。
論文 参考訳(メタデータ) (2023-02-03T09:54:27Z) - Advancing Multilingual Pre-training: TRIP Triangular Document-level
Pre-training for Multilingual Language Models [107.83158521848372]
我々は,従来のモノリンガルおよびバイリンガルの目的を,グラフト法と呼ばれる新しい手法で三言語的目的に加速する分野において,最初のテキストbfTriangular Document-level textbfPre-training(textbfTRIP)を提案する。
TRIPは、3つの多言語文書レベルの機械翻訳ベンチマークと1つの言語間抽象的な要約ベンチマークで、最大3.11d-BLEU点と8.9ROUGE-L点の一貫性のある改善を含む、強力なSOTAスコアを達成している。
論文 参考訳(メタデータ) (2022-12-15T12:14:25Z) - On Cross-Lingual Retrieval with Multilingual Text Encoders [51.60862829942932]
言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性について検討する。
教師なしのアドホック文と文書レベルのCLIR実験でそれらの性能をベンチマークする。
我々は、ゼロショット言語とドメイン転送CLIR実験のシリーズにおける英語関連データに基づいて、教師付き方式で微調整された多言語エンコーダの評価を行った。
論文 参考訳(メタデータ) (2021-12-21T08:10:27Z) - FILTER: An Enhanced Fusion Method for Cross-lingual Language
Understanding [85.29270319872597]
我々は,XLMファインタニングの入力として言語間データを利用する拡張融合法を提案する。
推論中は、ターゲット言語で入力されたテキストとソース言語の翻訳に基づいて予測を行う。
この問題に対処するため,対象言語における翻訳テキストのための自動生成ソフト擬似ラベルに基づくモデル学習のためのKL分割自己学習損失を提案する。
論文 参考訳(メタデータ) (2020-09-10T22:42:15Z) - XTREME: A Massively Multilingual Multi-task Benchmark for Evaluating
Cross-lingual Generalization [128.37244072182506]
言語間TRansfer Evaluation of Multilinguals XTREMEは、40言語および9タスクにわたる多言語表現の言語間一般化能力を評価するためのベンチマークである。
我々は、英語でテストされたモデルは、多くのタスクにおいて人間のパフォーマンスに達するが、言語間変換されたモデルの性能にはまだ大きなギャップがあることを示した。
論文 参考訳(メタデータ) (2020-03-24T19:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。