論文の概要: ChemCLIR-Bench: Benchmarking Cross-Lingual Information Retrieval in Multilingual Chemical Patents
- arxiv url: http://arxiv.org/abs/2609.23231v1
- Date: Sat, 19 Sep 2026 22:18:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.731564
- Title: ChemCLIR-Bench: Benchmarking Cross-Lingual Information Retrieval in Multilingual Chemical Patents
- Title(参考訳): ChemCLIR-Bench:多言語化学特許における言語間情報検索のベンチマーク
- Abstract要約: 多国籍産業では、言語間情報検索がますます重要になっている。
特許データを中心に化学分野のCLIRをベンチマークする。
言語間検索のための8つの最先端埋め込みモデルを評価する。
- 参考スコア(独自算出の注目度): 0.5025737475817937
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Cross-lingual information retrieval (CLIR) is increasingly important in multi-national industries, where critical technical evidence may exist in a different language than the query. However, existing benchmarks do not adequately capture domain-specific cross-lingual retrieval or the retrieval-depth and recoverability failures that aggregate recall hides. In this work, we benchmark CLIR in the chemical domain, with a focus on patent data. We construct a multilingual dataset from Google Patents and the European Patent Office (EPO) data, spanning five languages (covering major Eastern and Western languages) and reflecting the diversity and complexity of real-world industrial documentation. Using this dataset, we systematically evaluate eight state-of-the-art embedding models for cross-lingual retrieval. Our results show a substantial performance gap between monolingual and cross-lingual settings: for the best-performing model, Recall@10 drops from 0.72 to 0.53 in cross-lingual setting. Retrieval depth also degrades significantly, with relevant documents ranked lower across languages in cross-lingual scenarios. Furthermore, some multilingual embedding models that perform strongly in monolingual settings exhibit sharp declines when queries and documents are in different languages, providing practical insights for model selection in cross-lingual use cases. These findings highlight critical limitations of current approaches and emphasize the need for more robust cross-lingual retrieval methods in domain-specific settings. Our benchmark provides actionable insights for model selection and establishes a controlled diagnostic evaluation framework for CLIR over industrial technical text. Data and code are publicly available at https://github.com/MohammadKhodadad/Multi-Lingual-QAC.
- Abstract(参考訳): 言語間情報検索(CLIR)は、クエリとは異なる言語に重要な技術的証拠が存在する多国籍産業においてますます重要になっている。
しかし、既存のベンチマークでは、ドメイン固有の言語間検索や、リコールの隠蔽を集約する検索深度やリカバリ可能性の障害を適切に捉えていない。
本研究では,ケミカル領域におけるCLIRのベンチマークを行い,特許データに着目した。
Google Patentsと欧州特許庁(EPO)のデータから多言語データセットを構築し、5つの言語(主要な東西言語を含む)にまたがり、現実世界の産業文書の多様性と複雑さを反映しています。
このデータセットを用いて,言語間検索のための8つの最先端埋め込みモデルを体系的に評価する。
ベストパフォーマンスモデルでは、Recall@10は言語間設定で0.72から0.53に低下します。
検索の深さも大幅に低下し、関連する文書は言語横断のシナリオで言語全体でランクが下がった。
さらに, 単一言語設定で強く機能する多言語埋め込みモデルでは, クエリやドキュメントが言語によって異なる場合, 顕著な低下が見られ, 言語横断のユースケースにおけるモデル選択の実践的洞察を提供する。
これらの知見は、現在のアプローチの限界を浮き彫りにして、ドメイン固有の設定においてより堅牢な言語間検索手法の必要性を強調している。
本ベンチマークでは, モデル選択のための実用的な知見を提供し, 産業技術テキスト上でのCLIRの制御診断評価フレームワークを確立する。
データとコードはhttps://github.com/MohammadKhodadad/Multi-Lingual-QACで公開されている。
関連論文リスト
- Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study [15.5103844307963]
大規模言語モデル(LLM)は、生成したテキストの自動評価にますます利用されている。
本研究は多言語LLMs-as-a-judgeを開発するためのいくつかの戦略を探求する。
論文 参考訳(メタデータ) (2026-05-27T16:33:58Z) - Improving Semantic Proximity in Information Retrieval through Cross-Lingual Alignment [26.443216883777882]
言語横断情報検索 (CLIR) が重要な研究分野として浮上している。
ほとんどの多言語検索者は、クエリと同じ言語で書かれた関連文書よりも、無関係の英語文書を優先する傾向にある。
本稿では,言語間アライメント向上を目的とした新たなトレーニング戦略を提案する。
論文 参考訳(メタデータ) (2026-04-07T10:35:52Z) - VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding [49.07705729597171]
VisR-Benchは、長い文書における質問駆動型マルチモーダル検索のベンチマークである。
ベンチマークは、1.2Kドキュメントで35K以上の高品質なQAペアで構成されています。
テキストベースの手法,マルチモーダルエンコーダ,MLLMなど,さまざまな検索モデルを評価する。
論文 参考訳(メタデータ) (2025-08-10T21:44:43Z) - Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models [62.91524967852552]
大規模言語モデル(LLM)は、多言語コーパスの事前訓練のため、一般的に多言語である。
しかし、これらのモデルは言語間の対応する概念、すなわち言語を横断的に関連付けることができるだろうか?
本研究は,言語横断的タスクにおける最先端LLMの評価である。
論文 参考訳(メタデータ) (2024-06-23T15:15:17Z) - Soft Prompt Decoding for Multilingual Dense Retrieval [30.766917713997355]
本稿では,MLIRタスクへの言語間情報検索のための最先端手法の適用により,準最適性能が得られることを示す。
これは多言語コレクションの不均一性と不均衡性に起因する。
KD-SPDはMLIRの新しいソフトプロンプトデコーディング手法で、異なる言語における文書の表現を同じ埋め込み空間に暗黙的に「翻訳」する。
論文 参考訳(メタデータ) (2023-05-15T21:17:17Z) - On Cross-Lingual Retrieval with Multilingual Text Encoders [51.60862829942932]
言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性について検討する。
教師なしのアドホック文と文書レベルのCLIR実験でそれらの性能をベンチマークする。
我々は、ゼロショット言語とドメイン転送CLIR実験のシリーズにおける英語関連データに基づいて、教師付き方式で微調整された多言語エンコーダの評価を行った。
論文 参考訳(メタデータ) (2021-12-21T08:10:27Z) - XL-WiC: A Multilingual Benchmark for Evaluating Semantic
Contextualization [98.61159823343036]
単語の意味を正確にモデル化する能力を評価するために,Word-in-Context データセット (WiC) を提案する。
我々は、XL-WiCという大規模なマルチ言語ベンチマークを提案し、12の新しい言語でゴールドスタンダードを特徴付けました。
実験結果から、ターゲット言語にタグ付けされたインスタンスが存在しない場合でも、英語データのみにトレーニングされたモデルは、競争力のあるパフォーマンスが得られることが示された。
論文 参考訳(メタデータ) (2020-10-13T15:32:00Z) - XTREME: A Massively Multilingual Multi-task Benchmark for Evaluating
Cross-lingual Generalization [128.37244072182506]
言語間TRansfer Evaluation of Multilinguals XTREMEは、40言語および9タスクにわたる多言語表現の言語間一般化能力を評価するためのベンチマークである。
我々は、英語でテストされたモデルは、多くのタスクにおいて人間のパフォーマンスに達するが、言語間変換されたモデルの性能にはまだ大きなギャップがあることを示した。
論文 参考訳(メタデータ) (2020-03-24T19:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。