論文の概要: Claim2Source at CheckThat! 2026: Improving Multilingual Scientific Claim-Source Retrieval with Verification-based Re-Ranking
- arxiv url: http://arxiv.org/abs/2607.04043v1
- Date: Sat, 04 Jul 2026 22:07:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.804985
- Title: Claim2Source at CheckThat! 2026: Improving Multilingual Scientific Claim-Source Retrieval with Verification-based Re-Ranking
- Title(参考訳): Claim2Source at CheckThat! 2026: Verification-based Re-Rankingによる多言語科学的クレームソース検索の改善
- Authors: Tobias Schreieder, Harsh Khandelwal, Yu-Ling Zhong, Michael Färber,
- Abstract要約: 本稿では,多言語科学的クレームソース検索のための多段階検索フレームワークを提案する。
このフレームワークは、バイリンガルクレーム表現、メタデータ強化されたソース表現、および高密度検索モデルの言語固有の適応を用いている。
われわれのアプローチでは、英語、ドイツ語、フランス語のクレームの平均MRR@5スコアが0.7628に達し、2026年のCheckThat!
- 参考スコア(独自算出の注目度): 17.04255262988263
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multilingual scientific claim-source retrieval aims to identify the scientific publication supporting a claim shared on social media. This task is challenging because claims often differ from source publications in terms of language, wording, and level of detail, which weakens the connection between claims and their underlying evidence. In this paper, we present our approach for the CheckThat! 2026 Lab Task 1: Source Retrieval for Scientific Web Claims. We propose a multi-stage retrieval framework for multilingual scientific claim-source retrieval that combines structured claim and source representations with progressive candidate refinement. To address multilingual retrieval challenges, the framework employs bilingual claim representations, metadata-enhanced source representations, and language-specific adaptation of dense retrieval models. Building on this setup, a first-stage retriever generates an initial pool of candidate sources, after which similarity-based re-ranking improves the ranking of highly relevant sources and verification-based re-ranking identifies the candidate source that best supports the claim using verification signals. Our approach achieves an average MRR@5 score of 0.7628 across English, German, and French claims, ranking first on the CheckThat! 2026 leaderboard.
- Abstract(参考訳): 多言語科学的クレームソース検索は、ソーシャルメディア上で共有されたクレームをサポートする科学出版物を特定することを目的としている。
この課題は、クレームとクレームの関連性を弱める言語、言葉、詳細の観点から、しばしばソースパブリッシングと異なるため、困難である。
本稿では,CheckThatに対する我々のアプローチについて述べる。
2026 Lab Task 1: Source Retrieval for Scientific Web Claims
構造化されたクレームとソース表現とプログレッシブな候補修正を組み合わせた多言語科学的クレームソース検索のための多段階検索フレームワークを提案する。
多言語検索の課題に対処するため、このフレームワークはバイリンガルクレーム表現、メタデータ強化されたソース表現、および高密度検索モデルの言語固有の適応を用いている。
この設定に基づいて、第1段階検索器は、候補ソースの初期プールを生成し、その後、類似性に基づく再ランクは、関連性の高いソースのランキングを改善し、検証ベースの再ランクは、検証信号を用いたクレームを最も支持する候補ソースを特定する。
私たちのアプローチでは、英語、ドイツ語、フランス語のクレームで平均0.7628のMRR@5スコアを達成し、CheckThatにランクインしました!
2026年、リーダー。
関連論文リスト
- Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus [35.39357302837359]
XBCP (Cross-lingual BrowseComp-Plus) は、BrowseComp-Plusの英語の問合せ空間を保存するが、支援文書の言語は異なる制御されたベンチマークである。
XBCPは2つの補完的な設定をインスタンス化します。
我々は,スパースと高密度多言語検索を用いて,回答精度,エビデンスリコール,探索行動,キャリブレーション,引用忠実度,オラクル検索の4つのディープリサーチエージェントを評価した。
論文 参考訳(メタデータ) (2026-06-13T15:11:52Z) - The Multilingual Curse at the Retrieval Layer: Evidence from Amharic [49.25758237235551]
マルチリンガルベンチマークの強いゼロショットスコアは、現在のエンコーダが多くの言語で確実に転送される証拠としてしばしば考えられている。
この仮定は、表現が不十分で形態学的にリッチな言語に当てはまると我々は主張する。
我々は,ゼロショット多言語レトリバー,アンハリック細調整多言語レトリバー,単言語多言語レトリバーを比較した。
論文 参考訳(メタデータ) (2026-05-23T12:44:30Z) - MeVer at CheckThat! 2026: Cluster-Aware Hard-Negative Mining for Multilingual Scientific-Source Retrieval [11.097006771680896]
2026 タスク 1 では,多言語科学的ソース検索について提案する。
本稿では,検索した候補プールのセマンティック構造を利用したクラスタ認識型ハードネガティブマイニング手法を提案する。
実験により, 異なるハード負構造が異なる検索行動を引き起こすことが示された。
論文 参考訳(メタデータ) (2026-05-22T21:24:14Z) - Retrieval or Representation? Reassessing Benchmark Gaps in Multilingual and Visually Rich RAG [1.4425299138308667]
BM25の文書は、コーパスレベルの重み付けと重なり合う。
大規模なクエリドキュメントデータセットでトレーニングされたエンドツーエンドのマルチモーダルレトリバーは、これらのアプローチよりも大幅に改善されている。
より優れたドキュメント表現がベンチマーク改善の原動力であることを実証する。
論文 参考訳(メタデータ) (2026-03-04T16:21:20Z) - NeuCLIRTech: Chinese Monolingual and Cross-Language Information Retrieval Evaluation in a Challenging Domain [49.3943974580576]
本稿では,技術情報に対するクロスランゲージ検索のための評価収集であるNeuCLIRTechについて述べる。
このコレクションは中国語で書かれた技術文書と、その機械が英語に翻訳されたもので構成されている。
このコレクションは中国語での単言語検索と、クエリ言語としての英語による言語横断検索という2つの検索シナリオをサポートしている。
論文 参考訳(メタデータ) (2026-02-05T05:57:55Z) - Investigating Language and Retrieval Bias in Multilingual Previously Fact-Checked Claim Detection [4.6738956348193]
大きな言語モデル(LLM)は言語間ファクトチェックに強力な機能を提供する。
LLMは、しばしば言語バイアスを示し、英語のような高リソース言語で不公平に優れた性能を発揮する。
我々は,情報検索システムが他者よりも特定の情報を好む傾向にある場合,検索バイアスという新しい概念を提示し,検証する。
論文 参考訳(メタデータ) (2025-09-29T17:50:32Z) - Query Expansion Using Contextual Clue Sampling with Language Models [69.51976926838232]
本稿では,実効的なフィルタリング戦略と検索した文書の融合の組み合わせを,各文脈の生成確率に基づいて提案する。
我々の語彙マッチングに基づくアプローチは、よく確立された高密度検索モデルDPRと比較して、同様のトップ5/トップ20検索精度と上位100検索精度を実現する。
エンド・ツー・エンドのQAでは、読者モデルも我々の手法の恩恵を受けており、いくつかの競争基準に対してエクサクト・マッチのスコアが最も高い。
論文 参考訳(メタデータ) (2022-10-13T15:18:04Z) - CONCRETE: Improving Cross-lingual Fact-checking with Cross-lingual
Retrieval [73.48591773882052]
ほとんどのファクトチェックアプローチは、他の言語におけるデータ不足の問題にのみ英語に焦点を当てている。
クロスリンガル検索を付加した最初のファクトチェックフレームワークを提案する。
提案したクロスリンガル逆クローズタスク(XICT)を用いてレトリバーを訓練する。
論文 参考訳(メタデータ) (2022-09-05T17:36:14Z) - On Cross-Lingual Retrieval with Multilingual Text Encoders [51.60862829942932]
言語間文書・文検索タスクにおける最先端多言語エンコーダの適合性について検討する。
教師なしのアドホック文と文書レベルのCLIR実験でそれらの性能をベンチマークする。
我々は、ゼロショット言語とドメイン転送CLIR実験のシリーズにおける英語関連データに基づいて、教師付き方式で微調整された多言語エンコーダの評価を行った。
論文 参考訳(メタデータ) (2021-12-21T08:10:27Z) - Mr. TyDi: A Multi-lingual Benchmark for Dense Retrieval [51.004601358498135]
Mr. TyDiは、11の類型的多様言語における単言語検索のためのベンチマークデータセットである。
このリソースの目的は、非英語言語における高密度検索技術の研究を促進することである。
論文 参考訳(メタデータ) (2021-08-19T16:53:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。