論文の概要: XHotpotQA: A Benchmark for Cross-Lingual Knowledge Composition in Multi-Hop Question Answering
- arxiv url: http://arxiv.org/abs/2608.27481v1
- Date: Sun, 23 Aug 2026 15:05:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.077538
- Title: XHotpotQA: A Benchmark for Cross-Lingual Knowledge Composition in Multi-Hop Question Answering
- Title(参考訳): XHotpotQA:マルチホップ質問回答における言語間知識構成のベンチマーク
- Abstract要約: XHotpotQA(XHotpotQA)は、言語間知識合成のベンチマークである。
監査されたリソースには15,661のトレーニングと7,405のバリデーションインスタンスが含まれている。
完全な質問-証拠のミスマッチは、部分的なアライメントよりも10.25から15.79低いUnicode対応の回答F1と関連付けられている。
- 参考スコア(独自算出の注目度): 4.102826164335728
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Knowledge-intensive multi-hop question answering requires systems to select evidence and compose dependent facts, yet multilingual benchmarks usually translate an entire example into one language. This hides failures at language boundaries inside the reasoning chain. We introduce XHotpotQA, a controlled benchmark for cross-lingual knowledge composition over mixed-language evidence. Each instance is modeled as an evidence-dependency graph whose question, bridge evidence, answer-bearing evidence, and distractors have explicit language assignments. The audited resource contains 15,661 training and 7,405 validation instances, with sentence-level support supervision and supplied distractors. In validation, 99.81% of items cross the question-to-gold-evidence language interface and 95.60% use gold paragraphs in different languages. Across three reader artifacts, full question-evidence mismatch is associated with 10.25 to 15.79 lower Unicode-aware answer F1 than partial alignment, and different-script evidence with deficits of 11.98 to 23.70 points; the corresponding adapted-selector contrasts are 1.71 and 1.78 points. Under this supplied-candidate design, the evaluated readers therefore show substantially larger condition-associated deficits than the selector. XHotpotQA provides role-aware diagnostics, modular evaluation, and an audited test bed for knowledge-based systems that must integrate evidence across languages.
- Abstract(参考訳): 知識集約型多言語質問応答では、エビデンスを選択し、依存する事実を構成するシステムが必要であるが、多言語ベンチマークは通常、全例を一つの言語に変換する。
これにより、推論チェーン内の言語境界に障害を隠蔽する。
XHotpotQAは多言語間知識合成のための制御されたベンチマークである。
それぞれのインスタンスはエビデンス依存グラフとしてモデル化され、質問、ブリッジエビデンス、回答可能なエビデンス、およびイントラクタが明示的な言語代入を持つ。
監査されたリソースには15,661のトレーニングと7,405のバリデーションインスタンスが含まれており、文レベルのサポート監視とイントラクタの供給が可能である。
検証では、99.81%の項目が疑問と証拠の言語インターフェースを横断し、95.60%は異なる言語で金の段落を使用している。
3つの読者アーティファクト全体で、完全な質問-証拠のミスマッチは、部分的なアライメントよりも10.25から15.79低いUnicode対応の回答F1と、11.98から23.70ポイントの欠点を持つ異なるスクリプトのエビデンスに関連付けられ、対応する適応-セレクタのコントラストは1.71と1.78ポイントである。
この供給候補設計の下で、評価された読者は、セレクタよりも条件関連欠陥がかなり大きいことを示す。
XHotpotQAは、言語間でエビデンスを統合する必要がある知識ベースのシステムに対して、ロールアウェアな診断、モジュール評価、監査されたテストベッドを提供する。
関連論文リスト
- Better Decomposition, Free Aggregation: A Synthesizer-Folding Framework for Multilingual Multi-Hop Question Answering [48.94279718429342]
マルチリンガルなマルチホップ質問応答のためのフレームワークであるSyferを紹介する。
Syferは、デフォルトで適用するのではなく、翻訳をデフェクトする。
複数の言語で実験した結果、Syferは競争の正確さを達成できた。
論文 参考訳(メタデータ) (2026-08-13T12:25:59Z) - LitTraceQA: A Benchmark for Multi-Stage Grounding and Verification in Scientific Question Answering [30.616598264585203]
本稿では,学術論文に対する文献的回答のベンチマークであるLitTraceQAを紹介する。
研究質問と論文のメタデータプールが与えられた場合、システムは3つの接続された出力を返す必要がある。
我々は4,859枚のユニークなゴールド・ペーパーの4,978枚のユニーク・クエスト・レコードを用いて、より大規模な最終アノテーション・コレクションを解析した。
論文 参考訳(メタデータ) (2026-08-07T16:11:52Z) - Language-Routed RAG and Direct Option Scoring for Multilingual Financial QA: DS@GT at FinMMEval [0.0]
CFA、EFPA、CPAなどの金融認証試験は、ドメイン推論の構造化を要求する。
我々はLangGraph上に検索拡張パイプラインを構築し、クエリ言語を検出し、意味論的に関連する例を検索する。
効果的な多言語財務推論には、言語対応検索、モデルルーティング、故意の採点戦略選択が必要であることを示す。
論文 参考訳(メタデータ) (2026-07-24T18:31:11Z) - Overview of FinMMEval 2026 Task 1: Multilingual Financial Multiple-Choice Question Answering [59.67537254067838]
FinMMEval 2026 Task 1は、英語、中国語、アラビア語、ヒンディー語で、多言語による財務多目的質問の回答を評価する。
最終テストセットには800の質問と言語毎の200の質問が含まれており、各言語は正確さで独立してランク付けされている。
トップアキュラティはヒンディー語で92.0%から英語とアラビア語で97.5%までで、同じトップチームは4つの言語でトップに近づいた。
論文 参考訳(メタデータ) (2026-07-22T07:43:44Z) - Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus [35.39357302837359]
XBCP (Cross-lingual BrowseComp-Plus) は、BrowseComp-Plusの英語の問合せ空間を保存するが、支援文書の言語は異なる制御されたベンチマークである。
XBCPは2つの補完的な設定をインスタンス化します。
我々は,スパースと高密度多言語検索を用いて,回答精度,エビデンスリコール,探索行動,キャリブレーション,引用忠実度,オラクル検索の4つのディープリサーチエージェントを評価した。
論文 参考訳(メタデータ) (2026-06-13T15:11:52Z) - Self-Improving Multilingual Long Reasoning via Translation-Reasoning Integrated Training [50.177839592528294]
長い推論モデルは多言語設定でしばしば苦労する。
翻訳学習を多言語推論に統合する自己改善フレームワークであるTRIT(Translation-Reasoning Integrated Training)を提案する。
論文 参考訳(メタデータ) (2026-02-05T17:55:09Z) - Do Language Models Reason Across Languages? [19.660512783888016]
言語モデルは,ブリッジ情報を提供するものよりも,回答スパン文書の言語変化に敏感であることがわかった。
サブクエストによる多段階推論を導くための単純な3段階のSUBQプロンプト手法を提案する。
論文 参考訳(メタデータ) (2026-01-10T17:59:34Z) - Evaluating and Modeling Attribution for Cross-Lingual Question Answering [80.4807682093432]
この研究は、言語間質問応答の属性を初めて研究したものである。
我々は、5つの言語でデータを収集し、最先端の言語間QAシステムの属性レベルを評価する。
回答のかなりの部分は、検索されたどのパスにも帰属しないことがわかった。
論文 参考訳(メタデータ) (2023-05-23T17:57:46Z) - Learn to Explain: Multimodal Reasoning via Thought Chains for Science
Question Answering [124.16250115608604]
本稿では,SQA(Science Question Answering)について紹介する。SQA(Science Question Answering)は,21万のマルチモーダルな複数選択質問と多様な科学トピックと,それに対応する講義や説明による回答の注釈からなる新しいベンチマークである。
また,SQAでは,数ショットのGPT-3では1.20%,微調整のUnifiedQAでは3.99%の改善が見られた。
我々の分析は、人間に似た言語モデルは、より少ないデータから学習し、わずか40%のデータで同じパフォーマンスを達成するのに、説明の恩恵を受けることを示している。
論文 参考訳(メタデータ) (2022-09-20T07:04:24Z) - Delving Deeper into Cross-lingual Visual Question Answering [115.16614806717341]
標準学習装置に簡単な修正を加えることで、モノリンガル英語のパフォーマンスへの移行ギャップを大幅に減らすことができることを示す。
多言語マルチモーダル変換器の多言語間VQAを多言語間VQAで解析する。
論文 参考訳(メタデータ) (2022-02-15T18:22:18Z) - UPV at CheckThat! 2021: Mitigating Cultural Differences for Identifying
Multilingual Check-worthy Claims [6.167830237917659]
本稿では,意図しないバイアスを軽減するための補助課題として,言語識別タスクを提案する。
その結果,言語識別とチェックアワーなクレーム検出タスクを併用することで,選択した言語の性能向上が期待できることがわかった。
論文 参考訳(メタデータ) (2021-09-19T21:46:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。