論文の概要: Estimating Uncertainty from Reasoning: A Large-Scale Study of Multi- and Crosslingual MCQA Performance in LLMs
- arxiv url: http://arxiv.org/abs/2607.06327v1
- Date: Tue, 07 Jul 2026 14:25:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.551868
- Title: Estimating Uncertainty from Reasoning: A Large-Scale Study of Multi- and Crosslingual MCQA Performance in LLMs
- Title(参考訳): 推論の不確かさの推定:LLMにおける多言語・多言語MCQA性能の大規模評価
- Authors: Andrea Alfarano, Andrea Bacciu, Saab Mansour, Amin Mantrach, Marcello Federico,
- Abstract要約: 不確実性推定(UE)により、LLMシステムはいつ停止するかを認識できる。
本稿では,22言語を対象としたUE手法の大規模評価を行う。
- 参考スコア(独自算出の注目度): 15.831021059811045
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Uncertainty estimation (UE) enables LLM-powered systems to recognize when to abstain, yet existing research has predominantly focused on English. We present the first large-scale evaluation of UE methods across 22 languages, spanning high-, mid-, and low-resource settings. Using two human-curated Q\&A datasets, we compare open and closed box UE methods (nine in total) across different model sizes and architectures while eliciting long-form reasoning, avoiding LLM-as-a-judge and embedding-based scoring, which can introduce evaluation noise. We report three main actionable findings. First, we find that prompting models to reason in English while keeping questions in low-resource languages substantially improves UE performance, suggesting that comprehension of low-resource languages is largely intact, and that the reliability bottleneck lies in generation rather than understanding. Second, prompting models to reason in English closes the UE performance gap between low and high-resource languages, demonstrating that generation language matters more than the question language. Third, the choice of UE method should depend on model scale: at smaller scales, open-box probability-based methods outperform alternatives; at larger scales, closed-box self-verbalized uncertainty becomes superior. Finally, we provide an analysis of threshold selection for selective prediction, offering guidance on calibrating abstention in multilingual settings.
- Abstract(参考訳): 不確実性推定(UE)により、LLMを利用したシステムはいつ停止するかを認識できるが、既存の研究は主に英語に焦点を当てている。
本稿では,22言語にまたがるUE手法の大規模評価を行う。
人間の計算した2つのQ\&Aデータセットを用いて、異なるモデルサイズとアーキテクチャのオープンおよびクローズドボックスUE手法(合計9つ)を比較し、LLM-as-a-judgeや埋め込みベースのスコアリングを回避し、評価ノイズを導入する。
主な症例は3例である。
まず、低リソース言語における質問を抑えながら、モデルを英語で推論するよう促すことで、UEのパフォーマンスが大幅に向上し、低リソース言語の理解がほとんど無傷であること、信頼性のボトルネックは理解よりも世代にあることを示唆する。
第二に、モデルを英語で推論するよう促すことは、低リソース言語と高リソース言語のUEパフォーマンスギャップを埋め、世代言語が質問言語よりも重要であることを示す。
第3に、UE法の選択はモデルスケールに依存するべきであり、より小さなスケールでは、オープンボックス確率ベースの手法が代替よりも優れ、大規模では、クローズボックスの自己言語的不確実性の方が優れている。
最後に、選択予測のためのしきい値選択の分析を行い、多言語設定における禁忌の校正に関するガイダンスを提供する。
関連論文リスト
- Shared Doubt: Zero-shot Cross-Lingual Confidence Estimation for Language Models [14.815594636224747]
中間表現から直接解の正しさを予測する軽量線形プローブを用いる。
学習されたレイヤの重みと複数の改善により、信頼性機能は言語全体の中間層に集中していることが明らかになった。
ゼロショットの言語間性能はソース言語と類似性に依存するが、プローブはリトレーニングなしで強力なベースラインを提供する。
論文 参考訳(メタデータ) (2026-05-29T12:25:24Z) - Aligning Multilingual Reasoning with Verifiable Semantics from a High-Resource Expert Model [13.788758077632432]
本稿では,セマンティック検証リワードを用いたPivot-based Reinforcement Learningを紹介する。
このフレームワークは、ターゲット言語における人間の注釈付きデータの必要性を回避し、多言語推論を強化する。
提案手法は,英語と他言語のパフォーマンスギャップを著しく狭めることを示す。
論文 参考訳(メタデータ) (2025-09-29T22:03:11Z) - CM-Align: Consistency-based Multilingual Alignment for Large Language Models [84.19366314925593]
高品質な多言語嗜好データを構築するための一貫性に基づくデータ手法を提案する。
具体的には、一貫性のある英語参照選択と、言語間一貫性に基づく多言語嗜好データ構築の2つの部分を含む。
論文 参考訳(メタデータ) (2025-09-10T12:40:49Z) - Scaling Test-time Compute for Low-resource Languages: Multilingual Reasoning in LLMs [3.9530780161144667]
本稿では,大規模言語モデルが潜在空間で内部的に操作する多言語メカニズムについて検討する。
我々は、低リソース言語での入力を条件に、ターゲット言語で最終応答を出力しながら、英語でチェーン・オブ・ソート(CoT)を生成するモデルを訓練する。
我々の実験では、この手法は英語によるCoTトレーニングと呼ばれ、28.33%の改善で他のベースラインを上回っている。
論文 参考訳(メタデータ) (2025-04-02T16:58:36Z) - Assessing Agentic Large Language Models in Multilingual National Bias [31.67058518564021]
推論に基づくレコメンデーションにおける言語間の格差はほとんど未解明のままである。
この研究は、このギャップに最初に対処する。
複数の言語にわたる意思決定タスクに対する応答を解析することにより、最先端のLLMにおける多言語バイアスについて検討する。
論文 参考訳(メタデータ) (2025-02-25T08:07:42Z) - The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights [108.40766216456413]
大規模言語モデルの英語と非英語のパフォーマンスのギャップを埋めるための質問アライメントフレームワークを提案する。
実験結果から、さまざまな推論シナリオ、モデルファミリー、サイズにわたって、多言語のパフォーマンスを向上できることが示された。
我々は、表現空間、生成された応答とデータスケールを分析し、質問翻訳訓練がLLM内の言語アライメントをどのように強化するかを明らかにする。
論文 参考訳(メタデータ) (2024-05-02T14:49:50Z) - Analyzing and Adapting Large Language Models for Few-Shot Multilingual
NLU: Are We There Yet? [82.02076369811402]
教師付きファインチューニング(SFT)、教師付きインストラクションチューニング(SIT)、インコンテキストラーニング(ICL)は、3つの代替であり、事実上の標準的アプローチである。
提案手法は,6つの高・低リソース言語,3つの異なるNLUタスク,多種多様な言語とドメインのセットアップを用いて,3つのアプローチを網羅的かつ体系的に比較する。
そこで本研究では,教師あり指導のチューニングが,性能とリソース要件の最良のトレードオフであることを示す。
論文 参考訳(メタデータ) (2024-03-04T10:48:13Z) - From Good to Best: Two-Stage Training for Cross-lingual Machine Reading
Comprehension [51.953428342923885]
モデル性能を向上させるための2段階のアプローチを開発する。
我々は、トップk予測が正確な答えを含む確率を最大化するために、ハードラーニング(HL)アルゴリズムを設計する。
第2段階では, 正解と他の候補との微妙な違いを学習するために, 解答を意識したコントラスト学習機構が開発された。
論文 参考訳(メタデータ) (2021-12-09T07:31:15Z) - Boosting Cross-Lingual Transfer via Self-Learning with Uncertainty
Estimation [34.97086123805344]
最近の多言語事前訓練型言語モデルは、目覚ましいゼロショット性能を実現している。
対象言語のラベルのないデータをさらに活用する自己学習フレームワークを提案する。
我々は,NER(Nond Entity Recognition)とNLI(Natural Language Inference)の2つの言語間タスクについて,40言語を網羅した不確実性で評価した。
論文 参考訳(メタデータ) (2021-09-01T05:26:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。