論文の概要: Choosing the Right Language Mode at Inference Time for Multilingual Reliability
- arxiv url: http://arxiv.org/abs/2609.04653v1
- Date: Fri, 04 Sep 2026 02:36:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.895221
- Title: Choosing the Right Language Mode at Inference Time for Multilingual Reliability
- Title(参考訳): 多言語信頼性のための推論時間における正しい言語モードの選択
- Abstract要約: 大規模な言語モデルは、低級から中級の言語では推論に苦慮することが多い。
以前の研究によると、翻訳は、より強い英語中心の表現へのアクセスを支援することで、多言語推論を改善することができる。
これは、多言語の大言語モデルが確実に推論するためにどのくらいの翻訳が必要かという、中心的な疑問を提起する。
- 参考スコア(独自算出の注目度): 3.6095388702618405
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multilingual large language models often struggle to reason in low- to mid-resource languages. Prior work has shown that translation can improve multilingual reasoning by helping models access stronger English-centric representations. This raises a central question: How much translation is needed for multilingual large language models to reason reliably, and when does more translation instead trigger interference and overconfidence? Using LLaMA and Qwen models, we run extensive experiments varying text scope and language mode (target-only, English-only, bilingual) to evaluate both accuracy and reliability. Our results reveal a clear trade-off: English context often improve understanding and recover errors caused by non-English comprehension, yet adding redundant bilingual context intensifies interference. We address this trade-off with Reliability-Aware Adaptive Inference (RAAI), a training-free test-time framework that (i) performs Expected Calibration Error (ECE)-aware routing and prompt fusion, and (ii) uses a mid-layer Risk Index (RI) to gate sequential reasoning, allocating compute only when it is likely to help and suppressing harmful bilingual redundancy. Across two model families, RAAI enhances accuracy by 25-37.7% on low-resource languages and lowers calibration error by approximately 3-6%, with the most pronounced benefits in the lowest-resource language tiers.
- Abstract(参考訳): マルチリンガルな大言語モデルは、低級から中級の言語では推論に苦慮することが多い。
以前の研究によると、翻訳は、より強い英語中心の表現へのアクセスを支援することで、多言語推論を改善することができる。
これは中心的な疑問を提起する。多言語の大言語モデルに対して、どの程度の翻訳が必要か、いつより多くの翻訳が干渉や過信を引き起こすのか?
LLaMAとQwenモデルを用いて、テキストスコープと言語モード(ターゲットのみ、英語のみ、バイリンガル)の多種多様な実験を行い、精度と信頼性を評価した。
英語の文脈は、非英語の理解による誤りの理解と回復を改善するが、冗長なバイリンガルコンテキストを追加すると干渉が増大する。
トレーニング不要なテストタイムフレームワークであるRAAI(Reliability-Aware Adaptive Inference)とのトレードオフに対処する。
(i)期待校正誤差(ECE)対応ルーティングと即時融合を行い、
(ii) 中間層リスク指標(RI)を用いて逐次推論をゲートし、それが助けになりそうなときにのみ計算を割り当て、有害なバイリンガル冗長性を抑える。
2つのモデルファミリで、RAAIは低リソース言語の精度を25-37.7%向上し、キャリブレーションエラーを約3-6%低減する。
関連論文リスト
- Building Multilingual Bridges: Data Mixing as the Pillar of Generalization for In-Language Reasoning [75.46846056993418]
推論言語モデルは、それらが引き起こされる言語に関係なく、主に英語で理にかなっている。
これは、英語を話さないユーザにとってアクセス不能であり、元の質問の意図を失うリスクがあり、ターゲット言語でより容易に表現される知識を忘れてしまう。
本研究では,L2推論を推進し,ユーザのプロンプトの言語でモデルが一貫した推論を行えるようにし,プロンプトと応答の間に言語内ブリッジを構築する。
論文 参考訳(メタデータ) (2026-09-09T16:56:25Z) - M-GATE: Multilingual Grammar, Accuracy in Translation, and Efficiency Benchmark for Large Language Models [0.0]
M-GATE(英語: M-GATE)は、30言語にまたがる言語能力のベンチマークである。
80以上の構成で50以上のモデルを評価しました。
論文 参考訳(メタデータ) (2026-08-04T15:16:05Z) - Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs [51.56484100374058]
大規模言語モデル(LLM)は目覚ましい多言語流布を示すが、その内部知識表現はハイリソース言語に対して不均等に偏っている。
我々は,これらのバイアスを推論時に緩和できるかどうかを考察し,対象言語でクエリされたかのように,英語の確率モデルに答えるように強制する。
Gemma 3 12Bの実験では、最も強い全体的な介入、効率性のバランス、安全性、ドメイン外の一般化を促すペルソナが明らかにされている。
論文 参考訳(メタデータ) (2026-07-21T16:15:05Z) - Learning When to Translate for Multilingual Reasoning [20.51941069559769]
推論言語モデル (RLM) は複雑な推論タスクにおいて高い性能を発揮するが、それでもかなりの多言語推論のギャップがある。
英語翻訳は、RLMがより確実に解釈できる形で非英語入力を表現することによって、これらの失敗を軽減することができる。
本稿では,言語理解境界を意識した強化学習フレームワークLuarを提案する。
論文 参考訳(メタデータ) (2026-06-01T16:37:18Z) - Crosslingual On-Policy Self-Distillation for Multilingual Reasoning [48.68444770923683]
Crosslingual On-Policy Self-Distillation (COPSD)は、モデル自身の高リソース推論動作を低リソース言語に転送する。
17の低リソースアフリカ言語に対する実験では、COPSDはモデルサイズ全体の低リソース数学的推論を一貫して改善している。
論文 参考訳(メタデータ) (2026-05-10T14:06:09Z) - Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning [71.4175109189942]
Pivot-Aligned Self-Feedback Multilingual Reasoning (PASMR)を提案する。
このアプローチは、モデルの第一言語をピボット言語として指定する。
外部の正しい回答や報酬モデルに頼ることなく、言語横断的な自己フィードバック機構を確立する。
論文 参考訳(メタデータ) (2026-01-25T03:20:00Z) - Investigating the Multilingual Calibration Effects of Language Model Instruction-Tuning [58.355275813623685]
本研究は,多言語設定における大規模言語モデル(LLM)の校正における重要なギャップについて考察する。
低リソース言語であっても、高リソース言語SFTデータセットのインストラクションチューニング後にモデルの信頼性が著しく向上する可能性がある。
しかし、精度の改善は限界的あるいは存在しないものであり、多言語言語における標準SFTの重大な欠点を浮き彫りにしている。
論文 参考訳(メタデータ) (2026-01-04T04:29:12Z) - Think Natively: Unlocking Multilingual Reasoning with Consistency-Enhanced Reinforcement Learning [85.7304930030649]
本稿では,言語一貫性報酬と言語間思考アライメント報酬によって訓練されたM-Thinkerを提案する。
M-Thinkerは2つのマルチ言語ベンチマークで100%近い言語一貫性と優れたパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-10-08T17:55:02Z) - Cross-lingual Collapse: How Language-Centric Foundation Models Shape Reasoning in Large Language Models [44.94287386776289]
textbfCross-lingual Collapseは、多言語言語モデルが支配的な事前学習言語に回帰する体系的なドリフトである。
実験の結果, (i)GRPOは事前学習言語の不均衡を急速に増幅し, わずか数百回の更新で低リソース言語が侵食され, (ii) 言語整合性報酬はこのドリフトを緩和するが, ほぼ5~10ppの精度の低下を犠牲にしていることがわかった。
論文 参考訳(メタデータ) (2025-06-06T08:08:48Z) - Paths Not Taken: Understanding and Mending the Multilingual Factual Recall Pipeline [36.2731426595852]
その結果,多言語大言語モデル (LLM) は,他の言語に比べて,実際のリコールタスクにおいて有意に優れた性能を示すことがわかった。
事実的リコールのための信頼性の高い英語中心のメカニズムの関与が不十分なことと、ターゲット言語への英語からの誤った翻訳である。
我々の介入によって、最低パフォーマンス言語では、リコール精度が35%以上向上しました。
論文 参考訳(メタデータ) (2025-05-26T22:20:45Z) - A Comparative Study of Translation Bias and Accuracy in Multilingual Large Language Models for Cross-Language Claim Verification [1.566834021297545]
本研究は,言語間クレーム検証における翻訳バイアスと大規模言語モデルの有効性を体系的に評価する。
本稿では,事前翻訳と自己翻訳の2つの異なる翻訳手法について検討する。
その結果,低リソース言語では表現不足による直接推論の精度が著しく低いことが明らかとなった。
論文 参考訳(メタデータ) (2024-10-14T09:02:42Z) - The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights [108.40766216456413]
大規模言語モデルの英語と非英語のパフォーマンスのギャップを埋めるための質問アライメントフレームワークを提案する。
実験結果から、さまざまな推論シナリオ、モデルファミリー、サイズにわたって、多言語のパフォーマンスを向上できることが示された。
我々は、表現空間、生成された応答とデータスケールを分析し、質問翻訳訓練がLLM内の言語アライメントをどのように強化するかを明らかにする。
論文 参考訳(メタデータ) (2024-05-02T14:49:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。