論文の概要: Cross-lingual Calibration of Pre-Generation Success Probes for Multilingual LLM Routing
- arxiv url: http://arxiv.org/abs/2610.06216v1
- Date: Mon, 05 Oct 2026 12:26:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-09 17:45:10.406959
- Title: Cross-lingual Calibration of Pre-Generation Success Probes for Multilingual LLM Routing
- Title(参考訳): 多言語LPMルーティングのためのプレジェネレーション成功プローブの言語間校正
- Abstract要約: プレジェネレーション成功は、復号する前に言語モデルの隠れたアクティベーションから応答の正しさを推定する。
言語間の信頼性を3次元で検討する。
英語で訓練されたプローブは、言語間の識別に有用であるが、転送後に校正があまり行われない。
プールされた多言語監視は、両方の特性を改善し、より信頼性の高い成功推定をもたらす。
- 参考スコア(独自算出の注目度): 3.8439345751986913
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pre-generation success probes estimate response correctness from a language model's hidden activations before decoding, enabling cost-aware routing. While prior work has demonstrated their utility primarily on English inputs, we study their reliability across languages along three dimensions: (1) whether they preserve the ranking of likely successes and failures (DISCRIMINATION); (2) whether they retain probabilities that match observed success frequencies (CALIBRATION); and (3) whether they produce scores comparable enough across candidate models for cost-aware multilingual routing (UTILITY). Using 3,000 MATH problems in 10 languages and 8 open-weight model configurations, we compare cross-lingual transfer from English-trained probes and equal-budget pooled multilingual probes. English-trained probes retain useful cross-lingual discrimination but become less well calibrated after transfer. Pooled multilingual supervision improves both properties and yields more reliable estimates of success. In routing experiments, the pooled router achieves a 0.7% higher test success rate while reducing modeled cost by 13.0% relative to always selecting the model with the highest average success. These results show that multilingual routing requires success estimates that remain well calibrated and comparable across languages and models.
- Abstract(参考訳): プレジェネレーション成功は、デコード前に言語モデルの隠れアクティベーションから応答の正しさを推定し、コストを意識したルーティングを可能にする。
先行研究は英語入力に重点を置いているものの,(1)成功率と失敗率のランキングを維持するか(DISCriMINATION),(2)成功頻度に合致する確率を保持するか(CALIBRATION),(3)コスト対応多言語ルーティング(UTILITY)の候補モデルに匹敵するスコアを生成するか(UTILITY)という3次元の言語間での信頼性について検討した。
10言語で3000のMATH問題と8つのオープンウェイトモデル構成を用いて、英語学習プローブと等予算プール型多言語プローブの言語間移動を比較した。
英語で訓練されたプローブは、言語間の識別に有用であるが、転送後に校正があまり行われない。
プールされた多言語監視は、両方の特性を改善し、より信頼性の高い成功推定をもたらす。
ルーティング実験では、プールされたルータはテスト成功率0.7%を達成し、モデルの平均成功率が最も高いモデルを選択するのに対して、モデルコストを13.0%削減する。
これらの結果から,多言語ルーティングには,言語やモデルに比較して,十分な校正を保ったままの成功推定が必要であることが示唆された。
関連論文リスト
- What Does Post-Training Change in Multilingual Reasoning? [12.915215118963893]
オープンソース推論モデルは、言語間の推論能力に不平等なアクセスを提供する。
11言語における競合数学のタスクに関するQwen3チェックポイントを監査する。
10の非英語言語全体では、15.4-17.9%の問題は16のサンプルのいずれにおいても、要求された言語で目に見える推論を伴う正しい解決策が与えられ、英語では92.9%である。
論文 参考訳(メタデータ) (2026-09-29T09:23:31Z) - Calibrating Beyond English: Language Diversity for Better Quantized Multilingual LLM [10.689556615369272]
非英語および多言語キャリブレーションセットは、英語のみのベースラインに比べてパープレキシティを著しく改善する。
キャリブレーションセットを評価言語に調整すると、個々の言語で最大の改善が得られます。
論文 参考訳(メタデータ) (2026-01-26T09:36:03Z) - Translation as a Scalable Proxy for Multilingual Evaluation [41.29816736489213]
翻訳品質だけで、モデルのより広い多言語機能を示すことができるだろうか?
翻訳性能がダウンストリームタスクの成功を示す良い指標であることに気付きました。
論文 参考訳(メタデータ) (2026-01-16T21:01:40Z) - Can Embedding Similarity Predict Cross-Lingual Transfer? A Systematic Study on African Languages [12.074798555934855]
低リソースのアフリカ言語のためのNLPシステムを構築するためには、言語間移動が不可欠である。
816回の移動実験において,5つの埋め込み類似度指標を系統的に評価した。
その結果,コサインギャップと検索に基づく指標が転送成功を確実に予測できることが判明した。
論文 参考訳(メタデータ) (2026-01-06T16:39:28Z) - Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models [55.14276067678253]
本稿では,Large Language Models (LLMs) における言語間関係の弱点を効率的に同定するための新しい手法を提案する。
この手法を用いて16言語で6,000以上のバイリンガルペアからなる新しいデータセットを構築し、最先端のモデルにおいても弱点を明らかにする効果を実証した。
さらに,言語的類似性と言語間の弱点との関係について検討し,言語的関連言語が類似した演奏パターンを共有することを明らかにした。
論文 参考訳(メタデータ) (2025-05-24T12:31:27Z) - Prompt-Tuning Can Be Much Better Than Fine-Tuning on Cross-lingual
Understanding With Multilingual Language Models [95.32691891392903]
本稿では,プロンプトチューニングを用いた様々なNLUタスクの言語間評価を行い,それを微調整と比較する。
その結果, アクシデントチューニングは, データセット間の微調整よりもはるかに優れた言語間移動を実現することがわかった。
論文 参考訳(メタデータ) (2022-10-22T05:48:02Z) - Overcoming Catastrophic Forgetting in Zero-Shot Cross-Lingual Generation [48.80125962015044]
ラベル付きデータが英語でのみ利用可能である場合、対象言語で生成タスク(すなわち要約)を実行するという問題について検討する。
パラメータ効率の低い言語間での移動において、パラメータ効率の適応は標準的な微調整よりも向上することがわかった。
提案手法はさらなる品質向上を実現し,ロバストなゼロショット・クロスランガル生成が到達範囲内であることを示唆する。
論文 参考訳(メタデータ) (2022-05-25T10:41:34Z) - From Good to Best: Two-Stage Training for Cross-lingual Machine Reading
Comprehension [51.953428342923885]
モデル性能を向上させるための2段階のアプローチを開発する。
我々は、トップk予測が正確な答えを含む確率を最大化するために、ハードラーニング(HL)アルゴリズムを設計する。
第2段階では, 正解と他の候補との微妙な違いを学習するために, 解答を意識したコントラスト学習機構が開発された。
論文 参考訳(メタデータ) (2021-12-09T07:31:15Z) - AmericasNLI: Evaluating Zero-shot Natural Language Understanding of
Pretrained Multilingual Models in Truly Low-resource Languages [75.08199398141744]
我々は、XNLI(Conneau et al)の拡張である AmericasNLI を提示する。
は、アメリカ大陸の10の原住民の言語である。
XLM-Rで実験を行い、複数のゼロショットおよび翻訳ベースのアプローチをテストします。
XLM-Rのゼロショット性能は全10言語で低調であり、平均性能は38.62%である。
論文 参考訳(メタデータ) (2021-04-18T05:32:28Z) - Exploring Fine-tuning Techniques for Pre-trained Cross-lingual Models
via Continual Learning [74.25168207651376]
訓練済みの言語モデルから下流の言語間タスクへの微調整は、有望な結果を示している。
ダウンストリームタスクに微調整する場合、継続学習を活用して、事前学習したモデルの言語間能力を維持する。
提案手法は、ゼロショット言語間タグ付けや名前付きエンティティ認識タスクにおいて、他の微調整ベースラインよりも優れた性能を実現する。
論文 参考訳(メタデータ) (2020-04-29T14:07:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。