論文の概要: Rank Reversal in Multilingual LLM Judges: A Label-Free Double-Centering Calibrator
- arxiv url: http://arxiv.org/abs/2608.22432v1
- Date: Sun, 23 Aug 2026 14:18:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 13:29:43.768217
- Title: Rank Reversal in Multilingual LLM Judges: A Label-Free Double-Centering Calibrator
- Title(参考訳): 多言語LLM審査員のランク逆転:ラベルフリーダブルセンターキャリブレータ
- Abstract要約: LLM審査員は、プロンプト言語に応じて評価器-バックボーンランキングを生成する。
上位のバックボーンは英語、アラビア語、中国語、ヒンディー語、日本語、スペイン語、トルコ語、スワヒリ語で交互に使われている。
多言語判定スコアは、追加的にタスク難易度、バックボーンスキル、言語とバックボーンの相互作用項に分解する。
- 参考スコア(独自算出の注目度): 0.8253953000831505
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multilingual LLM judges produce different evaluator-backbone rankings depending on the prompt language: on an eight-language Agent-as-a-Judge benchmark, the top-ranked backbone alternates across English, Arabic, Chinese, Hindi, Japanese, Spanish, Turkish, and Swahili, and 7 of 15 backbone pairs show statistically significant pairwise rank reversal. We treat this as a measurement problem. The multilingual judge score decomposes additively into task difficulty, backbone skill, and a language-backbone interaction term, the last of which is recoverable without human labels by double-centering the cell-mean score matrix. We make this estimator (\textbf{Consensus-Based Calibration}, CBC) explicit, give an $O(1/\sqrt{n})$ finite-sample concentration bound with variance constant $(1-\tfrac{1}{m})(1-\tfrac{1}{k})$, and show that it is unbiased even when task-language interactions are present. Across 7{,}920 judge runs (6 backbones, 8 languages, 55 tasks, 3 frameworks), CBC raises held-out cross-task rank consistency $τ$ from 0.650 to 0.902 and agrees with the held-out additive-model oracle in 100\% of per-language decisions versus 68.5\% raw; these are consistency diagnostics, not human-grounded correctness measures. On a separately collected M-RewardBench panel (7 languages, 1{,}500 items per language, 10{,}500 language-item instances, 5 evaluators), panel agreement with the public human gold preferences rises from 68.7\% to 76.6\% (gain 7.9 percentage points, 95\% CI $[6.0, 9.9]$), our strongest external evidence of downstream usefulness. The estimator is the standard two-way ANOVA interaction-recovery operation under sum-to-zero contrasts; our contribution is its application as a label-free post-hoc calibrator for multilingual LLM judges, an explicit finite-sample concentration bound, and an unbiasedness result that holds even under task-language misspecification.
- Abstract(参考訳): 英語、アラビア語、中国語、ヒンディー語、日本語、スペイン語、トルコ語、スワヒリ語にまたがる上位のバックボーンと、15のバックボーンペアのうち7つは統計的に有意なペアのランク逆転を示している。
これを測定問題として扱う。
多言語判定スコアは、タスク難易度、バックボーンスキル、言語とバックボーンの相互作用項に加算的に分解され、最後はセル平均スコアマトリックスを二重中心化することにより、人名なしで復元可能である。
この推定器 (\textbf{Consensus-Based Calibration}, CBC) を明示し、分散定数$(1-\tfrac{1}{m})(1-\tfrac{1}{k})$で束縛された$O(1/\sqrt{n})$有限サンプル濃度を与える。
7{,}920の裁判官は (6つのバックボーン、8つの言語、55のタスク、3つのフレームワーク) で、CBCは0.650から0.902へのホールドアウトクロスタスクの整合性を高める。
個別に収集されたM-RewardBenchパネル(言語7言語、1{,}500項目、10{,}500言語-itemインスタンス、5評価器)では、公衆の金の選好とのパネル合意は68.7\%から76.6\%(7.9ポイント、95.% CI $[6.0, 9.9]$)に上昇し、下流の有用性の最も強い外部証拠となる。
我々の貢献は、多言語LLM判定のためのラベルフリーのポストホックキャリブレータ、明示的な有限サンプル濃度境界、タスク言語的不特定性の下でも保たれる不偏性結果などである。
関連論文リスト
- IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories [0.0]
LLM-as-a-judgeは、NLPパイプラインのスケーラビリティ評価において、主要なアプローチとなっている。
オープンソースのベンチマークと信頼性監査フレームワークであるBabelJudgeを紹介します。
位置バイアス、冗長性バイアス、順序の不整合、言語間の劣化の4つの障害モードを計測します。
論文 参考訳(メタデータ) (2026-06-21T04:35:43Z) - Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation [0.8253953000831505]
我々はエージェント・ア・ジャッジ・プロンプト・スタックを5つのタイプ的多様言語(英語、アラビア語、トルコ語、中国語、ヒンディー語)にローカライズする。
3つの開発者エージェントフレームワークと6つの審査バックボーンで55のDevAI開発タスクを評価し、合計4950回の審査を実行した。
GPT-4oは英語で最も満足度が高い(44.72%)のに対し、ジェミニはアラビア語(51.72%、$p0.001$、GPT-4o、Hindi)である。
論文 参考訳(メタデータ) (2026-04-06T08:54:16Z) - Benchmarking Bengali Dialectal Bias: A Multi-Stage Framework Integrating RAG-Based Translation and Human-Augmented RLAIF [0.3227658251731014]
大規模言語モデル(LLM)は、低リソース言語の方言に対する性能バイアスを頻繁に示している。
ベンガル方言9方言を対象に,LLM質問応答における方言バイアスを評価するための2段階の枠組みを提案する。
論文 参考訳(メタデータ) (2026-03-22T18:44:57Z) - Cross-Lingual Consistency: A Novel Inference Framework for Advancing Reasoning in Large Language Models [10.231866835957538]
大型言語モデル(LLM)における推論能力を高める重要なメカニズムとして、Chain-of-Thought(CoT)が登場した。
LLMの推論能力を高めるために,多数決による多言語推論経路を統合した言語間整合性(CLC)フレームワークを提案する。
CMATHデータセットの実証評価により、従来の自己整合性法よりもCLCの方が優れていることが明らかになった。
論文 参考訳(メタデータ) (2025-04-02T16:09:39Z) - Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios [49.53589774730807]
マルチモーダル大規模言語モデル(MLLM)は近年,視覚的質問応答から映像理解に至るまでのタスクにおいて,最先端のパフォーマンスを実現している。
12件のオープンソースMLLMが, 単一の偽装キューを受けた65%の症例において, 既往の正解を覆した。
論文 参考訳(メタデータ) (2024-11-05T01:11:28Z) - Breaking Language Barriers in Multilingual Mathematical Reasoning: Insights and Observations [59.056367787688146]
本稿では, マルチリンガル数学推論 (xMR) LLM の探索と学習の先駆者である。
我々は10の異なる言語を含む最初の多言語数学推論命令データセットMGSM8KInstructを構築した。
翻訳を利用して、10個の異なる言語を含む最初の多言語数学推論命令データセットMGSM8KInstructを構築した。
論文 参考訳(メタデータ) (2023-10-31T08:09:20Z) - SEAHORSE: A Multilingual, Multifaceted Dataset for Summarization
Evaluation [52.186343500576214]
本稿では,多言語・多面的要約評価のためのデータセットSEAHORSEを紹介する。
SEAHORSEは、テキスト品質の6次元に沿って人間格付けされた96Kの要約で構成されている。
本稿では,SEAHORSEでトレーニングしたメトリクスが,ドメイン外メタ評価ベンチマークTRUEとmFACEで高い性能を示すことを示す。
論文 参考訳(メタデータ) (2023-05-22T16:25:07Z) - Mismatching-Aware Unsupervised Translation Quality Estimation For
Low-Resource Languages [6.049660810617423]
XLMRScoreは、XLM-RoBERTa (XLMR)モデルで計算されたBERTScoreの言語間対応である。
WMT21QE共有タスクの4つの低リソース言語対に対して提案手法を評価する。
論文 参考訳(メタデータ) (2022-07-31T16:23:23Z) - OneAligner: Zero-shot Cross-lingual Transfer with One Rich-Resource
Language Pair for Low-Resource Sentence Retrieval [91.76575626229824]
文検索タスク用に特別に設計されたアライメントモデルであるOneAlignerを提案する。
大規模並列多言語コーパス(OPUS-100)の全ての言語ペアで訓練すると、このモデルは最先端の結果が得られる。
実験結果から,文アライメントタスクの性能はモノリンガルおよび並列データサイズに大きく依存することがわかった。
論文 参考訳(メタデータ) (2022-05-17T19:52:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。