論文の概要: UniRRM: Unified Reasoning Reward Models Across Languages and Evaluation Paradigms
- arxiv url: http://arxiv.org/abs/2609.05910v1
- Date: Sat, 05 Sep 2026 06:05:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.166497
- Title: UniRRM: Unified Reasoning Reward Models Across Languages and Evaluation Paradigms
- Title(参考訳): UniRRM:言語全体にわたる統一推論リワードモデルと評価パラダイム
- Abstract要約: 強化学習(Reinforcement Learning, RL)は、検証可能な報酬を伴うタスクを抜粋するが、オープンなタスクでは報酬モデルの信頼性が重要な課題である。
生成的報酬モデルに関する最近の研究は、有望な代替手段を提供するが、静的評価基準、断片化評価パラダイム、限定多言語サポートに制約されている。
我々は,複数の言語と評価パラダイムをサポートする統一推論報酬モデルである textbfUniRRM を提案する。
- 参考スコア(独自算出の注目度): 61.47798381713363
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Reinforcement learning (RL) excels on tasks with verifiable rewards, but in open-ended tasks, the reliability of reward models remains a key challenge. Existing solutions either depend on costly proprietary LLM-as-a-Judge systems or opaque scalar reward models that lack interpretability. Recent works on generative reward models offer a promising alternative, but they remain constrained by static evaluation criteria, fragmented evaluation paradigms, and limited multilingual support. To address these challenges, we introduce \textbf{MixReward}, a large-scale multilingual dataset spanning six domains and 103 languages, containing both pairwise and listwise data, and propose \textbf{UniRRM}, a unified reasoning reward model supporting multiple languages and evaluation paradigms. UniRRM uses a staged reasoning chain to dynamically generate task-generic and instruction-specific criteria, enabling fine-grained, input-adaptive judgments while maintaining consistency across languages. Experiments demonstrate that UniRRM-8B and UniRRM-14B achieve performance close to the state-of-the-art for models of comparable size across multiple benchmarks, and are effective for unseen evaluation paradigms. In addition, ablation studies validate the reliability and effectiveness of UniRRM.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)は、検証可能な報酬を伴うタスクを抜粋するが、オープンなタスクでは報酬モデルの信頼性が重要な課題である。
既存のソリューションは、高価でプロプライエタリなLCM-as-a-Judgeシステムか、解釈性に欠ける不透明なスカラー報酬モデルに依存している。
生成的報酬モデルに関する最近の研究は、有望な代替手段を提供するが、静的評価基準、断片化評価パラダイム、限定多言語サポートに制約されている。
これらの課題に対処するために,6つのドメインと103言語にまたがる大規模多言語データセットである \textbf{MixReward} を導入し,複数の言語と評価パラダイムをサポートする統一推論報酬モデルである \textbf{UniRRM} を提案する。
UniRRMは段階的推論チェーンを使用して、タスクジェネリックおよび命令固有の基準を動的に生成し、言語間の一貫性を維持しながら、きめ細かい入力適応的な判断を可能にする。
実験により、UniRRM-8BとUniRRM-14Bは、複数のベンチマークで比較可能な大きさのモデルの最先端に近い性能を達成し、見当たらない評価パラダイムに有効であることが示された。
さらに、アブレーション研究はUniRRMの信頼性と有効性を検証する。
関連論文リスト
- CDRRM: Contrast-Driven Rubric Generation for Reliable and Interpretable Reward Modeling [61.75914342638658]
CDRRM(Contrast-Driven Reward Model)は、高品質なルーリック生成と優先判断のためのフレームワークである。
この作業は、報酬モデリングのためのスケーラブルで解釈可能で、データ効率のよいパスを提供する。
論文 参考訳(メタデータ) (2026-03-09T07:15:23Z) - Limits and Gains of Test-Time Scaling in Vision-Language Reasoning [8.76012279865596]
テスト時間スケーリング(TTS)は、推論時にさらなる計算を割り当てることで、LLM(Large Language Models)の推論能力を改善するための強力なパラダイムとして登場した。
本稿では、異なるベンチマーク上で、オープンソースおよびクローズドソースのVision-Language Models (VLM) にまたがる推論時間推論手法について、系統的研究を行った。
論文 参考訳(メタデータ) (2025-12-11T20:48:54Z) - Asm2SrcEval: Evaluating Large Language Models for Assembly-to-Source Code Translation [4.45354703148321]
アセンブリ・トゥ・ソースのコード翻訳はリバースエンジニアリング、サイバーセキュリティ、ソフトウェアメンテナンスにおいて重要なタスクである。
本稿では,アセンブリ・トゥ・ソース・トランスフォーメーションにおける5つの最先端大規模言語モデルの包括的評価について述べる。
論文 参考訳(メタデータ) (2025-11-28T12:40:30Z) - A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation [63.76972456980632]
効率的なMLLM評価のためのマルチツーワンインタビューパラダイムを提案する。
本フレームワークは, (i) 事前面接と形式面接の2段階面接戦略, (ii) 公平性を確保するための重みの動的調整, (iii) 質問難度選択のための適応的メカニズムから構成される。
論文 参考訳(メタデータ) (2025-09-18T12:07:40Z) - Model Utility Law: Evaluating LLMs beyond Performance through Mechanism Interpretable Metric [99.56567010306807]
大規模言語モデル(LLM)は、学術、産業、そして日々のアプリケーションに欠かせないものになっている。
大規模言語モデル (LLM) 時代における評価の課題の1つは一般化問題である。
従来の性能スコアを補完するメカニズムの解釈可能性向上指標であるモデル利用指数(MUI)を提案する。
論文 参考訳(メタデータ) (2025-04-10T04:09:47Z) - SCORE: Systematic COnsistency and Robustness Evaluation for Large Language Models [4.875712300661656]
本稿では,大規模言語モデルの非敵対的評価のための総合的なフレームワークであるSCORE ($mathbfS$ystematic $mathbfCO$nsistency and $mathbfR$obustness $mathbfE$valuationを提案する。
SCOREフレームワークは、様々な設定で同じベンチマークで繰り返しテストすることでモデルを評価し、精度と一貫性を現実的に見積もる。
論文 参考訳(メタデータ) (2025-02-28T19:27:29Z) - Exploring Robustness of LLMs to Paraphrasing Based on Sociodemographic Factors [7.312170216336085]
我々は、SocialIQAデータセットを拡張して、社会デマログラフィー要因に基づく多様なパラフレーズセットを作成する。
人口統計に基づく言い回しが言語モデルの性能に大きな影響を及ぼすことがわかった。
論文 参考訳(メタデータ) (2025-01-14T17:50:06Z) - LMUnit: Fine-grained Evaluation with Natural Language Unit Tests [43.096722878672956]
応答品質を明示的でテスト可能な基準に分解するパラダイムである自然言語単体テストを導入する。
このパラダイムは、アノテーション間の合意を大幅に改善し、より効果的な開発を可能にする。
LMUnitは、評価ベンチマークとRewardBenchの競争結果で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-12-17T17:01:15Z) - Unified Generative and Discriminative Training for Multi-modal Large Language Models [88.84491005030316]
生成的トレーニングにより、視覚言語モデル(VLM)は様々な複雑なタスクに取り組むことができる。
CLIPのようなモデルで実証された差別的トレーニングは、ゼロショットイメージテキストの分類と検索に優れています。
本稿では,両パラダイムの強みを統合する統一的アプローチを提案する。
論文 参考訳(メタデータ) (2024-11-01T01:51:31Z) - Determine-Then-Ensemble: Necessity of Top-k Union for Large Language Model Ensembling [23.447466392929712]
大規模言語モデル(LLM)は、様々なタスクに様々な長所と短所を示す。
既存のLLMアンサンブル法は、しばしばモデルの互換性を見落とし、確率の非効率なアライメントに苦しむ。
textscUnion textscTop-$k$ textscEnsembling (textscUniTE)は,各モデルから上位kトークンの結合に着目し,効率的にモデルを結合する新しいアプローチである。
論文 参考訳(メタデータ) (2024-10-03T08:42:38Z) - The Power of Question Translation Training in Multilingual Reasoning: Broadened Scope and Deepened Insights [108.40766216456413]
大規模言語モデルの英語と非英語のパフォーマンスのギャップを埋めるための質問アライメントフレームワークを提案する。
実験結果から、さまざまな推論シナリオ、モデルファミリー、サイズにわたって、多言語のパフォーマンスを向上できることが示された。
我々は、表現空間、生成された応答とデータスケールを分析し、質問翻訳訓練がLLM内の言語アライメントをどのように強化するかを明らかにする。
論文 参考訳(メタデータ) (2024-05-02T14:49:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。