論文の概要: Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization
- arxiv url: http://arxiv.org/abs/2606.00544v1
- Date: Sat, 30 May 2026 05:30:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-02 21:34:28.515402
- Title: Escaping the Mode Lottery: Multi-Response Training Improves Language Model Generalization
- Title(参考訳): モードロッテの回避:マルチレスポンストレーニングによる言語モデルの一般化
- Abstract要約: 現代の言語モデルファインチューニングペアは、多くのプロンプトが複数の有効な完了を認めているにもかかわらず、それぞれ1つの応答でプロンプトを発行する。
これにより、マルチモーダルな条件分布をワンサンプルビューに効果的に還元し、トレーニングは可塑性モードのサブセットを強調する。
マルチレスポンス・トレーニング(MRT)について検討し、各プロンプト毎に複数の応答を保ちながら、いつ、なぜそれが役立つのかを原則的に説明する。
- 参考スコア(独自算出の注目度): 14.039980020878815
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern language-model fine-tuning typically pairs each prompt with a single response, even though many prompts admit multiple valid completions. This effectively reduces a multi-modal conditional distribution to a one-sample view, a phenomenon we call the "mode lottery," where training emphasizes a subset of plausible modes while leaving others underrepresented. We study multi-response training (MRT), which retains multiple responses per prompt, and develop a principled account of when and why it helps. Our key insight is that prompts and responses are distinct statistical resources: additional prompts reduce uncertainty about the input distribution, while additional responses reduce uncertainty about the conditional output distribution. This yields a variance-budget tradeoff that predicts when retaining multiple responses is worthwhile, shows diminishing returns as prompt-level uncertainty dominates, and explains why large redundant corpora can exhibit an implicit multi-response effect. We further analyze response selection, and show that Random-K-of-N is the unbiased default for distributional fine-tuning, reward-based selection can induce mode collapse, and a submodular quality-diversity objective provides an efficient alternative with theoretical guarantees. Controlled simulations validate the predicted variance and selection effects, including a striking failure mode where reward-only selection produces gradients misaligned with the true objective. Across structured and real-world datasets, including a new multi-prompt, multi-response benchmark, MRT consistently improves distributional generalization, with the largest gains in high response-diversity, low prompt-redundancy regimes. MRT reframes response multiplicity as a data-allocation problem with clear guidance: when responses are cheap and diverse, keeping more than one is not a heuristic, but a statistically grounded choice.
- Abstract(参考訳): 現代の言語モデルの微調整は、多くのプロンプトが複数の有効な完了を認めているにもかかわらず、通常、それぞれのプロンプトを単一の応答でペアリングする。
これにより、マルチモーダルな条件分布をワンサンプルビュー(mode lottery)と呼ぶ現象に効果的に還元する。
マルチレスポンス・トレーニング(MRT)について検討し、各プロンプト毎に複数の応答を保ちながら、いつ、なぜそれが役立つのかを原則的に説明する。
我々の重要な洞察は、プロンプトとレスポンスは異なる統計資源であり、追加のプロンプトは入力分布の不確実性を減少させ、追加の応答は条件出力分布の不確実性を減少させる。
これは、複数の応答を保持する価値があると予測する分散予算トレードオフをもたらし、即時レベルの不確実性が支配されるにつれてリターンが低下し、大きな冗長コーパスが暗黙のマルチレスポンス効果を示す理由を説明する。
我々はさらに応答選択を解析し、Random-K-of-Nが分布微調整の既定値であり、報酬に基づく選択はモード崩壊を誘発しうることを示す。
制御されたシミュレーションは、予測されたばらつきと選択効果を検証し、例えば、報酬のみの選択が真の目的と一致しない勾配を生成する印象的な失敗モードを含む。
MRTは、新しいマルチプロンプト、マルチレスポンスベンチマークを含む、構造化された実世界のデータセット全体にわたって、分散の一般化を一貫して改善し、高い応答多様性、低プロンプトの冗長性体制において最大の成果を上げている。
レスポンスが安価で多様な場合、ひとつ以上のレスポンスを維持することはヒューリスティックではなく、統計的に根拠のある選択である。
関連論文リスト
- ResiSpec: Enhancing Multi-Candidate Speculative Sampling via Residual Distribution Shaping [79.1905186547363]
ResiSpecは、検証中に提案の配布を戦略的に改革するフレームワークである。
候補の偏光を防止し、最先端のマルチ候補法よりも最大1.92$times$スピードアップを達成する。
論文 参考訳(メタデータ) (2026-08-25T11:25:55Z) - Diverse and Plausible Algorithmic Recourse via Tractable Recourse Distributions [0.8538830579425144]
リコースシステムは、1つではなく複数の現実的な代替手段を提供するべきである。
本稿では,ある実例に対して実現可能な代替案の空間を表す確率的フレームワークであるTractable Recourse Distributionsを提案する。
標準的なアルゴリズムリコースベンチマークデータセットの実験では、提案したフレームワークが多様性、妥当性、実現可能性を同時に達成できることが示されている。
論文 参考訳(メタデータ) (2026-08-05T10:40:53Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - Knowing When Not to Answer: Evaluating Abstention in Multimodal Reasoning Systems [52.83669998269706]
テキストのみの設定で研究されてきたが、まだマルチモーダルに探索されていない。
現在のベンチマークでは、未解決性を無視するか、現実的な障害モードを見逃す粗末なメソッドに依存している。
MM-AQAは、2つの軸に沿った変換によって解答不能なインスタンスを解答可能なインスタンスから構築するベンチマークである。
論文 参考訳(メタデータ) (2026-04-16T09:23:22Z) - Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Models [52.61023005303122]
低信頼度再マッシングは、誘導配列分布のエントロピーを制約しながら、品質のプロキシを改善することを示す。
我々は,デコード時に,この分布をほぼ対象とする簡易なインディペンデント・ハスティングス・サンプリング器を開発した。
論文 参考訳(メタデータ) (2026-04-01T02:01:30Z) - Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models [78.68818219506313]
本稿では,複数解に対する分布推論を行うための多解補足学習手法について述べる。
質問応答, 診断, コーディングベンチマークを通じて, 単一回答学習ベースラインと比較して, 多様性, カバレッジ, 設定レベルの校正スコアが向上した。
論文 参考訳(メタデータ) (2026-03-25T22:20:25Z) - Quantifying and Mitigating Selection Bias in LLMs: A Transferable LoRA Fine-Tuning and Efficient Majority Voting Approach [13.829059542429876]
大規模言語モデル(LLM)の性能評価手法として,MCQ (Multiple Choice Questioning) が広く用いられている。
LLMはMCQタスクにおいて選択バイアスを示し、その選択は内容よりも答えの位置やオプション記号などの要因に影響される。
論文 参考訳(メタデータ) (2025-11-17T21:31:37Z) - Answer-Consistent Chain-of-thought Reinforcement Learning For Multi-modal Large Langauge Models [33.398631680508814]
本稿では,GRPOアルゴリズムを補助的整合性チェックで修正するAnswer-Consistent Reinforcement Learningを提案する。
我々は、オリジナルとポストシャッフルの両方の回答が一致して正しい場合にのみ高い報酬を与える一貫性検証報酬を設計する。
我々は、ACREを挑戦的なビデオ推論ベンチマークとマルチモーダル数学推論ベンチマークで評価し、平均2.2%と1.5%の改善を達成した。
論文 参考訳(メタデータ) (2025-10-11T08:32:52Z) - GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning [12.724393910603299]
GM-PRM(Generative Multimodal Process Reward Model)を紹介する。
単純なスカラースコアの代わりに、GM-PRMは各推論ステップのきめ細かい解釈可能な分析を提供する。
GM-PRMは複数のマルチモーダル数学ベンチマークにおいて最先端の計算結果が得られることを示す。
論文 参考訳(メタデータ) (2025-08-06T05:10:29Z) - More is Less: The Pitfalls of Multi-Model Synthetic Preference Data in DPO Safety Alignment [80.04449725137177]
直接選好最適化(DPO)は、人間のフィードバックによる強化学習の、シンプルで効果的な代替手段として登場した。
我々の研究は、DPOアライメントに関連する、目覚ましい、安全性に特有な現象を明らかにした。
選択されたペアと拒否されたペアに対してのみ自己生成されたレスポンスを使用することで、より強力なモデルからのレスポンスを含む構成を大幅に上回る。
論文 参考訳(メタデータ) (2025-04-03T00:36:40Z) - Scalable Best-of-N Selection for Large Language Models via Self-Certainty [75.1351701045874]
Best-of-N selectionは、Large Language Models(LLMs)の推論性能を改善するための重要なテクニックである。
本稿では, LLM出力の固有確率分布を利用して, 外部報酬モデルを必要としない応答品質を推定する, 新規で効率的な指標である自己確実性を提案する。
本研究は, LLM推論能力を向上させるための実用的で効率的な方法として, 自己確実性を確立した。
論文 参考訳(メタデータ) (2025-02-25T19:08:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。