論文の概要: Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization
- arxiv url: http://arxiv.org/abs/2605.11974v1
- Date: Tue, 12 May 2026 11:31:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-13 21:48:56.819952
- Title: Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization
- Title(参考訳): 秩序公正に向けて:デュアルグループアドバンテージ最適化によるLLMの秩序感の緩和
- Authors: Xu Chu, Guanyu Wang, Zhijie Tan, Xinrong Chen, Ziyu Li, Tong Mo, Weiping Li,
- Abstract要約: 大規模言語モデル(LLM)は、入力要素の配列順序に影響される順序バイアスに悩まされる。
textbfDGAOはモデル精度と順序安定性を同時に向上することを目的としている。
- 参考スコア(独自算出の注目度): 20.259122922188126
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Models (LLMs) suffer from order bias, where their performance is affected by the arrangement order of input elements. This unfairness limits the model's applications in scenarios such as in-context learning and Retrieval-Augmented Generation (RAG). Recent studies attempt to obtain optimal or suboptimal arrangements based on statistical results or using dataset-based search, but these methods increase inference overhead while leaving the model's inherent order bias unresolved. Other studies mitigate order sensitivity through supervised fine-tuning using augmented training sets with multiple order variants, but often at the cost of accuracy, trapping the model in consistent yet incorrect hallucinations. In this paper, we propose \textbf{D}ual \textbf{G}roup \textbf{A}dvantage \textbf{O}ptimization (\textbf{DGAO}), which aims to improve model accuracy and order stability simultaneously. DGAO calculates and balances intra-group relative accuracy advantage and inter-group relative stability advantage, rewarding the policy model for generating order-stable and correct outputs while penalizing order-sensitive or incorrect responses. This marks the first time reinforcement learning has been used to mitigate LLMs' order sensitivity. We also propose two new metrics, Consistency Rate and Overconfidence Rate, to reveal the pseudo-stability of previous methods and guide more comprehensive evaluation. Extensive experiments demonstrate that DGAO achieves superior order fairness while improving performance on RAG, mathematical reasoning, and classification tasks. Our code is available at: https://github.com/Hyalinesky/DGAO.
- Abstract(参考訳): 大規模言語モデル(LLM)は、入力要素の配列順序に影響される順序バイアスに悩まされる。
この不公平さは、コンテキスト内学習や検索型拡張生成(RAG)のようなシナリオにおけるモデルの応用を制限する。
近年の研究では、統計結果やデータセットに基づく探索に基づく最適もしくは最適以下の配置が試みられているが、これらの手法は、モデル固有の順序バイアスを未解決のまま残しながら、推論オーバーヘッドを増大させる。
他の研究では、複数の順序変種を持つ強化トレーニングセットを使用して、教師付き微調整によって秩序の感度を緩和するが、しばしば正確さを犠牲にし、一貫した不正確な幻覚でモデルをトラップする。
本稿では,モデル精度と順序安定性を同時に向上することを目的とした, {textbf{D}ual \textbf{G}roup \textbf{A}dvantage \textbf{O}ptimization (\textbf{DGAO})を提案する。
DGAOは群内相対精度の利点と群間相対安定性の利点を計算・バランスさせ、群間相対安定性の利点を和らげる。
これはLLMの順序感度を緩和するために強化学習が使用された初めての例である。
また、従来手法の疑似安定性を明らかにするために、一貫性率と過信率という2つの新しい指標を提案し、より包括的な評価を導く。
大規模な実験により、DGAOは、RAG、数学的推論、分類タスクの性能を改善しながら、優れたオーダーフェアネスを達成することが示された。
私たちのコードは、https://github.com/Hyalinesky/DGAO.comで利用可能です。
関連論文リスト
- Beyond Static Best-of-N: Bayesian List-wise Alignment for LLM-based Recommendation [23.95623437107717]
大規模言語モデルは、ユーザ好みをモデル化するための生成機能を活用することで、レコメンデーションシステム(LLM4Rec)に革命をもたらした。
既存のLLM4Recメソッドはトークンレベルの目的に依存しており、実際のレコメンデーション品質を定義するリストレベルと非微分可能なメトリクスを最適化することは困難である。
我々はこれらの課題を克服するためにBLADE (Bayesian List-wise Alignment via Dynamic Estimation)を提案する。
論文 参考訳(メタデータ) (2026-05-06T07:02:57Z) - Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data [55.84428098924793]
構造保存探索を行うためのパラメータ自由復号法である Constrained Uniform Top-K Smpling (CUTS) を提案する。
グループ内の利点分散を増幅するために、エクスプロイトと探索的なロールアウトを相乗化するためのトレーニングフレームワークであるMixed-CUTSに統合する。
特にMixed-CUTSは、AIME25ベンチマークのPass@1の精度を標準のGRPOよりも15.1%向上している。
論文 参考訳(メタデータ) (2026-04-20T16:43:28Z) - APAO: Adaptive Prefix-Aware Optimization for Generative Recommendation [26.371939617653084]
生成レコメンデーションは自動回帰生成プロセスであり、ユーザインタラクション履歴に基づいて、次の項目の離散トークンを予測する。
既存の生成レコメンデーションモデルは、通常、クロスエントロピー損失のようなトークンレベルの可能性目標で訓練される。
標準的なトレーニングでは、推論中にビームサーチが低確率の分岐を産み出すという事実を無視して、地道の歴史が常に利用可能であると仮定している。
論文 参考訳(メタデータ) (2026-03-03T08:29:15Z) - CAIRO: Decoupling Order from Scale in Regression [13.755937210012883]
回帰を2つの異なる段階に分離する枠組みを提案する。
第1段階では,スケール不変ランキングの損失を最小限に抑えることで,スコアリング関数を学習する。
第2に,等速回帰による目標スケールの復元を行う。
論文 参考訳(メタデータ) (2026-02-16T03:50:05Z) - Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models [52.48582333951919]
ポリシー更新の信号対雑音比を最大化することにより、アライメントの信頼性を高めるために設計された動的フレームワークを提案する。
SAGE(Stability-Aware Gradient Efficiency)は、モデル能力に基づいて候補プールをリフレッシュする粗いきめ細かいカリキュラムメカニズムを統合する。
複数の数学的推論ベンチマークの実験により、SAGEは収束を著しく加速し、静的ベースラインを上回っていることが示された。
論文 参考訳(メタデータ) (2026-02-01T12:56:10Z) - Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction [41.53271688465831]
ユーザ行動軌跡予測(UBTP)を,長期ユーザの嗜好を明示的にモデル化するタスク設定として定式化する。
項目列全体に対して構造化された嗜好を直接最適化する拡散に基づくトレーニングフレームワークであるリスワイズ・ディフュージョン・最適化(LPDO)を導入する。
多段階の予測品質を厳密に評価するために、正確な軌跡合意を計測するタスク特異的な逐次マッチング(SeqMatch)を提案し、確率的忠実度を評価するパープレキシティ(PPL)を採用する。
論文 参考訳(メタデータ) (2025-11-01T12:16:24Z) - Permutative Preference Alignment from Listwise Ranking of Human Judgments [40.23480751285947]
我々はNDCGを異なる代理損失で近似することで、エンドツーエンドのアライメントアルゴリズムを開発する。
我々は,NDCGに基づく手法により,B-T法よりも効率よくランキング精度を向上させることを示す。
論文 参考訳(メタデータ) (2024-10-06T03:49:28Z) - Estimating the Hessian Matrix of Ranking Objectives for Stochastic Learning to Rank with Gradient Boosted Trees [63.18324983384337]
グラディエントブースト決定木(GBDT)のランク付け手法について紹介する。
我々の主な貢献は、二階微分、すなわちヘッセン行列に対する新しい推定器である。
推定器を既存のPL-Rankフレームワークに組み込む。
論文 参考訳(メタデータ) (2024-04-18T13:53:32Z) - Enhancing Few-shot NER with Prompt Ordering based Data Augmentation [59.69108119752584]
本稿では,PODA(Prompt Ordering Based Data Augmentation)手法を提案する。
3つのパブリックNERデータセットの実験結果とさらなる分析により,本手法の有効性が示された。
論文 参考訳(メタデータ) (2023-05-19T16:25:43Z) - Conditional Denoising Diffusion for Sequential Recommendation [62.127862728308045]
GAN(Generative Adversarial Networks)とVAE(VAE)の2つの顕著な生成モデル
GANは不安定な最適化に苦しむ一方、VAEは後続の崩壊と過度に平らな世代である。
本稿では,シーケンスエンコーダ,クロスアテンティブデノナイジングデコーダ,ステップワイズディフューザを含む条件付きデノナイジング拡散モデルを提案する。
論文 参考訳(メタデータ) (2023-04-22T15:32:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。