論文の概要: Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization
- arxiv url: http://arxiv.org/abs/2607.25136v1
- Date: Mon, 27 Jul 2026 23:05:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.652364
- Title: Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization
- Title(参考訳): より少ないデータ、より優れたアライメント: 優先度最適化のためのデータ中心型マルチ評価器契約
- Abstract要約: DMAPOは、ターゲットポリシーから候補応答を生成し、有用性、事実性、およびルーリック特異的評価器による簡潔性を評価する。
この手続きは、54,236人のMistral-7B候補のうち1,871人(3.45%)を受け入れている。
このセットで訓練されたKTOは、MT-Benchで7.50点、テキストダヴィンチ003参照に対して95.5%の勝利率、IFEvalが57.3%に達した。
- 参考スコア(独自算出の注目度): 20.147316178118732
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Research on preference optimization often varies the training objective while holding the data fixed. We instead ask whether a small, high-confidence set of on-policy responses can provide a reliable learning signal. Our method, DMAPO (Data-centric Multi-evaluator Agreement for Preference Optimization), generates candidate responses from the target policy, evaluates helpfulness, factuality, and conciseness with rubric-specialized evaluators, applies a process-critic correction, and retains only high-consensus desirable or undesirable examples. This procedure accepts 1,871 of 54,236 Mistral-7B candidates (3.45%). KTO trained on this set reaches 7.50 on MT-Bench, 95.5% length-controlled win rate against a text-davinci-003 reference, and 57.3% IFEval prompt accuracy. Independent pairwise evaluation also favors DMAPO over SimPO: GPT-4o yields a net win rate of 23.3 points on 129 held-out prompts and 24.0 points on 200 out-of-distribution LMSYS-Chat prompts; Claude Opus 4.7 yields 24.1 points on the held-out set. Changing the evaluator model or rubric alters the selected examples but has little effect on downstream performance. A second-backbone study yields a similar 3.41% acceptance rate, although its performance gains are more modest. Across these experiments, consensus filtering offers a data-efficient route to preference optimization for general instructions, at the cost of additional curation compute and dependence on evaluator judgments.
- Abstract(参考訳): 好みの最適化に関する研究は、データを固定しながらトレーニングの目的を異にすることが多い。
代わりに、小さな、高信頼のオン・ポリティクス・レスポンスセットが信頼できる学習信号を提供するかどうかを尋ねる。
提案手法であるDMAPO (Data-centric Multi-evaluator Agreement for Preference Optimization) は,対象ポリシーから候補応答を生成し,有効性,事実性,簡潔性を評価し,プロセスクリティカルな補正を行い,好ましくない,望ましくない事例のみを保持する。
この手続きは、54,236人のMistral-7B候補のうち1,871人(3.45%)を受け入れている。
このセットで訓練されたKTOは、MT-Benchで7.50点、テキストダヴィンチ003参照に対して95.5%の勝利率、IFEvalが57.3%に達した。
GPT-4oは129のホールトアウトプロンプトで23.3ポイント、200のアウト・オブ・ディストリビューションLMSYS-Chatプロンプトで24.0ポイント、Claude Opus 4.7は24.1ポイントである。
評価モデルやルーブリックの変更は、選択した例を変更するが、下流のパフォーマンスにはほとんど影響しない。
第2のバックボーンの研究では、同様の3.41%の受け入れ率が得られるが、パフォーマンスの上昇はより控えめである。
これらの実験全体を通して、コンセンサスフィルタリングは一般的な命令に対する選好最適化のためのデータ効率のよい経路を提供し、追加のキュレーション計算と評価器の判断への依存を犠牲にしている。
関連論文リスト
- Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0 [53.71882250666667]
エージェント最適化法で報告されているほとんどの利得はワンショットである。
これは、デプロイされたエージェントにとって重要な設定をテストするものではない。
エージェントハーネス最適化に対する3つのアプローチを比較する。
論文 参考訳(メタデータ) (2026-07-15T16:36:04Z) - Visual Preference Optimization with Rubric Rewards [30.826907231502663]
本稿では,インスタンス固有のルーリックをベースとした優先最適化フレームワークであるrDPOを提案する。
公開報酬モデルベンチマークでは、ルーリックベースのプロンプトにより30B-A3Bの判定が大幅に改善され、GPT-5.4に近づいた。
包括的なベンチマークでスケーラビリティを評価する場合、rDPOは61.01に達し、スタイル制約付きベースライン(52.36)を著しく上回り、59.48ベースモデルを上回っている。
論文 参考訳(メタデータ) (2026-04-14T17:58:22Z) - Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees [28.54776477263591]
本稿では, Prompt-Aware Online Evaluation Scheduling (POES)を提案する。
POESはIRTベースの識別ユーティリティ、施設位置のカバレッジ用語、スイッチングコストを意識したウォームスタートスワップを統一された目的に統合する。
POESは、無視できるトークンオーバーヘッドで、全体的な平均精度(最高のベースラインよりも6.2%改善)が最も高い。
論文 参考訳(メタデータ) (2026-04-13T11:31:04Z) - Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration [0.0]
マルチターンタスクにおける強化学習を伴う訓練ツール呼び出しエージェントは依然として困難である。
本稿では,MT-GRPO と GTPO を用いて,現実的なカスタマーサービスタスクにおけるツールコールエージェントのトレーニングを行う。
論文 参考訳(メタデータ) (2026-04-03T08:36:03Z) - Reverse Preference Optimization for Complex Instruction Following [61.39734201711077]
本稿では,Reverse Preference Optimization (RPO) という,シンプルで効果的な手法を提案する。
選択された応答が完璧であることを保証するために、命令内の制約を動的に反転させることで、優先ペアのノイズを緩和する。
RPOはモデルサイズで効果的にスケールし、70B RPOモデルはGPT-4oを超える。
論文 参考訳(メタデータ) (2025-05-28T09:44:27Z) - ELSPR: Evaluator LLM Training Data Self-Purification on Non-Transitive Preferences via Tournament Graph Reconstruction [25.85736569130897]
大規模言語モデル(LLM)のペアワイズ評価は、オープンエンドタスクのベンチマークにおいて支配的なパラダイムとなっている。
この重要な問題は、本質的に曖昧な選好ペアを含む低品質データに起因していることを示す。
トーナメントグラフとしてペアの選好をモデル化する,原則付きグラフ理論フレームワークであるESSPRを提案する。
論文 参考訳(メタデータ) (2025-05-23T10:00:03Z) - R.I.P.: Better Models by Survival of the Fittest Prompts [51.2293437372642]
本稿では,低品質入力が高ばらつきと低品質応答をもたらすという仮定に基づいて,データの完全性を評価する手法を提案する。
これは、拒否された応答品質と、選択された選好対と拒否された選好対の間の報酬ギャップを測定することで達成される。
論文 参考訳(メタデータ) (2025-01-30T18:50:25Z) - Preference Optimization for Reasoning with Pseudo Feedback [100.62603571434167]
提案手法では,解のラベル付けを関連するテストケースに対する評価として行うことで,推論タスクに対する疑似フィードバックを生成する手法を提案する。
本研究では,擬似フィードバックを優先最適化に用いる数学的推論と符号化の両タスクについて実験を行い,両タスク間の改善を観察する。
論文 参考訳(メタデータ) (2024-11-25T12:44:02Z) - Reward-Augmented Data Enhances Direct Preference Alignment of LLMs [63.32585910975191]
報奨条件付き大言語モデル(LLM)を導入し、データセット内の応答品質のスペクトル全体から学習する。
当社のアプローチは,DPOをかなりのマージンで継続的に向上させることを示す。
本手法は,嗜好データの有用性を最大化するだけでなく,未学習の問題も軽減し,データ拡張を超えてその広範な効果を実証する。
論文 参考訳(メタデータ) (2024-10-10T16:01:51Z) - Anchored Preference Optimization and Contrastive Revisions: Addressing Underspecification in Alignment [57.03947082589616]
大規模言語モデル(LLM)は、しばしばコントラスト的なアライメント目標と選好ペアデータセットを使用してアライメントされる。
これについて検討し、基礎となる応答が対照的な場合、嗜好データがより良い学習信号を与えることを示した。
我々は、よりコントラスト的な選好ペアを生み出すデータ生成手法である、AI Revisions (CLAIR) からのコントラスト学習を紹介する。
我々の最良のモデルは、APOで32K CLAIRの選好に基づいて訓練され、Llama-3-8B-Instructを7.65%改善し、GPT4-turboとのギャップを45%短縮しました。
論文 参考訳(メタデータ) (2024-08-12T16:24:51Z) - Self-Play Preference Optimization for Language Model Alignment [75.83359213697854]
近年の進歩は、嗜好の確率で直接作業することで、人間の嗜好をより正確に反映できることを示している。
本稿では,言語モデルアライメントのためのセルフプレイ方式を提案する。
我々の手法はSPPO(Self-Play Preference Optimization)と呼ばれ、繰り返しポリシー更新を利用してナッシュ均衡を確実に近似する。
論文 参考訳(メタデータ) (2024-05-01T17:59:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。