論文の概要: Code Consistency Preference Optimization Verification for Language Model Alignment
- arxiv url: http://arxiv.org/abs/2609.19002v1
- Date: Sat, 18 Jul 2026 09:51:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.590651
- Title: Code Consistency Preference Optimization Verification for Language Model Alignment
- Title(参考訳): 言語モデルアライメントのためのコード一貫性優先最適化検証
- Abstract要約: 本稿では,実行-一貫性のある優先最適化のための依存グラフを用いた計算音響解を生成する手法を提案する。
我々は,UltraFeedbackプロンプト,モデル生成,検証,一貫性結果を用いて,科学的推論データセットを構築した。
微調整のLlama-3-8BとDeepSeekMath-7Bは、MATHでは+17.0%、GSM8Kでは+15.1%という大きな利益をもたらす。
- 参考スコア(独自算出の注目度): 4.019632358747631
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Execution-based verification enhances large language models' mathematical reasoning through computational soundness and dependency-aware filtering. However, prior preference optimization methods relying on Bradley-Terry reward models fail to capture the logical dependencies and execution consistency needed for scientific tasks. We propose a method that generates computationally sound solutions with dependency graphs for execution-consistent preference optimization. We first build a scientific reasoning dataset using UltraFeedback prompts, model generations, verification, and consistency results. Then we extract reasoning step expressions, prerequisites, and derivability relationships to construct dependency graphs and compute execution consistency scores. These scores are appended to each step, creating paired training data. Fine-tuning Llama-3-8B and DeepSeekMath-7B yields significant gains: +17.0% on MATH and +15.1% on GSM8K. Extending our Scientific Feasibility Control framework achieves 50.1% accuracy on PhyX multimodal physics reasoning, surpassing DeepSeek-R1 (49.8%) and OpenAI o3-mini (48.2%), with 91.7% scientific validity coverage at alpha=0.10 and 73% fewer scientific law violations, resulting in the CCPO model family.
- Abstract(参考訳): 実行に基づく検証は、大規模言語モデルの数学的推論を、計算の健全性と依存性を考慮したフィルタリングによって強化する。
しかし、Bradley-Terryの報酬モデルに依存する事前優先度最適化手法は、科学的タスクに必要な論理的依存関係と実行一貫性を捉えることに失敗する。
本稿では,実行-一貫性のある優先最適化のための依存グラフを用いた計算音響解を生成する手法を提案する。
まず、UltraFeedbackプロンプト、モデル生成、検証、一貫性結果を用いて科学的推論データセットを構築します。
次に、推論ステップ表現、前提条件、導出可能性関係を抽出し、依存性グラフを構築し、実行整合性スコアを演算する。
これらのスコアは各ステップに付加され、ペア化されたトレーニングデータを生成する。
微調整のLlama-3-8BとDeepSeekMath-7Bは、MATHでは+17.0%、GSM8Kでは+15.1%という大きな利益をもたらす。
科学的フィージビリティ制御フレームワークの拡張は、PhyXマルチモーダル物理推論において50.1%の精度を達成し、DeepSeek-R1 (49.8%) とOpenAI o3-mini (48.2%) を上回り、91.7%の科学的妥当性がα=0.10で、そして73%の科学的法律違反が減少し、CCPOモデルファミリとなった。
関連論文リスト
- Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries [0.0]
神経脱コンパイルにおける微調整の有効性と妥当性に関する系統的研究を行った。
CodeBLEU, compile@k, pass@k の3つの指標を用いて, 3つの基本アーキテクチャにまたがる細かなモデル変異を評価した。
Swiftトレーニングからのクロスリンガル干渉は、4B(-2.66 pp, p)で非常に重要である(ただし8Bでゼロと統計的に区別できないが、スケーリング仮説と一致している)。
論文 参考訳(メタデータ) (2026-07-07T10:36:12Z) - AIR: Adaptive Interleaved Reasoning with Code in MLLMs [26.910280225921934]
マルチモーダル言語モデル(MLLM)を強化するためのコードとのインターリーブ推論は、重要な研究フロンティアとなっている。
本稿では、コード強化複素数値タスクにおける強化学習訓練により、適応的インターリーブ推論機能を有するMLLMを増強する。
実験により,グループ制約付き報酬関数を用いた強化学習の学習後,評価ベンチマークにおいて平均6.1ポイント(pp)の性能向上が示された。
論文 参考訳(メタデータ) (2026-06-22T17:58:54Z) - Structured Synthetic Reasoning Data for Arithmetic Fine-Tuning of Small Language Models [0.0]
構造化された合成推論データが、小言語モデルにおける算術的推論を改善することができるかどうかを検討する。
我々は,GPT-5-miniを用いて,21,250例の算術語-プロブレム変種のコーパスを生成する。
微調整されたモデルは、より短い推論トレースを生成し、算術的および散逸した使用ミスを少なくし、より一貫性のあるサンプリングの恩恵を受ける。
論文 参考訳(メタデータ) (2026-05-21T15:50:29Z) - Models Can Model, But Can't Bind: Structured Grounding in Text-to-Optimization [54.749573452394664]
定式化自体が単純である場合でも、インスタンスデータが大きくなるにつれて精度が低下する。
我々は, 数値データを構造化ファイルに外部化する単純な推論時アプローチであるBINDを用いて, モデルがプロンプトプロンプトからではなく, データをバインドする。
我々は,モデルのみをバインディングのみに微調整することで仮説を検証し,3つの構造的に異なる最適化カテゴリにおいて,エンドツーエンドのSFTおよびRLよりも優れていることを示す。
論文 参考訳(メタデータ) (2026-05-20T21:25:41Z) - Learning Adaptive Parallel Reasoning with Language Models [70.1745752819628]
本稿では,適応並列推論(Adaptive Parallel Reasoning, APR)を提案する。
APRは、spawn()とjoin()操作を使用して適応的なマルチスレッド推論を可能にすることで、既存の推論メソッドを一般化する。
鍵となる革新は、親と子の両方の推論スレッドを最適化して、事前に定義された推論構造を必要とせずにタスクの成功率を高める、エンドツーエンドの強化学習戦略である。
論文 参考訳(メタデータ) (2025-04-21T22:29:02Z) - Preference Optimization for Reasoning with Pseudo Feedback [100.62603571434167]
提案手法では,解のラベル付けを関連するテストケースに対する評価として行うことで,推論タスクに対する疑似フィードバックを生成する手法を提案する。
本研究では,擬似フィードバックを優先最適化に用いる数学的推論と符号化の両タスクについて実験を行い,両タスク間の改善を観察する。
論文 参考訳(メタデータ) (2024-11-25T12:44:02Z) - Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs [54.05511925104712]
本稿では,Step-DPOと呼ばれるシンプルで効果的でデータ効率のよい手法を提案する。
Step-DPOは、個々の推論ステップを、論理的に回答を評価するのではなく、優先最適化の単位として扱う。
以上の結果から,70B パラメータ以上のモデルでは,10K の選好データペアと500 Step-DPO トレーニングステップ以下では,MATH の精度が約3%向上する可能性が示唆された。
論文 参考訳(メタデータ) (2024-06-26T17:43:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。