論文の概要: Pareto-Dominant Clarification: Post-Training Coding LLMs via PPO-Lagrangian Budget Constraints
- arxiv url: http://arxiv.org/abs/2610.04089v1
- Date: Fri, 02 Oct 2026 21:54:46 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:30:18.425437
- Title: Pareto-Dominant Clarification: Post-Training Coding LLMs via PPO-Lagrangian Budget Constraints
- Title(参考訳): PPO-Lagrangian Budget Constraints(PPO-Lagrangian Budget Constraints)による学習後のLLMの解明
- Abstract要約: コーディングエージェントは、明確な質問をするか、ソリューションを直接試すかを判断しなければならない。
我々は、明確化行動を研究するが、強制的明確化予算の下では政策を訓練しない。
拘束マルコフ決定過程 (CMDP) と, PPO-ラグランジアンを用いたQwen2.5-Coder-7B-インストラクションの定式化を行った。
- 参考スコア(独自算出の注目度): 0.0
- License:
- Abstract: Coding agents operating under ambiguous instructions or user prompts must decide whether to ask clarifying questions or attempt a solution directly. While clarification from the user may improve the correctness of the agent's solution, each back-and-forth interaction incurs user and system costs, forming an explicit accuracy vs. efficiency tradeoff. Existing works study clarification behavior but do not train policies under enforceable clarification budgets; penalty-based approaches typically require separate coefficient tuning swept across all clarification budget levels. We formulate clarification as a Constrained Markov Decision Process (CMDP) and post-train Qwen2.5-Coder-7B-Instruct with PPO-Lagrangian to optimize coding accuracy, subject to an expected question-budget constraint. Evaluated on HumanEvalComm with a GPT-4o-mini oracle simulator, the resulting policies reveal that untuned clarification behavior is Pareto-inefficient: budget-constrained policies can simultaneously achieve higher accuracy and lower clarification rates than the baseline model. Across budget levels, we observe a log-shaped Pareto frontier with diminishing returns to additional clarification. Gains arise not from simply asking more questions overall, but from improved question targeting and better code generation under ambiguity. Without explicit supervision, trained policies learn to allocate clarification budget non-uniformly, asking more frequently on tougher (multi-degradation) tasks. These results suggest that unconstrained interactive LLM systems may systematically use clarification inefficiently.
- Abstract(参考訳): 曖昧な指示やユーザプロンプトの下で動作しているコーディングエージェントは、明確な質問をするか、ソリューションを直接試すべきかを判断しなければならない。
ユーザによる明確化は、エージェントのソリューションの正確性を改善する可能性があるが、各バック・フォースインタラクションは、ユーザとシステムコストを発生させ、明示的な精度と効率のトレードオフを形成する。
既存の研究は、明確化行動を研究するが、強制的明確化予算の下で政策を訓練しない。
我々は,制約付きマルコフ決定プロセス (CMDP) とポストトレインQwen2.5-Coder-7B-Instruct with PPO-Lagrangian を用いて,予測された質問予算制約の下で,符号化精度を最適化する。
GPT-4o-mini OracleシミュレータでHumanEvalCommを評価したところ、未修正の明確化動作はPareto非効率であることが判明した。
予算レベルでは,ログ形式のParetoフロンティアを観測し,リターンを減少させ,さらなる明確化を図る。
利益は、全体的な質問を増やすことではなく、改善された質問ターゲティングと曖昧さの下でのコード生成によって生まれる。
明確な監督がなければ、訓練された政策は明確化予算を不均一に割り当てることを学び、より厳しい(多重劣化)タスクについてより頻繁に要求する。
これらの結果から,非拘束型対話型LCMシステムは系統的に非効率に明確化を活用できる可能性が示唆された。
関連論文リスト
- One Policy, Any Budget: Internalizing Budget-Aware Search via Reinforcement Learning [41.55260785497756]
我々は,予算制約下での予算対応検索を単一ポリシーで行えるフレームワークであるAnySearchを提案する。
第1フェーズでは、明確な予算状態注入と構造化推論プロンプトでエージェントを訓練する。
第2段階では、足場を除去し、エージェントは適応的にサンプル化された予算制約の下で自律的に操作することを学ぶ。
論文 参考訳(メタデータ) (2026-09-01T07:12:32Z) - CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement [50.91045324738942]
CLAIMは、オープンドメイン環境でのアクティブな明確化学習のための不確実性駆動フレームワークである。
本研究では,不確実性推定とセマンティッククラスタリングと推論に基づく判断を統合したエントロピー駆動型合成データ生成パイプラインを提案する。
実験の結果,手動でラベル付けしたデータに頼ることなく,CLAIMが安定かつ一般化可能な明確化戦略を学習できることが確認された。
論文 参考訳(メタデータ) (2026-08-12T04:27:45Z) - Thinking Economically: A Hierarchical Framework for Adaptive-Complexity Reasoning in LLMs [36.73612668202756]
HABは、PPL由来のステップ比較からステップ固有のトークン予算信号を学ぶ。
GSM8KとMATH500の実験では、HABが標準的なCoTを超えるだけでなく、トークンの使用量を減らすことが示されている。
論文 参考訳(メタデータ) (2026-05-31T11:20:00Z) - Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge [4.511996087821266]
Reasoning-capable large language model (LLM) は、最近自動判断器として採用されている。
本研究では,明示的推論により,構造化された検証を必要とするタスクの判断精度が大幅に向上することを示す。
本稿では、推論と非推論の判断を選択可能なロバスト適応コスト効率ルーティング(RACER)を提案する。
論文 参考訳(メタデータ) (2026-05-11T16:30:20Z) - Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization [18.737087162461563]
テストタイムの計算スケーリングは、大規模言語モデルのパフォーマンスを向上させるための強力なレバーとなっている。
しかし、これらのテクニックを有限の推論予算の下で展開するには、現在のシステムがほとんど無視する決定が必要である。
我々はこれを制約付き最適化問題(平均計算予算の予測精度を最大化する)として定式化し、2段階のソルベ・テン・ラーンパイプラインで解いた。
論文 参考訳(メタデータ) (2026-04-16T10:39:22Z) - Learning Steerable Clarification Policies with Collaborative Self-play [67.67872810596839]
不明瞭なクエリを処理するために、AIアシスタントは不確実性を管理するためのポリシーが必要である。
我々は,この不確実性を管理するために,自己再生を用いて評価可能な政策を訓練することを提案する。
このことが、提供されたコストに応じて予測可能な振る舞いを変更する、評価可能なポリシーにつながることを示す。
論文 参考訳(メタデータ) (2025-12-03T18:49:54Z) - e1: Learning Adaptive Control of Reasoning Effort [88.51897900019485]
AIモデルの思考予算の増大は、精度を大幅に向上させるが、すべての質問が同じ量の推論を保証しているわけではない。
ユーザは、アウトプットの品質を、レイテンシやコストに対してどのように評価するかによって、さまざまな理由付けの労力を割り当てる傾向があります。
本稿では,ユーザが指定したトークン数を用いてモデルを学習する自己適応型強化学習手法であるAdaptive Effort Controlを提案する。
論文 参考訳(メタデータ) (2025-10-30T23:12:21Z) - HiPO: Hybrid Policy Optimization for Dynamic Reasoning in LLMs [54.16300997612526]
大規模言語モデル (LLM) は、複雑なタスクの正確性を改善するために、Chain-of-Thought (CoT) 推論にますます依存している。
本稿では適応推論制御のフレームワークであるHybrid Policy Optimization(HiPO)を紹介する。
数学とコーディングベンチマークによる実験は、HiPOがトークン長を大幅に削減し、正確性を維持したり改善したりすることを示した。
論文 参考訳(メタデータ) (2025-09-28T16:46:12Z) - Supervised Optimism Correction: Be Confident When LLMs Are Sure [91.7459076316849]
教師付き微調整とオフライン強化学習の間には,新たな理論的関係が確立されている。
広く使われているビームサーチ法は、許容できない過度な最適化に悩まされていることを示す。
本稿では,トークンレベル$Q$-value推定のための簡易かつ効果的な補助的損失を導入したSupervised Optimism Correctionを提案する。
論文 参考訳(メタデータ) (2025-04-10T07:50:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。