論文の概要: CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs
- arxiv url: http://arxiv.org/abs/2607.04854v1
- Date: Mon, 06 Jul 2026 09:29:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.103569
- Title: CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs
- Title(参考訳): CARL:LLMによる計画のための制約対応強化学習
- Abstract要約: 大規模言語モデル(LLM)は、タスク制約に違反するプランを頻繁に生成し、現実のアプリケーションにおける信頼性を損なう。
この欠損は、生成プロセス中に制約情報を組み込む体系的なメカニズムの欠如から生じる。
本稿では,LLMの制約に対する本質的な焦点強化を目的とした新しいRLフレームワークであるConstraint-Aware Reinforcement Learning (CARL)を提案する。
- 参考スコア(独自算出の注目度): 25.005954937023052
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Despite their strong reasoning capabilities and extensive world knowledge, Large Language Models (LLMs) frequently generate plans that violate task constraints, undermining their reliability in real-world applications. This deficiency arises from a lack of systematic mechanisms to incorporate constraint information during the generation process. While existing approaches attempt to mitigate this by relying on external tools or task decomposition, they fail to enhance the model's intrinsic constraint awareness. To address this, we propose Constraint-Aware Reinforcement Learning (CARL), a novel RL framework designed to strengthen LLMs' intrinsic focus on constraints. CARL introduces a constraint-aware reward by comparing the model's output distributions under constrained and unconstrained inputs, encouraging constraint focus and penalizing neglect. Compatible with various RL frameworks and requiring no external solvers or top models, CARL enables scalable, end-to-end constraint-aware planning. Extensive experiments on BlocksWorld, TravelPlanner, and T-Eval demonstrate that CARL significantly outperforms standard Reinforcement Fine-Tuning (RFT) baselines and state-of-the-art reasoning models, exhibiting a markedly increased focus on constraints.
- Abstract(参考訳): 強力な推論能力と広範な世界知識にもかかわらず、Large Language Models (LLM) はタスク制約に違反するプランを頻繁に生成し、現実世界のアプリケーションにおける信頼性を損なう。
この欠損は、生成プロセス中に制約情報を組み込む体系的なメカニズムの欠如から生じる。
既存のアプローチでは、外部ツールやタスクの分解に頼ってこれを緩和しようとするが、本質的な制約認識を強化することはできなかった。
これを解決するために,LLMの本質的な制約への焦点を強化するために設計された新しいRLフレームワークであるConstraint-Aware Reinforcement Learning (CARL)を提案する。
CARLは、制約付きおよび制約なしの入力の下でモデルの出力分布を比較し、制約焦点を奨励し、無視を罰することによって、制約対応の報酬を導入する。
さまざまなRLフレームワークと互換性があり、外部のソルバやトップモデルを必要としないため、CARLはスケーラブルでエンドツーエンドの制約対応プランニングを可能にする。
BlocksWorld、TravelPlanner、T-Evalの大規模な実験は、CARLが標準強化細調整(RFT)ベースラインと最先端の推論モデルを大幅に上回っており、制約に重点が置かれていることを示している。
関連論文リスト
- Bridging Auxiliary Constraints to Resolve Instruction Following in Large Reasoning Models [52.87406450655783]
大規模推論モデル(LRM)は多くのタスクにおいて印象的な能力を示してきたが、彼らは確実に複数の命令に従うことに苦労している。
我々はこの課題を制約整合問題(CAP)として定式化する。
本稿では,制約の構造化知識グラフとして命令を表現してCAPに対処する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-02T13:23:28Z) - AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution [61.593935260052795]
Supervised Fine-Tuning (SFT) とReinforcement Learning (RL) による後学習は多モーダル大規模言語モデル(MLLM)における推論の強化に不可欠である
既存のパラダイムは、静的データの制限により、しばしばパフォーマンスのボトルネックに達する。
我々は,真理に順応したデータキュレーションとモデル進化を統合する新しいパラダイムであるアンカー進化(AnE)を提案する。
論文 参考訳(メタデータ) (2026-05-25T08:26:34Z) - Enhancing Reinforcement Learning Fine-Tuning with an Online Refiner [15.619469979987429]
強化学習微調整(RFT)の安定化と退化の防止には制約が不可欠である。
微調整モデルの進化能力に適応するテクスチャ力学的制約を提案する。
対話とコード生成の実験は、動的制約がKL正規化と非制約ベースラインの両方より優れていることを示している。
論文 参考訳(メタデータ) (2026-03-18T08:37:31Z) - PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models [51.43746425777865]
大規模言語モデル(LLM)は、しばしばグローバル戦略を定式化する能力に欠けており、長い水平タスクにおけるエラーの伝播につながる。
PILOTは,大規模モデルの戦略的監視を本質的な潜伏誘導に内部化するためのフレームワークである。
論文 参考訳(メタデータ) (2026-01-07T12:38:56Z) - Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning [52.03884701766989]
オフライン強化学習(RL)アルゴリズムは、通常、アクション選択に制約を課す。
本稿では,Bellmanターゲットにおける行動選択を,データセットアクションの近傍の結合に制限する新しい地区制約を提案する。
我々は,この制約を満たす目標動作を用いてQ学習を行うための,単純で効果的なアルゴリズムであるAdaptive Neighborhood-Constrained Q Learning(ANQ)を開発した。
論文 参考訳(メタデータ) (2025-11-04T13:42:05Z) - ConstraintLLM: A Neuro-Symbolic Framework for Industrial-Level Constraint Programming [9.69748612176497]
制約プログラミング(CP)は実世界の制約最適化問題(COP)を解決するための重要な技術である
大きな言語モデル(LLM)を使用してCOPの形式的モデリングを自動的に生成することは、象徴的解決者の助けを借りて、ニューロシンボリックAIを構築するという、有望なアプローチになりつつある。
本稿では,CPモデリングに特化した最初のLLMであるConstraintLLMを紹介する。
CPモデリングのための最初の産業レベルのベンチマークであるIndusCPを構築し,リリースする。
論文 参考訳(メタデータ) (2025-10-07T10:43:39Z) - POT: Inducing Overthinking in LLMs via Black-Box Iterative Optimization [28.771942726400084]
我々は,ブラックボックス攻撃フレームワークのPOT(Prompt-Only OverThinking)を提案する。
PoTは他の方法に比べて優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-08-23T16:27:42Z) - R-ConstraintBench: Evaluating LLMs on NP-Complete Scheduling [0.0]
R-ConstraintBenchは、資源制約計画スケジューリング問題(RCPSP)のモデルを評価するフレームワークである。
データセンターのマイグレーション設定でベンチマークをインスタンス化し、実行可能性とエラー分析を用いて複数のLCMを評価する。
実証的には、強いモデルは優先順位のみのDAGでほぼシーリングされるが、ダウンタイム、時間的ウィンドウ、および解離的制約が相互作用すると、実現可能性のパフォーマンスは低下する。
論文 参考訳(メタデータ) (2025-08-21T03:35:58Z) - Scalable Chain of Thoughts via Elastic Reasoning [61.75753924952059]
Elastic Reasoningは、スケーラブルな思考の連鎖のための新しいフレームワークである。
推論は、独立して割り当てられた予算で、思考と解決の2つのフェーズに分けられる。
我々のアプローチは、制約のない設定でもより簡潔で効率的な推論をもたらす。
論文 参考訳(メタデータ) (2025-05-08T15:01:06Z) - Navigating Demand Uncertainty in Container Shipping: Deep Reinforcement Learning for Enabling Adaptive and Feasible Master Stowage Planning [3.565151496245487]
本研究では、状態依存的制約を伴う逐次動的意思決定問題に対処する。
関連性のある実世界のケーススタディとして、コンテナの出荷におけるストーッジ計画の問題に注目します。
本稿では,凸制約を満たすエンコーダ・デコーダモデルとファシビリティ層を備えた深いRLフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-18T11:18:17Z) - Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification [76.14641982122696]
本稿では,属性制御付き大規模言語モデル(LLM)の制約学習スキーマを提案する。
提案手法は, ベンチマーク上での競合性能と毒性検出タスクを達成しながら, 不適切な応答を少ないLCMに導出することを示す。
論文 参考訳(メタデータ) (2024-10-07T23:38:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。