論文の概要: Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
- arxiv url: http://arxiv.org/abs/2607.10601v1
- Date: Sun, 12 Jul 2026 06:38:55 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.478932
- Title: Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
- Title(参考訳): Agentic-DPO:ImitationからAgenic Policy Optimizationへ
- Abstract要約: 大規模言語モデル(LLM)エージェントは、教師付き微調整を用いて専門家の軌道から一般的に訓練される。
この問題を緩和する既存の方法は、好みの学習や強化学習である。
本稿では,軽量オフラインエージェントポリシー最適化手法であるAgentic-DPOを提案する。
- 参考スコア(独自算出の注目度): 8.282089724857528
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) agents are commonly trained from expert trajectories using supervised fine-tuning (SFT), which treats multi-turn agent behavior as ordinary text imitation. This recipe is simple and low-cost, but it only learns to imitate the sequence of expert actions, rather than training the agent to choose the right action against plausible mistakes at each state. Existing methods to mitigate this problem include preference learning or reinforcement learning, but they usually need high-cost environment rollouts and reward models. We propose Agentic-DPO, a lightweight offline agent policy optimization method that turns expert trajectories into state-conditioned preference supervision. At each expert action state, Agentic-DPO samples a one-step action from the current state, treats plausible wrong actions as negatives, and contrasts them with the expert action using a DPO-style preference objective. To avoid mixing both policy and schema in preference learning, we introduce Policy-Preserving Augmentation (PPA), which renders the same latent trajectory under multiple schemas while keeping the expert policy fixed. Agentic-DPO requires no online environment rollout, reward model, or full-trajectory student exploration. We conduct experiments across StableToolBench, tau-bench retail, and Mind2Web, where Agentic-DPO consistently improves agents at different model scales beyond imitation. In particular, it raises tau-bench accuracy from 21.7% (SFT) to 41.4% for a 9B model, matching online GRPO under the same backbone with only step-level rollouts and without environment interaction during gradient steps. The results suggest that expert trajectories can support low-cost agentic policy optimization when converted from demonstrations into state-level action preferences. Code for Agentic-DPO is released at https://github.com/Schuture/Agentic-DPO.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、教師付き微調整(SFT)を用いて専門家の軌道から訓練される。
このレシピはシンプルで低コストだが、各州でもっともらしい間違いに対して適切な行動を選択するようにエージェントを訓練するのではなく、専門家の行動の順序を真似ることしか学ばない。
この問題を緩和するための既存の方法は、好みの学習や強化学習であるが、彼らは通常、高コストの環境ロールアウトと報酬モデルを必要としている。
本稿では、専門家の軌道を状態条件付き優先監視に変換する軽量オフラインエージェントポリシー最適化手法であるAgentic-DPOを提案する。
それぞれの専門家行動状態において、エージェントDPOは現在の状態から一段階のアクションをサンプリングし、実証可能な間違ったアクションを否定として扱い、DPOスタイルの好みの目的を使って専門家行動と対比する。
プライオリティ学習におけるポリシとスキーマの混在を回避するため,複数のスキーマの下で同じ潜在軌道を描画し,専門家のポリシを固定した上でPPA(Policy-Preserving Augmentation)を導入する。
Agentic-DPOは、オンライン環境のロールアウト、報酬モデル、フル軌道の学生探索を必要としない。
我々はStableToolBench、tau-bench retail、Mind2Webで実験を行い、Agentic-DPOは模倣以上のさまざまなモデルスケールのエージェントを一貫して改善します。
特に、Tau-benchの精度は、9Bモデルでは21.7%(SFT)から41.4%に向上し、オンラインGRPOを同じバックボーンの下にマッチングし、ステップレベルのロールアウトのみで、グラデーションステップの間は環境相互作用がない。
その結果,実証から状態レベルの行動嗜好に変換された場合,専門家の軌道は低コストなエージェントポリシー最適化を支援することが示唆された。
Agentic-DPOのコードはhttps://github.com/Schuture/Agentic-DPOで公開されている。
関連論文リスト
- Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution [25.26084224278813]
Role-Agentは単一のLarge Language Model(LLM)を使用してエージェントと環境の両方として同時に機能する。
Role-Agentはパフォーマンスを継続的に改善し、強いベースラインよりも平均4%以上向上する。
論文 参考訳(メタデータ) (2026-06-09T14:28:07Z) - ProAct: Agentic Lookahead in Interactive Environments [56.50613398808361]
ProActは、2段階のトレーニングパラダイムを通じて、エージェントが正確なルックアヘッド推論を内部化することを可能にするフレームワークである。
そこでは,環境に基づく探索から得られたトラジェクトリの微調整をエージェントが行うGLAD(Grounded LookAhead Distillation)を紹介する。
また,政策段階のアルゴリズムを改良する補助値推定器であるモンテカルロ批判(MC-Critic)を提案する。
論文 参考訳(メタデータ) (2026-02-05T05:45:16Z) - Multi-Agent Deep Research: Training Multi-Agent Systems with M-GRPO [24.532870400949424]
現在の訓練方法は、システム内のすべてのエージェントに対して統一された大きな言語モデルを訓練する。
これにより、異なるエージェントの基本的な分布が異なるため、パフォーマンスが制限される可能性がある。
垂直多エージェントシステムに対するグループ相対ポリシー最適化の階層的拡張であるM-GRPOを提案する。
論文 参考訳(メタデータ) (2025-11-17T12:06:30Z) - Agentic Reinforcement Learning with Implicit Step Rewards [92.26560379363492]
大規模言語モデル (LLMs) は強化学習 (agentic RL) を用いた自律的エージェントとして発展している。
我々は,標準RLアルゴリズムとシームレスに統合された一般的なクレジット割り当て戦略であるエージェントRL(iStar)について,暗黙的なステップ報酬を導入する。
我々は,WebShopとVisualSokobanを含む3つのエージェントベンチマークと,SOTOPIAにおける検証不可能な報酬とのオープンなソーシャルインタラクションについて評価した。
論文 参考訳(メタデータ) (2025-09-23T16:15:42Z) - SAND: Boosting LLM Agents with Self-Taught Action Deliberation [54.48979740613828]
大規模言語モデル(LLM)エージェントは、通常、ReActスタイルの専門家軌道の教師付き微調整や、ペアのロールアウトよりも好みの最適化で調整される。
本稿では,自己学習型アクチオN審議(SAND)フレームワークを提案する。
SANDは、初期教師付き微調整よりも平均20%改善し、また最先端のエージェントチューニングアプローチより優れている。
論文 参考訳(メタデータ) (2025-07-10T05:38:15Z) - SDPO: Segment-Level Direct Preference Optimization for Social Agents [56.970902914217156]
大規模言語モデル(LLM)を利用した社会エージェントは、人間の社会的振る舞いをシミュレートできるが、複雑な社会対話を扱うには不十分である。
マルチターンエージェントの動作を最適化するために,対話内のキーセグメントを動的に選択するセグメントレベル直接参照最適化(SDPO)を提案する。
論文 参考訳(メタデータ) (2025-01-03T14:09:46Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z) - Adaptive Opponent Policy Detection in Multi-Agent MDPs: Real-Time Strategy Switch Identification Using Running Error Estimation [1.079960007119637]
OPS-DeMoは、動的エラー減衰を利用して相手のポリシーの変更を検出するオンラインアルゴリズムである。
提案手法は,プレデター・プレイ設定のような動的シナリオにおいて,PPO学習モデルよりも優れている。
論文 参考訳(メタデータ) (2024-06-10T17:34:44Z) - D2PO: Discriminator-Guided DPO with Response Evaluation Models [63.71853401569461]
学習を通して嗜好が収集されるオンライン環境において,識別器誘導型DPOであるD2POを提案する。
金の選好を収集する際、これらは政策の訓練だけでなく、銀ラベルによる政策訓練のためのさらに総合的なデータに対する差別的な反応評価モデルを訓練するために利用します。
DPOで政策を訓練し、従来のPPOを上回り、政策モデルから分離した差別者を維持することの恩恵を受けるのが最も効果的である。
論文 参考訳(メタデータ) (2024-05-02T17:44:41Z) - Robust Policy Optimization in Deep Reinforcement Learning [16.999444076456268]
連続的な行動領域では、パラメータ化された行動分布は容易に探索の制御を可能にする。
特に,摂動分布を利用したロバストポリシ最適化(RPO)アルゴリズムを提案する。
我々は,DeepMind Control,OpenAI Gym,Pybullet,IsaacGymの各種連続制御タスクについて評価を行った。
論文 参考訳(メタデータ) (2022-12-14T22:43:56Z) - Explaining Reinforcement Learning Policies through Counterfactual
Trajectories [147.7246109100945]
人間の開発者は、RLエージェントがテスト時にうまく機能することを検証しなければならない。
本手法では, エージェントの挙動をより広い軌道分布で示すことにより, エージェントの挙動を分布変化下で表現する。
本研究では,2つのエージェント検証タスクのうちの1つに対して,ベースライン法よりも優れたスコアを得られることを示す。
論文 参考訳(メタデータ) (2022-01-29T00:52:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。