論文の概要: DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing
- arxiv url: http://arxiv.org/abs/2608.20161v1
- Date: Thu, 20 Aug 2026 15:16:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 20:28:51.624172
- Title: DARS: Dual-Level Credit Assignment RL with Structured Reasoning for Instruction-Based Image Editing
- Title(参考訳): DARS: インストラクションベースの画像編集のための構造化推論付きデュアルレベルクレジットアサインメントRL
- Abstract要約: 本稿では,2段階クレジット代入のための強化学習フレームワークであるDARSを提案する。
DARSは、同じバックボーン、データ、報酬モデル、ロールアウト予算で、JointRLベースラインを上回っていることを示す。
- 参考スコア(独自算出の注目度): 10.682353786796734
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Instruction-based image editing uses a planner-renderer pipeline: a vision-language model (VLM) first converts the instruction into an edit plan, and a diffusion model then executes that plan. Training such systems with only final-image rewards is inefficient because a poor edit does not reveal whether additional optimization should place more emphasis on the planner or the renderer, and even planner-dominant cases remain difficult to localize within a free-form reasoning trace. We present DARS, a reinforcement learning framework for dual-level credit assignment in this two-stage setting. Across modules, multi-plan multi-render rollouts estimate between-plan and within-plan reward variability for soft module routing, while rollout mean rewards provide hardness estimates for an adaptive curriculum. Within the planner, a four-field structured reasoning output enables a prefix-gated reward and token-level advantage reweighting, turning outcome-level feedback into localized supervision. Experiments on five benchmarks show that DARS outperforms a Joint~RL baseline with the same backbone, data, reward model, and rollout budget, with the largest gains on reasoning-intensive edits.
- Abstract(参考訳): 視覚言語モデル(VLM)はまず命令を編集計画に変換し、拡散モデルはその計画を実行する。
最終的な報酬しか持たないシステムのトレーニングは非効率である。なぜなら、編集が貧弱な場合には、追加の最適化がプランナーやレンダラーに重きを置くべきかどうかを明らかにしず、プランナーが支配するケースでさえ、フリーフォームの推論トレース内でのローカライズが困難である。
本稿では,この2段階設定における2段階クレジット代入のための強化学習フレームワークであるDARSを提案する。
モジュール全体にわたって、マルチプランマルチレンダーロールアウトは、ソフトモジュールルーティングのための計画間および計画内報酬変動を推定し、ロールアウト平均報酬は適応的なカリキュラムに対して硬度推定を提供する。
プランナー内では、4つのフィールド構造的推論出力によりプレフィックス付き報酬とトークンレベルの優位性の再重み付けが可能になり、結果レベルのフィードバックを局所的な監視に変換する。
5つのベンチマークの実験では、DARSは同じバックボーン、データ、報酬モデル、ロールアウト予算でJoint~RLベースラインを上回り、推論集約的な編集で最大の利益が得られた。
関連論文リスト
- REChart: Reasoning-Efficient Chart Editing with Large Reasoning Models [6.014442477518621]
中間的推論ステップに対するプロセスレベルの監視を提供する2段階のトレーニングフレームワークであるREChartを紹介します。
まず,大規模な画像インストラクションコードプールから200kの高品質推論軌道を合成し,教師付き微調整を行う。
第二に、コード正当性、視覚的忠実性、構造的整合性を評価し、各ロールアウトにランダムな思考予算を割り当てる即効性報酬という2つの相補的な報酬を用いて、強化学習によるモデルを最適化する。
論文 参考訳(メタデータ) (2026-08-18T06:26:45Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition [62.56752617853322]
アウトカムベースの報酬はスパースフィードバックのみを提供するが、トラジェクトリによる報酬は注釈付き参照ソリューションに依存している。
本稿では,関数スキーマと実行時実行を直接管理する報奨フレームワークであるtrajectory-Invariant Execution Rewardsを提案する。
論文 参考訳(メタデータ) (2026-05-16T03:47:26Z) - DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing [41.08605870394525]
我々は、固定生成モデル(編集者)よりも計画モジュール(Thinker)を独立に最適化するためのThinker中心のフレームワークを提案する。
このフレームワークは、フィードバックを検証可能なチェックリストによって実装された2つの異なる原子報酬に分解する。
RISE-Bench や KRIS-Bench などの推論駆動画像編集ベンチマークの実験は,我々の手法が全体的な性能を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-04-28T10:30:01Z) - VisFly-Lab: Unified Differentiable Framework for First-Order Reinforcement Learning of Quadrotor Control [11.762246555812554]
微分可能なシミュレーションによる一階強化学習は、二次制御に有望である。
しかし、実際の進歩はタスク固有の設定で断片化されている。
マルチタスク四元数制御のための統合微分可能なフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-22T08:42:26Z) - Agentic Planning with Reasoning for Image Styling via Offline RL [66.10749901925941]
直接的なプロンプトベースの編集は複雑な変換では失敗するが、なぜなら曖昧で主観的なプロンプトは、画像に何を変更するべきかを微妙に理解する必要がしばしばあるからである。
ツールベースのエージェントRLポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T11:14:37Z) - ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing [33.888289858260706]
画像編集の質を向上させるために,強化学習(RL)について検討した。
RL は,(1) ノイズ除去に限定した推論探索,(2) バイアスド報酬融合,(3) 不安定な VLM ベースの命令報酬の3つの主要な課題に直面している。
画像合成から視覚的推論を分離する推論中心のRLフレームワークであるThinkRL-Editを提案する。
論文 参考訳(メタデータ) (2026-01-06T23:43:00Z) - RePlan: Reasoning-guided Region Planning for Complex Instruction-based Image Editing [80.70169829264812]
RePlanは、視覚言語プランナーと拡散エディタを結合した計画実行フレームワークである。
プランナーはステップバイステップの推論を通じて命令を分解し、ターゲット領域に明示的に配置する。
エディタはトレーニング不要のアテンションリージョンインジェクション機構を使用して変更を適用する。
論文 参考訳(メタデータ) (2025-12-18T18:34:23Z) - Learning a Dense Reasoning Reward Model from Expert Demonstration via Inverse Reinforcement Learning [50.20267980386502]
我々は、専門家によるデモンストレーションから直接、プロセスの監督のための密集したトークンレベルの報酬モデルを学びます。
学習された推論報酬は、2つの補完的な役割を果たす: (i)訓練中の推論ポリシーを最適化するためのステップレベルのフィードバックを提供する。
論文 参考訳(メタデータ) (2025-10-02T09:55:26Z) - DART: Dual Adaptive Refinement Transfer for Open-Vocabulary Multi-Label Recognition [59.203152078315235]
Open-Vocabulary Multi-Label Recognition (OV-MLR)は、画像内の複数の見えないオブジェクトカテゴリを識別することを目的としている。
ビジョンランゲージ事前学習モデルは強力なオープン語彙基盤を提供するが、弱い監督下では微粒な局所化に苦慮する。
本稿では,これらの制約を克服するためのDART(Dual Adaptive Refinement Transfer)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-07T17:22:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。