論文の概要: TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration
- arxiv url: http://arxiv.org/abs/2603.27742v1
- Date: Sun, 29 Mar 2026 15:50:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:45.094569
- Title: TIR-Agent: Training an Explorative and Efficient Agent for Image Restoration
- Title(参考訳): TIR-Agent:画像修復のための探索的で効率的なエージェントの訓練
- Authors: Yisheng Zhang, Guoli Jia, Haote Hu, Shanxu Zhao, Kaikai Zhao, Long Sun, Xinwei Long, Kai Tian, Che Jiang, Zhaoxiang Liu, Kai Wang, Shiguo Lian, Kaiyan Zhang, Bowen Zhou,
- Abstract要約: TIR-Agentは、2段階のトレーニングパイプラインを通じて直接ツールコールポリシーを実行する訓練可能なイメージ復元エージェントである。
i) SFTデータに適用されたランダムな摂動戦略により、タスクスケジュールやツール構成に対するポリシーの探索を拡大し、(ii)ハッキングに対して動的に不均一な画像品質メトリクスを再重み付けする多次元適応報酬機構である。
- 参考スコア(独自算出の注目度): 25.116475029653884
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language agents that orchestrate specialized tools for image restoration (IR) have emerged as a promising method, yet most existing frameworks operate in a training-free manner. They rely on heuristic task scheduling and exhaustive tool traversal, resulting in sub-optimal restoration paths and prohibitive computational cost. We argue that the core bottleneck lies in the absence of a learned policy to make decision, as a vision-language model cannot efficiently handle degradation-aware task ordering and tool composition. To this end, we propose TIR-Agent, a trainable image restoration agent that performs a direct tool-calling policy through a two-stage training pipeline of supervised fine-tuning (SFT) followed by reinforcement learning (RL). Two key designs underpin effective RL training: (i) a random perturbation strategy applied to the SFT data, which broadens the policy's exploration over task schedules and tool compositions, and (ii) a multi-dimensional adaptive reward mechanism that dynamically re-weights heterogeneous image quality metrics to mitigate reward hacking. To support high-throughput, asynchronous GPU-based tool invocation during training, we further develop a globally shared model-call pool. Experiments on both in-domain and out-of-domain degradations show that TIR-Agent outperforms 12 baselines, including 6 all-in-one models, 3 training-free agents, and 3 proprietary models, and achieves over 2.5$\times$ inference speedup by eliminating redundant tool executions.
- Abstract(参考訳): 画像復元のための特殊なツール(IR)を編成する視覚言語エージェントは、有望な手法として登場したが、既存のフレームワークのほとんどは、トレーニングなしの方法で動作している。
それらはヒューリスティックなタスクスケジューリングと徹底的なツールトラバーサルに依存しており、結果として準最適復元パスと禁忌な計算コストが生じる。
我々は、視覚言語モデルでは、劣化認識タスクの順序付けやツール構成を効率的に扱えないため、学習した意思決定方針が欠如していることが中心的なボトルネックであると主張している。
この目的のために、教師付き微調整(SFT)と強化学習(RL)の2段階トレーニングパイプラインを介して直接ツールコールポリシーを実行する訓練可能なイメージ復元エージェントであるTIR-Agentを提案する。
効果的なRLトレーニングを支える2つの重要な設計。
i) SFTデータに適用されたランダムな摂動戦略で、タスクスケジュールやツール構成に関する政策の探索を拡大し、
二 報酬ハッキングを緩和するために、不均一な画像品質指標を動的に重み付けする多次元適応報酬機構。
トレーニング中の高スループットで非同期なGPUベースのツール呼び出しをサポートするため、我々はさらにグローバルに共有されたモデルコールプールを開発する。
ドメイン内およびドメイン外での実験では、TIR-Agentは6つのオールインワンモデル、3つのトレーニングフリーエージェント、3つのプロプライエタリモデルを含む12のベースラインを上回り、冗長なツールの実行を排除して2.5$\times$推論スピードアップを達成している。
関連論文リスト
- TopoCurate:Modeling Interaction Topology for Tool-Use Agent Training [53.93696896939915]
訓練用ツール使用エージェントは一般的に、パスレート選択されたタスクに対して、軌道変更の成功と強化学習(RL)に依存している。
TopoCurateは,同一タスクから多段階的なロールアウトを統一的な意味的商トポロジに投影する対話型フレームワークである。
TopoCurateは最先端のベースラインに対して4.2%(SFT)と6.9%(RL)という一貫したゲインを達成している。
論文 参考訳(メタデータ) (2026-03-02T10:38:54Z) - AgentMath: Empowering Mathematical Reasoning for Large Language Models via Tool-Augmented Agent [80.83250816918861]
o3やDeepSeek-R1のようなLarge Reasoning Models (LRM)は、長いチェーン・オブ・シークレットを持つ自然言語推論において顕著な進歩を遂げている。
しかし、計算的に非効率であり、複雑な数学的操作を必要とする問題を解く際には精度に苦しむ。
本稿では,言語モデルの推論能力とコードインタプリタの計算精度をシームレスに統合するエージェントフレームワークであるAgentMathを紹介する。
論文 参考訳(メタデータ) (2025-12-23T19:57:49Z) - Training Multi-Image Vision Agents via End2End Reinforcement Learning [51.81337984526068]
我々は、エンドツーエンドの強化学習によって訓練されたオープンソースの視覚エージェントであるIMAgentを提案する。
マルチエージェントシステムを利用することで、困難かつ視覚的にリッチなマルチイメージQAペアを生成する。
我々は、視覚的反射と確認のための2つの特別なツールを開発し、モデルが積極的に画像コンテンツに注意を向けることを可能にする。
論文 参考訳(メタデータ) (2025-12-05T10:02:38Z) - Reinforcement Learning for Machine Learning Engineering Agents [52.03168614623642]
強化学習によって改善される弱いモデルによって支援されるエージェントは、はるかに大きいが静的モデルによって支援されるエージェントよりも優れていることを示す。
分散非同期RLフレームワークにおいて,高コストかつ高利回りな動作を増幅するための時間依存性の勾配更新を提案する。
また,早期に失敗するプログラムとほぼ正しくないプログラムを区別し,部分クレジットを提供する環境機器を提案する。
論文 参考訳(メタデータ) (2025-09-01T18:04:10Z) - VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use [78.29315418819074]
VerlToolは、体系的な設計原則を通じて制限に対処する統一的でモジュール化されたフレームワークです。
我々のフレームワークはARLTをマルチターントラジェクトリとして定式化し、マルチモード観測トークン(テキスト/画像/ビデオ)を単一ターンRLVRパラダイムを超えて拡張する。
モジュール化されたプラグインアーキテクチャは、軽量Python定義のみを必要とする迅速なツール統合を可能にする。
論文 参考訳(メタデータ) (2025-09-01T01:45:18Z) - MENTOR: Mixture-of-Experts Network with Task-Oriented Perturbation for Visual Reinforcement Learning [17.437573206368494]
視覚深部強化学習(RL)は、ロボットが非構造化タスクの視覚入力からスキルを習得することを可能にする。
本稿では,RLエージェントのアーキテクチャと最適化の両方を改善する手法であるMENTORを提案する。
MenTORは3つのシミュレーションベンチマークで最先端の手法を上回り、挑戦的な3つの現実世界のロボット操作タスクで平均83%の成功率を達成した。
論文 参考訳(メタデータ) (2024-10-19T04:31:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。