論文の概要: Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO
- arxiv url: http://arxiv.org/abs/2607.11581v1
- Date: Mon, 13 Jul 2026 14:00:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.497652
- Title: Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO
- Title(参考訳): アクターの批判 : CycleGRPOによる地域理解と地域化
- Abstract要約: Cycle Group Relative Policy Optimization (CycleGRPO) は、マルチモーダル大言語モデル(MLLM)の領域理解とローカライゼーションを共同で最適化する。
1つのMLLMはまずアクターとして地域キャプションを生成し、その後すぐに批評家に移行し、生成されたテキストを空間領域に戻す。
テキストキャプションのセマンティックな識別性を評価するために、品質を意識したトークンレベルのサイクル一貫性報酬を用いる。
- 参考スコア(独自算出の注目度): 43.173161414861966
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper introduces Actor as Its Own Critic, a unified reinforcement learning framework, Cycle Group Relative Policy Optimization (CycleGRPO), that jointly optimizes region understanding and localization for Multimodal Large Language Models (MLLMs). Unlike existing separate pipelines, we leverage the inherent duality between the two tasks to construct a self-evaluating reinforcement learning paradigm: "region $\to$ text $\to$ region''. Specifically, a single MLLM first acts as the actor to generate region captions, then immediately transitions to a critic to ground its generated text back in the spatial domain. Therefore, CycleGRPO requires only region inputs, e.g., masks or bounding boxes, entirely bypassing the need for textual ground truths. A quality-aware token-level cycle-consistency reward is employed to assess the semantic discriminability of text captions via their physical localization accuracy. Empirically, built upon SAMTok, our CycleGRPO framework successfully bootstraps both capabilities simultaneously. Without any task-specific fine-tuning, the framework yields consistent performance gains across a wide range of benchmarks, including region captioning, region VQA, grounded dialogue, and referring segmentation. Overall, CycleGRPO offers a straightforward and scalable way to advance pixel-level capabilities in MLLMs. Code and models are released at https://github.com/devinxzhang/CycleGRPO.
- Abstract(参考訳): 本稿では,マルチモーダル大規模言語モデル(MLLM)の領域理解とローカライゼーションを共同で最適化する,統合強化学習フレームワークであるCycleGRPO(CycleGRPO)であるActor as Its Own Criticを紹介する。
既存の独立したパイプラインとは異なり、我々は2つのタスクの固有の双対性を利用して自己評価強化学習パラダイムを構築します。
具体的には、1つのMLLMがまずアクターとして地域キャプションを生成し、その後すぐに批評家に移行し、生成されたテキストを空間領域に戻す。
そのため、CycleGRPOは領域入力(例えばマスクやバウンディングボックス)しか必要とせず、テキスト基底真理の必要性を完全に回避している。
テキストキャプションのセマンティックな識別性を評価するために, 品質を意識したトークンレベルのサイクル整合性報酬を用いる。
SAMTok上に構築された私たちのCycleGRPOフレームワークは、両方の機能を同時にブートストラップすることに成功しました。
タスク固有の微調整がなければ、このフレームワークは、領域キャプション、領域VQA、接地ダイアログ、参照セグメンテーションなど、幅広いベンチマークで一貫したパフォーマンス向上が得られる。
全体として、CycleGRPOはMLLMでピクセルレベルの能力を向上するための、単純でスケーラブルな方法を提供する。
コードとモデルはhttps://github.com/devinxzhang/CycleGRPO.comで公開されている。
関連論文リスト
- From Coordinates to Candidate Regions: Temporal Change Localization via Region Selection in Remote Sensing Multimodal LLMs [48.93485452013392]
マルチモーダル大言語モデル (RS-MLLM) は、衛星画像に対する高度なシーン理解と視覚的質問応答を持つ。
本稿では,自然画像MLLMで探索された領域選択パラダイムのRS特異的な定式化について述べる。
本フレームワークでは,テキスト条件付き領域提案モジュールを用いて,各候補を空間的および時間的手がかりに富んだフレーム単位の視覚的特徴を持つ特別なトークンとして符号化する。
論文 参考訳(メタデータ) (2026-09-08T07:59:21Z) - PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle [31.234013315817858]
PixVLは、ピクセルレベルのマルチモーダルな大規模言語モデルのための自己教師付きポストトレーニングフレームワークである。
地域記述を生成し、自己検証し、ラベルのないデータから学習する。
実験によりPixVLは領域理解とセグメンテーションの両方を改善することが示された。
論文 参考訳(メタデータ) (2026-08-02T16:13:52Z) - ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search [12.859616063162491]
テキストベースパーソンサーチモデルは、大域的な表現バイアスと短いキャプションでのトレーニングから受け継がれた意味空間性のために、きめ細かな理解に苦慮している。
ROGLEは、自動化された領域間マッチング戦略により、コストのかかる手作業によるアノテーションへの依存を克服する統合フレームワークである。
また、P-VLGベンチマーク(P-VLG Benchmark)についても紹介する。
論文 参考訳(メタデータ) (2026-06-01T07:41:44Z) - Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation [52.8308168727975]
Seg-Agentは完全にトレーニング不要のフレームワークで、Explicit Multimodal Chain-of-Reasoningの先駆者です。
提案手法は, 生成, 選択, 洗練の3段階からなる対話型視覚推論ループを構築する。
various-LangSegは、明示的なセマンティック、ジェネリックオブジェクト、推論誘導セグメンテーションタスクをカバーする新しいベンチマークである。
論文 参考訳(メタデータ) (2026-05-13T03:36:44Z) - Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding [26.30521907946121]
Qwen3-VL-SegはMLLM予測ボックスを意味論的基盤構造として扱うパラメータ効率のよいフレームワークである。
その中核は、軽量のボックス誘導マスクデコーダで、マルチスケールの空間的特徴注入、空間意味的クエリ構築、ボックス誘導高解像度ピクセル融合を組み合わせている。
Qwen3-VL-Segはクローズドセットとオープンワールド設定で強く機能することを示す。
論文 参考訳(メタデータ) (2026-05-08T02:20:40Z) - Connecting the Dots: Training-Free Visual Grounding via Agentic Reasoning [63.109585527799005]
GroundingAgentは、タスク固有の微調整なしで動作するビジュアルグラウンドティングフレームワークである。
広く使用されているベンチマークでは、平均ゼロショットグラウンドの精度は65.1%である。
また、強い解釈可能性を提供し、各推論ステップを透過的に照らす。
論文 参考訳(メタデータ) (2025-11-24T03:11:08Z) - FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning [62.11389260206383]
textscFineRSは、非常に小さなオブジェクトをセグメント化するための2段階のMLLMベースの強化学習フレームワークである。
textscFineRS-4kは,属性レベルの推論に基づくMLLMの評価と,微妙で小規模なターゲットに対する画素レベルのセグメンテーションのための新しいデータセットである。
論文 参考訳(メタデータ) (2025-10-24T10:14:17Z) - ESCA: Contextualizing Embodied Agents via Scene-Graph Generation [47.008144510161486]
本研究では,空間的時間的シーングラフの認識を基盤として,エンボディーズエージェントを文脈的に認識するフレームワークであるESCAを提案する。
コアとなるSGCLIPは、シーングラフを生成するための、新しく、オープンドメインで、プロンプト可能な基盤モデルである。
SGCLIPは、プロンプトベースの推論とタスク固有の微調整の両方で優れており、シーングラフ生成とアクションローカライゼーションベンチマークにおける最先端の結果を達成する。
論文 参考訳(メタデータ) (2025-10-11T20:13:59Z) - URECA: Unique Region Caption Anything [29.363967361960043]
地域レベルのキャプションは、特徴を強調しながら、特定の画像領域の自然言語記述を生成することを目的としている。
マルチグラニュラリティ領域キャプションに適した大規模データセットであるURECAデータセットを紹介する。
多粒度領域を効果的に符号化する新しいキャプションモデルであるURECAを提案する。
論文 参考訳(メタデータ) (2025-04-07T17:59:44Z) - Global and Local Semantic Completion Learning for Vision-Language
Pre-training [34.740507502215536]
クロスモーダルアライメントは、視覚言語事前学習モデルにおいて重要な役割を果たす。
グローバル・ローカル・セマンティック・コンプリート・ラーニング(GLSCL)タスクを提案し,グローバル・ローカル・アライメントとローカル・ローカル・アライメントを同時に行う。
論文 参考訳(メタデータ) (2023-06-12T13:20:29Z) - Context-aware Biaffine Localizing Network for Temporal Sentence
Grounding [61.18824806906945]
本論文では時間文接地(TSG)の問題について述べる。
TSGは、文章クエリによって、未トリムのビデオから特定のセグメントの時間境界を特定することを目指しています。
ビデオ内の開始と終了の全てのインデックスをバイアフィン機構で同時にスコア付けする,新しいローカリゼーションフレームワークを提案する。
論文 参考訳(メタデータ) (2021-03-22T03:13:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。