論文の概要: Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning
- arxiv url: http://arxiv.org/abs/2607.15374v1
- Date: Thu, 16 Jul 2026 18:18:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.679408
- Title: Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning
- Title(参考訳): 強化学習による推論ガイド付き部分レベル視覚接地
- Abstract要約: そこで我々は,親オブジェクトを位置づけし,その内部を位置決めする推論誘導型接地戦略を提案する。
この方法でトレーニングされた4Bモデルは、PascalPart、PartImageNet、InstructPartで7BのグラウンドングLLMとSAM3を上回り、推論セグメンテーションに転送する。
- 参考スコア(独自算出の注目度): 12.320501636949837
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multimodal large language models (MLLMs) ground whole objects well from free-form language queries, but they struggle when the query names a part rather than the object. We trace this to a missing object-part hierarchy, since parts are localized in the same single step used for objects. We propose Object-Part Hierarchical Reflective Grounding (OP-HRG), a coarse-to-fine reasoning-guided grounding strategy that first localizes the parent object and then the part within it. A self-check then reflects on the result, with an extension to re-encode the predicted crop to inspect the region it is correcting. We introduce a part-aware GRPO framework to train our pipeline with stage-wise rewards. A 4B model trained this way outperforms 7B grounding LLMs and SAM3 across PascalPart, PartImageNet, and InstructPart, and transfers to reasoning segmentation.
- Abstract(参考訳): マルチモーダルな大言語モデル (MLLM) は、全てのオブジェクトを自由形式の言語クエリから十分に基礎づけるが、クエリがオブジェクトではなく部分の名前である場合、それらは困難である。
パーツは、オブジェクトに使用されるのと同じ単一のステップでローカライズされるからです。
本稿では,まず親オブジェクトの局所化を行い,その内部部分の局所化を行う粗大な推論誘導接地戦略,OP-HRG(Object-Part Hierarchical Reflective Grounding)を提案する。
次に、自己チェックが結果に反映され、予測された作物を再エンコードして、修正している領域を検査する拡張が提供される。
ステージワイドな報酬でパイプラインをトレーニングするための、パートアウェアなGRPOフレームワークを導入します。
この方法でトレーニングされた4Bモデルは、PascalPart、PartImageNet、InstructPartで7BのグラウンドングLLMとSAM3を上回り、推論セグメンテーションに転送する。
関連論文リスト
- STORM: End-to-End Referring Multi-Object Tracking in Videos [21.06069180171397]
参照マルチオブジェクト追跡(RMOT)は、所定のテキストクエリや参照式にセマンティックにマッチするビデオ内のすべてのオブジェクトを関連付けるタスクである。
既存のRMOTアプローチは、オブジェクトのグラウンドとトラッキングを分離したモジュールに分解し、限られた性能を示す。
統合されたフレームワーク内でグラウンディングとトラッキングを共同で実行するエンドツーエンドのMLLMであるSTORMを紹介します。
論文 参考訳(メタデータ) (2026-04-12T08:43:28Z) - LangHOPS: Language Grounded Hierarchical Open-Vocabulary Part Segmentation [56.12844551763724]
オープンな語彙を持つオブジェクト-部分のインスタンスセグメンテーションのための,MLLM(Multimodal Large Language Model)ベースのフレームワークであるLangHOPSを提案する。
LangHOPSは、オープン語彙候補カテゴリから階層オブジェクトと部分インスタンスを共同で検出し、セグメント化することができる。
論文 参考訳(メタデータ) (2025-10-29T08:21:59Z) - Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation [17.238084264485988]
Referring Video Object (RVOS) は、言語記述に基づいて、ビデオ全体を通して関心のあるオブジェクトをセグメントすることを目的としている。
bftextPARSE-VOSは、Large Language Models (LLMs)を利用したトレーニング不要のフレームワークである。
bftextPARSE-VOSは、Ref-YouTube-VOS、Ref-DAVIS17、MeViSの3つの主要なベンチマークで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2025-09-06T15:46:23Z) - RecBase: Generative Foundation Model Pretraining for Zero-Shot Recommendation [78.01030342481246]
RecBaseは、レコメンデーション指向の目的によって事前訓練されたドメインに依存しない基礎モデルである。
アイテムを階層的な概念識別子にエンコードする統一されたアイテムトークンを導入します。
我々のモデルは、ゼロショットおよびクロスドメインレコメンデーションタスクにおいて、LLMのベースラインの最大7Bパラメータのパフォーマンスを一致または超過します。
論文 参考訳(メタデータ) (2025-09-03T08:33:43Z) - GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation [81.0871900167463]
GeoSAM2は3次元部分分割のためのプロンプト制御可能なフレームワークである。
テクスチャのないオブジェクトが与えられた場合、事前に定義された視点から正規写像とポイントマップを描画する。
部品の選択をガイドするシンプルな2Dプロンプト(クリックやボックス)を受け入れます。
予測されたマスクはオブジェクトにバックプロジェクションされ、ビューに集約される。
論文 参考訳(メタデータ) (2025-08-19T17:58:51Z) - ObjectGS: Object-aware Scene Reconstruction and Scene Understanding via Gaussian Splatting [54.92763171355442]
ObjectGSは3Dシーンをセマンティックな理解と統合するオブジェクト認識フレームワークである。
我々はObjectGSがオープンボキャブラリやパン光学のセグメンテーションタスクにおいて最先端の手法より優れていることを示す実験を通して示す。
論文 参考訳(メタデータ) (2025-07-21T10:06:23Z) - In Defense of Lazy Visual Grounding for Open-Vocabulary Semantic Segmentation [50.79940712523551]
我々は,非教師対象マスク発見の2段階的アプローチである遅延視覚接地を行い,それに続いて物体接地を行う。
私たちのモデルは、追加のトレーニングは必要ありませんが、5つの公開データセットで優れたパフォーマンスを示します。
論文 参考訳(メタデータ) (2024-08-09T09:28:35Z) - WorldAfford: Affordance Grounding based on Natural Language Instructions [4.4269011841945085]
Affordance Groundingは、与えられた指示に従ってシーンイメージ内の操作対象のインタラクション領域をローカライズすることを目的としている。
本稿では,自然言語の指示に基づく新たな手頃なグラウンド化の課題について紹介する。
SAMとCLIPを用いて画像内の割当知識に関連するオブジェクトをローカライズする。
論文 参考訳(メタデータ) (2024-05-21T02:37:45Z) - Rethinking Cross-modal Interaction from a Top-down Perspective for
Referring Video Object Segmentation [140.4291169276062]
ビデオオブジェクトセグメンテーション(RVOS)は、ビデオオブジェクトを自然言語参照のガイダンスでセグメント化することを目的としている。
以前の手法では、画像格子上の言語参照を直接グラウンド化することで、RVOSに対処するのが一般的であった。
そこで本研究では,複数のサンプルフレームから検出されたオブジェクトマスクをビデオ全体へ伝播させることにより,オブジェクトトラッカーの徹底的なセットを構築した。
次に,Transformerベースのトラックレット言語基底モジュールを提案し,インスタンスレベルの視覚的関係とモーダル間相互作用を同時に,効率的にモデル化する。
論文 参考訳(メタデータ) (2021-06-02T10:26:13Z) - Utilizing Every Image Object for Semi-supervised Phrase Grounding [25.36231298036066]
フレーズグラウンドモデルでは、参照式が与えられた画像内のオブジェクトをローカライズする。
本稿では,半教師付き句接頭辞の学習にラベル付きクエリを使わずにオブジェクトを適用した場合について検討する。
提案手法は,提案手法により,クエリをラベル付けせずに対象物から学習し,検出結果と相対的に34.9%の精度で精度を向上できることを示す。
論文 参考訳(メタデータ) (2020-11-05T04:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。