論文の概要: DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation
- arxiv url: http://arxiv.org/abs/2607.04779v1
- Date: Mon, 06 Jul 2026 08:10:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:30.084364
- Title: DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation
- Title(参考訳): DGSeg:Reasoning Segmentationのための意味空間誘導予測の動的ゲーティング
- Abstract要約: 推論セグメンテーションは、複雑な言語クエリが与えられたターゲットに対してピクセルワイズマスクを予測することを目的としている。
本稿では,意味的および空間的手がかりによって導かれる予測を融合させるフレームワークであるDGSegを提案する。
実験によると、DGSegは複数のベンチマークで強いベースラインを一貫して上回っている。
- 参考スコア(独自算出の注目度): 5.5825182710791275
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning segmentation aims to predict pixel-wise masks for targets given complex language queries. Existing approaches leverage Multimodal Large Language Models (MLLMs) for vision-language reasoning and generate intermediate target cues (e.g., points or boxes) to guide a segmentation model. However, compressing rich reasoning into sparse cues often introduces ambiguity and noise, preventing these cues from accurately preserving the reasoning intent. While multiple complementary cues can enrich target information, existing methods typically feed them jointly into a single segmentation process, allowing ambiguous or erroneous cues to affect the entire prediction. Therefore, we propose DGSeg, a reasoning segmentation framework that learns to fuse predictions guided by semantic and spatial cues. Specifically, the MLLM jointly reasons about both target identity and spatial location, producing complementary semantic and spatial cues that are fed into separate segmentation branches. Their predictions are adaptively integrated by a lightweight dynamic gating module trained with relative branch-quality supervision to suppress noisy or conflicting regions. Extensive experiments demonstrate that DGSeg consistently outperforms strong baselines on multiple benchmarks and achieves 69.6% and 67.3% gIoU on the challenging ReasonSeg validation and test splits. Code is available at https://github.com/RZZeng/DGSeg.
- Abstract(参考訳): 推論セグメンテーションは、複雑な言語クエリが与えられたターゲットに対してピクセルワイズマスクを予測することを目的としている。
既存のアプローチでは、視覚言語推論にMLLM(Multimodal Large Language Models)を使用し、中間ターゲットキュー(例えば、ポイントやボックス)を生成してセグメンテーションモデルを導く。
しかし、豊かな推論をスパースキューに圧縮することは曖昧さとノイズをもたらすことが多く、これらの手がかりが推論意図を正確に保存するのを防ぐ。
複数の補完的手がかりはターゲット情報を豊かにすることができるが、既存の手法は通常、それらを単一のセグメンテーションプロセスに共同で供給し、曖昧または誤った手がかりが予測全体に影響を及ぼす。
そこで本稿では,意味的および空間的手がかりによって導かれる予測を融合する推論セグメンテーションフレームワークであるDGSegを提案する。
具体的には、MLLMは目的のアイデンティティと空間的位置の両方について共同で理由を定め、相補的意味と空間的手がかりを生成し、別々のセグメンテーションブランチに供給する。
これらの予測は、比較的分岐品質の監督によって訓練された軽量な動的ゲーティングモジュールによって適応的に統合され、ノイズや矛盾する領域を抑える。
大規模な実験では、DGSegは複数のベンチマークで強いベースラインを一貫して上回り、挑戦的なReasonSeg検証とテスト分割で69.6%と67.3%のgIoUを達成した。
コードはhttps://github.com/RZeng/DGSeg.comで入手できる。
関連論文リスト
- Multi-Agent Reasoning with Adaptive Worker Allocation for Stance Detection [2.8758927043198206]
姿勢検出のためのアダプティブワーカーアロケーションを備えたマルチエージェント推論フレームワークを提案する。
このフレームワークは、アグリゲーションをラベルレベルの投票から推論レベルの合成にシフトする。
Llama, Mistral, Gemini を用いたSemEval-2016, P-Stance, COVID-19 Stance のフレームワークについて検討した。
論文 参考訳(メタデータ) (2026-06-10T03:20:55Z) - CR-Seg: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation [26.21876180083083]
Reasoning segmentation は、複雑な言語で記述されたターゲットオブジェクトを視覚的・テキスト的推論によって分割することを目的としている。
既存の手法では、学習したセマンティックトークンを使ってMLLM(Multimodal Large Language Models)とセグメンテーションモデルをブリッジする。
本稿では,空間分割のための2段階フレームワークCR-Segを提案する。
論文 参考訳(メタデータ) (2026-06-02T12:30:04Z) - Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation [52.8308168727975]
Seg-Agentは完全にトレーニング不要のフレームワークで、Explicit Multimodal Chain-of-Reasoningの先駆者です。
提案手法は, 生成, 選択, 洗練の3段階からなる対話型視覚推論ループを構築する。
various-LangSegは、明示的なセマンティック、ジェネリックオブジェクト、推論誘導セグメンテーションタスクをカバーする新しいベンチマークである。
論文 参考訳(メタデータ) (2026-05-13T03:36:44Z) - AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation [56.21301367698041]
AnchorSegを導入し、画像トークン上での条件生成の構造化として、推論セグメンテーションを再構成する。
我々は、アンカークエリがローカライズ信号を決定する画像トークン上の因子分布として空間条件をモデル化する。
Token-Mask Cycle Consistency (TMCC)を提案する。
論文 参考訳(メタデータ) (2026-04-20T17:49:22Z) - ConInfer: Context-Aware Inference for Training-Free Open-Vocabulary Remote Sensing Segmentation [12.428190609914594]
リモートセンシング画像におけるカテゴリに依存しない意味理解を実現するための,訓練不要なオープン語彙リモートセンシングセグメンテーション (OVRSS) が,有望なパラダイムとして登場した。
我々は,複数の空間単位をまたいだ共同予測を行う,OVRSSのコンテキスト認識推論フレームワークであるConInferを提案する。
本手法は,複雑なリモートセンシング環境におけるセグメンテーションの整合性,堅牢性,一般化を著しく向上させる。
論文 参考訳(メタデータ) (2026-03-31T05:12:02Z) - CORE-Seg: Reasoning-Driven Segmentation for Complex Lesions via Reinforcement Learning [48.77689764063103]
推論駆動型複雑病変セグメンテーションのための最初の多種多様なChain-of-ThoughtベンチマークであるComLesion-14Kを紹介する。
本稿では,セマンティックガイド型プロンプトアダプタによる推論とセグメンテーションを統合したエンドツーエンドフレームワークであるCORE-Segを提案する。
我々の手法は、平均Diceが37.06%(第2ベットベースラインよりも14.89%高い)であり、失敗率は18.42%に低下する。
論文 参考訳(メタデータ) (2026-03-06T04:58:55Z) - Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Remote Sensing [8.731693840957716]
Think2Seg-RSはLVLMプロンプトをトレーニングし、構造化された幾何学的プロンプトを介して凍ったセグメンション・アプライシング・モデル(SAM)を制御するフレームワークである。
このフレームワークは、EarthReasonデータセット上で最先端のパフォーマンスを達成する。
コンパクトセグメンタは、意味レベルの監督の下でより大きなセグメンタより優れており、異種空中背景において負のプロンプトは効果がない。
論文 参考訳(メタデータ) (2025-12-22T11:46:42Z) - CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation [51.25997439181537]
CoPRSは、ヘアマップとしてインスタンス化された、微分可能で解釈可能な位置推定を通じて、セグメンテーションへの言語推論をブリッジする。
学習可能な集中トークンは、画像の特徴と推論テキストを集約して、この位置先を生成する。
論文 参考訳(メタデータ) (2025-10-13T09:07:54Z) - LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance [54.683384204063934]
大規模マルチモーダルモデル(LMM)は不正確なセグメンテーションと幻覚的理解に苦しむ。
視覚的理解とセグメンテーションの相補的関係を生かしたフレームワークであるLIRAを提案する。
LIRAはセグメンテーションと理解タスクの両方で最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-08T07:46:26Z) - Localization and Expansion: A Decoupled Framework for Point Cloud Few-shot Semantic Segmentation [39.7657197805346]
Point Cloud few-shot semantic segmentation (PC-FSS)は、特定のクエリポイントクラウドに、いくつかのアノテーション付きのサポートサンプルで、新しいカテゴリのターゲットをセグメントすることを目的としている。
本稿では,DLE(Decoupled Localization and Expansion)の精神における,シンプルで効果的な枠組みを提案する。
構造的ローカライゼーションモジュール(SLM)と自己拡張モジュール(SEM)を含むDLEは、いくつかのメリットを享受している。
論文 参考訳(メタデータ) (2024-08-25T07:34:32Z) - Beyond the Prototype: Divide-and-conquer Proxies for Few-shot
Segmentation [63.910211095033596]
少ないショットのセグメンテーションは、少数の濃密なラベル付けされたサンプルのみを与えられた、目に見えないクラスオブジェクトをセグメンテーションすることを目的としている。
分割・分散の精神において, 単純かつ多目的な枠組みを提案する。
提案手法は、DCP(disvision-and-conquer proxies)と呼ばれるもので、適切な信頼性のある情報の開発を可能にする。
論文 参考訳(メタデータ) (2022-04-21T06:21:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。