論文の概要: Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning
- arxiv url: http://arxiv.org/abs/2607.05798v1
- Date: Tue, 07 Jul 2026 03:50:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.391915
- Title: Segmentation before Answering: Pixel Grounding for MLLM Visual Reasoning
- Title(参考訳): 回答前のセグメンテーション:MLLMビジュアル推論のための画素グラウンドリング
- Abstract要約: 我々は textbfAnswering (SegAnswer) の前に textbfSegmentation を提案する。
SegAnswerはズームインの単位を一般的なバウンディングボックスからピクセルレベルのセグメンテーションマスクにシフトする。
一貫性のある改善を実現し、セグメンテーションタスクでかなりのパフォーマンスを発揮する。
- 参考スコア(独自算出の注目度): 26.2787717786409
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Recent advancements in Multimodal Large Language Models (MLLMs) have evolved from static perception to interleaved visual-language reasoning, often referred to as ``thinking with images''. A basic operation in this reasoning process is to zoom in on regions of interest (often represented with bounding boxes) to acquire finer visual details. In this paper, we propose \textbf{Seg}mentation before \textbf{Answer}ing (SegAnswer), which shifts the unit of zoom-in from the popular bounding box to pixel-level segmentation mask. By employing fine-grained masks to isolate the target area from cluttered environments, segmented visual input yields a more precise region of interest, effectively filtering out redundant background and interfering objects. Furthermore, the discrete patches of segmented visual input align more seamlessly with how MLLMs structure visual tokens via positional embeddings. In experiments, we evaluate SegAnswer across diverse benchmarks, including high-resolution perception, general perception, and hallucination. It achieves consistent improvements and also exhibits considerable performance on segmentation tasks, validating its capability for reliable pixel grounding.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)の最近の進歩は、静的認識からインターリーブされた視覚言語推論へと発展してきた。
この推論プロセスにおける基本的な操作は、興味のある領域(しばしば境界ボックスで表される)をズームインして、より詳細な視覚的詳細を取得することである。
本稿では、一般的なバウンディングボックスからピクセルレベルのセグメンテーションマスクにズームインの単位をシフトさせる、‘textbf{Seg}mentation before \textbf{Answer}ing(SegAnswer)’を提案する。
粗い環境からターゲット領域を分離するためにきめ細かいマスクを用いることで、セグメント化された視覚入力によりより正確な関心領域が得られ、効果的に冗長な背景をフィルタリングし、オブジェクトを干渉する。
さらに、分割された視覚入力の離散パッチは、MLLMが位置埋め込みを介して視覚トークンを構造化する方法とよりシームレスに一致している。
実験では、高分解能知覚、一般知覚、幻覚を含む様々なベンチマークでSegAnswerを評価した。
一貫性のある改善を実現し、またセグメンテーションタスクでかなりのパフォーマンスを示し、信頼性の高いピクセルグラウンドの能力を検証する。
関連論文リスト
- Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token [75.67455028589505]
本稿では,MLLM itSELFのセグメンテーションを1セグメンテーション・エンベディング(SELF1E)でアンロックする方法について検討する。
本手法は,MLLMからの画素シャッフル画像特徴の分解能の基本的な制限を目標とする。
総合的な実験により、SELF1Eは、スペシャリストマスクデコーダベースの手法と性能を競うことができる。
論文 参考訳(メタデータ) (2026-03-19T15:25:36Z) - PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity [39.98516860109934]
PixelReferは、統一された領域レベルのMLLMフレームワークで、ユーザが指定した領域についてより詳細な理解を可能にする。
解析の結果,グローバルな視覚トークンは主に初期のLCM層に寄与し,PixelRefer-Liteの設計を刺激していることがわかった。
微粒な命令チューニングを容易にするため,高品質なオブジェクト中心命令データセットであるPixelRefer-2.2Mをキュレートする。
論文 参考訳(メタデータ) (2025-10-27T17:59:32Z) - FineRS: Fine-grained Reasoning and Segmentation of Small Objects with Reinforcement Learning [62.11389260206383]
textscFineRSは、非常に小さなオブジェクトをセグメント化するための2段階のMLLMベースの強化学習フレームワークである。
textscFineRS-4kは,属性レベルの推論に基づくMLLMの評価と,微妙で小規模なターゲットに対する画素レベルのセグメンテーションのための新しいデータセットである。
論文 参考訳(メタデータ) (2025-10-24T10:14:17Z) - ARGenSeg: Image Segmentation with Autoregressive Image Generation Model [46.837184955843355]
本稿では,ARGenSeg(AutoRegressive Generation-based paradigm for image)を提案する。
提案手法は,複数のセグメンテーションデータセットに対する従来手法を超越し,推論速度を著しく向上させる。
論文 参考訳(メタデータ) (2025-10-23T17:58:26Z) - UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning [83.68366772745689]
視覚的なプロンプト入力を柔軟に解釈し,マスクによる応答を生成できる大規模マルチモーダルモデルUniPixelを提案する。
具体的には、UniPixelは、要求に応じて視覚的なプロンプトを処理し、関連するマスクを生成し、推論中にこれらの中間ポインタに対してその後の推論条件を実行する。
提案手法の有効性は,画素レベルの参照/セグメンテーションや画像・ビデオにおけるオブジェクト中心の理解など,多種多様なタスクを対象とした10のベンチマークで検証されている。
論文 参考訳(メタデータ) (2025-09-22T17:59:40Z) - Text4Seg++: Advancing Image Segmentation via Generative Language Modeling [52.07442359419673]
画像分割をテキスト生成問題として用いた新しいテキスト・アズ・マスクパラダイムを提案する。
鍵となる革新はセグメンテーションマスクの新しいテキスト表現であるセグメンテーション記述子である。
自然およびリモートセンシングデータセットの実験は、Text4Seg++が最先端モデルよりも一貫して優れていることを示している。
論文 参考訳(メタデータ) (2025-09-08T04:07:14Z) - X-SAM: From Segment Anything to Any Segmentation [63.79182974315084]
大きな言語モデル(LLM)は、広い知識表現において強力な能力を示すが、本質的にはピクセルレベルの知覚的理解において不十分である。
テキスト化からテキスト化まで,セグメンテーションパラダイムを拡張したマルチモーダル大規模言語モデルフレームワークであるX-SAMを提案する。
インタラクティブな視覚的プロンプトで全てのインスタンスオブジェクトをセグメンテーションし、視覚的グラウンドでピクセルワイドな解釈能力を持つMLLMに権限を与える、Visual GrounDed (VGD)セグメンテーションと呼ばれる新しいセグメンテーションタスクを提案する。
論文 参考訳(メタデータ) (2025-08-06T17:19:10Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models [2.331828779757202]
本稿では,マルチイメージ部分レベルの推論セグメンテーションのためのLVLM(Large Vision-Language Model)を提案する。
セマンティックな部分レベルの対応を識別する新しい対応抽出モジュールと、この情報をLVLMに埋め込む適応対応モジュールである。
パラメータの0.3%しか微調整されていないCALICOは,この課題に対して高いパフォーマンスを実現していることを示す。
論文 参考訳(メタデータ) (2024-12-26T18:59:37Z) - MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation [26.667974865352708]
MROVSegは、オープンボキャブラリイメージセグメンテーションのためのマルチレゾリューショントレーニングフレームワークで、単一の事前トレーニングされたCLIPバックボーンを備えている。
スライドウィンドウを使用して、高解像度の入力を均一なパッチにスライスし、それぞれがよく訓練されたイメージエンコーダの入力サイズにマッチする。
論文 参考訳(メタデータ) (2024-08-27T04:45:53Z) - Locate then Segment: A Strong Pipeline for Referring Image Segmentation [73.19139431806853]
参照画像セグメンテーションは、自然言語表現によって参照されるオブジェクトをセグメンテーションすることを目的とする。
従来の方法は、視覚言語機能を融合させ、最終的なセグメンテーションマスクを直接生成するための暗黙的および反復的な相互作用メカニズムの設計に焦点を当てています。
これらの問題に取り組むための「Then-Then-Segment」スキームを紹介します。
私たちのフレームワークはシンプルですが驚くほど効果的です。
論文 参考訳(メタデータ) (2021-03-30T12:25:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。