論文の概要: Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation
- arxiv url: http://arxiv.org/abs/2608.02791v1
- Date: Mon, 03 Aug 2026 18:42:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.919718
- Title: Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation
- Title(参考訳): より良く、より強く、より速く、より広範に:MLLMに基づくセグメンテーションのための構造化全マスク予測
- Abstract要約: STAMPは、強い参照と推論のセグメンテーションと、保存されたマルチモーダル能力と効率的な推論を組み合わせる。
明示的なIDとオプションボックスを持つターゲットリストを生成し、これらのIDを共有のマルチクラスマスク空間にバインドし、1つの非自己回帰パスですべてのターゲットを共同で予測する。
単一の統一されたチェックポイントは、STAMPの参照と推論能力を維持しながら、オープン語彙セマンティクス、インスタンス認識、リモートセンシングされた小さなターゲットセグメンテーションに拡張する。
- 参考スコア(独自算出の注目度): 10.813064862132379
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: MLLM-based segmentation faces a core segmentation trilemma: high segmentation performance, preserved dialogue ability, and fast inference. Embedding-prediction methods may disrupt language modeling through pixel-level objectives, whereas next-token generation is inefficient for dense masks. We propose All-Mask Prediction, decoupling autoregressive dialogue from non-autoregressive mask prediction. Its binary instantiation, STAMP (Simultaneous Textual All-Mask Prediction), emits an in-vocabulary <SEG> trigger, fuses image-aligned mask tokens with corresponding patch features, and uses hybrid attention to classify all tokens as foreground or background in one pass. It thereby combines strong referring and reasoning segmentation with preserved multimodal ability and efficient inference. However, binary masks cannot retain multiple semantic or instance identities without repeated target-specific predictions. We therefore propose Structured All-Mask Prediction and develop STAMPlus. It generates a target list with explicit IDs and optional boxes, binds these IDs to a shared multi-class mask space, and jointly predicts all targets in one non-autoregressive pass. A single unified checkpoint retains STAMP's referring and reasoning capabilities while extending to open-vocabulary semantic, instance-aware, and remote-sensing small-target segmentation, where high-resolution mask-token scaling preserves finer spatial evidence. Across these settings, STAMPlus achieves state-of-the-art segmentation performance, preserves general multimodal instruction following, and reduces 12-category latency from 13.50s for repeated STAMP inference to 5.16s. Further analyses show that accurate target cues improve segmentation and learned spatial grounding benefits look-twice reasoning. Overall, STAMPlus resolves the trilemma beyond single-target prediction.
- Abstract(参考訳): MLLMベースのセグメンテーションは、高いセグメンテーション性能、保存された対話能力、高速推論という、コアセグメンテーションのトリレンマに直面している。
埋め込み予測法は画素レベルの目的によって言語モデリングを阻害する可能性があるが、次のトーケン生成は高密度マスクでは非効率である。
非自己回帰型マスク予測から自己回帰型対話を分離する全マスク予測を提案する。
そのバイナリインスタンス化であるSTAMP(Simultaneous Textual All-Mask Prediction)は、インボキャブラリ<SEG>トリガを出力し、対応するパッチ機能でイメージ整列マスクトークンを融合させ、すべてのトークンをフォアグラウンドまたはバックグラウンドとして1パスで分類するためにハイブリッドアテンションを使用する。
これにより、強い参照と推論のセグメンテーションと、保存されたマルチモーダル能力と効率的な推論を組み合わせる。
しかし、バイナリマスクは、複数のセマンティックやインスタンスのアイデンティティを保持することはできない。
そこで本研究では,Structured All-Mask Predictionを提案し,STAMPlusを開発した。
明示的なIDとオプションボックスを持つターゲットリストを生成し、これらのIDを共有のマルチクラスマスク空間にバインドし、1つの非自己回帰パスですべてのターゲットを共同で予測する。
単一の統一チェックポイントは、STAMPの参照と推論能力を保ちつつ、オープンボキャブラリセマンティック、インスタンス認識、リモートセンシングされた小さなターゲットセグメンテーションにまで拡張し、高解像度マスクトーケンスケーリングはより微細な空間証拠を保存する。
これらの設定全体で、STAMPlusは最先端のセグメンテーション性能を達成し、一般的なマルチモーダル命令を継続し、12カテゴリの遅延を13.50秒から5.16秒に短縮する。
さらに分析した結果, 精度の高い目標キューがセグメンテーションを改善し, 空間接地を学習することで, ルック・ツース推論の利点が得られた。
全体として、STAMPlusは単一ターゲット予測を超えたトリレンマを解決している。
関連論文リスト
- DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation [5.5825182710791275]
推論セグメンテーションは、複雑な言語クエリが与えられたターゲットに対してピクセルワイズマスクを予測することを目的としている。
本稿では,意味的および空間的手がかりによって導かれる予測を融合させるフレームワークであるDGSegを提案する。
実験によると、DGSegは複数のベンチマークで強いベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2026-07-06T08:10:03Z) - Bottleneck Tokens for Unified Multimodal Retrieval [16.707536543758344]
マルチモーダル検索のためのデコーダのみのマルチモーダル大言語モデル(MLLM)の適用には、2つの構造的ギャップがある。
まず、既存のメソッドは暗黙のプーリングに依存しており、シーケンスレベルの表現として標準語彙トークンの隠れた状態をオーバーロードする。
第二に、コントラスト的な微調整は、埋め込みが一致すべきものを特定するが、どのように情報を圧縮すべきかについてのトークンレベルのガイダンスは提供しない。
本稿では,Bottleneck Tokens(BToks)を紹介した。これは,固定容量明示的なプール機構として機能する,学習可能なトークンの小さなセットである。
論文 参考訳(メタデータ) (2026-04-13T07:12:12Z) - Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction [10.813064862132379]
本稿では、このパラダイムを具現化したMLLMである、同時テキスト全マスク予測について述べる。
テキスト応答を生成した後、STAMPは、イメージパッチに対して並列な "fill-in-the-blank"タスクとして扱うことにより、単一のフォワードパス内のセグメンテーションマスク全体を予測する。
この設計は、対立する目的を避けることでMLLMの対話能力を維持し、マスクトークンにリッチで双方向な空間コンテキストを活用することで高いセグメンテーション性能を実現し、例外的な速度を達成する。
論文 参考訳(メタデータ) (2025-11-29T08:52:41Z) - Text4Seg++: Advancing Image Segmentation via Generative Language Modeling [52.07442359419673]
画像分割をテキスト生成問題として用いた新しいテキスト・アズ・マスクパラダイムを提案する。
鍵となる革新はセグメンテーションマスクの新しいテキスト表現であるセグメンテーション記述子である。
自然およびリモートセンシングデータセットの実験は、Text4Seg++が最先端モデルよりも一貫して優れていることを示している。
論文 参考訳(メタデータ) (2025-09-08T04:07:14Z) - LESS: Label-Efficient and Single-Stage Referring 3D Segmentation [55.06002976797879]
参照3Dは、クエリの文で記述された3Dポイントクラウドから、指定されたオブジェクトのすべてのポイントをセグメントする視覚言語タスクである。
本稿では,LESSと呼ばれるレファレンス3次元パイプラインを提案する。
ScanReferデータセット上での最先端のパフォーマンスは、バイナリラベルのみを使用して、以前の3.7% mIoUの手法を上回ります。
論文 参考訳(メタデータ) (2024-10-17T07:47:41Z) - Bridge the Points: Graph-based Few-shot Segment Anything Semantically [79.1519244940518]
プレトレーニング技術の最近の進歩により、視覚基礎モデルの能力が向上した。
最近の研究はSAMをFew-shot Semantic segmentation (FSS)に拡張している。
本稿では,グラフ解析に基づく簡易かつ効果的な手法を提案する。
論文 参考訳(メタデータ) (2024-10-09T15:02:28Z) - MaskUno: Switch-Split Block For Enhancing Instance Segmentation [0.0]
マスク予測を洗練されたROIを処理し、それらを分類し、特定のマスク予測者に割り当てるスイッチスプリットブロックに置き換えることを提案する。
平均平均精度(mAP)が2.03%上昇し,80クラスにおいて高い成績を示した。
論文 参考訳(メタデータ) (2024-07-31T10:12:14Z) - Open-Vocabulary Segmentation with Unpaired Mask-Text Supervision [87.15580604023555]
Unpair-Segは、弱制御されたオープン語彙セグメンテーションフレームワークである。
未ペア画像マスクと画像テキストペアから学習し、独立して効率的に収集することができる。
ADE-847とPASCAL Context-459データセットで14.6%と19.5%のmIoUを達成した。
論文 参考訳(メタデータ) (2024-02-14T06:01:44Z) - Segment (Almost) Nothing: Prompt-Agnostic Adversarial Attacks on
Segmentation Models [61.46999584579775]
汎用セグメンテーションモデルは、様々なプロンプトから(意味)セグメンテーションマスクを生成することができる。
特に、入力画像は、イメージエンコーダによって前処理され、後にマスク予測に使用される埋め込みベクトルを得る。
我々は、半径$エプシロン=1/255$の知覚不能な摂動でさえ、ポイント、ボックス、テキストプロンプトで予測されるマスクを劇的に修正するのに十分であることを示す。
論文 参考訳(メタデータ) (2023-11-24T12:57:34Z) - Beyond the Prototype: Divide-and-conquer Proxies for Few-shot
Segmentation [63.910211095033596]
少ないショットのセグメンテーションは、少数の濃密なラベル付けされたサンプルのみを与えられた、目に見えないクラスオブジェクトをセグメンテーションすることを目的としている。
分割・分散の精神において, 単純かつ多目的な枠組みを提案する。
提案手法は、DCP(disvision-and-conquer proxies)と呼ばれるもので、適切な信頼性のある情報の開発を可能にする。
論文 参考訳(メタデータ) (2022-04-21T06:21:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。