論文の概要: Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
- arxiv url: http://arxiv.org/abs/2605.27764v1
- Date: Tue, 26 May 2026 23:26:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.598374
- Title: Can Segmentation Models Understand the World? Towards Proactive Affordance Reasoning via Visual Chain-of-Thought
- Title(参考訳): セグメンテーションモデルは世界を理解することができるか?ビジュアル・チェーン・オブ・サートによるアクティブ・アフォーマンス・推論に向けて
- Authors: Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su,
- Abstract要約: 次に、SegWorldを紹介します。このモデルでは、複数のレベルの視覚的連鎖を通して、シーンを理由付けます。
我々はSegWorldを確率論的推論として定式化し、プロアクティブな観察が言語シーンのコンテキストを提供する。
実験では、SegWorldは命令駆動のベースラインをターゲット参照命令と一致させ、インテントレベルのベースラインを大幅に改善する。
- 参考スコア(独自算出の注目度): 61.69802853759301
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent segmentation models couple large language models (LLMs) with mask decoders to ground complex language expressions into masks, yet their instructions remain target-referential: they describe, constrain, or imply the region to be segmented. However, in real-world embodied interaction, human instructions are often at the intent-level, which includes the desired outcome without naming the region that enables it. To bridge this gap, we introduce SegWorld, where the model reasons about the scene through a multi-level visual chain-of-thought (CoT) before committing to a mask. Before receiving any instructions, it proactively observes the scene, describing visible objects and inferring plausible events they may support. Given an instruction, it continues the chain: from the object relevant to the intent, through the action that satisfies it, to the physical interaction site, the object part that affords the action. We formalize SegWorld as probabilistic inference, in which proactive observation supplies a linguistic scene context that improves mask prediction when instructions are given at the level of intent. We construct an intent-to-part benchmark for evaluating affordance-bearing part segmentation from high-level goals. Experiments show SegWorld matches instruction-driven baselines on target-referential instructions and improves substantially on intent-level ones.
- Abstract(参考訳): 最近のセグメンテーションモデルは、マスクデコーダと大きな言語モデル(LLM)を組み合わせ、複雑な言語表現をマスクに接地するが、それらの命令は、セグメンテーションされる領域を記述、制約、暗示する。
しかし、現実世界の具体的相互作用では、人間の指示はしばしば意図レベルにあり、それはそれを可能にする領域を命名せずに望ましい結果を含む。
このギャップを埋めるために、私たちはSegWorldを紹介します。SegWorldでは、マスクをコミットする前に、マルチレベル視覚チェーン(CoT)を通じてシーンをモデルに理由付けます。
指示を受ける前に、そのシーンを積極的に観察し、目に見える物体を記述し、それらが支援する可能性のある妥当な出来事を推測する。
インテントに関連するオブジェクトから、それを満足するアクション、物理的相互作用サイト、アクションに余裕のあるオブジェクト部分まで、チェーンを継続する。
我々はSegWorldを確率的推論として定式化し、プロアクティブな観察は意図のレベルで指示が与えられたときのマスク予測を改善する言語シーンのコンテキストを提供する。
我々は,高レベルな目標から有償部分のセグメンテーションを評価するためのインテント・ツー・パート・ベンチマークを構築した。
実験では、SegWorldは命令駆動のベースラインをターゲット参照命令と一致させ、インテントレベルのベースラインを大幅に改善する。
関連論文リスト
- See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding [41.70825455674463]
SWIM(See What I Mean)は、視覚と言語表現を調整し、テキストのプロンプトからのみ、きめ細かいオブジェクト理解を可能にする訓練戦略である。
SWIMはテキスト・ビジュアル・アライメントを大幅に改善し,細粒度オブジェクト理解ベンチマークにおける視覚プロンプトに基づく手法よりも優れた性能を実現する。
論文 参考訳(メタデータ) (2026-05-18T08:09:37Z) - Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation [17.238084264485988]
Referring Video Object (RVOS) は、言語記述に基づいて、ビデオ全体を通して関心のあるオブジェクトをセグメントすることを目的としている。
bftextPARSE-VOSは、Large Language Models (LLMs)を利用したトレーニング不要のフレームワークである。
bftextPARSE-VOSは、Ref-YouTube-VOS、Ref-DAVIS17、MeViSの3つの主要なベンチマークで最先端のパフォーマンスを達成した。
論文 参考訳(メタデータ) (2025-09-06T15:46:23Z) - Mask Grounding for Referring Image Segmentation [42.69973300692365]
Referring Image(RIS)は、自由形式の言語表現によって参照されるオブジェクトをセグメントするアルゴリズムを必要とする難しいタスクである。
最先端のSOTA(State-of-the-art)手法の多くは、画素やワードレベルでの言語・画像のモダリティのギャップを被っている。
本稿では,言語機能内の視覚的グラウンド化を大幅に改善する,新しいマスクグラウンド化補助タスクを提案する。
論文 参考訳(メタデータ) (2023-12-19T14:34:36Z) - SAGE: Bridging Semantic and Actionable Parts for GEneralizable Manipulation of Articulated Objects [9.500480417077272]
本稿では,自然言語命令下での汎用的な操作を実現するために,意味的および動作可能なオブジェクトをブリッジする新しいフレームワークを提案する。
パーシャルグラウンドモジュールは、セマンティックな部分を「ジェネリザブル・アクティブル・パート(GAParts)」と表現し、パートモーションに関する情報を本質的に保持する。
インタラクティブなフィードバックモジュールが障害に対応するために組み込まれており、ループを閉じ、全体的なフレームワークの堅牢性を高める。
論文 参考訳(メタデータ) (2023-12-03T07:22:42Z) - LISA: Reasoning Segmentation via Large Language Model [68.24075852136761]
そこで我々は,新たなセグメンテーションタスク,すなわち推論セグメンテーションを提案する。
このタスクは、複雑で暗黙的なクエリテキストを与えられたセグメンテーションマスクを出力するように設計されている。
提案するLISA: Large Language Instructed Assistantは,マルチモーダル大規模言語モデルの言語生成能力を継承する。
論文 参考訳(メタデータ) (2023-08-01T17:50:17Z) - Position-Aware Contrastive Alignment for Referring Image Segmentation [65.16214741785633]
マルチモーダル特徴のアライメントを強化するために,位置認識型コントラストアライメントネットワーク(PCAN)を提案する。
1)自然言語記述に関連するすべてのオブジェクトの位置情報を提供する位置認識モジュール(PAM)と,2)マルチモーダルアライメントを強化するコントラスト言語理解モジュール(CLUM)の2つのモジュールで構成されている。
論文 参考訳(メタデータ) (2022-12-27T09:13:19Z) - Locate then Segment: A Strong Pipeline for Referring Image Segmentation [73.19139431806853]
参照画像セグメンテーションは、自然言語表現によって参照されるオブジェクトをセグメンテーションすることを目的とする。
従来の方法は、視覚言語機能を融合させ、最終的なセグメンテーションマスクを直接生成するための暗黙的および反復的な相互作用メカニズムの設計に焦点を当てています。
これらの問題に取り組むための「Then-Then-Segment」スキームを紹介します。
私たちのフレームワークはシンプルですが驚くほど効果的です。
論文 参考訳(メタデータ) (2021-03-30T12:25:27Z) - SceneEncoder: Scene-Aware Semantic Segmentation of Point Clouds with A
Learnable Scene Descriptor [51.298760338410624]
本研究では,グローバル情報の効果を高めるために,シーン認識型ガイダンスを付加するSceneEncoderモジュールを提案する。
モジュールはシーン記述子を予測し、シーンに存在するオブジェクトのカテゴリを表現することを学習する。
また,同じラベルを持つ隣接点に対する特徴の識別を伝搬する領域類似度損失を設計する。
論文 参考訳(メタデータ) (2020-01-24T16:53:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。