論文の概要: FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge
- arxiv url: http://arxiv.org/abs/2608.15410v1
- Date: Sat, 15 Aug 2026 20:56:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.291662
- Title: FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge
- Title(参考訳): FloodReasonBench: エッジでの身体的洪水応答に対するVLM推論セグメンテーションのベンチマーク
- Abstract要約: FloodReasonBenchはVLM推論セグメンテーションのベンチマークであり、エッジでの浸水応答を具現化する。
FloodReasonBenchが中心となるFloodResponseSegは、洪水固有の推論セグメンテーションデータセットである。
一方,洪水適応型ターゲットワークロード設計空間では,パーティション間の精度が大幅に向上するのに対して,一般的な事前適応設定では,パーティション依存性の強い精度変化が観察される。
- 参考スコア(独自算出の注目度): 2.1139740930690487
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning segmentation enables vision-language models (VLMs) to translate mission-relevant language requests into pixel-level visual grounding, offering a natural perception interface for embodied agents. However, existing benchmarks largely focus on generic visual scenes and overlook the domain and resource constraints encountered in flood-response platforms. We present FloodReasonBench, a benchmark for VLM reasoning segmentation for embodied flood response at the edge. At its core, FloodReasonBench introduces FloodResponseSeg, a flood-specific reasoning-segmentation dataset constructed from real-world scenes and response-relevant targets. Beyond task accuracy, the benchmark characterizes reasoning-segmentation pipelines under lightweight visual encoding, hierarchical split inference, and compressed intermediate representations. We observe strong partition-dependent accuracy variation in the generic pre-adaptation setting, while the flood-adapted target-workload design space exhibits a substantially more compact accuracy range across partitions. Evaluation on an NVIDIA Jetson AGX Xavier further exposes the tradeoffs among reasoning-segmentation accuracy, edge-side latency, energy, and communication footprint, enabling quality-constrained selection of edge operating points. Together, these results provide a task- and system-level characterization of reasoning segmentation for resource-constrained embodied flood response at the edge.
- Abstract(参考訳): 推論セグメンテーション(Reasoning segmentation)は、視覚言語モデル(VLM)が、ミッション関連言語要求をピクセルレベルの視覚的グラウンドに翻訳することを可能にする。
しかし、既存のベンチマークは主に一般的な視覚シーンに焦点を当てており、洪水応答プラットフォームで遭遇するドメインとリソースの制約を見落としている。
本稿では,VLM推論セグメンテーションのベンチマークであるFloodReasonBenchを紹介する。
FloodReasonBenchが中心となるFloodResponseSegは、現実世界のシーンと応答関連ターゲットから構築された、洪水固有の推論セグメンテーションデータセットだ。
タスクの正確性以外にも、このベンチマークでは、軽量なビジュアルエンコーディング、階層的な分割推論、圧縮された中間表現の下での推論分離パイプラインを特徴付けている。
一方,洪水適応型ターゲットワークロード設計空間では,パーティション間の精度が大幅に向上するのに対して,一般的な事前適応設定では,パーティション依存性の強い精度変化が観察される。
NVIDIA Jetson AGX Xavierの評価は、推論のセグメンテーション精度、エッジ側レイテンシ、エネルギ、通信フットプリントのトレードオフをさらに露呈し、エッジ操作ポイントの品質に制約のある選択を可能にする。
これらの結果と合わせて, 資源拘束型浸水応答における推論セグメンテーションのタスクレベルおよびシステムレベルの特徴を与える。
関連論文リスト
- CR-Seg: Attention-Guided and CoT-Enhanced Coarse-to-Refined Reasoning Segmentation [26.21876180083083]
Reasoning segmentation は、複雑な言語で記述されたターゲットオブジェクトを視覚的・テキスト的推論によって分割することを目的としている。
既存の手法では、学習したセマンティックトークンを使ってMLLM(Multimodal Large Language Models)とセグメンテーションモデルをブリッジする。
本稿では,空間分割のための2段階フレームワークCR-Segを提案する。
論文 参考訳(メタデータ) (2026-06-02T12:30:04Z) - Towards Realistic Open-Vocabulary Remote Sensing Segmentation: Benchmark and Baseline [52.65099689153431]
オープンボキャブラリリモートセンシングイメージセグメンテーション(OVRSIS)は、データセットの断片化、トレーニングの多様性の制限、評価ベンチマークの欠如などにより、まだ探索されていない。
我々はOVRSISの大規模かつアプリケーション指向のベンチマークである textitOVRSISBenchV2 を提案する。
以上の結果から,リアルなベンチマーク設計の重要性と,OVRSISの摂動型転送の有効性が示唆された。
論文 参考訳(メタデータ) (2026-04-17T02:49:46Z) - GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery [12.65874706732698]
推論駆動型リモートセンシングセグメンテーションの監視ボトルネックを回避し,ゼロショットでトレーニング不要なフレームワークであるGeoSegを提案する。
GeoSegは、(i)系統的な接地シフトを補正するためのバイアス対応座標補正、(ii)細粒な空間的手がかりで意味的意図を融合するための二重ルートプロンプト機構を通じて、正確な局所化を伴うMLLM推論を結合する。
実験の結果、GeoSegはすべてのベースラインを一貫して上回り、各コンポーネントの有効性と必要性を検証している。
論文 参考訳(メタデータ) (2026-03-04T12:24:16Z) - ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation [21.87321809019825]
Referring Expression(RES)は、自由形式の言語表現によるターゲットのピクセルレベルの理解を可能にする、コアビジョン言語セグメンテーションタスクである。
textbfmodelは textbfEntropy-textbfBased Point textbfDiscovery (textbfEBD) と textbfVision-textbfBased textbfReasoning (textbfVBR) を統合する新しいRESフレームワークである。
model は coarse-to を実装します
論文 参考訳(メタデータ) (2026-01-23T01:56:04Z) - GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model [0.6281229317487581]
GLACIAは、大きな言語モデルとセグメンテーション機能を統合して、正確なセグメンテーションマスクとそれに対応する空間推論出力の両方を生成するフレームワークである。
我々のアプローチは、急速に変化する氷河環境の中で、直感的な防災準備と情報ポリシー作成を可能にする。
論文 参考訳(メタデータ) (2025-12-10T02:11:48Z) - CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation [51.25997439181537]
CoPRSは、ヘアマップとしてインスタンス化された、微分可能で解釈可能な位置推定を通じて、セグメンテーションへの言語推論をブリッジする。
学習可能な集中トークンは、画像の特徴と推論テキストを集約して、この位置先を生成する。
論文 参考訳(メタデータ) (2025-10-13T09:07:54Z) - Temporal Prompting Matters: Rethinking Referring Video Object Segmentation [64.82333675385802]
Referring Video Object (RVOS) は、クエリ文によって参照されるオブジェクトをビデオにセグメントすることを目的としている。
既存のほとんどの方法は、密集したマスクアノテーションによるエンドツーエンドのトレーニングを必要とする。
本稿では,参照要因とビデオ要因に対処するテンポラル・プロンプト生成・選択(テネ)フレームワークを提案する。
論文 参考訳(メタデータ) (2025-10-08T17:59:57Z) - Reinforcing Video Reasoning Segmentation to Think Before It Segments [67.5703457389657]
本稿では,ビデオ推論セグメンテーションのためのLVLMであるVeason-R1を紹介する。
Veason-R1 は、Chain-of-Thought trajectories を付加した Group Relative Policy Optimization (O) を通じて訓練される。
空間的アライメントと時間的整合性を高める包括的報酬機構を組み込んだ。
Veason-R1は、複数のベンチマークで最先端のパフォーマンスを達成し、先行技術を上回っている。
論文 参考訳(メタデータ) (2025-08-15T15:34:56Z) - Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception [71.26728044621458]
DeCLIPは、CLIPを強化する新しいフレームワークで、自己認識モジュールを分離して、それぞれコンテンツ’と“コンテキスト’の機能を取得する。
2D検出とセグメンテーション、3Dインスタンスのセグメンテーション、ビデオインスタンスのセグメンテーション、6Dオブジェクトのポーズ推定など、幅広いタスクにわたる最先端のパフォーマンスを一貫して達成する。
論文 参考訳(メタデータ) (2025-08-15T06:43:51Z) - OoDIS: Anomaly Instance Segmentation and Detection Benchmark [57.89836988990543]
この作業は、インスタンスセグメンテーションとオブジェクト検出タスクを含むために、よく使われる異常セグメンテーションベンチマークを拡張します。
異常セグメンテーションおよびオブジェクト検出手法の評価は,これらの課題が未解決問題のままであることを示す。
論文 参考訳(メタデータ) (2024-06-17T17:59:56Z) - Fully and Weakly Supervised Referring Expression Segmentation with
End-to-End Learning [50.40482222266927]
Referring Expression(RES)は、与えられた言語表現に従ってターゲットをローカライズし、セグメンテーションすることを目的としている。
そこで我々は,カーネル分割パイプラインを並列に構築し,より分離し,局所化とセグメント化のステップと相互作用する。
我々の手法は単純だが驚くほど効果的であり、完全に教師された設定と弱い設定において、従来の最先端のRES手法よりも優れている。
論文 参考訳(メタデータ) (2022-12-17T08:29:33Z) - Framework-agnostic Semantically-aware Global Reasoning for Segmentation [29.69187816377079]
本稿では,画像特徴を潜在表現に投影し,それら間の関係を推論するコンポーネントを提案する。
我々の設計では、活性化領域が空間的に不整合であることを保証することにより、潜在領域が意味概念を表現することを奨励している。
潜在トークンはセマンティックに解釈可能で多様性があり、下流タスクに転送可能な豊富な機能セットを提供します。
論文 参考訳(メタデータ) (2022-12-06T21:42:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。