論文の概要: Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?
- arxiv url: http://arxiv.org/abs/2608.08077v1
- Date: Sat, 08 Aug 2026 11:57:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.650875
- Title: Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?
- Title(参考訳): VLMは安全で批判的なシナリオに対応できるのか?
- Authors: Gabriele La Malfa, Nitay Alon, Emanuele La Malfa, Reuth Mirsky, Stefan Sarkadi,
- Abstract要約: ToS(Theory of Space framework)は、好奇心駆動型視覚言語モデル(VLM)の空間的理解を評価する。
私たちはToSフレームワークを,Explore, Map, Remember, Decideという,安全クリティカルで目標駆動のパイプラインに拡張しています。
以上の結果から,VLMは事前学習したテキストの先行情報に基づいて,頻繁に避難地点を選択することが示唆された。
以上の結果から,VLM記憶は人間の認知から根本的に切り離され,誤認識の予測不能なリスクが生じることが示唆された。
- 参考スコア(独自算出の注目度): 10.965442867842109
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Theory of Space framework (ToS) assesses the spatial understanding of curiosity-driven Vision-Language Models (VLMs) under partial observability. As AI techniques are increasingly applied to safety-critical scenarios, it is crucial to understand whether VLMs possess robust spatial memory and make reliable decisions. In this paper, we assess whether VLMs' decisions are based on physical evidence or are corrupted by visual-language biases, if their memory processes align with human cognitive patterns, and how they respond to environmental hazards. We extend the ToS framework into a safety-critical, goal-driven pipeline, named Explore, Map, Remember, and Decide (EMRD). We then quantify Exploration Competence (Explore) through metrics of environmental coverage and temporal efficiency, assess Spatial Fidelity (Map), evaluate, with a suite of psychological metrics, Memory Persistence (Remember), and measure, using focal-point metrics, Cognitive Decision-Making (Decide). Our results show that in terms of decision-making capabilities, VLMs frequently select evacuation points based on pre-trained textual priors while lacking the spatial grounding to justify their choices. We also show that spatial reasoning degrades in low-light conditions, but it is not affected by texture and colour tampering. Our findings suggest that VLM memory fundamentally diverges from human cognition, creating unpredictable risks of misalignment.
- Abstract(参考訳): ToS(Theory of Space framework)は、好奇心駆動型視覚言語モデル(VLM)の空間的理解を評価する。
AI技術が安全クリティカルなシナリオにますます適用されているため、VLMが堅牢な空間記憶を持ち、信頼性の高い意思決定を行うかどうかを理解することが不可欠である。
本稿では,VLMの判断が身体的証拠に基づくものなのか,あるいは視覚的偏見によって損なわれるものなのか,記憶過程が人間の認知パターンと一致しているか,環境障害にどのように反応するかを評価する。
私たちはToSフレームワークを,Explore, Map, Remember, Decide(EMRD)という,安全クリティカルな目標駆動パイプラインに拡張しています。
次に、環境カバレッジと時間効率の指標を用いて探索能力(Explore)を定量化し、空間忠実度(Map)を評価し、心理学的指標、記憶持続性(Remember)、測定を行い、焦点測度、認知的意思決定(Decide)を用いて評価する。
以上の結果から,VLMは事前学習したテキストの先行情報に基づいて,選択を正当化するための空間的根拠を欠きながら,避難地点の選択を頻繁に行うことが示唆された。
また,空間的推論は低照度条件では劣化するが,テクスチャや色調の影響を受けないことを示す。
以上の結果から,VLM記憶は人間の認知から根本的に切り離され,誤認識の予測不能なリスクが生じることが示唆された。
関連論文リスト
- ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models [37.686748605290795]
ESPIREは空間推論のための診断ベンチマークである。
物理的に視覚言語モデルに基づいて、空間推論中心のロボットタスクでそれらを評価する。
我々は各タスクをローカライズと実行に分解し、両方を生成問題として扱う。
論文 参考訳(メタデータ) (2026-03-13T14:43:00Z) - Rethinking Memory Mechanisms of Foundation Agents in the Second Half: A Survey [211.01908189012184]
今年、何百もの論文が公開されたメモリは、ユーティリティギャップを埋めるための重要なソリューションとして現れます。
ファンデーションエージェントのメモリを3次元に統一したビューを提供する。
次に、異なるエージェントトポロジの下でメモリがどのようにインスタンス化され、操作されるかを分析する。
論文 参考訳(メタデータ) (2026-01-14T07:38:38Z) - How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective [103.44502230776352]
視覚言語モデル(VLM)における視覚空間推論(VSR)の系統的研究について述べる。
空間インテリジェンスを3つのレベル,すなわち基本的な知覚,空間理解,空間計画,および空間インテリジェンスベンチマークSIBenchに分類した。
論文 参考訳(メタデータ) (2025-09-23T12:00:14Z) - Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts [79.1081247754018]
大規模言語モデル(LLM)は、推論、計画、意思決定のタスクに広くデプロイされている。
そこで我々は, 接触探索質問(CSQ)に基づく枠組みを提案し, 騙しの可能性を定量化する。
論文 参考訳(メタデータ) (2025-08-08T14:46:35Z) - Cognitive Guardrails for Open-World Decision Making in Autonomous Drone Swarms [31.87394696063202]
スモール・アンクルード・エアリアル・システムズ(SUAS)は、捜索救助任務において自律的な群れとしてますます配備されている。
本稿では, サーチ・レスキューミッションにおける sUAS Swarm のための認知ガードレールの設計, シミュレーション, 実世界の統合について述べる。
論文 参考訳(メタデータ) (2025-05-29T15:47:49Z) - Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models [13.768090541138571]
視覚言語モデル(VLM)はオブジェクトの識別と記述に優れるが、しばしば空間的推論では失敗する。
視覚トークンの埋め込みは、テキストトークンよりもはるかに大きな規範を持っている。
視覚トークンとシステムが注目を惹きつけることを明らかにするツール。
論文 参考訳(メタデータ) (2025-03-21T17:51:14Z) - REVAL: A Comprehension Evaluation on Reliability and Values of Large Vision-Language Models [59.445672459851274]
REVALは、Large Vision-Language Modelsの textbfREliability と textbfVALue を評価するために設計された包括的なベンチマークである。
REVALには144K以上の画像テキストビジュアル質問回答(VQA)サンプルが含まれており、信頼性と価値の2つの主要なセクションで構成されている。
主流のオープンソースLVLMや,GPT-4oやGemini-1.5-Proといった著名なクローズドソースモデルを含む26のモデルを評価した。
論文 参考訳(メタデータ) (2025-03-20T07:54:35Z) - Why Is Spatial Reasoning Hard for VLMs? An Attention Mechanism Perspective on Focus Areas [69.56484419619919]
機械的解釈可能性のレンズによる空間的推論の課題について検討する。
空間的推論の成功は、実際の物体の位置と注意を一致させるモデルの能力と強く相関している。
本研究の目的は,ADAPTVISを用いて,信頼性の高い地域への注意を喚起することである。
論文 参考訳(メタデータ) (2025-03-03T17:57:03Z) - Explore until Confident: Efficient Exploration for Embodied Question Answering [32.27111287314288]
我々は、大きな視覚言語モデルの強力な意味推論機能を活用して、質問を効率的に探索し、答える。
深度情報とVLMの視覚的プロンプトに基づいて,まずシーンのセマンティックマップを構築する手法を提案する。
次に、コンフォメーション予測を用いて、自信に答えるVLMの質問を校正し、いつ探索を中止するかをロボットが知ることができるようにする。
論文 参考訳(メタデータ) (2024-03-23T22:04:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。