論文の概要: EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding
- arxiv url: http://arxiv.org/abs/2607.26518v1
- Date: Wed, 29 Jul 2026 06:33:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.560603
- Title: EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding
- Title(参考訳): EgoSafe: 視覚的安全理解のための最初のモバイルキャプチャベンチマーク
- Authors: Yuyun Chen, Tianao Li, TianQuan Feng, Cen Chen, Huiping Zhuang, Hao Peng, Ziqian Zeng,
- Abstract要約: EgoSafe-Benchは、エゴ中心の安全シナリオにおける法医学的推論を調査するために設計されたベンチマークである。
提案した階層型推論評価プロトコルによって制御されるQAチェーンと,3,000本のビデオクリップをそれぞれペアリングして生成した12,000のユニークな評価サンプルから構成される。
我々の研究は、論理的に堅牢なビデオ理解システムの開発を促進するために、挑戦的なデータセットと体系的な評価フレームワークを提供する。
- 参考スコア(独自算出の注目度): 25.995418289744205
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliable visual safety understanding in real-world scenarios demands more than just object recognition; it requires causal reasoning under epistemic uncertainty. While Large Vision-Language Models (LVLMs) demonstrate impressive semantic alignment on standard benchmarks, they often struggle to distinguish between superficial correlation and genuine forensic logic when grounded in the dynamic, partially observable nature of first-person experiences. Existing evaluations, dominated by third-person surveillance footage and binary classification metrics, fail to expose this cognitive gap. To address this, we introduce EgoSafe-Bench, a benchmark specifically designed to probe forensic reasoning in egocentric safety scenarios. It comprises 12,000 unique evaluation samples, generated by pairing each of the 3,000 video clips with a QA chain governed by our proposed Hierarchical Reasoning Evaluation (HRE) protocol. Unlike standard benchmarks, HRE mandates a rigorous reasoning trajectory from initial feature anchoring to blind-spot deduction and intent inference, thereby enforcing logical consistency and penalizing shortcut-based predictions.Extensive evaluations of state-of-the-art LVLMs (e.g., Qwen3-VL, Gemini, VideoLLaMA 3) reveal a significant perception-reasoning decoupling: models often achieve high descriptive scores but exhibit notable fragility in causal reasoning and logical closure. Our work provides both a challenging dataset and a systematic evaluation framework to foster the development of logically robust video understanding systems.
- Abstract(参考訳): 現実のシナリオにおける信頼性の高い視覚的安全性の理解は、単に物体認識以上のものを必要とします。
LVLM(Large Vision-Language Models)は、標準的なベンチマークで印象的なセマンティックアライメントを示すが、ファーストパーソン体験のダイナミックで部分的に観察可能な性質を基礎として、表面的相関と真の法学論理の区別に苦慮することが多い。
既存の評価では、第三者の監視映像とバイナリ分類の指標が支配的だったが、この認知的ギャップを露呈することはできなかった。
この問題に対処するために,エゴセントリックな安全シナリオにおける法医学的推論を調査するためのベンチマークであるEgoSafe-Benchを紹介した。
提案した階層推論評価(HRE)プロトコルによって制御されるQAチェーンと,3,000本のビデオクリップをそれぞれペアリングすることで,12,000のユニークな評価サンプルを作成した。
標準ベンチマークとは異なり、HREは、初期特徴のアンカーから盲点推論、意図推論への厳格な推論軌道を義務付け、論理的一貫性を強制し、ショートカットに基づく予測をペナル化させる。
我々の研究は、論理的に堅牢なビデオ理解システムの開発を促進するために、挑戦的なデータセットと体系的な評価フレームワークを提供する。
関連論文リスト
- SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection [30.634696315154383]
本稿では,知覚と意味的推論の協調的特殊化を可能にするマルチエージェントフレームワークであるSafeGuardを提案する。
新しいAI生成ビデオ検出ベンチマークであるSafeVidを導入し、身体的妥当性、構造的整合性、社会的行動の合理性を評価する。
論文 参考訳(メタデータ) (2026-07-03T08:03:35Z) - FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis [29.80090524705393]
FoodMonitorは、商用キッチン監視における説明可能なコンプライアンス分析のベンチマークである。
最高の性能モデルは0.360ドルC_textscore$でしか得られず、空間的局所化と細かいルール理解が主要なボトルネックとして現れる。
論文 参考訳(メタデータ) (2026-05-23T10:19:41Z) - Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models [28.981226513192535]
最近のVision-Language-Action(VLA)モデルでは、標準的なロボットベンチマークで顕著な成功率が報告されている。
最近の証拠は、標準ベンチマークの成功と真の具体的推論の体系的な不一致を示唆している。
本稿では,ロボットポリシーにおける真の身体的推論の診断ベンチマークであるBeTTERを紹介する。
論文 参考訳(メタデータ) (2026-04-20T09:25:30Z) - Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models [14.927545906619295]
大規模言語モデルは、複雑なタスクを解決するために明示的なチェーン・オブ・シンク(CoT)推論にますます依存している。
LLMの安全性に関する既存の研究は、コンテンツ安全性に焦点を当てている。
我々は、推論の安全性をセキュリティの側面として認識する:モデルの推論の軌道が論理的に一貫したものであるという要求。
論文 参考訳(メタデータ) (2026-03-26T13:08:56Z) - A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions [2.7694879331630182]
本稿では、安全クリティカルな2次元物体検出のためのLVLM(Large Vision-Language Models)を体系的に評価する。
PeSOTIFデータセットは、ロングテール交通シナリオと環境劣化のベンチマークである。
LVLMは複雑な自然シナリオの25%以上をリコールしてYOLOベースラインを上回ります。
論文 参考訳(メタデータ) (2026-01-30T10:58:24Z) - SSVP: Synergistic Semantic-Visual Prompting for Industrial Zero-Shot Anomaly Detection [55.54007781679915]
本稿では,多種多様な視覚的エンコーディングを効率よく融合させ,モデルの微粒化知覚を高めるSynergistic Semantic-Visual Prompting (SSVP)を提案する。
SSVPは、MVTec-AD上で93.0%のImage-AUROCと92.2%のPixel-AUROCで最先端のパフォーマンスを達成し、既存のゼロショットアプローチを著しく上回っている。
論文 参考訳(メタデータ) (2026-01-14T04:42:19Z) - SafeRBench: A Comprehensive Benchmark for Safety Assessment in Large Reasoning Models [60.8821834954637]
LRMの安全性をエンドツーエンドに評価する最初のベンチマークであるSafeRBenchを紹介する。
私たちは、リスクカテゴリとレベルを入力設計に組み込んだ先駆者です。
我々は,長い推論トレースを意味的に一貫性のある単位にセグメント化するためのマイクロシンクのチャンキング機構を導入する。
論文 参考訳(メタデータ) (2025-11-19T06:46:33Z) - DeceptionBench: A Comprehensive Benchmark for AI Deception Behaviors in Real-world Scenarios [57.327907850766785]
現実的な現実のシナリオにまたがる騙しのキャラクタリゼーションは未解明のままである。
DeceptionBenchは、さまざまなドメインにまたがる認知傾向を体系的に評価する最初のベンチマークです。
本研究は,本質的な側面から,ユーザ満足度を優先する自己関心のエゴスティックな傾向を示すモデルや,サイコファンティックな行動を示すモデルについて検討する。
実世界のフィードバックダイナミクスのより現実的なシミュレーションを構築するために,持続的マルチターン相互作用ループを組み込んだ。
論文 参考訳(メタデータ) (2025-10-17T10:14:26Z) - RoboView-Bias: Benchmarking Visual Bias in Embodied Agents for Robotic Manipulation [67.38036090822982]
ロボット操作における視覚バイアスの定量化を目的とした,最初のベンチマークであるRoboView-Biasを提案する。
我々は、個々の視覚的要因とその相互作用によって引き起こされるバイアスの堅牢な測定を可能にする2,127のタスクインスタンスを作成します。
本研究は,視覚バイアスの系統的解析が,安全で信頼性の高い汎用的なエンボディエージェントの開発に必須であることを示す。
論文 参考訳(メタデータ) (2025-09-26T13:53:25Z) - Exploring Robustness of Unsupervised Domain Adaptation in Semantic
Segmentation [74.05906222376608]
クリーンな画像とそれらの逆の例との一致を、出力空間における対照的な損失によって最大化する、逆向きの自己スーパービジョンUDA(ASSUDA)を提案する。
i) セマンティックセグメンテーションにおけるUDA手法のロバスト性は未解明のままであり, (ii) 一般的に自己スーパービジョン(回転やジグソーなど) は分類や認識などのイメージタスクに有効であるが, セグメンテーションタスクの識別的表現を学習する重要な監視信号の提供には失敗している。
論文 参考訳(メタデータ) (2021-05-23T01:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。