論文の概要: VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
- arxiv url: http://arxiv.org/abs/2607.14660v1
- Date: Thu, 16 Jul 2026 07:25:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.026337
- Title: VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance
- Title(参考訳): VIABench:視覚障害支援のためのブラインド個人による総合的なビデオベンチマーク
- Abstract要約: 視覚障害のある人(VII)は、視覚情報へのアクセスが限られているため、重要な日々の課題に直面している。
MLLMは、一般的なビジョンや言語タスクにおいて印象的な成果を上げてきたが、現実の視覚障害者支援における実用性は、いまだに未発見のままである。
VIABenchは視覚障害者支援シナリオにおけるMLLMを評価するための総合的なビデオベンチマークである。
- 参考スコア(独自算出の注目度): 36.71994269007502
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Visually impaired individuals (VIIs) encounter significant daily challenges due to limited access to visual information. Although Multimodal Large Language Models (MLLMs) have achieved impressive results on general vision and language tasks, their practical utility in real-world blind assistance still remains largely underexplored. To fill this gap, we introduce VIABench, a comprehensive video benchmark specifically designed to evaluate MLLMs in Visually Impaired Assistance scenarios using first-person videos recorded or shared by VIIs themselves. VIABench defines three core tasks, each targeting a distinct requirement in visual assistance. Proactive Reminder: Assesses the model's ability to interpret ongoing video content while proactively anticipating and verbally describing upcoming navigation-critical events; Visual Question Answering (VQA): Evaluates the model's capacity to answer user-posed questions about the environment or objects within the video; Vision-Guided Interaction: Tests context-aware reasoning to accomplish intentional interactions between user and environment. To ensure a robust and fair evaluation, we propose a rigorous benchmarking pipeline that supports both online (real-time) and offline settings. Our experiments demonstrate that current MLLMs still struggle to deliver comprehensive support for VIIs, especially in the Proactive Reminder task, which demands accurate anticipation and real-time responsiveness. We hope VIABench will drive future research toward developing customized MLLMs for real-world assistance, ultimately improving navigation and interaction experiences for visually impaired individuals. Code and data will be released at https://github.com/MCG-NJU/VIABench.
- Abstract(参考訳): 視覚障害のある人(VII)は、視覚情報へのアクセスが限られているため、重要な日々の課題に直面している。
MLLM(Multimodal Large Language Models)は、一般的なビジョンや言語タスクにおいて印象的な成果を上げてきたが、現実の視覚障害者支援における実用性はいまだに未熟である。
このギャップを埋めるために、VIABenchという、視覚障害者支援シナリオにおけるMLLMを評価するための総合的なビデオベンチマークを紹介します。
VIABenchは3つのコアタスクを定義している。
Proactive Reminder: 今後のナビゲーションクリティカルなイベントを積極的に予測し、口頭で記述しながら、進行中のビデオコンテンツを解釈するモデルの能力を確認する: Visual Question Answering (VQA): ユーザが提供する、ビデオ内の環境やオブジェクトに関する質問に答えるモデルの能力を評価する; Vision-Guided Interaction: ユーザと環境間の意図的なインタラクションを実現するためのコンテキスト認識推論の推論をテストする。
堅牢で公平な評価を確保するため,オンライン(リアルタイム)とオフラインの両方をサポートする厳密なベンチマークパイプラインを提案する。
我々の実験によると、現在のMLLMは、特に正確な予測とリアルタイム応答性を必要とするProactive Reminderタスクにおいて、VIIの包括的なサポートの提供に苦慮している。
VIABenchは将来、現実世界の補助のためにカスタマイズされたMLLMを開発し、最終的に視覚障害者のナビゲーションと対話体験を改善していくことを願っている。
コードとデータはhttps://github.com/MCG-NJU/VIABench.comで公開される。
関連論文リスト
- How Multimodal Large Language Models Support Access to Visual Information: A Diary Study With Blind and Low Vision People [11.750552918474993]
MLLM(Multimodal large language model)は、BlindとLow Vision(BLV)の人々が視覚情報にアクセスする方法を変えつつある。
MLLMは視覚的解釈の精度を向上させることができるが、日常的な使用を支援することは「視覚アシスタント」のスキルにも依存する。
論文 参考訳(メタデータ) (2026-02-13T21:19:40Z) - VersaViT: Enhancing MLLM Vision Backbones via Task-Guided Optimization [87.26383908243878]
マルチモーダル大言語モデルにおける視覚エンコーダは,その高密度な特徴表現に欠けていることを示す。
本稿では,協調学習のための新しいマルチタスクフレームワークであるVersaViTを提案する。
論文 参考訳(メタデータ) (2026-02-10T16:08:19Z) - MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs [22.99984702966184]
MVI-Benchは、視覚入力がLVLM(Large Vision-Language Models)の堅牢性をいかに損なうかを評価するための最初の総合的なベンチマークである。
MVI-Benchは、視覚概念、視覚属性、視覚関係という3つの階層的な視覚的インプットに焦点を当てている。
MVI-Sensitivityは、LVLMのロバスト性を粒度レベルで特徴づける新しい計量である。
論文 参考訳(メタデータ) (2025-11-18T05:48:08Z) - Response Wide Shut? Surprising Observations in Basic Vision Language Model Capabilities [54.94982467313341]
視覚言語モデル(VLM)は、様々な複雑なコンピュータビジョン問題に対処するための汎用ツールとして登場した。
我々は、設計のどのコンポーネントが欠落しているかを調査する一連のテストを構築することで、基本的な視覚的タスクにおけるSoTA VLMの限界を理解することにしました。
論文 参考訳(メタデータ) (2025-07-10T15:26:41Z) - VideoExplorer: Think With Videos For Agentic Long-Video Understanding [117.68219930263153]
ロングビデオ理解はコンピュータビジョンにおいて難しい問題である。
ビデオによる思考の原則に基づくフレームワークであるVideoExplorerを提案する。
静的なコンテキストを推論する代わりに、VideoExplorerは、サブクエストを反復的に定式化し、関連するモーメントを特定し、タスク指向で時間的にスケーラブルなビデオ理解を実行する。
論文 参考訳(メタデータ) (2025-06-12T15:39:10Z) - Hidden in plain sight: VLMs overlook their visual representations [48.83628674170634]
視覚言語モデル(VLM)と視覚エンコーダを比較し、これらのモダリティをまたいで統合する能力を理解する。
VLMは視覚エンコーダよりも著しく性能が悪く、近距離性能に低下することがわかった。
論文 参考訳(メタデータ) (2025-06-09T17:59:54Z) - ViSpeak: Visual Instruction Feedback in Streaming Videos [50.99067964073338]
本稿では,視覚的インストラクションフィードバック(Visual Instruction Feedback)という新しいタスクを提案する。
我々は,様々なストリーミングビデオ理解ベンチマークにおいて,GPT-4oレベルの性能を持つSOTAストリーミングビデオ理解LMMであるViSpeakモデルを提案する。
論文 参考訳(メタデータ) (2025-03-17T03:05:31Z) - VIAssist: Adapting Multi-modal Large Language Models for Users with Visual Impairments [0.5572412691057121]
全世界で220億人が視覚障害に罹患している。
MLLMの視覚的理解と推論の優れた能力を持つVI人を助けることが望ましい。
本稿では,視覚的な質問応答を提供するために,MLLMをVI個人に活用する方法について検討する。
論文 参考訳(メタデータ) (2024-04-03T06:53:27Z) - Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models [50.653838482083614]
本稿では,IT-LVLMの基本的なコンピュータビジョンタスクにおける能力を評価するために,スケーラブルなテストベッドを提案する。
MERLIMには300K以上の画像検索ペアが含まれており、IT-LVLMにおけるクロスモーダルな"ハロシン化"イベントの検出に重点を置いている。
論文 参考訳(メタデータ) (2023-12-03T16:39:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。