論文の概要: SABRE: Scalable and Automated Benchmarking of VLMs under Stress
- arxiv url: http://arxiv.org/abs/2608.07435v1
- Date: Fri, 07 Aug 2026 17:21:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.580083
- Title: SABRE: Scalable and Automated Benchmarking of VLMs under Stress
- Title(参考訳): SABRE: ストレス下でのVLMのスケーラブルで自動ベンチマーク
- Abstract要約: ビジョン言語モデル(VLM)は急速に改善されているが、ベンチマークの開発は遅れている。
私たちは、Test Primerを構造化仕様に変換するスケーラブルで自動化されたパイプラインであるSABREを紹介します。
我々は、SABRE-Prior を用いて、VLM が世界標準に依存するのではなく、視覚的証拠に従うかどうかを検証する。
- 参考スコア(独自算出の注目度): 10.315515647818009
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) are improving rapidly, but benchmark development lags behind, making weaknesses hard to identify. Building stress tests is costly: samples must satisfy controlled conditions, remain answerable, and challenge current models. We present SABRE, a scalable, automated pipeline that converts a Test Primer (a Markdown Task Design with Data Schema) into structured specifications, generated or edited images, and question-answer pairs. Automated filtering removes candidates solved by a Filtering VLM, while human review verifies candidate validity and supports annotation correction and localized image repair. We instantiate SABRE-Prior to test whether VLMs follow visual evidence instead of relying on world priors -- learned expectations about familiar objects and scenes. Its 600 images and 1,000 questions span Context (unexpected entities in familiar scenes), Texture (counterfactual materials), Attribute (noncanonical component counts), and Language Elicitation (answers suggested by language but unsupported by the image). Across six VLMs, macro-average accuracy ranges from 17.8% to 31.3% (22.6% mean). A real-image Attribute control is comparably difficult for the Filtering VLM. SABRE-Counting and SABRE-Spatial pilots show that the workflow supports other stress-test settings. These results establish SABRE as a reusable framework for constructing and refreshing VLM stress tests rather than a single fixed benchmark.
- Abstract(参考訳): 視覚言語モデル(VLM)は急速に改善されているが、ベンチマーク開発は遅れており、弱点を特定するのが難しくなっている。
ストレステストの構築はコストがかかる - サンプルは制御された条件を満たし、応答可能であり続け、現在のモデルに挑戦しなければならない。
SABREは、テストプライマー(Markdown Task Design with Data Schema)を構造化された仕様、生成または編集された画像、質問応答ペアに変換するスケーラブルで自動化されたパイプラインである。
自動フィルタリングはフィルタリングVLMによって解決された候補を除去するが、人間のレビューは候補の有効性を検証し、アノテーションの修正と局所的な画像修復をサポートする。
我々はSABRE-Priorをインスタンス化して、VLMが世界の先行技術に頼るのではなく、視覚的証拠に従うかどうかをテストする。
その600の画像と1000の質問は、コンテキスト(見慣れないシーンにおける未発見の実体)、テクスチャ(偽物)、属性(非標準成分数)、言語引用(言語によって提案されるが、画像によって支持されない回答)にまたがる。
6つのVLMで、マクロ平均精度は17.8%から31.3%(平均22.6%)である。
フィルタVLMでは実像属性制御が不可分に難しい。
SABRE-CountingとSABRE-Spatialのパイロットは、ワークフローが他のストレステスト設定をサポートすることを示した。
これらの結果は、単一の固定ベンチマークではなく、VLMストレステストの構築とリフレッシュのための再利用可能なフレームワークとしてSABREを確立している。
関連論文リスト
- Harnessing Image Question Dependence for Better VLM Test-time Reinforcement Learning [66.13367818892503]
Vlm 適応性を向上させるために画像探索依存を利用したテスト時強化学習フレームワーク TTIQ を提案する。
TTIQの教師は、元の画像検索ペアとその画像と質問対応のバリエーションの下で、各サンプル応答を強制する。
イメージと質問への依存と信頼を組み合わせることで、共同で接地された応答を好む応答レベルの報酬を構築する。
論文 参考訳(メタデータ) (2026-09-09T22:54:15Z) - Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA [6.404338288187941]
エージェント駆動型ゲーム品質保証パイプラインにおける異常検出における視覚言語モデル(VLM)の利用について検討した。
我々は、ゼロショットプロンプト設定下で6つの最近のVLMをベンチマークし、その感度を4つのプロンプト変種に解析する。
以上の結果から,VLMは幾何学的クリッピングに関連する視覚的手がかりを捉えることができるが,視覚的不明瞭なフレームに対して有意な偽陽性が生じることが示唆された。
論文 参考訳(メタデータ) (2026-07-28T16:10:47Z) - What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs [52.50210189669399]
視覚言語モデル(VLM)を駆動するには,操作設計領域(ODD)が定義する様々な条件のシーンを正確に理解する必要がある
SliceScorerは、欠落したスライス推薦のための決定論的スコアリングルールである。
SliceNavは, 従来のスライス発見法よりも, 高リスクカバレッジギャップを効果的に表面化することを示す。
論文 参考訳(メタデータ) (2026-06-01T03:18:01Z) - Employing Vision-Language Models for Face Image Quality Assessment [0.023141219541346198]
顔画像品質評価(FIQA)はバイオメトリックパイプラインにおいて重要な制御ステップである。
最先端のFIQA法は高い実用性を達成するが、通常「ブラックボックス」として機能する
ゼロショット環境でFIQAを実行することにより,このギャップを埋めるため,市販のビジョンランゲージモデル(VLM)の可能性を検討する。
論文 参考訳(メタデータ) (2026-05-17T14:57:52Z) - Test-Time Hinting for Black-Box Vision-Language Models [11.005886421208709]
Test-Time Hintingは、単一のVLMコールによるVLMパフォーマンスを改善し、ブラックボックスAPIアクセスのみを必要とする。
テスト時間ヒンティングは、自然画像のVQAベンチマークにおいて、複数の閉重VLMの精度を向上することを示す。
論文 参考訳(メタデータ) (2026-05-13T14:35:22Z) - Stress Tests REVEAL Fragile Temporal and Visual Grounding in Video-Language Models [18.243585941034116]
Video-Language Models (VidLM) は、ビデオの内容、時間的シーケンス、動きを強く説明する。
本稿では,現代Vidsの基礎的弱点を探索する診断ベンチマークREVEALを紹介する。
これらのモデルでは,映像コンテンツを無視しながら質問に回答し,虚偽の主張に同意し,基本的なカメラの動きに苦しむとともに,時間的スケーラブルな情報を収集することができない。
論文 参考訳(メタデータ) (2026-02-11T17:39:14Z) - FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges [85.24983823102262]
本稿では,テキスト・トゥ・イメージ(T2I)モデルと視覚言語モデル(VLM)を評価するための構造化手法を提案する。
我々は,挑戦的プロンプトで条件付きT2Iモデルにより生成された画像において,VLMが27の特定の障害モードを識別できるかどうかを検証した。
以上の結果から,現在の測定値ではこれらの誤差を捉えるには不十分であることが示唆された。
論文 参考訳(メタデータ) (2025-12-01T19:46:03Z) - Lost in Translation and Noise: A Deep Dive into the Failure Modes of VLMs on Real-World Tables [0.1749935196721634]
WikiTableQuestionsやFinQAといった既存のQA用データセットは、圧倒的にモノリンガル(英語)である。
MirageTVQAは、テーブル推論のためのより堅牢なVLMモデルに向けた進捗の測定と推進のためのベンチマークを提供する。
論文 参考訳(メタデータ) (2025-11-21T13:32:56Z) - CARES: Context-Aware Resolution Selector for VLMs [29.734101330721263]
大規模な視覚言語モデル(VLM)は、通常、ネイティブまたは高解像度で画像を処理し、タスク全体にわたって効果的に維持する。
本稿では,簡単な事前処理モジュールであるemphCARESを紹介する。
CARESはタスク性能を最大80%削減しながら維持する。
論文 参考訳(メタデータ) (2025-10-22T11:44:31Z) - DySS: Dynamic Queries and State-Space Learning for Efficient 3D Object Detection from Multi-Camera Videos [53.52664872583893]
Bird's Eye View (BEV) におけるカメラベースの3Dオブジェクト検出は、自律運転において最も重要な認識タスクの1つである。
状態空間学習と動的クエリを用いた新しいDySSを提案する。
提案するDySSは,優れた検出性能と効率的な推論を実現する。
論文 参考訳(メタデータ) (2025-06-11T23:49:56Z) - Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage [50.84150600032693]
MLLM(Multimodal large language model)は、非常に詳細なキャプションを生成するのに優れるが、幻覚を引き起こすことが多い。
我々は,LLM-MLLM協調を利用して与えられたキャプションを補正するマルチエージェント手法を提案する。
提案手法は, キャプションの精度を向上し, GPT-4Vによるキャプションの精度を向上する。
論文 参考訳(メタデータ) (2024-12-20T01:37:22Z) - Trust but Verify: Programmatic VLM Evaluation in the Wild [62.14071929143684]
プログラム型VLM評価(Programmatic VLM Evaluation、PROVE)は、オープンなクエリに対するVLM応答を評価するための新しいベンチマークパラダイムである。
我々は,PROVE上でのVLMの有効性-実効性トレードオフをベンチマークした結果,両者のバランスが良好であることは極めて少ないことがわかった。
論文 参考訳(メタデータ) (2024-10-17T01:19:18Z) - Test-Time Self-Adaptive Small Language Models for Question Answering [63.91013329169796]
ラベルのないテストデータのみを用いて、より小さな自己適応型LMの能力を示し、検討する。
提案した自己適応戦略は,ベンチマークQAデータセットの大幅な性能向上を示す。
論文 参考訳(メタデータ) (2023-10-20T06:49:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。