論文の概要: Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption
- arxiv url: http://arxiv.org/abs/2603.26769v1
- Date: Tue, 24 Mar 2026 10:14:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:44.589569
- Title: Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption
- Title(参考訳): 視覚言語モデルにおけるエッジ信頼性ギャップ:圧縮VLMの視覚的破壊時の故障モードの定量化
- Abstract要約: エッジデプロイメントのための大規模視覚言語モデルの迅速な圧縮は、未解決の問題を引き起こす: コンパクトモデルは、単に頻繁にではなく、異なるフェールするのだろうか?
本研究では, VQAv2 および COCO キャプションから 4,000 個のサンプルに対して, 7-ビリオンパラメータ定量 VLM (Qwen2.5-VL-7B, 4-bit NF4) と500 万パラメータFP16モデル (SmolVLM2-500M) を比較した。
平均トークン確率を用いて3カテゴリーの誤り分類法(対象盲点, セマンティックドリフト, 先行バイアス)を診断の枠組みとして適用し, 信頼度校正を期待誤差(ECE)を用いて測定する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid compression of large vision-language models (VLMs) for edge deployment raises an underexplored question: do compact models fail differently, not merely more often? This study compares a 7-billion-parameter quantised VLM (Qwen2.5-VL-7B, 4-bit NF4) against a 500-million-parameter FP16 model (SmolVLM2-500M) across 4,000 samples from VQAv2 and COCO Captions. A three-category error taxonomy (Object Blindness, Semantic Drift, Prior Bias) is applied as a diagnostic framework. A text-only GPT-4o judge reveals Semantic Drift (B) as the dominant failure mode on VQAv2 and on COCO for Qwen, with a mixed Object Blindness / Semantic Drift profile for SmolVLM2 on COCO; Prior Bias (C) is present on VQAv2 but absent on COCO for both models. Confidence calibration is measured via Expected Calibration Error (ECE) using geometric mean token probability, compositional reasoning is probed with structured negation probes across four templates, and a blur robustness experiment completes the evaluation. For this model pair, the compact model exhibits a qualitatively distinct failure signature: a 12.5pp larger negation collapse (-33.2pp vs. -20.8pp, Wald 95% CI [8.2, 16.8]pp, p < 10^-8), driven almost entirely by COCO while the VQAv2 gap is not statistically significant (4.5pp, p=0.19). The most discriminating template is false_yn: SMOLVLM2-500M responds "Yes" (incorrectly claiming a depicted object is absent) on 100% of COCO trials vs. 14% for Q WEN 2.5-VL-7B. Asymmetric dataset-dependent miscalibration and a blur experiment with two controlled ablations complete the analysis. The fully reproducible pipeline is released for systematic safety auditing of compressed VLMs prior to edge deployment.
- Abstract(参考訳): エッジデプロイメントのための大規模視覚言語モデル(VLM)の高速圧縮は、未解決の問題を引き起こしている。
本研究では,VQAv2 および COCO キャプションから 4,000 個のサンプルに対して,7ビリオンパラメータ定量 VLM (Qwen2.5-VL-7B, 4-bit NF4) を500万パラメータ FP16 モデル (SmolVLM2-500M) と比較した。
診断の枠組みとして,3カテゴリーの誤り分類法(対象盲点,セマンティックドリフト,先行バイアス)を適用した。
テキストのみの GPT-4o 判事は、VQAv2 と Qwen の COCO では Semantic Drift (B) が支配的な障害モードであり、COCO では SmolVLM2 では Object Blindness / Semantic Drift プロファイルが混在していることを明らかにした。
信頼度校正は、幾何学的平均トークン確率を用いて期待校正誤差(ECE)を用いて測定され、構成推論は4つのテンプレートにまたがる構造化否定プローブを用いて探索され、曖昧なロバスト性実験により評価が完了する。
このモデル対に対して、コンパクトモデルは定性的に異なる故障符号を示す: 12.5ppより大きな否定崩壊(-33.2pp vs. -20.8pp, Wald 95% CI [8.2, 16.8]pp, p < 10^-8)、ほぼ完全にCOCOによって駆動されるが、VQAv2ギャップは統計的に有意ではない(4.5pp, p=0.19)。
SMOLVLM2-500M は COCO 試験の100%に対して、Q WEN 2.5-VL-7B では 14% で "Yes" 反応する。
非対称なデータセット依存の誤校正と、2つの制御されたアブレーションによる曖昧な実験が解析を完了した。
完全に再現可能なパイプラインは、エッジデプロイメントの前に圧縮されたVLMの系統的な安全性監査のためにリリースされている。
関連論文リスト
- Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts [0.0]
学習後の量子化は,タスク精度が保存されている場合でも,大きな言語モデルがどのように推論するかを静かに変更できることを示す。
3つの量子化精度で5つの命令調整LDMから3万のチェーン・オブ・シント出力を分類する。
精度は精度で高いが,Hollow Convergence は NF4 で大きく依存的な変化を示す。
論文 参考訳(メタデータ) (2026-07-10T21:55:05Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks [46.43161388634735]
医用視覚言語モデル(VLM)は、画像と質問応答ペアが何年も無料でダウンロードされている公開ベンチマークで評価される。
SLAKE-En,PathVQA,VQA-RAD,および4つの検出器ファミリを用いたOmniMedVQAミラーのオープンVLMを検査した。
論文 参考訳(メタデータ) (2026-06-08T18:40:10Z) - Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks [45.86413490112477]
大規模言語モデル(LLM)は信頼性に敏感なアプリケーションで使用される。
厳密な信頼境界を持つ稀な失敗確率を推定するには、違法に大きなLSM推論サイズが必要である。
そこで本研究では,クロスエントロピー手法を用いて,故障確率入力に集中したサンプリング分布を学習する。
論文 参考訳(メタデータ) (2026-05-11T20:23:44Z) - The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs [0.0]
メタ認知プローブ(Metacognitive Probe)は、探索的な5タスク、15スロットの診断である。
LLMの信頼性動作を5つの行動特異的な次元に分解する。
N=69人に対して評価される。
論文 参考訳(メタデータ) (2026-05-11T00:55:31Z) - Quantization Undoes Alignment: Bias Emergence in Compressed LLMs Across Models and Precision Levels [0.0]
大規模言語モデルは、クラウドおよびエッジデプロイメントの推論コストとメモリフットプリントを低減するために、トレーニング後の量子化を通じて定期的に圧縮される。
既存の研究は通常、2つの条件のみを比較し、集約バイアスメトリクスに依存し、単一のモデルファミリを評価する。
12,148 BBQ バイアスベンチマーク項目の5つの精度レベル (BF16 - 3-bit) における3つの命令調整モデルの制御実験を行った。
論文 参考訳(メタデータ) (2026-05-02T05:41:47Z) - Auditing Frontier Vision-Language Models for Trustworthy Medical VQA: Grounding Failures, Format Collapse, and Domain Adaptation [4.177028541321909]
医療用VQAの5つの視覚言語モデル(VLM)を2つの信頼関連軸に沿って評価する。
モデルは解剖学的および病理学的ターゲットを不十分にローカライズする。
同じモデルをローカライズして回答するセルフグラウンドパイプラインは、VQAの精度を低下させる。
論文 参考訳(メタデータ) (2026-04-30T11:11:47Z) - The Verification Tax: Fundamental Limits of AI Auditing in the Rare-Error Regime [0.0]
最も引用されているキャリブレーションの結果は、CIFAR-100上での温度スケーリング後のECEの0.012は、統計的ノイズフロアより下である。
モデル誤差率のエプシロンによるキャリブレーション誤差を推定するミニマックスレートは Theta((Lepsilon/m)2/3) であり、推定器が打ち負かせない。
論文 参考訳(メタデータ) (2026-04-14T16:48:24Z) - How Independent are Large Language Models? A Statistical Framework for Auditing Behavioral Entanglement and Reweighting Verifier Ensembles [46.63622714488747]
共有事前学習データ、蒸留、アライメントパイプラインは、隠れた振る舞い依存、潜伏絡みを誘導することができる。
実際には、これは相関した推論パターンと同期された障害として現れます。
ブラックボックス言語モデル間の行動絡みを監査するための統計的枠組みを開発する。
論文 参考訳(メタデータ) (2026-04-08T23:32:06Z) - The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation [1.8345614451086532]
RLHF 対応言語モデルは TruthfulQA 上で応答均質化を示す。
40-79%の質問は、10のi.i.d.サンプルに対して単一のセマンティッククラスタを生成する。
論文 参考訳(メタデータ) (2026-03-25T09:35:15Z) - VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models [64.56065206447788]
ビジョン言語モデル(VLM)は、標準の高品質なデータセット上で強力なパフォーマンスを達成する。
VLM-RobustBenchはノイズ、ブラー、天気、デジタル、幾何学にまたがる49種類の拡張型にまたがるベンチマークである。
低重度空間摂動は、視覚的に重度な光度劣化よりも、しばしば性能を低下させる。
論文 参考訳(メタデータ) (2026-03-06T10:58:02Z) - The Devil in the Details: Emergent Misalignment, Format and Coherence in Open-Weights LLMs [0.0]
次世代オープンウェイトモデルがQwen-2.5ファミリーに類似した耐性を示すかどうかを評価する。
9つの現代的なオープンウェイトモデルにまたがって効果を再現する。
論文 参考訳(メタデータ) (2025-11-25T09:25:33Z) - Parrot: Persuasion and Agreement Robustness Rating of Output Truth -- A Sycophancy Robustness Benchmark for LLMs [0.0]
PARROT (Persuasion and Agreement Robustness Rating of Output Truth) は、ユーザの社会的圧力下での精度の劣化を測定するための堅牢性にフォーカスしたフレームワークである。
我々は13のドメインにまたがる1,302のMMLUスタイルの多重選択質問とドメイン固有の権威テンプレートを用いて22のモデルを評価する。
論文 参考訳(メタデータ) (2025-11-21T13:01:28Z) - Token-Level Inference-Time Alignment for Vision-Language Models [58.41370989069588]
VLM(Vision-Language Models)は、現代のマルチモーダルインテリジェンスの重要なバックボーンとなっている。
本稿では,基本VLMを凍結し,その分布を近似する報酬モデルをトレーニングする軽量フレームワークTITAを提案する。
推測中、暗黙の選好信号は報酬モデルと目標VLMの対数確率比として抽出され、密集した自己回帰フィードバックが得られる。
論文 参考訳(メタデータ) (2025-10-20T09:58:03Z) - SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement [100.85923086072204]
我々はThinkLite-VLを紹介した。これは最先端(SoTA)パフォーマンスを実現する視覚推論モデルのファミリーで、トレーニングサンプルの桁数を桁違いに減らしている。
我々はMonte Carlo Tree Search (MCTS) を用いて、各インスタンスの解決に必要な視覚言語モデル(VLM)の推論反復数を用いてサンプルの難易度を測定する。
ThinkLite-VL-7BとThinkLite-VL-72Bは、8つの視覚的推論ベンチマークにおいて、それぞれのベースモデルよりも大幅に優れていた。
論文 参考訳(メタデータ) (2025-04-10T17:49:05Z) - Evaluating Large Language Models for Automated Clinical Abstraction in Pulmonary Embolism Registries: Performance Across Model Sizes, Versions, and Parameters [16.74673750576054]
データ品質を犠牲にすることなく,オープンソースの大規模言語モデル (LLM) がCTPEレポートから概念抽出を自動化できるかを検討した。
LLMは、PEレジストリの抽象化のためのスケーラブルで正確なソリューションを提供し、デュアルモデルレビューワークフローは、人間の監視を最小限にして、データ品質をさらに保護します。
論文 参考訳(メタデータ) (2025-03-26T21:38:06Z) - RLAIF-V: Open-Source AI Feedback Leads to Super GPT-4V Trustworthiness [88.82621231987815]
RLAIF-Vは,MLLMを完全なオープンソースパラダイムで整列させる新しいフレームワークである。
RLAIF-Vは、高品質なフィードバックデータ生成を含む2つの観点から、オープンソースのMLLMを最大限に探求する。
RLAIF-Vは、自動評価と人的評価の両方で6つのベンチマーク実験を行い、モデルの信頼性を大幅に向上させることを示した。
論文 参考訳(メタデータ) (2024-05-27T14:37:01Z) - EqCo: Equivalent Rules for Self-supervised Contrastive Learning [81.45848885547754]
本稿では,InfoNCEをベースとしたコントラスト学習フレームワークにおいて,負のサンプル数と無関係に自己教師型学習を実現する手法を提案する。
InfoMaxの原理に着想を得て、負のペアの数に応じて、対照的な損失のマージン項を適応的にスケールする必要があることを指摘する。
論文 参考訳(メタデータ) (2020-10-05T11:39:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。