論文の概要: Hierarchical Compression of Vision-Language Model Benchmarks
- arxiv url: http://arxiv.org/abs/2609.37515v1
- Date: Tue, 29 Sep 2026 13:08:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.532753
- Title: Hierarchical Compression of Vision-Language Model Benchmarks
- Title(参考訳): 視覚言語モデルベンチマークの階層圧縮
- Abstract要約: PRIMEBenchは、視覚対応の階層型ベンチマーク圧縮フレームワークである。
モデルランキングを維持しながら、評価コストを大幅に削減する。
平均忠実度は5%の保持率で最高である。
- 参考スコア(独自算出の注目度): 13.305925102057818
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Thorough evaluation of vision-language models (VLMs) has become prohibitively expensive, as benchmarks span an ever-broader spectrum of capabilities and new models arrive at a relentless pace. Benchmark compression methods that preserve model rankings at a fraction of the cost are well studied for language models, but for VLMs the question remains under-explored. We present PRIMEBench (Pruning Redundant Items for Multimodal Evaluation), a vision-aware hierarchical benchmark compression framework that substantially reduces evaluation cost while preserving model rankings. This hierarchical framework operates in four stages: data cleaning to remove items answerable without the image and all-correct items, category representative selection to pick one benchmark per capability category, item pruning with Vision-Aware Variance (VAW), and category-count pruning. VAW combines inter-model variance with a vision-dependence score computed from multimodal embeddings alone, while encouraging coverage of diverse items within each benchmark. On models held out from item selection, it has the highest mean fidelity at the released 5% retention. The hierarchical design lets practitioners stop at any stage to match their compute budget; the released suite removes over 97% of items while preserving model rankings. Beyond compression, our analyses show how VLM evaluation behaves as model panels grow and evolve, providing guidance for designing future benchmarks that are more efficient, robust to model turnover, and explicit about the limits of evaluation-side pruning.
- Abstract(参考訳): 視覚言語モデル (VLM) の詳細な評価は、ベンチマークがより広範に広まっており、新しいモデルは絶え間ないペースで到達しているため、非常に高価になっている。
モデルランキングを若干のコストで保持するベンチマーク圧縮法は言語モデルではよく研究されているが、VLMでは未検討のままである。
モデルランキングを保存しながら評価コストを大幅に削減する,視覚対応の階層型ベンチマーク圧縮フレームワークであるPRIMEBench(Pruning Redundant Items for Multimodal Evaluation)を提案する。
この階層的なフレームワークは、4つのステージで機能する: 画像と全修正項目なしで応答可能なアイテムを除去するデータクリーニング、機能カテゴリごとに1つのベンチマークを選択するカテゴリ代表の選択、ビジョン・アウェア・バリアンス(VAW)によるアイテムプルーニング、およびカテゴリカウントプルーニング。
VAWは、モデル間の差異と、マルチモーダル埋め込みだけで計算された視覚依存性スコアを組み合わせ、各ベンチマーク内の多様な項目のカバレッジを奨励する。
アイテム選択から得られるモデルでは、リリースされた5%の保持率において、平均忠実度が最も高い。
階層的な設計では、実践者が計算予算に合うように任意の段階に立ち止まることができる。リリーススイートでは、モデルランキングを維持しながら、97%以上のアイテムを削除している。
圧縮以外にも、モデルパネルの成長と進化に伴ってVLMの評価がどのように振る舞うかを示し、将来のベンチマークを設計するためのガイダンスを提供する。
関連論文リスト
- To Isolate or to Score? Model-Adaptive Assessment for Cost-Efficient Multi-Agent RAG [31.664195597760422]
検索拡張生成のためのマルチエージェント文書評価は計算コストが高い。
各種QAベンチマークを用いて、7B-9B命令調整モデルに対する無訓練介入の制御を行った。
モデル適応型ルーティングアーキテクチャであるMADARAを提案する。
論文 参考訳(メタデータ) (2026-06-23T21:34:23Z) - Q-Save: Towards Scoring and Attribution for Generated Video Evaluation [65.83319736145869]
本稿では,AIGV品質の総合評価のためのベンチマークデータセットとモデルであるQ-Saveを紹介する。
データセットには10000近いビデオが含まれており、それぞれにスカラー平均評価スコア(MOS)と微粒な属性ラベルが付与されている。
品質評価と属性に基づく説明を共同で行う統一評価モデルを提案する。
論文 参考訳(メタデータ) (2025-11-24T07:00:21Z) - Scales++: Compute Efficient Evaluation Subset Selection with Cognitive Scales Embeddings [23.9553588103042]
本稿では,タスク項目自体の本質的な特性に基づいて選択を行うことを論じ,サブセット選択をベンチマークする項目中心のアプローチを提案する。
Scales++は、競争力のある予測忠実性を達成しながら、事前選択コストを18倍以上削減します。
この項目中心のアプローチは,忠実度を著しく低下させることなく,より効率的なモデル評価を可能にすることを実証する。
論文 参考訳(メタデータ) (2025-10-30T11:28:58Z) - LiveXiv -- A Multi-Modal Live Benchmark Based on Arxiv Papers Content [62.816876067499415]
我々は、科学的ArXiv論文に基づくスケーラブルな進化型ライブベンチマークであるLiveXivを提案する。
LiveXivは、任意のタイムスタンプでドメイン固有の原稿にアクセスし、視覚的な問合せペアを自動的に生成することを提案する。
ベンチマークの最初のバージョンで、複数のオープンでプロプライエタリなLMM(Large Multi-modal Models)をベンチマークし、その挑戦的な性質を示し、モデルの真の能力を明らかにする。
論文 参考訳(メタデータ) (2024-10-14T17:51:23Z) - VHELM: A Holistic Evaluation of Vision Language Models [75.88987277686914]
視覚言語モデル(VHELM)の全体的評価について述べる。
VHELMは、視覚的知覚、知識、推論、バイアス、公平性、多言語性、堅牢性、毒性、安全性の9つの側面の1つ以上をカバーするために、さまざまなデータセットを集約する。
私たちのフレームワークは軽量で自動で、評価の実行が安価で高速に行えるように設計されています。
論文 参考訳(メタデータ) (2024-10-09T17:46:34Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。