論文の概要: VisionQ: VLM-as-a-Judge Taxonomy, Dataset and Benchmark for Qualitative Analysis in Computer Vision
- arxiv url: http://arxiv.org/abs/2610.00666v1
- Date: Wed, 30 Sep 2026 20:03:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.750716
- Title: VisionQ: VLM-as-a-Judge Taxonomy, Dataset and Benchmark for Qualitative Analysis in Computer Vision
- Title(参考訳): VisionQ: VLM-as-a-Judge Taxonomy, Dataset and Benchmark for Qualitative Analysis in Computer Vision
- Abstract要約: 名前付き視覚基準ですべての判断を下す最初のベンチマークであるVisionQを紹介します。
VisionQは,(1)1,409個のCVPRおよびICCV論文のコーパスと,1,800以上の検証済み比較図と3,911個の手書きデータポイントから構成される。
最強の精度は63.1%(32.2%)であり、信頼性は基準によって大きく異なる。
- 参考スコア(独自算出の注目度): 13.533870980905943
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Qualitative comparison figures are central evidence in computer vision papers, and vision-language models (VLMs) are increasingly used to judge them. Yet existing benchmarks score only scalar quality or overall preference, so a judge can be rewarded for picking the preferred image for the wrong visual reason. We introduce VisionQ, the first benchmark built from peer-reviewed CV comparison figures that grounds every judgment in a named visual criterion: each question states the criterion, and a judge is credited only when it selects the output the authors identify as best on that criterion. We call this task criterion-conditioned visual discrimination. VisionQ comprises (1) a corpus of 1,409 CVPR and ICCV papers with 1,800+ validated comparison figures and 3,911 hand-annotated data points linking method crops to author-stated visual claims; (2) a six-axis, 51-leaf taxonomy of the visual criteria behind qualitative judgment; (3) a criterion-conditioned evaluation protocol that hides method names, captions, and paper identity and reports accuracy per criterion; and (4) VisionQ-Judge, a DPO-tuned Gemma-4-E4B judge trained on symmetric evidence pairs, which reduces last-option predictions by 7.0pp and improves accuracy by 2.5pp on a held-out test set. Evaluating 20 open- and closed-source VLM judges, we find that the strongest reach only 63.1% accuracy (chance 32.2%) and that reliability varies sharply across criteria. Code: https://github.com/ReML-AI/visionq. Data: https://huggingface.co/datasets/visionq-anon-2026/VisionQ-1k.
- Abstract(参考訳): 定性的比較図はコンピュータビジョン論文における中心的な証拠であり、視覚言語モデル(VLM)はそれらを判断するためにますます使われている。
しかし、既存のベンチマークは、スカラー品質や全体的な嗜好のみをスコア付けしているため、審査員は、間違った視覚的理由のために好みの画像を選択することで報奨を受けることができる。
VisionQは、ピアレビューされたCV比較図から構築された最初のベンチマークで、名前付き視覚的基準で全ての判断を下す:各質問は基準を述べ、審査員は、著者が基準に基づいて最良の出力を選択した場合にのみクレジットされる。
我々はこのタスクを条件付き視覚的識別と呼ぶ。
VisionQ は,(1) CVPR と ICCV 紙の1,409 個のコーパスと,1,800 以上の検証済み比較図と3,911 個の手書きデータポイントからなるコーパス,(2) 質的判断の背景にある視覚的基準の6軸51リーフ分類,(3) メソッド名,キャプション,紙の同一性を隠蔽する基準条件付き評価プロトコル,および (4) DPO で調整された Gemma-4-E4B による左右対称のエビデンス対を判定する VisionQ-Judge を含む。
オープンおよびクローズドソースのVLM審査員20名を評価すると、最強の精度は63.1%(32.2%)であり、信頼性は基準によって大きく異なる。
コード:https://github.com/ReML-AI/visionq.com
データ:https://huggingface.co/datasets/visionq-anon-2026/VisionQ-1k。
関連論文リスト
- Benchmarking the Explanatory Quality of Open-Weight Vision-Language Models in Face Recognition [30.24519065442108]
VLMに基づく顔認識のためのベンチマークフレームワークを提案する。
説明が満足すべき2つの基準を提案する。
オープンウェイトVLMのいくつかのファミリーをベンチマークし、顔の検証精度と説明品質を共同評価した。
論文 参考訳(メタデータ) (2026-09-18T15:06:02Z) - SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context [27.236953887247125]
SciFigQual-Benchは5次元の科学的画像を評価するフルテキスト文脈ベンチマークである。
このデータは、2020年から2025年までのコンピュータサイエンスカンファレンスのトップをカバーしている。
従来の科学的フィギュアベンチマークとは異なり、私たちのデータセットは各イメージをキャプションにバインドし、文や原稿のコンテキストを引用します。
論文 参考訳(メタデータ) (2026-07-29T16:07:44Z) - SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence [7.2640055022009635]
SciFigAlignは,原稿証拠の質評価を基礎とした微調整型マルチモーダルスコアラーである。
紙レベルでの分割では、SciFigAlignは0.3524のマクロMAEを達成し、テストセット上では紙内ペアの精度は81.64%である。
論文 参考訳(メタデータ) (2026-07-29T15:54:14Z) - VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection [0.04736448323490553]
VendorBench-100は、ディープフェイク画像検出のためのクロスパラダイムなベンチマークである。
単一対角100画像コーパス,統一出力スキーマ,共通評価フレームワークを用いて36種類の代表モデルを評価する。
評価の結果,商用APIが最も高い性能を達成し,次いでビジョンLLMとオープンソース検出器が続いた。
論文 参考訳(メタデータ) (2026-07-07T13:22:00Z) - CriterAlign: Criterion-Centric Rationale Alignment for Code Preference Judging [95.02210956333374]
本稿では,一対の選好評価にルーブリックに基づく判断を適応させる基準中心のフレームワークを提案する。
BigCodeRewardでは、CriterAlignはQwen2.5-VL-32Bモノリシック判事を60.4%から66.3%に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:59:19Z) - Visual Aesthetic Benchmark: Can Frontier Models Judge Beauty? [59.923111838399144]
本稿では,視覚的審美性ベンチマーク (VAB) を提案する。
VABには400のタスクと1,195のイメージが芸術、写真、イラストに含まれており、ラベルはタスクごとに10人の独立した専門家審査員のコンセンサスから導かれる。
最強のシステムは、人間の専門家が達成した68.9%よりもはるかに低い26.5%のタスクで、候補順の3つのランダムな順で、最良の画像と最悪の画像の両方を正しく識別する。
論文 参考訳(メタデータ) (2026-05-12T19:33:28Z) - CritiQ: Mining Data Quality Criteria from Human Preferences [91.44025907584931]
人間の嗜好からデータ品質の基準を自動的にマイニングする新しいデータ選択手法であるCritiQを紹介する。
CritiQ Flowはマネージャエージェントを使用して品質基準を進化させ、ワーカーエージェントはペアで判断する。
コード,数学,論理領域において,本手法の有効性を実証する。
論文 参考訳(メタデータ) (2025-02-26T16:33:41Z) - Evaluating the Fairness of Discriminative Foundation Models in Computer
Vision [51.176061115977774]
本稿では,CLIP (Contrastive Language-Pretraining) などの差別基盤モデルのバイアス評価のための新しい分類法を提案する。
そして、これらのモデルにおけるバイアスを緩和するための既存の手法を分類学に関して体系的に評価する。
具体的には,ゼロショット分類,画像検索,画像キャプションなど,OpenAIのCLIPとOpenCLIPモデルをキーアプリケーションとして評価する。
論文 参考訳(メタデータ) (2023-10-18T10:32:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。