論文の概要: What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks
- arxiv url: http://arxiv.org/abs/2607.10240v1
- Date: Sat, 11 Jul 2026 10:01:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 15:40:48.348201
- Title: What Does Your Short-Answer VQA Score Actually Measure? Evaluator-Dependent Instability in Multimodal Short-Answer Benchmarks
- Title(参考訳): あなたの短解VQAスコアは実際に何を測定するか? マルチモーダル短解ベンチマークにおける評価者依存性の不安定性
- Authors: Guanhua Ye, Niu Jingbin, Yan Li, Meiyu Liang, Zhe Xue, Yingxia Shao, Yawen Li,
- Abstract要約: 短解VQAベンチマークは2つの異なる量を説明する。
我々は、人間公認のセマンティック・ジャッジを使用して37k以上の公式エラーを監査する。
- 参考スコア(独自算出の注目度): 25.519850997497283
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Short-answer VQA benchmarks conflate two distinct quantities: whether a model's answer is semantically correct, and whether that answer matches the surface form expected by the automatic evaluator. We study this conflation across six vision--language models and six benchmarks, using a human-validated semantic judge (97.6% precision) to audit over 37k official errors. A second text-only judge reproduces the same benchmark-level false-negative pattern, showing that the effect is not an artifact of a single audit model. On text-rich benchmarks, up to half of these errors are semantically acceptable answers penalized purely for surface-form mismatch. This instability is structured by answer type: extractive and multi-span answers are far more evaluator-sensitive than scalar answers. Benign prompt and context rewrites further destabilize official outcomes, flipping item-level correctness at substantial rates without changing the underlying task. A deterministic CPU-only contract repair confirms that the undercount is partially recoverable. These findings imply that official short-answer VQA scores should be accompanied by semantic audits and answer-type diagnostics to remain interpretable.
- Abstract(参考訳): 短解VQAベンチマークでは、モデルの解答が意味論的に正しいか、その解答が自動評価器によって期待される表面形状と一致するかの2つの異なる量について記述している。
人間の検証されたセマンティック・ジャッジ(97.6%の精度)を用いて、視覚言語モデル6つとベンチマーク6つにまたがって、37k以上の公式エラーを監査する。
第2のテキストのみの判断は、同じベンチマークレベルの偽陰性パターンを再現し、その効果が単一の監査モデルの成果物ではないことを示す。
テキストリッチなベンチマークでは、これらのエラーの最大半分は、表面形状のミスマッチに対して純粋に罰せられる意味論的に許容される答えである。
この不安定性は、解答型によって構成される:抽出型とマルチスパン型は、スカラー型よりもはるかに評価値に敏感である。
便宜的なプロンプトとコンテキストは公式な成果をさらに不安定にし、基礎となるタスクを変更することなく、項目レベルの正しさをかなりの速度で反転させる。
決定論的CPUのみの契約修復は、アンダーカウントが部分的に回復可能であることを確認する。
以上の結果から,VQAスコアは意味監査と回答型診断を併用して解釈可能であることが示唆された。
関連論文リスト
- Answer Self-Consistency with Margin-Triggered Question Re-Arbitration for the CVPR 2026 VidLLMs Challenge [0.0]
CVPR 2026 VidLLMs Challenge のトラック2の解について述べる。
このトラックはビデオにおける視覚的推論を評価し、モデルは常にはっきりと見えない関係を推論しなければならない。
マルチモーダル推論モデル上に構築された学習不要なテスト時間推論フレームワークであるASCを提案する。
論文 参考訳(メタデータ) (2026-06-03T00:51:55Z) - Towards Human-Like Interactive Speech Recognition With Agentic Correction and Semantic Evaluation [53.844308305341166]
単一パスのASRフロントエンドと意味的訂正,意図のルーティング,推論に基づく編集を組み合わせた閉ループフレームワークである textbfAgentic ASR を提案する。
複数言語、名前付き集中型、コードスイッチングベンチマークの実験は、反復的相互作用が意味的誤りを一貫して減少させることを示している。
論文 参考訳(メタデータ) (2026-05-28T06:23:31Z) - Rethinking Atomic Decomposition for LLM Judges: A Prompt-Controlled Study of Reference-Grounded QA Evaluation [5.94231111588812]
我々は、自己分解型原子式判定器(単一プロンプト分解検証器)を、同じ入力と同様の詳細なルーリックを持つ、即時制御された全体的判定器と比較する。
我々の発見は、QAスタイルの3つのベンチマークで、それぞれ200のソース例で自己分解するシングルプロンプトパターンに特化しています。
論文 参考訳(メタデータ) (2026-03-30T03:55:26Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation [0.0]
SpaceBench-UCは、ペアの空間関係を再現可能な小さなベンチマークである。
ベンチマークパッケージ、バージョン付きプロンプト、ピン付き構成、サンプルごとのチェッカー出力、レポートテーブルをリリースします。
安定拡散1.5, SD 1.5 BoxDiff, SD 1.4 GLIGENの3つのベースラインについて検討した。
論文 参考訳(メタデータ) (2026-01-19T23:37:10Z) - Gaming the Answer Matcher: Examining the Impact of Text Manipulation on Automated Judgment [6.104512852467398]
自動回答マッチングは、人間の評価に代わるスケーラブルで整合性のあるものとして、かなり有望である。
本研究では,このような手法が,受験者モデルに冗長な応答を生じさせるよう促すことで,回答マッチングモデルを欺くかどうかを検討する。
以上の結果から,これらの操作ではスコアが増加せず,しばしば減少することが示された。
論文 参考訳(メタデータ) (2025-12-22T17:39:13Z) - Contextualized Evaluations: Judging Language Model Responses to Underspecified Queries [85.81295563405433]
本稿では,不特定クエリを取り巻くコンテキストを合成的に構築し,評価中にそれを提供するプロトコルを提案する。
その結果,1) 評価から得られた結論の変更,2) モデルペア間のベンチマークランキングの反転,2) スタイルのような表面レベルの基準に基づいて判断を下すナッジ評価,3) 多様なコンテキスト間でのモデル行動に関する新たな洞察の提供,などが確認できた。
論文 参考訳(メタデータ) (2024-11-11T18:58:38Z) - Localizing Factual Inconsistencies in Attributable Text Generation [74.11403803488643]
本稿では,帰属可能なテキスト生成における事実の不整合をローカライズするための新しい形式であるQASemConsistencyを紹介する。
QASemConsistencyは、人間の判断とよく相関する事実整合性スコアを得られることを示す。
論文 参考訳(メタデータ) (2024-10-09T22:53:48Z) - A Semantic-based Method for Unsupervised Commonsense Question Answering [40.18557352036813]
ラベル付きタスクデータに依存しないため、教師なしのコモンセンス質問応答は魅力的である。
教師なしコモンセンス質問応答のためのSemantic-based Question Answering法(SEQA)を提案する。
論文 参考訳(メタデータ) (2021-05-31T08:21:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。