論文の概要: Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation
- arxiv url: http://arxiv.org/abs/2606.22918v1
- Date: Mon, 22 Jun 2026 06:58:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-25 03:36:55.357017
- Title: Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation
- Title(参考訳): 各裁判官のヤードスティック:物理ビデオ評価のためのVLM単位の分類を発見
- Authors: Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song,
- Abstract要約: 本稿では,VLM毎に評価された分類を反復的に検出する手法を提案する。
我々は、VLMの寸法ごとのスコアを人間の身体的共同評価に調整し、そのスコアが信頼できないか冗長であるかを診断し、LPMに修復を促す。
改良された分類法は、テストされた全てのVLMビデオのホールドアウトビデオにおいて、平均的な相対的な改善が約32%で、グローバルスキーマベースラインを上回っている。
- 参考スコア(独自算出の注目度): 73.85089704122315
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Maintaining physical consistency in video generators and world models increasingly relies on vision-language models (VLMs) as automated judges that provide reward signals, ranking decisions, and data-filtering criteria. Yet VLMs differ substantially in training data and architecture, encoding physical phenomena through distinct internal representations. A single global evaluation schema therefore gives every VLM the same axes of competence, regardless of what each can actually perceive. We propose JudgeFit, an iterative refinement procedure that discovers a per-VLM evaluation taxonomy. An initial taxonomy is constructed by prompting the target VLM to enumerate physics errors on a small set of videos and clustering the resulting descriptions. The taxonomy is then refined through a diagnostic step: we calibrate the VLM's per-dimension scores to human physical-commonsense ratings, diagnose which dimensions it scores unreliably or redundantly, and prompt an LLM to repair them, iterating until convergence. We further instantiate this procedure as a benchmark and apply it to 16 VLMs spanning eight model families. The refined taxonomy outperforms the global-schema baseline on held-out videos for every VLM tested, with a mean relative improvement of approximately 32%. Beyond aggregate accuracy, the per-VLM profiles expose model-specific blind spots that overall rankings cannot anticipate, with reliability patterns differing markedly across model families.
- Abstract(参考訳): ビデオジェネレータや世界モデルにおける物理的な一貫性を維持することは、報酬信号、ランキング決定、データフィルタリング基準を提供する自動判断器として視覚言語モデル(VLM)にますます依存している。
しかし、VLMはトレーニングデータとアーキテクチャにおいて大きく異なり、異なる内部表現を通して物理現象を符号化する。
したがって、単一のグローバル評価スキーマは、各VLMが実際に知覚できるものに関係なく、すべてのVLMに同じ能力の軸を与える。
本稿では,VLMごとの評価分類を発見する反復的精錬法であるJiceFitを提案する。
最初の分類法は、ターゲットのVLMに小さなビデオの物理誤差を列挙させ、その結果の記述をクラスタリングすることで構成される。
分類は、診断段階を通じて洗練され、VLMの次元ごとのスコアを人間の身体的共同評価に調整し、そのスコアが不確実であるか冗長であるかを診断し、LPMに修復を促させ、収束するまで反復する。
さらに、この手順をベンチマークとしてインスタンス化し、8つのモデルファミリーにまたがる16のVLMに適用する。
改良された分類法は、テストされた全てのVLMビデオのホールドアウトビデオにおいて、平均的な相対的な改善が約32%で、グローバルスキーマベースラインを上回っている。
総合的精度を超えて、VLMプロファイルは、全体的なランキングが予測できないモデル固有の盲点を公開し、モデルファミリ間で信頼性パターンが著しく異なる。
関連論文リスト
- ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning [59.558706734431276]
空間知能の現在の評価は、現代の視覚言語モデル(VLM)設定下で体系的に無効にすることができる。
本稿では,各QAペアが実際の入力の下で応答可能で正しいことを保証するためのベンチマークとプロトコルであるReVSIを紹介する。
論文 参考訳(メタデータ) (2026-04-27T10:45:51Z) - Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge [17.40713507922006]
大規模言語モデル(LLM)は、他の出力の迅速かつ信頼性の高い評価を提供する裁判官として機能する。
LLMは、自己バイアス(self-bias)として知られる、過度に好ましい評価を自身のアウトプットに体系的に割り当てる。
本稿では,自己バイアスを特定・推定できる仮定を明示的に定式化する統計的枠組みを提案する。
論文 参考訳(メタデータ) (2025-08-08T21:22:12Z) - Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation [54.3628937181904]
内部世界モデル(英語版)(WM)は、エージェントが世界の状態を理解し、遷移を予測することを可能にする。
近年,OpenAI o3, GPT-4o, Geminiなどの大規模視覚言語モデル(VLM)は汎用的なWMとしての可能性を示している。
論文 参考訳(メタデータ) (2025-06-27T03:24:29Z) - FIOVA: A Multi-Annotator Benchmark for Human-Aligned Video Captioning [15.363132825156477]
大規模視覚言語モデル(LVLM)の評価に適した人中心ベンチマークであるFIOVAを紹介する。
実際のビデオは3,002本(それぞれ33.6本)で、それぞれが5つのアノテーションによって独立して注釈付けされている。
本稿では,アノテータのコンセンサスから得られる認知重みを組み込んだ事象レベルの評価指標であるFIOVA-DQを提案する。
論文 参考訳(メタデータ) (2024-10-20T03:59:54Z) - VHELM: A Holistic Evaluation of Vision Language Models [75.88987277686914]
視覚言語モデル(VHELM)の全体的評価について述べる。
VHELMは、視覚的知覚、知識、推論、バイアス、公平性、多言語性、堅牢性、毒性、安全性の9つの側面の1つ以上をカバーするために、さまざまなデータセットを集約する。
私たちのフレームワークは軽量で自動で、評価の実行が安価で高速に行えるように設計されています。
論文 参考訳(メタデータ) (2024-10-09T17:46:34Z) - Large Language Models as Automated Aligners for benchmarking
Vision-Language Models [48.4367174400306]
VLM(Vision-Language Models)は新しいレベルの高度化に達し、複雑な認知と推論タスクの実行において顕著な能力を示している。
既存の評価ベンチマークは、厳密で手作りのデータセットを主に頼りにしており、人為的なモデルと人間の知性との整合性を評価する上で、重大な制限に直面している。
本研究では,LLMを有能なキュレーションとして探求し,自動データキュレーションとアセスメントによってVLMと人間の知性と価値のアライメントを測定するAuto-Benchを用いて,その限界に対処する。
論文 参考訳(メタデータ) (2023-11-24T16:12:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。