論文の概要: Hob-VL: A Benchmark for Visually Grounded Boolean Reasoning
- arxiv url: http://arxiv.org/abs/2610.01605v1
- Date: Thu, 01 Oct 2026 12:48:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.133722
- Title: Hob-VL: A Benchmark for Visually Grounded Boolean Reasoning
- Title(参考訳): Hob-VL: 視覚的にグラウンド化されたブール推論のためのベンチマーク
- Abstract要約: Hob-VLは、視覚的に接地されたブール推論のベンチマークである。
6,000人の人間による検証されたバランスの取れたYes/No質問が含まれており、それぞれが10の視覚的ステートメントのブールの組み合わせによって定義されている。
- 参考スコア(独自算出の注目度): 1.2773729093273072
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable visual reasoning requires composing multiple visual observations and returning consistent answers to logically equivalent questions. We introduce Hob-VL, a benchmark for visually grounded Boolean reasoning. Hob-VL comprises two tasks: (1) evaluating whether a Boolean rule holds in an image, and (2) identifying the (unique) object satisfying a Boolean description. Hob-VL contains 6,000 human-verified balanced Yes/No questions, each defined by a Boolean combination of ten visual statements, across 1,000 generated scenes and 46 diverse labeled photographs, along with 1,000 object-identification questions over the same photographs. Our question families are deliberately constructed to challenge reasoning through misleading local cues and nested logical operations, and include symbolic and structured natural-language presentations. Across eight model configurations with thinking disabled or minimized, Boolean accuracy ranges from 48.52% to 50.57%, while the identification accuracy reaches at most 43.0%. A thinking-enabled GLM configuration achieves uneven gains while retaining substantial errors and inconsistencies. Hob-VL exposes these failures through executable reference answers and matched evaluations.
- Abstract(参考訳): 信頼性の高い視覚的推論には、複数の視覚的観察を構成し、論理的に等価な質問に一貫した答えを返す必要がある。
本稿では,視覚的なブール推論のためのベンチマークであるHob-VLを紹介する。
Hob-VLは、(1)ブール規則が画像中に保持されているかどうかを評価すること、(2)ブール記述を満たす(一意)オブジェクトを特定すること、の2つのタスクから構成される。
Hob-VLには6,000人の人間による検証されたバランスの取れたYes/Noの質問が含まれており、それぞれ1000の生成されたシーンと46の多彩なラベル付き写真からなるBooleanの10の視覚的ステートメントの組み合わせによって定義されている。
質問家族は, ローカルな手がかりやネストした論理的操作を誤解を招くことによって, 推論に挑戦するために意図的に構築され, 記号的, 構造化された自然言語的プレゼンテーションを含む。
思考障害または最小化の8つのモデル構成において、ブール精度は48.52%から50.57%の範囲で、識別精度は43.0%に達する。
思考可能なGLM構成は、かなりのエラーと矛盾を保ちながら、不均一なゲインを達成する。
Hob-VLは、実行可能な参照応答と一致した評価を通じて、これらの障害を公開する。
関連論文リスト
- Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization [0.44787896002954924]
広範に使われている5つの視覚言語モデル(VLM)を評価する。
本実験では, エンゲージメント認識のためのゼロショットVLMの3つの主要な故障モードを明らかにした。
論文 参考訳(メタデータ) (2026-06-20T03:53:40Z) - TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models [0.0]
TACIT Benchmarkは、6つの推論領域にわたる10のタスクからなるプログラム的なビジュアル推論ベンチマークである。
このベンチマークでは、モデルが決定論的コンピュータビジョンパイプラインを通じて検証されたソリューションイメージを生成する必要がある生成トラックと、構造的に妥当なニアミストラクタを備えた5方向の多重選択を提供する識別トラックの2トラック評価が提供されている。
論文 参考訳(メタデータ) (2026-02-27T11:45:26Z) - Beyond Accuracy: Evaluating Grounded Visual Evidence in Thinking with Images [34.324634481264034]
我々は、忠実な視覚的推論を評価するために設計されたプロセス検証可能なベンチマークであるViEBenchを提案する。
専門家による視覚的エビデンスを含む200個の高解像度画像を合成し、ViEBenchは難易度でタスクを知覚と推論の次元に分類する。
実験の結果,(1)VLMは無関係な領域に接するにもかかわらず,正しい最終回答を導き出すことができ,(2)正しい証拠を見つけることはできるが,正確な結論に至らなかった。
論文 参考訳(メタデータ) (2026-01-14T07:25:15Z) - ORBIT: An Object Property Reasoning Benchmark for Visual Inference Tasks [10.848408092385192]
本稿では,3つの代表型,複雑性増大の3つの推論レベル,および4つのオブジェクト特性次元の画像を用いた体系的評価フレームワークを提案する。
我々は、このベンチマークをORBITにインスタンス化する。これは、合計1,080のカウントベースの質問と組み合わせた360画像からなるオブジェクト特性のマルチレベル推論VQAベンチマークである。
ゼロショット設定で12の最先端のVLMを用いた実験では、最高のパフォーマンスモデルは40%の精度でしか達成できないため、人間に比べて大きな制限が示される。
論文 参考訳(メタデータ) (2025-08-14T11:28:40Z) - Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology [87.65242416688146]
TreeBenchは、ビジュアルグラウンド推論の診断ベンチマークである。
TreeVGRは、強化学習と共同でローカライゼーションと推論を監督する訓練パラダイムである。
論文 参考訳(メタデータ) (2025-07-10T17:59:58Z) - VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models [66.56298924208319]
視覚言語生成報酬モデル(VL-GenRM)は、マルチモーダルAIシステムの調整と評価において重要な役割を果たす。
現在の評価方法は、主に従来のタスクからのAIアノテーション付き好みラベルに依存している。
VL-RewardBenchは、一般的なマルチモーダルクエリ、視覚幻覚検出、複雑な推論タスクにまたがる包括的なベンチマークである。
論文 参考訳(メタデータ) (2024-11-26T14:08:34Z) - HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models [69.52245481329899]
本稿では,画像コンテキスト推論評価のためのベンチマークであるHalusionBenchを紹介する。
このベンチマークは、1129の質問と組み合わせた346の画像で構成されており、すべて人間の専門家によって細心の注意を払って作成されている。
HallusionBenchの評価では、15種類のモデルをベンチマークし、最先端のGPT-4Vによって達成された31.42%の質問対精度を強調した。
論文 参考訳(メタデータ) (2023-10-23T04:49:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。