論文の概要: ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making
- arxiv url: http://arxiv.org/abs/2608.07584v1
- Date: Wed, 05 Aug 2026 10:05:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.448916
- Title: ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making
- Title(参考訳): ComplexityWorld: 検証可能な視覚決定のためのビジョンランゲージモデルのベンチマーク
- Abstract要約: 視覚言語モデル(VLM)は、視覚知覚を急速に進歩させ、画像に依存する現実的なタスクをますますサポートしている。
39のドメインにインスパイアされた視覚世界と29のカテゴリーにわたる390のタスクのベンチマークであるCompleXITYWORLDを紹介する。
- 参考スコア(独自算出の注目度): 30.869819258358405
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) have made rapid progress in visual perception and increasingly support real-world tasks that depend on images. Many such tasks, however, require more than rec- ognizing what an image contains: a model must use visual evidence to make a complete decision whose parts jointly satisfy global constraints. We introduce COMPLEXITYWORLD, a benchmark of 390 tasks across 39 domain-inspired visual worlds and 29 decision categories. Each task is generated from a hidden structured specification, rendered as a visual scene, and scored by an exe- cutable verifier that accepts any feasible solution. Under direct inference, all evaluated models ex- cept GPT-5.6-Sol remain below 40% verifier ac- ceptance rate (VAR), while GPT-5.6-Sol reaches 75.6%. Performance improves substantially when the same decision information is made explicit in structured form, yet varies sharply across equiva- lent visual presentations. Agent scaffolds provide smaller, model-dependent gains. Together, these results reveal a persistent visual-to-decision bot- tleneck that additional inference alone does not remove.
- Abstract(参考訳): 視覚言語モデル(VLM)は、視覚知覚を急速に進歩させ、画像に依存する現実的なタスクをますますサポートしている。
しかし、そのようなタスクの多くは、イメージが含んでいるものを再認識する以上のものを必要としている: モデルは、世界的制約を共同で満たす完全な決定をするために、視覚的証拠を使用しなければならない。
39のドメインにインスパイアされた視覚世界と29のカテゴリーにわたる390のタスクのベンチマークであるCompleXITYWORLDを紹介する。
各タスクは、隠れた構造化された仕様から生成され、視覚的なシーンとしてレンダリングされ、実行可能なソリューションを受け入れるexe-cutable verifierによってスコアされる。
直接推論では、GPT-5.6-Solは40%の検証対象ac-セプタンスレート(VAR)以下であり、GPT-5.6-Solは75.6%に達する。
同じ決定情報が構造化された形で明示される場合、性能は大幅に向上するが、均等な視覚的表現では顕著に変化する。
エージェントの足場は、より小さく、モデルに依存した利得を提供する。
これらの結果は、追加の推論だけで取り除かれない、永続的な視覚的・決定的ボット・トルネック(英語版)を明らかにしている。
関連論文リスト
- Learning to Look Again: Loss-Gap Supervision for Free-form Crop Routing in Vision-Language Models [9.530053392873178]
視覚言語モデル(VLM)は、具体的な理由から多くの詳細中心の質問に失敗する。
より視覚的なトークンをクエリ毎に割り当てることによって、OCRやドキュメントケースが改善されるが、非差別的に費やされ、グローバルなコンテキストに依存するタスクを邪魔する可能性がある。
本稿では,視覚的再読解学習のためのフレームワークであるGapSightを提案する。
論文 参考訳(メタデータ) (2026-08-22T04:10:28Z) - MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents [50.27505102982638]
本稿では,ツールコールエージェントのベンチマークおよび評価フレームワークであるMM-ToolSandBoxを紹介する。
このフレームワークは16のアプリケーションドメインで500以上のツールにまたがるステートフルな実行環境を提供する。
マルチイメージのマルチターンタスクをサポートしており、エージェントは実行可能ツールコールに徐々に視覚的な入力を入力しなければならない。
論文 参考訳(メタデータ) (2026-07-13T17:13:09Z) - UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling [33.6086006552446]
ワールド・モデリングを用いたマルチビュー・ビジョン・ランゲージ・アクション・モデルであるUniviewVLAを提案する。
生成されたマルチビューの将来のビューを活用することで、UniviewVLAは隠蔽されたキューと将来のシーンの進化をモデル化する。
UniviewVLA は LIBERO で95.8%、CALVIN ABCD to D で4.60を達成している。
論文 参考訳(メタデータ) (2026-06-19T14:53:40Z) - VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents [130.70999337445468]
言語モデル(LLM)エージェントと比較して、視覚言語モデル(VLM)エージェントを訓練する際の重要な課題は、テキスト状態から複雑な視覚観察に移行することである。
VLMエージェントは、明示的な視覚状態推論によって内部世界モデルを構築することができるか?
我々は、強化学習(RL)を通して、エージェントの推論プロセスを建築的に実施し、報奨する。
エージェントの状態推定と遷移モデリングへの推論が成功に不可欠であることが分かりました。
論文 参考訳(メタデータ) (2025-10-19T16:05:07Z) - COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark [3.5018278981067685]
COREVQA (Crowd Observations and Reasoning Entailment) は5608の画像と合成生成された真/偽のステートメントペアのベンチマークである。
以上の結果から,トップパフォーマンスのVLMでも80%以下で精度が向上し,他のモデルも大幅に悪化した。
論文 参考訳(メタデータ) (2025-07-17T04:47:47Z) - ChartMuseum: Testing Visual Reasoning Capabilities of Large Vision-Language Models [48.99485386990197]
視覚的推論によってのみ解決可能な合成データセットを用いてケーススタディを行う。
次に、1,162人の専門家が注釈を付けた質問を含む新しいチャート質問回答(QA)ベンチマークであるChartMuseumを紹介します。
人間は93%の精度を達成しているが、最高のパフォーマンスモデルであるGemini-2.5-Proは63.0%しか達成できず、主要なオープンソースであるLVLM Qwen2.5-VL-72B-Instructは38.5%しか達成していない。
論文 参考訳(メタデータ) (2025-05-19T17:59:27Z) - Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing [84.16442052968615]
RISEBenchはReasoning-Informed ViSual Editing (RISE)の最初のベンチマークである。
RISEBenchは、時間、因果、空間、論理的推論の4つの主要な推論カテゴリに焦点を当てている。
オープンソースモデルとプロプライエタリモデルの両方を含む,9つの目立った視覚編集モデルを評価する実験を行った。
論文 参考訳(メタデータ) (2025-04-03T17:59:56Z) - Beyond Visual Understanding: Introducing PARROT-360V for Vision Language Model Benchmarking [0.12369742273401668]
2487の難解な視覚パズルを特徴とする新しい総合ベンチマークであるPARROT-360Vベンチマークを紹介する。
GPT-4o, Claude-3.5-Sonnet, Gemini-1.5-Pro の先行モデルの評価を行った。
最新モデルのスコアはベンチマークで28~56パーセンテージで、一般的なベンチマークでのパフォーマンスよりも大幅に低かった。
論文 参考訳(メタデータ) (2024-11-20T01:09:21Z) - Enhancing Large Vision Language Models with Self-Training on Image Comprehension [131.14381425260706]
本稿では、画像理解に特化して自己学習アプローチを強調する自己学習 on Image (STIC)を紹介する。
まず、ラベルのない画像を用いて、画像記述の好みを自己構築する。
抽出した視覚情報に対する推論をさらに自己改善するため,既存の命令調整データのごく一部をモデルに再利用する。
論文 参考訳(メタデータ) (2024-05-30T05:53:49Z) - Pushing Boundaries: Exploring Zero Shot Object Classification with Large
Multimodal Models [0.09264362806173355]
LLVA(Large Language and Vision Assistant Model)は、画像ベースのクエリと連動したリッチな会話体験をユーザに提供するモデルである。
本稿では,LMMについて一意に考察し,画像分類タスクの適応性について検討する。
我々の研究では、MNIST、Cats Vs. Dogs、Hymnoptera(Ants Vs. Bees)、Pox Vs. Non-Poxの皮膚画像からなる非伝統的なデータセットの4つの多様なデータセットのベンチマーク分析を含む。
論文 参考訳(メタデータ) (2023-12-30T03:19:54Z) - Improving Visual Grounding by Encouraging Consistent Gradient-based
Explanations [58.442103936918805]
注意マスク整合性は,従来の方法よりも優れた視覚的グラウンドリング結果が得られることを示す。
AMCは効率的で実装が容易であり、どんな視覚言語モデルでも採用できるため一般的である。
論文 参考訳(メタデータ) (2022-06-30T17:55:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。