論文の概要: An Exam for Active Observers
- arxiv url: http://arxiv.org/abs/2607.16165v1
- Date: Fri, 17 Jul 2026 17:46:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 17:56:52.919042
- Title: An Exam for Active Observers
- Title(参考訳): アクティブオブザーバのエグザム
- Authors: Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger,
- Abstract要約: 大規模言語モデルに対してアクティブな観察測定を可能にするベンチマークであるActiveVisionを紹介する。
タスクは、単一の静的な記述ではなく、繰り返し視覚的な知覚を強制するように設計されています。
最高スコアモデルであるGPT-5.5は、アイテムの10.6%しか解決せず、17タスクのうち11タスクで0となる。
クロード・ファイブ5でさえ、ほとんどの推論やコーディングのリーダーボードを上回り、わずか3.5%しか解決していないが、平均96.1%の3人の参加者よりはるかに遅れている。
- 参考スコア(独自算出の注目度): 30.677664832420046
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human vision is a closed loop: gaze is continuously redirected by intermediate hypotheses rather than a single snapshot. Decades of psychophysics and cognitive science have argued that this active observation is essential for a wide range of tasks. Whether today's multimodal large language models (MLLMs) exercise active observation is an empirical question that current vision-language benchmarks do not answer. We introduce ActiveVision, a benchmark that makes active observation measurable for MLLMs, comprising 17 tasks across 3 categories. Tasks are designed to force repeated visual perception rather than a single static description. Frontier MLLMs collapse on ActiveVision: the highest-scoring model we evaluate, GPT-5.5 at the highest exposed reasoning-effort tier, solves only 10.6% of items and scores zero on 11 of the 17 tasks, and even Claude Fable 5, despite topping most reasoning and coding leaderboards, solves just 3.5%, far behind three human participants who average 96.1%. Furthermore, much of the gap persists even when models write and run their own vision code: such code is unreliable on realistic imagery, and catching its failures itself requires the active perception the models lack. Together, these results indicate that current MLLMs lack robust active visual observation, motivating architectures and training objectives that close the perception-reasoning loop.
- Abstract(参考訳): 人間の視覚は閉じたループであり、視線は単一のスナップショットではなく中間仮説によって継続的にリダイレクトされる。
心理学と認知科学の進歩は、この活動的な観察が幅広いタスクに不可欠であると主張している。
今日のマルチモーダルな大規模言語モデル(MLLM)がアクティブな観察を行うかどうかは、現在のビジョン言語ベンチマークが答えないという実証的な疑問である。
MLLMに対してアクティブな観察測定を可能にするベンチマークであるActiveVisionを導入し,3つのカテゴリにまたがる17のタスクについて検討した。
タスクは、単一の静的記述ではなく、繰り返し視覚的な知覚を強制するように設計されている。
最前線のMLLMはActiveVisionで崩壊する: 評価した最高のスコアモデル、GPT-5.5は最も露出率の高い推論-評価層で、アイテムの10.6%しか解決せず、17タスクのうち11タスクでスコアがゼロ、そしてクロード・ファイブ5でさえ、もっとも高い推論とコーディングのリーダーボードを上回っているにもかかわらず、96.1%の人間の3人の参加者よりわずか3.5%遅れている。
さらに、モデルが独自のビジョンコードを書き、実行している場合でも、そのギャップの多くは持続します。
これらの結果から,現在のMLLMには活発な視覚観察,アーキテクチャのモチベーション,知覚関連ループを閉じる学習目標が欠如していることが示唆された。
関連論文リスト
- Active Zero: Self-Evolving Vision-Language Models through Active Environment Exploration [72.84714132070404]
受動的相互作用から視覚環境の能動的探索に移行する枠組みを提案する。
Active-Zeroでは,3つの共進化エージェントが採用されている。 モデルの機能フロンティアに基づいて,オープンワールドリポジトリからイメージを取得する検索だ。
12ベンチマークにわたるQwen2.5-VL-7B-インストラクションについて : Active-Zero 53.97 における推論タスクの平均精度(5.7%の改善)と一般理解における 59.77 について(3.9%の改善)
論文 参考訳(メタデータ) (2026-02-11T17:29:17Z) - Vision-aligned Latent Reasoning for Multi-modal Large Language Model [82.26044667101011]
VaLR(Vision-aligned Latent Reasoning)は、思考の連鎖の推論ステップの前に動的に視覚対応の潜在トークンを生成するフレームワークである。
VaLRは、MLLMの中間埋め込みを視覚エンコーダのものと整合させることにより、推論中の視覚的知識の保存を訓練する。
論文 参考訳(メタデータ) (2026-02-04T12:04:02Z) - CoT4Det: A Chain-of-Thought Framework for Perception-Oriented Vision-Language Tasks [53.88194225946438]
Chain-of-Thought for Detection (CoT4Det)は、知覚タスクを3つの解釈可能なステップに再構成するシンプルだが効率的な戦略である。
一般的な視覚言語能力を損なうことなく,CoT4Detは認識性能を著しく向上させることを示す。
論文 参考訳(メタデータ) (2025-12-07T05:26:30Z) - Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning [77.34651118909748]
本稿では,Qwen2.5-VL-7Bに基づく2段階のパラダイムを提案する。
この先駆的な研究は、3つの基本的な洞察を明らかにしている: 1) 行動伝達は、言語的精神イメージによる冷戦開始時に驚くほど早く出現し、2) 冷戦開始は、視覚行動を広く記憶し、RLは、効果的パターンを批判的に識別し、スケールアップする。
得られたモデルであるOpen-Vision-Reasoner (OVR)は、MATH500で95.3%、MathVisionで51.8%、54.6%を含む一連の推論ベンチマークで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2025-07-07T17:59:03Z) - VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models [121.03333569013148]
VisuLogicは、6つのカテゴリにまたがる1,000の人間認証された問題のベンチマークです。
これらの質問は、複数の視点からMLLMの視覚的推論能力を評価するために評価することができる。
ほとんどのモデルは精度が30%以下で、25%のランダムベースラインよりわずかに高く、人間によって達成された51.4%よりはるかに低い。
論文 参考訳(メタデータ) (2025-04-21T17:59:53Z) - Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs [65.93003087656754]
VisFactorは、よく確立された認知心理学評価から20の視覚中心のサブテストをデジタル化するベンチマークである。
GPT、Gemini、Claude、LLaMA、Qwen、SEEDファミリーから20のフロンティアマルチモーダル言語モデル(MLLM)を評価する。
最高のパフォーマンスモデルは100点中25.19点のスコアしか得られず、精神的な回転、空間的関係推論、図形の識別といったタスクに一貫して失敗する。
論文 参考訳(メタデータ) (2025-02-23T04:21:32Z) - ActiView: Evaluating Active Perception Ability for Multimodal Large Language Models [18.992215985625492]
マルチモーダル大言語モデル(MLLM)における能動的知覚の評価
我々は、既存のMLLMでは難しい評価を緩和し、定量化する、視覚質問回答(VQA)の専門形式に焦点を当てる。
我々は,制限された知覚野が能動的な知覚を可能にする上で重要な役割を担っていることを観察した。
論文 参考訳(メタデータ) (2024-10-07T00:16:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。