論文の概要: VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
- arxiv url: http://arxiv.org/abs/2608.26105v1
- Date: Wed, 26 Aug 2026 17:59:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:16.018408
- Title: VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
- Title(参考訳): VBVR-Pro: ネイティブビジュアル推論のためのスケーラブルで検証可能なスイート
- Abstract要約: 本稿では,視覚的推論生成をネイティブに制御可能にするテストベッドであるVBVR-Proを紹介する。
VBVR-Proは、視覚的推論を300の手続き的に生成されたタスク空間に変換する。
VLM-as-a-judgeパラダイムの繰り返し発生する障害モードを同定する。
- 参考スコア(独自算出の注目度): 133.66021945481876
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Native visual reasoning treats visual generation as the medium of reasoning itself: visual states (i.e. images and videos) are not merely inputs to be understood or outputs to be rendered, but first-class substrates for problem solving beyond language. Yet progress remains bottlenecked by the lack of scalable training tasks, reliable feedback, and controlled comparisons across generative substrates. In this work, we introduce VBVR-Pro, a closed-loop testbed that makes native visual reasoning through generation trainable, verifiable, optimizable, and experimentally controllable. 1) Task scaling. VBVR-Pro turns visual reasoning into a controlled task space of 300 procedurally generated tasks. Models trained on VBVR-Pro show strong transfer beyond the proposed suite across seven external visual reasoning benchmarks such as RISE-Video, MME-CoF-Pro, and BabyVision. 2) Verifiable rewards. VBVR-Pro provides verifiable reward scorers for task-grounded evaluation. Through a systematic study of leading MLLMs as judges, we identify recurring failure modes of the prevalent VLM-as-a-judge paradigm. In contrast, the proposed scorers are grounded in deterministic, task-specific rules, achieve fine-grained alignment with human judgments. Importantly, they serve as reliable reward signals for large-scale multi-task reinforcement learning and demonstrate stronger post-RL performance across visual reasoning tasks. 3) Mechanism study. VBVR-Pro enables controlled modality studies across more than 30 image, video, and interleaved generators. Our analysis shows that video generation remains strongest for tasks requiring persistent spatiotemporal state tracking, while interleaved generation provides a compute-efficient alternative. Critically, ablations and probing suggest the presence of vision-native trajectories that are crucial to visual reasoning. We release all data, models, scorers, and code.
- Abstract(参考訳): 視覚状態(画像やビデオ)は単に理解すべき入力や描画すべき出力ではなく、言語を超えた問題解決のための第一級の基質である。
しかし、拡張性のあるトレーニングタスクの欠如、信頼性の高いフィードバック、生成基板間での制御された比較によって、進歩はいまだにボトルネックになっている。
本稿では,VBVR-Proを提案する。VBVR-Proは,学習可能,検証可能,最適化可能,実験的に制御可能な生成物による視覚的推論を実現するクローズドループテストベッドである。
1)タスクスケーリング。
VBVR-Proは、視覚的推論を300の手続き的に生成されたタスク空間に変換する。
VBVR-Proでトレーニングされたモデルは、RISE-Video、MME-CoF-Pro、BabyVisionといった7つの外部視覚推論ベンチマークにまたがって提案されたスイートを超えて強力な転送を示している。
2) 検証可能な報酬。
VBVR-Proは、タスクグラウンド評価のための検証可能な報酬スコアラーを提供する。
MLLMを審査員としてリードする体系的な研究を通じて,VLM-as-a-judgeパラダイムの繰り返し失敗モードを同定する。
対照的に、提案したスコアラーは決定論的、タスク固有のルールに基づいており、人間の判断と微妙に一致している。
重要なことは、大規模なマルチタスク強化学習のための信頼性の高い報奨信号として機能し、視覚的推論タスクにおけるRL後のパフォーマンスを強く示すことである。
3)メカニズム研究。
VBVR-Proは、30以上の画像、ビデオ、およびインターリーブされたジェネレータ間で制御されたモダリティ研究を可能にする。
解析の結果、ビデオ生成は時空間追跡を必要とするタスクに対して最強であり、インターリーブド生成は計算効率のよい代替手段であることがわかった。
批判的に、アブレーションと探索は、視覚的推論に不可欠な視覚ネイティブな軌跡の存在を示唆している。
すべてのデータ、モデル、スコア、コードをリリースします。
関連論文リスト
- VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies [58.65913948991329]
正確な低レイテンシVLAポリシーのためのビジュアル中間推論フレームワークであるVISUALTHINK-VLAを提案する。
私たちのブートストラップ哲学は、効果的な視覚的思考でアクションを導くことです。
これは、デコードオーバーヘッドを回避しながら空間的精度を保った、コンパクトなビジュアル・エビデンスインターフェースを通じてアクション予測をブートストラップする。
論文 参考訳(メタデータ) (2026-05-28T14:36:53Z) - CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models [41.60751475372144]
ビデオ生成モデル(VGM)は、ゴール指向タスクにおいて繰り返し発生する障害モードを示す。
ステップレベルの批判においてVLMとVGMを結合するクローズドループフレームワークであるVLM-VGMコラボレーションビデオ推論(CollabVR)を提案する。
Gen-ViReとVBVR-Benchでは、CollabVRはシングル推論、Pass@$k$、マッチした計算における以前のテストタイムスケーリングベースラインよりも、オープンソースとクローズドソース両方のVGMを改善している。
論文 参考訳(メタデータ) (2026-05-09T06:39:17Z) - PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models [33.89873575295867]
我々はPokeGymを紹介した。Pokemon Legends: Z-Aは視覚的に複雑な3DオープンワールドであるRole-Playing Gameである。
PokeGymは厳格なコードレベルの分離を強制する:エージェントは生のRGB観測のみで動作するが、独立した評価器はメモリスキャンによって成功を検証する。
このベンチマークは、ナビゲーション、インタラクション、混合シナリオにまたがる30のタスク(30-220ステップ)と、3つの命令の粒度(Visual-Guided、Step-Guided、Goal-Only)で構成され、視覚的な接地、セマンティック推論、自律的な探索機能を体系的に分解する。
論文 参考訳(メタデータ) (2026-04-09T15:12:36Z) - A Very Big Video Reasoning Suite [155.70016888896927]
ビデオモデルの急速な普及は視覚的品質を捉えており、その推論能力は未解明のままである。
Very Big Video Reasoning(VBVR)データセットは、200のキュレートされた推論タスクにまたがる、前例のない大規模なリソースである。
VBVR-Benchは、ルールベースのヒューマンアライメントスコアラーによるモデルベースの判断を超えて、検証可能な評価フレームワークである。
論文 参考訳(メタデータ) (2026-02-23T18:59:41Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning [52.107043437362556]
抽象視覚推論(AVR)は、抽象ルールを素早く発見し、新しいシナリオに一般化することを可能にする。
本稿では,統一フレームワークにおける複数のタスクに対処する,統一条件生成解法(UCGS)を提案する。
UCGSはゼロショット推論の能力を示しており、テストフェーズで目に見えないタスクから問題に対する抽象的推論を行うことができる。
論文 参考訳(メタデータ) (2025-07-15T21:54:51Z) - See, Think, Confirm: Interactive Prompting Between Vision and Language
Models for Knowledge-based Visual Reasoning [60.43585179885355]
本稿では,知識に基づく視覚推論のための新しいフレームワークであるInteractive Prompting Visual Reasoner(IPVR)を提案する。
IPVRには3つのステージがある。
我々は,知識に基づく視覚的推論データセットについて実験を行った。
論文 参考訳(メタデータ) (2023-01-12T18:59:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。