論文の概要: V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning
- arxiv url: http://arxiv.org/abs/2605.10172v1
- Date: Mon, 11 May 2026 08:21:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.641023
- Title: V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning
- Title(参考訳): V-ABS:動的ビジュアル推論のためのアクションオブザーバ駆動ビームサーチ
- Authors: Zhiwei Ning, Xuanang Gao, Jiaxi Cao, Gengming Zhang, Shengnan Ma, Wenwen Tong, Hanming Deng, Jie Yang, Wei Liu,
- Abstract要約: MLLM(Multimodal large language model)は、一般的な認識において顕著な成功を収めてきたが、複雑な多段階の視覚的推論は、依然として永続的な課題である。
本稿では,アクション・オブザーバ駆動のビームサーチフレームワークであるV-ABSを紹介する。
V-ABSは最先端の性能を実現し,Qwen3-VL-8Bベースラインで平均19.7%の改善を実現している。
- 参考スコア(独自算出の注目度): 7.200097753831728
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Multimodal large language models (MLLMs) have achieved remarkable success in general perception, yet complex multi-step visual reasoning remains a persistent challenge. Although recent agentic approaches incorporate tool use, they often neglect critical execution feedback. Consequently, they suffer from the imagination-action-observer (IAO) bias, a misalignment between prior imagination and observer feedback that undermines reasoning stability and optimality. To bridge this gap, we introduce V-ABS, an action-observer driven beam search framework that enables deliberate reasoning through thinker-actor-observer iterations. We also propose an entropy-based adaptive weighting algorithm to mitigate the IAO bias by dynamically balancing the confidence scores between the policy priors and the observational feedback. Moreover, we construct a large-scale supervised fine-tuning (SFT) dataset comprising over 80k samples to guide the model to assign higher prior confidence to correct action paths. Extensive experiments across eight diverse benchmarks show that V-ABS achieves state-of-the-art performance, delivering an average improvement of 19.7% on the Qwen3-VL-8B baseline and consistent gains across both open-source and proprietary models.
- Abstract(参考訳): MLLM(Multimodal large language model)は、一般的な認識において顕著な成功を収めてきたが、複雑な多段階の視覚的推論は永続的な課題である。
最近のエージェント的アプローチはツールの使用を取り入れているが、重要な実行フィードバックを無視することが多い。
その結果、彼らはイマジネーション・アクション・オブザーバ(IAO)バイアスに悩まされ、事前のイマジネーションとオブザーバフィードバックのミスアライメントは、推論の安定性と最適性を損なう。
このギャップを埋めるために、我々はアクション・オブザーバ駆動のビームサーチフレームワークであるV-ABSを紹介した。
また、ポリシー先行と観測フィードバックの信頼度を動的にバランスさせることにより、IAOバイアスを軽減するエントロピーに基づく適応重み付けアルゴリズムを提案する。
さらに,80k以上のサンプルからなる大規模教師付き微調整(SFT)データセットを構築し,精度の高い事前信頼度を適切な行動経路に割り当てるよう誘導する。
V-ABSが最先端のパフォーマンスを達成し、Qwen3-VL-8Bベースラインで平均19.7%の改善と、オープンソースモデルとプロプライエタリモデルの両方で一貫した利益をもたらすことを示す8つの多種多様なベンチマークによる大規模な実験結果が示されている。
関連論文リスト
- Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization [41.15414881730464]
VLM(Vision-Language Models)は、この目標に対して、一般的なパーセプティブ・レアソン・アクティベート・フレームワークを提供する。
従来のアプローチは、ノイズの多い予見予測から状態値の非効率で、しばしば不正確な暗黙の学習に依存していた。
動作生成から状態評価を分離する新しいテスト時間計算フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-22T22:53:16Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding [71.654781631463]
ReAgent-Vは、新しいエージェントビデオ理解フレームワークである。
推論中に効率の良いフレーム選択とリアルタイムの報酬生成を統合する。
12のデータセットに対する大規模な実験は、一般化と推論において大きな成果を上げている。
論文 参考訳(メタデータ) (2025-06-02T04:23:21Z) - TRACE: A Self-Improving Framework for Robot Behavior Forecasting with Vision-Language Models [1.3408365072149797]
反応剤の短期的挙動を予測することは、多くのロボットシナリオにおいて重要である。
本稿では,ツリー・オブ・ソート・ジェネレーションとドメイン・アウェア・フィードバックを結合した推論フレームワークTRACEを提案する。
我々は,地上車両シミュレーションと実世界海面車両の両面においてTRACEを検証した。
論文 参考訳(メタデータ) (2025-03-02T06:58:02Z) - Self-Consistent Model-based Adaptation for Visual Reinforcement Learning [27.701421196547674]
視覚強化学習エージェントは、視覚障害による実世界のアプリケーションの性能低下に直面している。
既存の方法は、手作りの拡張でポリシーの表現を微調整することに依存している。
本稿では、ポリシーを変更することなくロバスト適応を促進する新しい手法である自己一貫性モデルベース適応(SCMA)を提案する。
論文 参考訳(メタデータ) (2025-02-14T05:23:56Z) - Benchmarking and Improving Bird's Eye View Perception Robustness in Autonomous Driving [55.93813178692077]
本稿では,BEVアルゴリズムのレジリエンスを評価するためのベンチマークスイートであるRoboBEVを紹介する。
検出,マップセグメンテーション,深さ推定,占有予測といったタスクにまたがる33の最先端のBEVベースの知覚モデルを評価する。
また, 事前学習や深度自由なBEVトランスフォーメーションなどの戦略が, アウト・オブ・ディストリビューションデータに対するロバスト性を高める上で有効であることを示す。
論文 参考訳(メタデータ) (2024-05-27T17:59:39Z) - Efficient Empowerment Estimation for Unsupervised Stabilization [75.32013242448151]
エンパワーメント原理は 直立位置での 力学系の教師なし安定化を可能にする
本稿では,ガウスチャネルとして動的システムのトレーニング可能な表現に基づく代替解を提案する。
提案手法は, サンプルの複雑さが低く, 訓練時より安定であり, エンパワーメント機能の本質的特性を有し, 画像からエンパワーメントを推定できることを示す。
論文 参考訳(メタデータ) (2020-07-14T21:10:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。