論文の概要: FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy
- arxiv url: http://arxiv.org/abs/2608.16697v1
- Date: Mon, 17 Aug 2026 15:14:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.764795
- Title: FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy
- Title(参考訳): FabriMAE I Trust myself? Markov Attention Entropyを用いた自己評価VLAアクション生成
- Abstract要約: VLA(Vision-Language-Action Model)は、視覚認識、言語命令、アクション生成をエンドツーエンドのポリシーに統合する。
既存の手法は専門家のアノテーションに頼るか、出力統計のみから不確実性を見積もる。
我々は,内部の注意信号をアーキテクチャ対応信頼性スコアに変換する自己評価フレームワークであるMAE(Markov Attention Entropy)を提案する。
- 参考スコア(独自算出の注目度): 63.26759696630558
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-Language-Action models (VLAs) integrate visual perception, language instruction, and action generation into end-to-end policies across heterogeneous architectures. However, enabling VLAs to self-evaluate their action generation reliability without external supervision remains a major challenge. Existing methods either rely on expert annotations or estimate uncertainty only from output statistics, largely ignoring internal signals. In this work, we observe that internal visual modality entropy exhibits consistent distinctions between successful and failed tasks across heterogeneous VLAs. Although VLAs' architectures differ in their action generation, we show that they share a common latent action generation abstraction evolving under visual perception, language instruction, and state input, which we formulate as a Conditional Generative Markov Chain. Based on this formulation, we propose MAE (Markov Attention Entropy), a self-evaluation framework that directly converts internal attention signals into architecture-aware reliability scores, and introduce LIBERO-Reflect, a 4,000-episode benchmark combining 2,000 standard episodes and 2,000 challenging episodes across four subsets. Extensive experiments across heterogeneous VLA architectures and diverse scenarios show that MAE consistently outperforms state-of-the-art baselines on AUPR, AUROC, and FPR@95. We further instantiate FabriMAE for verifier-free test-time action selection, showing that MAE-guided multiple sampling improves PI-family robustness on LIBERO-Plus with small observed runtime overhead.
- Abstract(参考訳): VLA(Vision-Language-Action Model)は、視覚認識、言語命令、アクション生成を異種アーキテクチャのエンドツーエンドポリシーに統合する。
しかしながら、VLAが外部の監督なしに行動生成の信頼性を自己評価できることは大きな課題である。
既存の手法は専門家のアノテーションに頼るか、出力統計のみから不確実性を推定する。
本研究では,不均質なVLA間でのタスクの成功と失敗との間には,内部的な視覚的モダリティのエントロピーが一貫した相違を示すことを観察する。
VLAのアーキテクチャはアクション生成において異なるが、視覚的知覚、言語命令、状態入力の下で進化する共通の潜在アクション生成抽象化を共有しており、条件生成マルコフ連鎖として定式化している。
この定式化に基づいて,内部の注意信号を直接アーキテクチャ対応の信頼性スコアに変換する自己評価フレームワークであるMAE(Markov Attention Entropy)を提案し,2000の標準エピソードと2000の課題エピソードを4つのサブセットで組み合わせた4,000のエピソードベンチマークであるLIBERO-Reflectを紹介した。
不均一なVLAアーキテクチャと多様なシナリオにわたる大規模な実験により、MAEはAUPR、AUROC、FPR@95の最先端のベースラインを一貫して上回っている。
さらに、検証不要なテスト時間動作選択のためのFabriMAEのインスタンス化を行い、MAE誘導多重サンプリングにより、LIBERO-Plus上のPI系ロバスト性を、少ないランタイムオーバーヘッドで向上することを示す。
関連論文リスト
- Towards Generalizable Visually Grounded Exploration of Household Devices [74.66117923766632]
汎用的な自律的実施エージェントを実現する上でのボトルネックは、Generalizable Visually Grounded Explorationにある。
VGEBenchは、視覚言語モデルの一般化可能な視野探索能力を評価するために設計されたベンチマークである。
静的なデータセットとは異なり、我々はLogic-Driven State Machineフレームワークを構築している。このフレームワークは多ターンインタラクションループをシミュレートし、アクティブな視覚知覚とフィードバック駆動の修正によって目標を達成するエージェントを説得する。
論文 参考訳(メタデータ) (2026-09-01T07:42:45Z) - Unified Hallucination Fuzzing for Multimodal Large Language Models [44.4785399881315]
マルチモーダル大言語モデル(MLLM)に対する幻覚は依然として永続的な課題である
既存の評価は、主に静的なベンチマークに基づいており、狭い分類範囲と急速な性能飽和に悩まされている。
本稿では,総合的なベンチマークと自己進化型ストレステストを統合するシステム評価フレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-15T17:57:37Z) - AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward [52.7128440950672]
我々はAlphaGRPOを提案し、追加のコールドスタートステージなしでマルチモーダル生成能力を向上する。
我々のアプローチは、高度な推論タスクを実行するためのモデルの本質的な可能性を解き放つ。
実世界のマルチモーダル世代を安定的に管理する上での課題に対処するために、DVReward(Decompositional Verifiable Reward)を導入する。
論文 参考訳(メタデータ) (2026-05-12T17:59:47Z) - SMFormer: Empowering Self-supervised Stereo Matching via Foundation Models and Data Augmentation [55.67206878777881]
本稿では、VFM(Vision Foundation Model)とデータ拡張によって導かれる、より信頼性の高いセルフスーパービジョンを統合するフレームワークであるSMFormerを提案する。
SMFormerは、自己教師付きメソッド間での最先端(SOTA)のパフォーマンスを達成し、教師付きメソッドと同等に競合する。
論文 参考訳(メタデータ) (2026-04-11T13:56:41Z) - Observing and Controlling Features in Vision-Language-Action Models [20.193036403223903]
VLA(Vision-Language-Action Models)は、インボディードインテリジェンスに対する顕著な進歩を示している。
機能可観測性と機能可制御性という,2つの主要な概念を紹介し,分析する。
この結果から,ロボットの動作を確実に制御する,目標とする軽量な介入が可能であることが示唆された。
論文 参考訳(メタデータ) (2026-03-05T18:53:50Z) - VAUQ: Vision-Aware Uncertainty Quantification for LVLM Self-Evaluation [22.921677603408188]
LVLM(Large Vision-Language Models)はしばしば幻覚を呈し、現実世界のアプリケーションに安全な配置を制限している。
LVLM自己評価のための視覚対応不確実性定量化フレームワークVAUQを提案する。
VAUQは、モデルの出力が視覚的証拠に依存するかを明確に測定する。
論文 参考訳(メタデータ) (2026-02-24T16:11:14Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - HARMONY: Hidden Activation Representations and Model Output-Aware Uncertainty Estimation for Vision-Language Models [42.91752946934796]
不確実性推定は、モデル出力の信頼性の定量化において中心的な役割を果たす。
既存の確率に基づくUEアプローチの多くは、単一不確実性スコアにトークン確率を集約する出力確率分布に依存している。
本稿では,モデルアクティベーションにおける融合マルチモーダル情報とVLMの出力分布を協調的に活用する新しいUEフレームワークHARMONYを提案する。
論文 参考訳(メタデータ) (2025-10-25T05:45:18Z) - Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection [71.8243083897721]
視覚言語モデルは、しばしば詳細を幻覚させ、既存のオブジェクトを生成するか、出力信頼性を損なう不正確な属性を生成する。
本稿では、長文応答と短文応答の自己整合性を利用して、学習のための選好ペアを生成する新しいフレームワークを提案する。
論文 参考訳(メタデータ) (2025-09-27T10:37:11Z) - SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards [55.99492656542475]
textbfSDER (textbfSelf-improving textbfUnified LMMs with textbfDual stextbfElf-textbfRewards) を提案する。
論文 参考訳(メタデータ) (2025-06-09T17:38:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。