論文の概要: When Reasoning Helps Action: Monitoring and Steering Chain-of-Thought in Vision-Language-Action Policies
- arxiv url: http://arxiv.org/abs/2610.00601v1
- Date: Wed, 30 Sep 2026 19:04:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.724929
- Title: When Reasoning Helps Action: Monitoring and Steering Chain-of-Thought in Vision-Language-Action Policies
- Title(参考訳): Reasoningが行動を助ける時--ビジョン・ランゲージ・アクション・ポリシーのモニタリングとチェーン・オブ・サード
- Abstract要約: 推論可能なVLAポリシは、そのアクションの説明とガイドのように見えるチェーンオブ思想のトレースを公開する。
信頼性と動作性を評価するための2つの評価軸を定義し,運用する。
アルパマヨ1.5の運転VLAでは、TRUSTは88.9%の精度で正確さを監視し、推論の正確さを75.9%から90.0%に改善する。
- 参考スコア(独自算出の注目度): 7.580719272198118
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reasoning-enabled VLA policies expose chain-of-thought (CoT) traces that appear to explain and guide their actions, creating a potential interface for runtime safety through reasoning monitoring and correction. In this work, we define and operationalize two evaluation axes for assessing when this interface can improve embodied behavior: correctability, which measures whether unreliable reasoning can be detected and improved during generation, and actionability, which measures whether reasoning corrections produce behaviorally meaningful changes in the intended direction. To enable correctability, we introduce Token-level Reward for Utility-Steered Chain-of-Thought (TRUST), an offline-trained value model that predicts eventual reasoning correctness from partial prefixes and uses these estimates to monitor and selectively steer reasoning generation in frozen VLA policies. On the Alpamayo 1.5 driving VLA, TRUST monitors correctness with 88.9% accuracy and improves reasoning correctness from 75.9% to 90.0%. On a baseline-defined challenging subset in AlpaSim, TRUST reduces collision rate by 30.4% and maximum trajectory error by 11.5% relative to the unsteered policy, outperforming a compute-matched Best-of-4 baseline. On the DeepThinkVLA manipulation VLA, TRUST improves the correctness of grasp-state claims from 69.3% to 90.2% and action-choice claims from 68.8% to 85.9%, yet closed-loop task performance on LIBERO-Plus remains largely unchanged. Empirical analysis reveals intent-consistent behavioral effects in Alpamayo 1.5 but limited effects in DeepThinkVLA, helping interpret these different task-level outcomes. Together, our results show that gains in reasoning correctness do not automatically imply gains in embodied performance, motivating evaluation of correctability and actionability when using CoT as a runtime safety interface.
- Abstract(参考訳): 推論可能なVLAポリシは、アクションの説明とガイドのように見えるチェーンオブ思想(CoT)トレースを公開し、推論監視と修正を通じて実行時の安全性のための潜在的なインターフェースを作成する。
本研究では,このインターフェースが具体的動作を改善することができるかどうかを評価するための2つの評価軸を定義し,運用する。
そこで本研究では,部分的なプレフィックスから最終的な推論正当性を予測するオフライン学習値モデルであるTRUST(Token-level Reward for Utility-Steered Chain-of-Thought)を導入し,これらの推定値を用いて凍結VLAポリシにおける推論生成の監視と選択的ステアリングを行う。
アルパマヨ1.5の運転VLAでは、TRUSTは88.9%の精度で正確さを監視し、推論の正確さを75.9%から90.0%に改善する。
AlpaSimのベースライン定義挑戦サブセットでは、TRUSTは衝突率を30.4%、最大軌道誤差を11.5%削減し、計算整合のBest-of-4ベースラインを上回っている。
ディープシンクVLA操作VLAでは、TRUSTはグリップステートのクレームの正しさを69.3%から90.2%に改善し、アクションチョイスのクレームは68.8%から85.9%に改善したが、LIBERO-Plusでのクローズドループタスクのパフォーマンスはほとんど変わっていない。
実証分析では、Alpamayo 1.5では意図的無矛盾な行動効果を示すが、DeepThinkVLAでは限定的な効果を示し、これらの異なるタスクレベルの結果の解釈に役立っている。
この結果から,COTをランタイムセーフティインタフェースとして使用する場合の精度と動作性の評価を動機として,精度の推論が自動的に向上するわけではないことが示唆された。
関連論文リスト
- Credit-Guided Policy Improvement for Test-time Adaptive Vision-Language Navigation [53.30116823667751]
視覚言語ナビゲーションのためのテスト時適応(TTA-VLN)により、事前訓練されたポリシーは、目に見えない環境にオンラインで適応できる。
分散シフトは、局所的な行動選好を歪め、オフコース決定につながる可能性がある。
我々は,行動誘発観察遷移から署名付き参照関連決定クレジットを回収する信用誘導政策改善(CGPI)を提案する。
論文 参考訳(メタデータ) (2026-09-29T13:46:11Z) - CereVLA: Cerebellum-Inspired Consequence-Aware Residual Governance for Efficient Vision-Language-Action Execution [53.635273213001796]
アクションチャンクされた視覚言語アクション(VLA)ポリシーは推論効率を改善するが、コミットされたアクションチャンク内の限られたフィードバックは、実行エラーの蓄積につながる。
本稿では,軽量残効改善と予測結果評価を冷凍VLA実行に統合した統合フレームワークであるCereVLAについて述べる。
論文 参考訳(メタデータ) (2026-09-23T07:30:58Z) - Taming CoT Obfuscation in VLMs: From Mechanistic Evidence to Activation Enforcement [74.92755267784983]
強化学習は、視覚言語モデルにおける推論を改善するが、チェーン・オブ・オファシケーションを誘発することができる。
本稿では, 行動フィードバックとテンプレート関連アクティベーションの標的抑制を組み合わせ, メカニスティック・エンハンスメント(TAME)を用いた標的的アンチ・オブファシケーションを提案する。
VIRL-39k、SPA-VL、および2つのモデルファミリの中で、TAMEはグループ相対政策最適化よりも最大30.9および16.7%のCoT監視性を改善している。
論文 参考訳(メタデータ) (2026-09-21T08:08:56Z) - Bilinear Optimization Divergence: Diagnosing Factor-Constrained LoRA Continual Learning [9.210432526729507]
本稿では,選択した歴史的特徴に対する有効更新応答のアンカー相対的診断を定式化する。
共用アダプタにおいて、ルーティング変位を保護すると、変化した共役因子を介して学習アンカー残余が残る。
新たなゼロ出力ブロックでは、実行可能なルーティング状態が、両方の現在の要因がトレーニング可能である間、構成された更新を保護することができる。
論文 参考訳(メタデータ) (2026-09-20T12:26:14Z) - ReDraft, Don't Just Distill: Reference-Driven Revision for Continual VLLM Post-Training [66.72708893922605]
大規模なマルチモーダルモデルのポストトレーニングは、事前トレーニングから保護しながら、新しい機能を追加する必要がある。
SFTは、タスクをほぼゼロの精度から学習する明確なターゲット監視を提供するが、そのオフポリティックターゲットはモデルを十分に移動させ、忘れる原因となる。
モデル自身の失敗から両方を得るReDraftを紹介します。
論文 参考訳(メタデータ) (2026-09-15T04:59:03Z) - SVR: Self-Verifying Refinement via Joint Verdict-Confidence Reinforcement Learning for Adaptive Test-Time Compute [62.3458279176813]
自己検証リファインメント(Self-Verifying Refinement)は、オラクルフリーのマルチターン強化学習フレームワークである。
自己検証を計算制御ポリシとして使用することを学ぶ。
マクロ平均精度は0.563で、平均で2.99回しか推測できない。
論文 参考訳(メタデータ) (2026-07-30T16:20:58Z) - Minimizing Targeted Activations: Input-Only Suppression of Evaluation-Awareness Latents in Large Language Models [0.4783156204372467]
アクティベーションステアリングは、推論時に内部アクティベーションを編集することでモデル動作を制御する。
入力側双対について検討し、流動的なプロンプトを最適化し、選択した内部潜伏剤をゼロに駆動する。
論文 参考訳(メタデータ) (2026-07-28T16:01:48Z) - Evaluation Awareness Is Not One Capability: Evidence from Open Language Models [1.758143872501506]
安全ベンチマークは、テスト条件の振る舞いがデプロイメントの振る舞いを予測すると仮定する。
これにより、ベンチマークパフォーマンスとデプロイメントの動作のギャップが開ける。
我々は、37のオープンウェイトモデルと7つのファミリーにわたる8つの実験を通して、この評価意識を特徴づける。
論文 参考訳(メタデータ) (2026-06-22T16:48:43Z) - Accurate Failure Prediction in Agents Does Not Imply Effective Failure Prevention [2.0838114053126366]
LLM批判モデルによる積極的な介入は、しばしば信頼性を向上させると仮定されるが、展開時の影響はよく理解されていない。
高いオフライン精度 (AUROC 0.94) を持つバイナリLLM批判者は, にもかかわらず, 高い性能劣化を引き起こす可能性がある。
我々は、50のタスクからなる小さなパイロットを用いて、完全な配備を必要とせず、介入が助けになるか、害を与えるかを見積もる事前デプロイテストを提案する。
論文 参考訳(メタデータ) (2026-02-03T10:02:50Z) - Active Test-time Vision-Language Navigation [60.69722522420299]
ATENAは、不確実なナビゲーション結果に対するエピソードフィードバックを通じて、実用的な人間とロボットのインタラクションを可能にする、テスト時のアクティブな学習フレームワークである。
特にATENAは、成功エピソードにおける確実性を高め、失敗エピソードにおいてそれを減らすことを学び、不確実性の校正を改善している。
さらに,自信ある予測に基づいて,エージェントがナビゲーション結果を評価することができる自己学習戦略を提案する。
論文 参考訳(メタデータ) (2025-06-07T02:24:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。