論文の概要: Reasoning Without Inference Cost: Latent Semantic Scaffolding for Robot VLA Policies
- arxiv url: http://arxiv.org/abs/2609.04893v1
- Date: Fri, 04 Sep 2026 08:49:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-07 18:15:23.982796
- Title: Reasoning Without Inference Cost: Latent Semantic Scaffolding for Robot VLA Policies
- Title(参考訳): 推論コストのない推論:ロボットVLAポリシーの潜在セマンティックスキャッフィング
- Abstract要約: 補助的障害であるLatent Semantic Scaffolding(LSS)を導入する。
LSSは、VLAのアクション・トーケン表現を、小さな投影ヘッドを通して物理的推論的理性のテキスト埋め込みと整列する。
それぞれのアクショントークンを、単一のプールドエピソードレベルの埋め込み(Pooled LSS)ではなく、独自の操作フェーズ(Dense LSS)の論理に整合させること。
Dense LSSは、アライメント中に見つからないタスクに最高の分配成功と最高の転送の両方を達成する一方、プール化されたアライメントは特化している。
- 参考スコア(独自算出の注目度): 7.194575455352589
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action (VLA) models are trained by imitation and capture what action to take but not why; adding causal reasoning improves manipulation, but current methods pay for it at inference time - generating reasoning tokens or rolling out predicted future states at every step, a cost that compounds over long horizons. We ask whether this benefit can instead be captured during training and discarded before deployment. We introduce Latent Semantic Scaffolding (LSS), an auxiliary loss applied during human-demonstration pretraining that aligns a VLA's action-token representations to text embeddings of physical-reasoning rationales through a small projection head. The head is dropped at inference, leaving the unmodified base policy with zero added cost. Our central finding concerns alignment granularity: aligning each action token to the rationale of its own manipulation phase (Dense LSS) rather than to a single pooled episode-level embedding (Pooled LSS) yields representations that transfer markedly better to held-out tasks. Dense LSS attains both the best in-distribution success and the best transfer to tasks unseen during alignment, whereas pooled alignment over-specializes to the training task. A representational probe shows Dense LSS induces roughly twice the per-phase separability in the backbone, supporting that phase-local alignment is the operative mechanism.
- Abstract(参考訳): 因果推論を追加することで操作が改善されるが、現在のメソッドは推論時にそれに対して支払う - 推論トークンを生成したり、あらゆるステップで予測される将来の状態をロールアウトする。
私たちは、このメリットをトレーニング中にキャプチャして、デプロイ前に破棄できるかどうか尋ねます。
本稿では,VLAのアクション・トーケン表現を,小さなプロジェクション・ヘッドを通した物理共振有理のテキスト埋め込みに整列させる,人間の実証前訓練中に適用される補助的損失であるLatent Semantic Scaffolding(LSS)を紹介する。
頭は推論時に落とされ、修正されていない基本方針は追加コストがゼロになる。
それぞれのアクショントークンを1つのプールドエピソードレベルの埋め込み(Pooled LSS)ではなく、独自の操作フェーズ(Dense LSS)の合理性に合わせることで、保留タスクよりもはるかによい表現が得られます。
Dense LSSは、アライメント中に見つからないタスクへの最高の分配と、トレーニングタスクへの過度に調整されたアライメントの両方を達成します。
表現型プローブは、Dense LSSが背骨の約2倍の相分離性を誘導し、位相局所アライメントが手術機構であることを示す。
関連論文リスト
- RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models [8.012549967082832]
RL2$はVision-Language-Action(VLA)モデルの適応型推論時ステアリングフレームワークである。
VLAアクションエキスパートから抽出した表現的潜伏者に基づく軽量オフラインRLポリシーを訓練する。
この構成的ステアリング戦略は、大規模な模倣学習の行動先行と、オフラインRLによって誘導される行動多様性を結合する。
論文 参考訳(メタデータ) (2026-07-29T14:49:56Z) - Spinning Straw into Gold: Relabeling LLM Agent Trajectories in Hindsight for Successful Demonstrations [53.931465193216155]
我々は、HSL(Hindsight Supervised Learning)を導入し、補助的なLLMが各完了軌跡をレビューし、エージェントが実際に達成したすべての自然言語目標をラベル付けする。
HSLは軌道をその延長された目標と組み合わせ、これらのペアを追加の微調整に使用する。
実験の結果,HSLは既存のポストトレーニングパイプラインと柔軟で互換性があることがわかった。
論文 参考訳(メタデータ) (2026-07-05T11:21:26Z) - Learning to Move Before Learning to Do: Task-Agnostic pretraining for VLAs [46.61554174146852]
Task-Agnostic Pretraining (TAP)は、安価な未ラベルのインタラクションデータから転送可能なモータの事前学習を行う2段階のフレームワークである。
SIMPLERベンチマークでは、TAPは100万以上の専門家の軌道上でトレーニングされたモデルと、ラベル付きデータの桁数を桁違いに削減する。
現実世界のWidowXプラットフォームでは、TAPは、インターネットスケールのベースラインが0%に崩壊するカメラの摂動の下で25%の成功を維持している。
論文 参考訳(メタデータ) (2026-07-02T17:33:37Z) - OVIG: Optimistic Verification of AI Training Integrity via Gradient Signals [12.13115443718909]
アウトソーストレーニングは、トレーニング統合性ギャップを生み出します。
OVIGは、異種実行下でのトレーニング後のアウトソースAIに対して、実用的な整合性レイヤを提供する。
論文 参考訳(メタデータ) (2026-06-19T02:22:28Z) - Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments [53.85970147743299]
専門家によるデモンストレーションは、ロボット模倣学習における金の標準であると広く考えられている。
しかし、挿入、積み重ね、アライメントなどのきめ細かい操作のために、私たちは直感的な失敗モードを発見しました。
視覚言語モデルとアクションエキスパートをブリッジする,コンパクトな動的特徴であるSTAIRを導入する。
論文 参考訳(メタデータ) (2026-06-14T04:15:29Z) - Effort as Ceiling, Not Dial: Reasoning Budget Does Not Modulate Cognitive Cost Alignment Between Humans and Large Reasoning Models [0.4306164411864404]
大きな推論モデルは、認知タスク全体で人間の反応時間を追跡するチェーンオブ思考のトレースを生成する。
このアライメントが推論時間推論の努力と異なるかどうかをテストする。
トレーニングタイムの達成、LRMと人間の間の認知的コストの調整は、トレーニングタイムの達成のように見える。
論文 参考訳(メタデータ) (2026-05-16T11:20:01Z) - PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations [66.94988600664574]
我々は,目標達成型強化学習を通じて事前学習を再構築するVLA基盤モデルであるtextbfPRTS(textbfPrimitive textbfReasoning and textbfTasking textbfSystem)を提案する。
論文 参考訳(メタデータ) (2026-04-30T06:14:02Z) - Latent Reasoning in LLMs as a Vocabulary-Space Superposition [80.01651003144282]
大規模言語モデル(LLM)は、チェーン・オブ・シークレット・プロンプトによる強力な推論能力を示すが、明示的な推論は計算上のオーバーヘッドを大幅に引き起こす。
遅延推論に関する最近の研究は、明示的な監督なしに遅延空間を推論することでコストを削減するが、性能は著しく低下する。
この問題に対処するため、LLM語彙の列空間に潜伏空間を制限し、潜伏推論を語彙確率の重ね合わせとして扱う。
後続の推論が終わると、それは最終的な答えを得るために明確な推論の固有状態に崩壊する。
Latent-SFTはGSM8kに新しい状態を設定し、明示的に一致する
論文 参考訳(メタデータ) (2025-10-17T10:51:20Z) - IntentionVLA: Generalizable and Efficient Embodied Intention Reasoning for Human-Robot Interaction [51.130510883952546]
Vision-Language-Action(VLA)モデルは、事前訓練された視覚言語モデル(VLM)を活用して、ロボット制御との認識を両立させる。
カリキュラム学習パラダイムと効率的な推論機構を備えたVLAフレームワークである textbfIntentionVLA を提案する。
提案手法はまず,意図推論,空間的接地,コンパクトな具体的推論を組み合わせ,慎重に設計した推論データを活用する。
論文 参考訳(メタデータ) (2025-10-09T04:49:46Z) - Stable Distillation: Regularizing Continued Pre-training for
Low-Resource Automatic Speech Recognition [54.9235160379917]
安定蒸留はSSLベースの継続事前トレーニングのためのシンプルで斬新なアプローチである。
これにより、ラベル付きデータとラベルなしデータの両方が制限されたターゲットドメインでのASRパフォーマンスが向上する。
論文 参考訳(メタデータ) (2023-12-20T06:02:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。