論文の概要: REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
- arxiv url: http://arxiv.org/abs/2609.01215v1
- Date: Tue, 01 Sep 2026 13:19:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.680639
- Title: REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
- Title(参考訳): REFACTOR-VLA:タイプドモータープログラムの教師なしライブラリ学習
- Authors: Riyaaz Shaik, Chandru Venkataraman,
- Abstract要約: ほとんどの視覚言語アクション(VLA)モデルはモノリシックである。
本稿では、再利用可能なスキルを学習するためのウェイク/スリープモデルシステムであるREFACTOR-VLAを紹介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Most vision-language-action (VLA) models -- OpenVLA, $π_0$, RT-2, RDT-1B -- are monolithic: they emit raw motor commands or short action chunks without organizing behavior into reusable abstractions, so they degrade on long-horizon tasks and resist interpretation. Existing skill-discovery methods sidestep the core question of when two action sequences are behaviorally equivalent, either clustering contrastive embeddings or delegating the judgment to a language model uncalibrated to the robot's dynamics. We introduce REFACTOR-VLA, a wake/sleep system for learning reusable skills. Its sleep phase clusters motor-program fragments under a Behavioral-Equivalence Kernel (BEK) computed from rollouts of a learned latent world model $M_φ$; its wake phase emits typed lambda terms over a Hindley--Milner-inspired vocabulary, consumed by a library-conditioned rectified-flow action decoder. Abstractions are admitted only if they pass Minimum Description Length and return-preservation gates. On LIBERO we report two findings. First, enlarging the world model from 188M to 430M parameters worsened performance on 4 of 4 suites, so capacity alone does not help. Second, the training objective matters far more: adding an auxiliary supervised contrastive (InfoNCE) loss during world-model warmup substantially improves sleep-phase clustering, giving Normalized Mutual Information at $n=3$ seeds of $0.462 \pm 0.021$ (object), $0.867 \pm 0.025$ (spatial), $0.915 \pm 0.013$ (goal) and $0.754 \pm 0.010$ (LIBERO-10), and beating the strongest published baseline on all 4 suites by a mean $Δ= +0.184$. Across providers ($n=12$) the 95% bootstrap confidence interval for mean pairwise NMI is $[0.683, 0.729]$ (mean $0.705$). The sleep phase also yields the first real-LIBERO task-language library: the decoder uses 2 of 3 admitted abstractions and rewrites all 256 sampled demonstrations.
- Abstract(参考訳): ほとんどの視覚言語アクション(VLA)モデル(OpenVLA, $π_0$, RT-2, RDT-1B)はモノリシックである。
既存のスキル発見手法は、2つのアクションシーケンスが動作的に等価である場合、あるいはロボットのダイナミクスに左右されない言語モデルに判断を委譲するかという、コアな疑問を脇に置いている。
本稿では、再利用可能なスキルを学習するためのウェイク/スリープシステムであるREFACTOR-VLAを紹介する。
そのスリープフェーズは、学習された潜在世界モデルのロールアウトから計算されたBeK(Behavial-Equivalence Kernel)の下でモータープログラムのフラグメントをクラスタし、そのウェイクフェーズは、ライブラリ条件の修正フローデコーダによって消費されるヒンドリー-ミルナー-インスパイアされた語彙上の型付きラムダ語を出力する。
抽象化は、最小記述長と戻り保存ゲートを通過する場合にのみ許可される。
LIBEROでは2例を報告した。
まず、世界モデルを188Mから430Mパラメータに拡張すると、4つのスイートのうち4つのパフォーマンスが悪化するので、キャパシティだけでは役に立たない。
第2に、ワールドモデルウォームアップ中に補助的な教師付きコントラスト(InfoNCE)損失を追加することで、睡眠相クラスタリングが大幅に改善され、標準化された相互情報が$0.462 \pm 0.021$ (object), $0.867 \pm 0.025$ (spatial), $0.915 \pm 0.013$ (goal), $0.754 \pm 0.010$ (LIBERO-10), そして平均$Δ=+0.184$で発行された4つのスイートのベースラインを破る。
平均対NMIの95%ブートストラップ信頼区間(n=12$)は[0.683, 0.729]$(平均0.705$)である。
デコーダは3つある抽象化のうち2つを使用し、256のサンプルデモをすべて書き直します。
関連論文リスト
- EquiVLA: A General Framework for Rotationally Equivariant Vision-Language-Action Models [7.807191061951358]
エンド・ツー・エンドの$mathrmSO(2)$-equivariant VLAモデルのための最初の汎用フレームワークである textscEquiVLA を提示する。
textscEquiVLAは、フローマッチングディフュージョントランスフォーマーアクションヘッドと凍結された視覚言語バックボーンを結合する任意のアーキテクチャに適用できる。
論文 参考訳(メタデータ) (2026-06-18T04:36:57Z) - Toward Compiler World Models: Learning Latent Dynamics for Efficient Tensor Program Search [9.85275171877854]
本稿では,プログラム状態に対する動作条件付き潜在ダイナミクスとしての評価をスケジュールする評価器を提案する。
提案手法は,GPUで1.37$times$,CPUで1.54$times$,Ansorで64-trial budgetで1.37$times$の改善を行う。
また、PyTorch/PyTorch-opt(cuDNN)に対するフルモデル推論を4.61$times$/3.67$times$ometric meanで高速化する。
論文 参考訳(メタデータ) (2026-06-08T10:17:27Z) - What Do EEG Foundation Models Capture from Human Brain Signals? [64.48249643001402]
現代の脳波基礎モデルは、自己教師付き事前訓練を通じて生信号から直接学習する。
我々は3つのサブクエストに分解する: モデルが何を学習するか、モデルを何に使用するのか、そしてどのように説明できるのか。
3つの基礎モデル(CSBrain, CBraMod, LaBraM),5つの臨床タスク(MDD, Stress, ISRUC-Sleep, TUSL, Siena)と6ファミリー63機能レキシコンを含む。
論文 参考訳(メタデータ) (2026-05-12T01:57:53Z) - Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect [0.0]
本研究は,小言語モデルが内的アクティベーションを検出・報告できるかどうかを考察する。
まず,先行研究で使用される二項検出パラダイムが,質問内容に関係なく肯定的応答に偏りを示すため,小さなモデルで構築されていることを示す。
次に、モデル自身の摂動前進パスから構築した文局在化例を教師付き微調整するEmphIntrospection Fine-Tuning(IFT)を導入する。
論文 参考訳(メタデータ) (2026-05-08T05:30:26Z) - Understanding Asynchronous Inference Methods for Vision-Language-Action Models [0.0]
Vision-Language-Action(VLA)モデルは汎用ロボット制御への有望な経路を提供するが、その推論遅延は、生成されたアクションが非同期に実行されるときに観察の安定化を引き起こす。
Inference-time Inpainting (IT-RTC), training-time delay Simulation (TT-RTC), future-state-aware conditioning (VLASH), light residual correction (A2C2) の2つの手法が同時に提案されている。
制御条件下でのこれらの4つの手法の系統的な比較について述べる。
論文 参考訳(メタデータ) (2026-05-04T18:01:15Z) - Large Language Models as Optimization Controllers: Adaptive Continuation for SIMP Topology Optimization [4.365822392824561]
本稿では,SIMP最適化のためのオンラインコントローラとして,大規模言語モデルが機能するフレームワークを提案する。
ハードグレーネスゲートは未熟なバイナライゼーションを防止し、メタ最適化ループは第2パスを使用してエージェントの呼び出し周波数を調整する。
エージェントはすべてのベンチマークの最終的なコンプライアンスを達成する:$5.7%$から$-1%、すべてのソリューションが完全にバイナリである。
論文 参考訳(メタデータ) (2026-03-26T07:14:31Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z) - Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments [54.67512489842682]
大規模言語モデル(LLM)は、複雑な実施環境において、強力な計画と意思決定能力を示す。
LLMをベースとしたエージェントの早期退避行動を探究する第一歩を踏み出す。
論文 参考訳(メタデータ) (2025-05-23T08:23:36Z) - From Continual Learning to SGD and Back: Better Rates for Continual Linear Models [50.11453013647086]
以前見られたタスクの損失を、$k$の繰り返しの後、忘れること、すなわち、分析する。
実現可能な最小二乗の設定において、新しい最上界を創出する。
我々は、タスクを繰り返しないランダム化だけで、十分に長いタスクシーケンスで破滅的な事態を防げることを初めて証明した。
論文 参考訳(メタデータ) (2025-04-06T18:39:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。