論文の概要: SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation
- arxiv url: http://arxiv.org/abs/2608.09771v1
- Date: Mon, 10 Aug 2026 15:58:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.364591
- Title: SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation
- Title(参考訳): SLIM-0.5B:ロボットマニピュレーションのための行動学習型予測潜伏器
- Abstract要約: SLIM はコンパクトな潜在相互作用ポリシーである。
自己教師付きマスク付き軌道予測を通じて表現を学習する。
SLIMは、より少ないパラメータで、大規模なVLAとワールドアクションモデルベースラインとを一致または超える。
- 参考スコア(独自算出の注目度): 35.54319311306262
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language-action policies rely on large multimodal backbones to jointly perform perception, language conditioning, and action generation at every control step. Much of this capacity supports open-domain semantics, whereas continuous robot manipulation primarily requires compact representations of observations, actions, and the transitions induced by actions. Pixel-level world models provide another route, but predicting visual details irrelevant to control can be unnecessarily expensive. We propose SLIM (Self-supervised Latent Interaction Model), a compact 0.5B-parameter latent interaction policy. SLIM learns action-grounded predictive latents that capture both action-conditioned future transitions and the actions that explain observed changes. SLIM learns these representations through self-supervised masked trajectory prediction, combining action reconstruction with future-latent prediction. A compact Mixture-of-Transformers (MoT) backbone models interactions between observation latents and action tokens. The resulting policy is trained with flow matching for language-conditioned action generation. Across simulation benchmarks and real-world evaluation, SLIM matches or exceeds representative large-scale VLA and world-action-model baselines with fewer parameters, no additional embodied pretraining, lower inference latency, and substantially lower GPU memory usage.
- Abstract(参考訳): 視覚言語アクションポリシーは、制御ステップ毎に認識、言語条件付け、アクション生成を共同で行うために、大きなマルチモーダルバックボーンに依存している。
この能力の多くはオープンドメインのセマンティクスをサポートしているが、連続的なロボット操作は観察、行動、行動によって引き起こされる遷移のコンパクトな表現を必要とする。
ピクセルレベルの世界モデルは、別のルートを提供するが、制御に関係のない視覚的詳細を予測することは、必要以上にコストがかかる。
本稿では,コンパクトな0.5Bパラメトリック潜時インタラクションポリシーであるSLIMを提案する。
SLIMは、アクション条件付き将来の遷移と観察された変化を説明するアクションの両方をキャプチャするアクション基底予測潜時を学習する。
SLIMは自己教師付きマスク付き軌道予測によりこれらの表現を学習し、動作再構成と将来の遅延予測を組み合わせる。
コンパクトなMixture-of-Transformers (MoT) バックボーンは、観測潜時とアクショントークン間の相互作用をモデル化する。
結果として得られるポリシーは、言語条件のアクション生成のためのフローマッチングによって訓練される。
シミュレーションベンチマークと実世界の評価を通じて、SLIMは大規模なVLAとワールドアクションモデルベースラインに、パラメータが少ないこと、追加の実施前トレーニング、推論レイテンシの低減、GPUメモリ使用率の大幅な低下をマッチさせる。
関連論文リスト
- WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression [24.010807495676605]
生成的世界モデルは、相互作用の下で世界がどのように進化するかの予測モデルを提供する。
WALL-SSは,スケールワイドの自己回帰スケーリングによって視覚的未来を生成する世界モデルである。
We show that WALL-SS improves action following and trajectory accuracy, support coherent minute-long streaming rollout under bounded memory, and consistent benefit of on-policy alignment。
論文 参考訳(メタデータ) (2026-08-26T17:57:12Z) - Overcoming Statistical Bias in Action-Controllable World Models [18.890337378174678]
アクション条件付き世界モデルは、エージェントのアクションの下で視覚環境がどのように進化するかを予測することを目的としている。
将来のフレームは、しばしば視覚的慣性や反復的な動きパターンから非常に予測可能である。
アクション制御性を高めるために,CoCoという対実整合性フレームワークを紹介した。
論文 参考訳(メタデータ) (2026-08-05T10:10:36Z) - ABot-M0.5: Unified Mobility-and-Manipulation World Action Model [27.262271208923995]
ABot-M0.5は、モバイル操作には時間的粒度、アクションスペース、列車-テスト整合性の3段階のアライメントが必要であるという洞察に基づいて構築されている。
モバイルおよびきめ細かい操作ベンチマークの実験により、ABot-M0.5は、長距離タスクの成功ときめ細かい制御精度の両方において最先端の性能を達成することが示された。
論文 参考訳(メタデータ) (2026-07-01T09:21:20Z) - Sensorimotor World Models: Perception for Action via Inverse Dynamics [59.121736411156384]
Inverse dynamics regularization で訓練されたエンド・ツー・エンドのセンサモレータ・ワールドモデルを導入する。
表現の崩壊を防ぎ、アクション整列表現を誘導する。
コンパクトで解釈可能な潜在空間を学習し、単純な2Dおよび3D制御タスク間の競合計画性能を実現する。
論文 参考訳(メタデータ) (2026-06-18T11:25:16Z) - From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation [88.39072412680633]
将来の映像を実行可能な表現に変換する制御指向インタフェースであるMoLAを提案する。
我々は,シミュレーションベンチマークと実世界のロボット操作タスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2026-05-12T14:15:16Z) - LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning [51.969318585152116]
LatentPilotは、トレーニング中の将来の観察を貴重なデータソースとして利用して、アクション条件付きビジュアルダイナミクスを学習する。
そこで本稿では,フライホイール方式のトレーニング機構を提案する。これは,道路上の軌道を反復的に収集し,エージェントの行動分布に適合するようにモデルを再訓練する。
R2R-CE、RxR-CE、R2R-PEベンチマークの実験では新たなSOTA結果が得られた。
論文 参考訳(メタデータ) (2026-03-31T02:21:59Z) - Drift No More? Context Equilibria in Multi-Turn LLM Interactions [58.69551510148673]
コンテキストドリフト(Contexts drift)とは、ターン間のゴール一貫性のある振る舞いからモデルが出力する出力の段階的なばらつきである。
シングルターンエラーとは異なり、ドリフトは時間的に展開し、静的な評価指標では捉えにくい。
マルチターンドリフトは、避けられない崩壊というよりも、制御可能な平衡現象として理解できることを示す。
論文 参考訳(メタデータ) (2025-10-09T04:48:49Z) - FLARE: Robot Learning with Implicit World Modeling [87.81846091038676]
$textbfFLARE$は、予測潜在世界モデリングをロボットポリシー学習に統合する。
$textbfFLARE$は最先端のパフォーマンスを実現し、これまでのポリシー学習のベースラインを最大26%上回っている。
この結果は、暗黙の世界モデリングと高周波ロボット制御を組み合わせた汎用的でスケーラブルなアプローチとして$textbfFLARE$を確立した。
論文 参考訳(メタデータ) (2025-05-21T15:33:27Z) - Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy [73.75271615101754]
本稿では,Transformerアーキテクチャを活用した拡張性のあるフレームワークであるDitaについて紹介する。
Ditaはコンテキスト内コンディショニング(context conditioning)を採用しており、歴史的観察から生の視覚トークンと識別されたアクションをきめ細やかなアライメントを可能にする。
Ditaは、さまざまなカメラパースペクティブ、観察シーン、タスク、アクションスペースの横断的なデータセットを効果的に統合する。
論文 参考訳(メタデータ) (2025-03-25T15:19:56Z) - Diffusion Transformer Policy [48.50988753948537]
本稿では,拡散変圧器ポリシー(Diffusion Transformer Policy)と呼ばれる多モード拡散変圧器を提案し,連続的なエンドエフェクタ動作をモデル化する。
トランスのスケーリング機能を活用することで、提案手法は、多種多様なロボットデータセットにわたる継続的エンドエフェクタアクションを効果的にモデル化することができる。
論文 参考訳(メタデータ) (2024-10-21T12:43:54Z) - ManipLLM: Embodied Multimodal Large Language Model for Object-Centric
Robotic Manipulation [22.071450379253235]
MLLM(Multimodal Large Language Models)の頑健な推論機能を活用したロボット操作のための革新的なアプローチを提案する。
インジェクトアダプタの微調整により,MLLMの固有共通感覚と推論能力を保ちながら,操作能力も備えている。
シミュレータと実世界の実験は,ManipLLMの有望な性能を示している。
論文 参考訳(メタデータ) (2023-12-24T06:38:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。