論文の概要: Habilis-$β$: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model
- arxiv url: http://arxiv.org/abs/2602.18813v1
- Date: Sat, 21 Feb 2026 12:15:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-02-24 17:42:02.329482
- Title: Habilis-$β$: A Fast-Motion and Long-Lasting On-Device Vision-Language-Action Model
- Title(参考訳): Habilis-$β$: 高速かつ長時間のオンデバイスビジョン・ランゲージ・アクションモデル
- Abstract要約: Habilis-$は、現実のデプロイメント用に設計された、デバイス上での高速かつ長期間のビジョン言語アクション(VLA)モデルである。
本稿では,Productivity-Reliability Plane (PRP)を導入し,時間ごとのタスク(TPH)とMTBI(Mean Time Between Intervention)を連続実行プロトコルで評価する。
1時間の連続実行評価では、Habilis-$は、シミュレーションと実環境の両方で$_0.5$に対して、RPPメトリクスで強いパフォーマンスを達成する。
- 参考スコア(独自算出の注目度): 24.23805196139948
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce Habilis-$β$, a fast-motion and long-lasting on-device vision-language-action (VLA) model designed for real-world deployment. Current VLA evaluation remains largely confined to single-trial success rates under curated resets, which fails to capture the fast-motion and long-lasting capabilities essential for practical operation. To address this, we introduce the Productivity-Reliability Plane (PRP), which evaluates performance through Tasks per Hour (TPH) and Mean Time Between Intervention (MTBI) under a continuous-run protocol that demands both high-speed execution and sustained robustness. Habilis-$β$ achieves high performance by integrating language-free pre-training on large-scale play data for robust interaction priors with post-training on cyclic task demonstrations that capture state drift across consecutive task iterations. The system further employs ESPADA for phase-adaptive motion shaping to accelerate free-space transit, utilizes rectified-flow distillation to enable high-frequency control on edge devices, and incorporates classifier-free guidance (CFG) as a deployment-time knob to dynamically balance instruction adherence and learned interaction priors. In 1-hour continuous-run evaluations, Habilis-$β$ achieves strong performance under the PRP metrics, compared to $π_{0.5}$ in both simulation and real-world environments. In simulation, Habilis-$β$ achieves 572.6 TPH and 39.2 s MTBI (vs. 120.5 TPH and 30.5 s for $π_{0.5}$), while in a real-world humanoid logistics workflow it achieves 124 TPH and 137.4 s MTBI (vs. 19 TPH and 46.1 s for $π_{0.5}$). Finally, Habilis-$β$ achieves the highest reported performance on the standard RoboTwin 2.0 leaderboard across representative tasks, validating its effectiveness in complex manipulation scenarios.
- Abstract(参考訳): 実世界展開用に設計された,高速かつ長時間のデバイス上での視覚-言語-アクション(VLA)モデルであるHabilis-$β$を紹介する。
現在のVLA評価は、未熟なリセット下での単心室成功率に限られており、実用運用に必要な速さと長期の能力の獲得に失敗している。
これを解決するために、高速実行と持続ロバスト性の両方を必要とする連続実行プロトコルの下で、TPH(Tasks per Hour)とMTBI(Mean Time Between Intervention)によるパフォーマンス評価を行うProductivity-Reliability Plane (PRP)を導入する。
Habilis-$β$は、連続したタスクイテレーション間の状態ドリフトをキャプチャするサイクリックタスクデモの後のトレーニングと、ロバストな相互作用に先立って、大規模プレイデータに言語フリーの事前トレーニングを統合することで、高いパフォーマンスを実現する。
このシステムは、位相適応型モーションシェーピングにESPADAを使用し、自由空間移動を加速し、整流蒸留を利用してエッジデバイス上での高周波制御を可能にし、分類器フリーガイダンス(CFG)をデプロイ時ノブとして組み込んで、命令の順守と学習前の相互作用を動的にバランスさせる。
1時間の連続実行評価では、Habilis-$β$は、シミュレーションと実環境の両方で$π_{0.5}$と比較して、RPPの指標の下で強い性能を達成する。
シミュレーションでは、Habilis-$β$ は 572.6 TPH と 39.2 s MTBI (vs. 120.5 TPH と 30.5 s for $π_{0.5}$) を達成するが、現実のヒューマノイドのロジスティクスワークフローでは 124 TPH と 137.4 s MTBI (vs. 19 TPH と 46.1 s for $π_{0.5}$) を達成する。
最後に、Habilis-$β$は、代表的なタスクで標準のRoboTwin 2.0のリーダーボード上で報告された最高のパフォーマンスを達成し、複雑な操作シナリオにおけるその効果を検証する。
関連論文リスト
- StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models [84.17128030384099]
StreamPIはストリーミングマルチモーダル時間モデリングフレームワークである。
追加パラメータを導入することなく、単一フレームのVLAに時間的推論能力を持たせる。
メモリ依存および正確な認識シナリオにまたがる実ロボットタスクの実験とシミュレーションベンチマークのLIBEROは、StreamPIが様々なタスクでpi0.5より優れていることを示した。
論文 参考訳(メタデータ) (2026-08-26T17:33:19Z) - FutureRTC: Real-Time Robot Execution with Anticipatory-Conditioned Action Chunking [51.97839311685636]
FutureRTCは、実行時の観察と非同期VLA制御の状態を予測するためのプラグイン・アンド・プレイ適応フレームワークである。
FutureRTCは推論遅延に対する堅牢性を実現し,よりスムーズな軌道,高速な実行,一貫したタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-07-27T05:10:16Z) - Hy-Embodied-VLM-1.0: Efficient Physical-World Agents [60.26641387128157]
Hy-Embodied-VLM-1.0は、エンボディエージェントの効率的で強力なエンボディド基礎モデルである。
我々はHy3-A3B言語バックボーンとHy3-ViT2ビジョンエンコーダのモデルを構築した。
我々は,Hy-Embodied-VLM-1.0を,具体的知覚,物理世界理解,具体的推論を含む38のベンチマークスイートで評価した。
論文 参考訳(メタデータ) (2026-07-14T15:34:17Z) - PIER-Flow: Physics-Informed Efficient Rectified Flow for Real-Time Mobile Robot Navigation [10.164953732323463]
PIER-Flowは移動ロボットのための軽量ナビゲーションポリシーである。
98.85%の成功率とゼロ衝突を達成し、平均値は$sim$1.29 msである。
論文 参考訳(メタデータ) (2026-07-11T12:34:28Z) - LiquidTAD: Efficient Temporal Action Detection via Parallel Liquid-Inspired Temporal Relaxation [2.3837169660687123]
LiquidTADは、液体神経力学以前の指数緩和を並列時間演算子に蒸留するフレームワークである。
LiquidTADは、モデルフットプリントを大幅に低下させながら、強力なベースラインと競合する精度を達成する。
論文 参考訳(メタデータ) (2026-04-20T13:48:17Z) - A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model [112.9420001646428]
VLA(Vision-Language-Action)モデルは、オープンワールドロボット操作の強力なパラダイムとして登場したが、実際の展開はコストに制約されることが多い。
我々は、低コストで高スループットな推論のために設計された、完全にオープンソースで透明なVLAフレームワークであるA1を提示する。
A1は最先端の成功率を達成すると同時に、推論コストを大幅に削減する。
論文 参考訳(メタデータ) (2026-04-07T10:18:40Z) - ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models [12.232846303286161]
近年,フローマッチング (FM) アクションヘッドを搭載したビジョン・ランゲージ・アクション (VLA) モデルは,複雑なロボット操作において最先端の性能を実現する。
現在の加速はビジョン・ランゲージ・モデル(VLM)のバックボーンを最適化しているが、アクションヘッドのボトルネックは見落としている。
本稿では,継続的ロボット制御のためのトレーニング不要適応推論フレームワークProbeFlowを提案する。
論文 参考訳(メタデータ) (2026-03-18T15:38:29Z) - Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward [11.066720921275648]
視覚言語アクション(VLA)モデルは、ロボット操作に非常に有望である。
厳格な産業用ロボットへの展開は、コンプライアンスと応答性の本質的にのトレードオフのため、依然として困難である。
本稿では、このトレードオフを解決するために、速度フィードフォワード項をVLAポリシーに統合することの重要性を示す。
論文 参考訳(メタデータ) (2026-03-17T07:50:00Z) - One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies [18.743330791557522]
ワンステップフローポリシー (One-Step Flow Policy, OFP) は、教師の訓練を受けずに高忠実でシングルステップのアクション生成を行うための自己蒸留フレームワークである。
56の多様なシミュレートされた操作タスクに対する評価は、一段階のOFPが最先端の結果を達成することを示す。
論文 参考訳(メタデータ) (2026-03-12T21:58:12Z) - RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation [68.7948300643741]
ロボットの異常検出と介入をリアルタイムに監視するロボット・コンディションド・ノーマライゼーション・フロー(RC-NF)を提案する。
RC-NFは、正規化フロー内のタスク認識ロボットとオブジェクト状態の処理を分離する。
従来のロボットタスクの監視方法と比較して、あらゆる異常なタイプで最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-11T10:14:37Z) - Le-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder Design [72.55935017828891]
我々は Le-DETR (textbfLow- Cost and textbfEfficient textbfDEtection textbfTRansformer) を提案する。
ImageNet1KとCOCO 2017トレーニングデータセットのみを使用して、リアルタイム検出で新しいtextbfSOTAを実現する。
YOLOv12-L/X を textbf+0.6/-0.1 mAP で上回り、同様の速度と textbf+20% のスピードアップを実現している。
論文 参考訳(メタデータ) (2026-02-24T15:29:55Z) - Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation [95.89924101984566]
GPM(Global Prior Memory)とLCM(Local Consistency Memory)を備えたデュアルメモリVLAフレームワークOptimusVLAを紹介する。
GPMはガウスノイズを意味論的に類似した軌道から取得したタスクレベルの先行値に置き換える。
LCMは、時間的コヒーレンスと軌道の滑らかさを強制する学習された一貫性制約を注入する。
論文 参考訳(メタデータ) (2026-02-22T15:39:34Z) - ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation [72.78362530982109]
ARTIS(Agenic Risk-Aware Test-Time Scaling via Iterative Simulation)は、コミットメントから探索を分離するフレームワークである。
LLMをベースとした簡易シミュレータは, 希少かつ高インパクトな障害モードの捕捉に苦慮していることを示す。
本稿では,障害発生行動の忠実度を強調するリスク認識ツールシミュレータを提案する。
論文 参考訳(メタデータ) (2026-02-02T06:33:22Z) - YOLO-Master: MOE-Accelerated with Specialized Transformers for Enhanced Real-time Detection [26.013463778761317]
YOLO-Masterは、リアルタイムオブジェクト検出のためのインスタンス条件適応計算を導入する、YOLOライクな新しいフレームワークである。
我々のモデルは1.62msのレイテンシで42.4%のAPを達成し、YOLOv13-Nを+0.8% mAPで上回り、17.8%高速化した。
論文 参考訳(メタデータ) (2025-12-29T07:54:49Z) - FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization [61.10456021136654]
本稿では,効率的で汎用的なロボット学習のための統合フレームワークであるFASTerを紹介する。
FASTerVQは、アクションチャンクをシングルチャネルイメージとしてエンコードし、高い圧縮比を維持しながら、グローバルな時間的依存関係をキャプチャする。
FASTerVLAはブロックワイドの自動回帰デコーディングと軽量アクションエキスパートを備えたトークンライザ上に構築されており、推論の高速化とタスクパフォーマンスの向上を実現している。
論文 参考訳(メタデータ) (2025-12-04T16:21:38Z) - Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach [78.4812458793128]
動作チャンクの高忠実度検証に軽量な擬数推定器を適用したテスト時間スケーリングフレームワークである textbfTACO を提案する。
我々の手法は、オフライン強化学習(RL)における古典的な反探索原理に似ており、勾配のないため、計算上の大きな恩恵をもたらす。
論文 参考訳(メタデータ) (2025-12-02T14:42:54Z) - VFP: Variational Flow-Matching Policy for Multi-Modal Robot Manipulation [3.986404588605909]
可変フローマッチングポリシー(VFP)は、タスクレベルとトラジェクトリレベルの両方のマルチモーダリティをキャプチャするフローマッチングポリシーである。
VFPは、標準的なフローベースベースラインよりもタスク成功率を49%向上させる。
論文 参考訳(メタデータ) (2025-08-03T07:23:02Z) - VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks [49.0793012627959]
本稿では,価値に基づくパラダイム内での推論モデルに適した新しいフレームワークVAPOを提案する。
VAPOは最先端のスコアが$mathbf60.4$に達する。
同じ実験条件下で直接比較すると、VAPOはDeepSeek-R1-Zero-Qwen-32BとDAPOの結果を10点以上上回っている。
論文 参考訳(メタデータ) (2025-04-07T14:21:11Z) - FlowTS: Time Series Generation via Rectified Flow [67.41208519939626]
FlowTSは、確率空間における直線輸送を伴う整流フローを利用するODEベースのモデルである。
非条件設定では、FlowTSは最先端のパフォーマンスを達成し、コンテキストFIDスコアはStockとETThデータセットで0.019と0.011である。
条件設定では、太陽予測において優れた性能を達成している。
論文 参考訳(メタデータ) (2024-11-12T03:03:23Z) - HiRT: Enhancing Robotic Control with Hierarchical Robot Transformers [12.373320641721344]
大型ビジョンランゲージ・アクション(VLA)モデルは、その印象的な一般化能力のためにロボット制御において有望であることが示されている。
数十億のパラメータを持つVLMバックエンドへの依存は、高い計算コストと遅延推定につながる。
本稿では,柔軟な周波数・性能トレードオフを実現する階層型ロボットトランスフォーマフレームワークであるHiRTを提案する。
論文 参考訳(メタデータ) (2024-09-12T09:18:09Z) - Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head [23.472634293569463]
新しいトランスフォーマーベースのリアルタイムOVDモデルは、OmDetやGrounding-DINOで観測されるボトルネックを軽減するために設計された、革新的なEfficient Fusion Head (EFH)モジュールを備えている。
OmDet-Turboは、現在の最先端の教師付きモデルとほぼ同等のパフォーマンスレベルを達成する。
論文 参考訳(メタデータ) (2024-03-11T16:48:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。