論文の概要: FabriVLA: A Lightweight Vision-Language-Action Model for Precise Multi-Task Manipulation
- arxiv url: http://arxiv.org/abs/2607.08575v2
- Date: Fri, 10 Jul 2026 02:28:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.410769
- Title: FabriVLA: A Lightweight Vision-Language-Action Model for Precise Multi-Task Manipulation
- Title(参考訳): FabriVLA: 高精度マルチタスク操作のための軽量ビジョンランゲージ・アクションモデル
- Authors: Shiyuan Yang, Borong Zhang, Jizheng Zhang, Zhijia Tao, Junfei Guo, Donglai Ran, Xu Bian, Qingbiao Li,
- Abstract要約: 本稿では,FabriVLAを提案する。
Meta-World MT50ベンチマークでは、50種類の操作タスクにまたがって、FabriVLAの平均的な成功率は90.0%に達した。
- 参考スコア(独自算出の注目度): 5.328444469283032
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: We present FabriVLA, a lightweight Vision-Language-Action model for Precise Multi-Task Manipulation. FabriVLA combines an InternVL3.5 vision-language backbone with a flow-matching action head featuring gated self-attention across action tokens and shallow VLM layer fusion for enriched spatial context. The model is trained via single stage joint optimization from a pretrained VLM and randomly initialized action head. On the Meta-World MT50 benchmark spanning 50 diverse manipulation tasks, FabriVLA achieves a tier-average success rate of 90.0%, demonstrating that a compact VLA built on a 1B scale VLM can achieve strong performance without relying on multi billion parameter VLA backbones.
- Abstract(参考訳): 本稿では,FabriVLAを提案する。
FabriVLAは、インターンVL3.5視覚言語バックボーンと、アクショントークン間のゲート自己アテンションと、豊富な空間コンテキストのための浅いVLM層融合を備えたフローマッチングアクションヘッドを組み合わせる。
モデルは、事前訓練されたVLMとランダムに初期化されたアクションヘッドから、単一ステージのジョイント最適化によって訓練される。
Meta-World MT50ベンチマークにおいて、FabriVLAは1BスケールのVLM上に構築されたコンパクトなVLAが、数十億のパラメータのVLAバックボーンに頼ることなく、強力なパフォーマンスを達成できることを示した。
関連論文リスト
- VITAL: Vision-Encoder-centered Pre-training for LMMs in Visual Quality Assessment [88.83260031198023]
本稿では,視覚エンコーダを中心とした生成事前学習パイプラインを提案し,VITAL-Series LMMを開発した。
これまでで最大のVQualAトレーニングデータセットである、450万以上の視覚言語(VL)ペアを構築した。
モデルの定量的スコアリング精度を同時に向上するマルチタスクトレーニングワークフローを採用している。
論文 参考訳(メタデータ) (2025-11-22T07:55:21Z) - InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation [43.83789393525928]
InstructVLAは、大規模な視覚言語モデル(VLM)の柔軟な推論を保存し、主要な操作性能を提供するエンド・ツー・エンドの視覚言語モデルである。
InstructVLAは、新しいトレーニングパラダイムであるVision-Language-Action Instruction Tuning (VLA-IT)を導入している。
ドメイン内のSimplerEnvタスクでは、InstructVLAはSpatialVLAよりも30.5%改善されている。
論文 参考訳(メタデータ) (2025-07-23T13:57:06Z) - VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models [84.84277196012907]
VLsI: Verbalized Layers-to-Interactions, a new VLM family in 2B and 7B model size。
GPT-4Vよりも優れた性能向上(2Bは11.0%、7Bは17.4%)を達成した。
論文 参考訳(メタデータ) (2024-12-02T18:58:25Z) - Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance [78.48606021719206]
Mini-InternVL は 1B から 4B までのパラメータを持つ一連の MLLM であり、パラメータの 5% しか持たない性能の90% を達成している。
我々は,ダウンストリームタスクにおける特化モデルの転送と性能向上を可能にする,Mini-InternVLの統一適応フレームワークを開発した。
論文 参考訳(メタデータ) (2024-10-21T17:58:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。