論文の概要: LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding
- arxiv url: http://arxiv.org/abs/2608.07596v1
- Date: Thu, 06 Aug 2026 08:12:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.453225
- Title: LIRA: Local Cross-Layer Information Routing for Vision-Language-Action Decoding
- Title(参考訳): LIRA: Vision-Language-Action Decodingのためのローカルクロスレイ情報ルーティング
- Abstract要約: Vision-Language-Action (VLA)モデルは、事前訓練された視覚言語モデル(VLM)からロボットアクションに変換する。
既存の設計では、表現階層の狭い部分のみを公開するか、それぞれのデコーダブロックを1つのVLM層に厳密にマッチさせる。
我々は、深度情報ルーティングとしてVLM-to-action条件を定式化するローカルなクロスレイヤアクションコンディショニング機構であるLIRAを紹介する。
- 参考スコア(独自算出の注目度): 22.722295179202604
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-Language-Action (VLA) models transform representations from pretrained vision-language models (VLMs) into robot actions, yet the interface that routes intermediate VLM features into action decoders remains underexplored. Existing designs either expose only a narrow part of the representation hierarchy or rigidly match each decoder block to one VLM layer, restricting access to complementary task evidence across depths. We introduce LIRA, a local cross-layer action-conditioning mechanism that formulates VLM-to-action conditioning as depth-aware information routing. LIRA operates on task-token features and LIRA Query features derived from intermediate VLM states, then assigns each Parallel Fusion Block a depth-aligned local window centered on its corresponding VLM layer. Parallel Fusion Blocks aggregate neighboring LIRA Query features and integrate them with task-token features and proprioceptive inputs before action prediction. This routing interface leaves the backbone architecture, action decoder, and supervised training recipe unchanged. Across LIBERO, LIBERO-Plus, CALVIN ABC$\rightarrow$D, and real-world manipulation, LIRA improves the principal aggregate metrics over the VLA-Adapter baseline under the same 0.5B-parameter configuration. In zero-shot transfer to LIBERO-Plus, LIRA increases average success from 59.1% to 78.0%, an 18.9-point gain indicating improved robustness under controlled distribution shifts.
- Abstract(参考訳): VLA(Vision-Language-Action)モデルは、事前訓練された視覚言語モデル(VLM)からロボットアクションへと表現を変換するが、中間的なVLM機能をアクションデコーダにルーティングするインタフェースはまだ未定である。
既存の設計では、表現階層の狭い部分のみを公開するか、各デコーダブロックを1つのVLM層に厳密にマッチさせ、深い範囲で補完的なタスクエビデンスへのアクセスを制限する。
我々は、深度情報ルーティングとしてVLM-to-action条件を定式化するローカルなクロスレイヤアクションコンディショニング機構であるLIRAを紹介する。
LIRAは、中間VLM状態から派生したタスクトーケン機能とLIRAクエリ機能で動作し、各Parallel Fusion Blockに、対応するVLM層を中心とした深さ整列ローカルウィンドウを割り当てる。
Parallel Fusion Blocksは、近隣のLIRA Query機能を集約し、アクション予測の前にタスクトーケン機能やプロプリセプティブインプットと統合する。
このルーティングインターフェースは、バックボーンアーキテクチャ、アクションデコーダ、教師付きトレーニングレシピをそのまま残している。
LIBERO、LIBERO-Plus、CALVIN ABC$\rightarrow$D、および実世界の操作において、LIRAは同じ0.5Bパラメータ構成の下でVLA-Adapterベースライン上の主集合メトリクスを改善している。
LIBERO-Plusへのゼロショット転送では、LIRAは平均的な成功率を59.1%から78.0%に引き上げる。
関連論文リスト
- LayerRoute: Action-Conditioned Mixture-of-Layers Routing for Vision-Language-Action Policies [13.829774140685545]
VLA(Vision-Language-Action)ポリシは、事前訓練された視覚言語計算モデル(VLM)を利用して、ロボット制御のためのアクション生成をガイドする。
動作条件付き表現ルーティングインタフェースであるLayerRouteを導入し、VLM層やアクション表現への適応的なアクセスを可能にする。
論文 参考訳(メタデータ) (2026-09-05T13:13:07Z) - CLAP: Direct VLM-to-VLA Adaptation via Language-Action Grounding [16.03159066719039]
CLAP(Causal Language-Action Prediction)は、自然言語アクション記述で各数値アクションシーケンスをプリペイドする。
CLAP は 0.8B, 2B, 4B で,単一の VLM 系統からオープンウェイトでマルチスケールのコンパクト VLA ファミリとしてリリースする。
論文 参考訳(メタデータ) (2026-07-09T22:34:11Z) - EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training [36.75413663296722]
視覚言語モデル(VLA)は視覚言語モデル(VLM)から視覚的・言語的能力を継承する
ほとんどのVLAは、エンボディドメインに適応せず、下流のパフォーマンスを制限した既製のVLMで構築されている。
本稿では,VLMとVLAのギャップを埋めるために,EmbodiedMidtrainを提案する。
論文 参考訳(メタデータ) (2026-04-21T21:40:58Z) - Fast-dVLM: Efficient Block-Diffusion VLM via Direct Conversion from Autoregressive VLM [58.322826487307765]
我々は,KV-cache互換並列デコードと推測ブロックデコードが可能なブロック拡散型VLMであるFast-dVLMを提案する。
SGLangの統合とFP8量子化により、Fast-dVLMはARベースライン上でのエンドツーエンドの推論速度を6倍以上に向上する。
論文 参考訳(メタデータ) (2026-04-08T08:50:08Z) - CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning [79.07656918674684]
CoME-VLは、対照的に訓練された視覚エンコーダと自己教師型DINOエンコーダを統合するモジュラーフュージョンフレームワークである。
提案手法は,RefCOCOのベースライン上での精度を高いマージンで向上させながら,検出のための最先端性能を実現する。
論文 参考訳(メタデータ) (2026-04-03T17:59:51Z) - Routing without Forgetting [20.60324059904291]
変換器における連続学習をルーティング問題として再放送する。
タスク固有のプロンプトを格納またはマージする代わりに、RwFはシングルステップの連想検索を通じて動的プロンプトを生成する。
Split-ImageNet-R と Split-ImageNet-S では、RwF は数ショットの学習システムであっても、事前のプロンプトベースのアプローチよりも大きなマージンでパフォーマンスを向上している。
論文 参考訳(メタデータ) (2026-03-10T12:23:46Z) - RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation [104.68774434699158]
RoboInter Manipulation Suiteはデータ、ベンチマーク、中間表現のモデルを含む統一されたリソースである。
多様な表現の半自動アノテーションを可能にする軽量GUIであるRoboInter-Toolと、571の多様なシーンにわたる230万回以上のエピソードを含む大規模なデータセットであるRoboInter-Dataで構成されている。
RoboInter-VLAは、モジュールとエンドツーエンドのVLAバリアントをサポートする、統合されたプラン-then-executeフレームワークを提供する。
論文 参考訳(メタデータ) (2026-02-10T17:01:54Z) - Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs [88.68484904214142]
Patch-as-Decodable Token (PaDT)を導入し、テキストと多様な視覚出力を生成する。
PaDTの中心は、クエリイメージのビジュアルパッチ埋め込みから派生したVisual Reference Tokens (VRT)である。
MLLMモデルと比較しても,PaDTは最先端の性能を一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-10-02T12:23:57Z) - Vision Function Layer in Multimodal LLMs [70.42157905484765]
本研究では,マルチモーダル大言語モデル(MLLM)において,視覚関連関数デコーディングが異なるデコーダ層に分散していることを明らかにする。
Visual Token Swappingは、ターゲットのKVキャッシュエントリを変更して、デコード中の層固有の機能を正確に解明する。
本研究は、MLLM視覚処理をより深く理解し、より効率的で解釈可能で堅牢なモデルの作成を促進する。
論文 参考訳(メタデータ) (2025-09-29T13:45:35Z) - Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies [62.653984010274485]
VLA(Vision-Language-Action)モデルは、画像や命令をロボットアクションにマッピングするために、大きな視覚言語バックボーンを適応させる。
prevailingAsは、固定された左から右への順序で自動回帰的にアクションを生成するか、バックボーンの外側で分離または拡散ヘッドをアタッチする。
本稿では離散拡散を伴う離散化作用チャンクをモデル化する統一変換器ポリシである離散拡散VLAを提案する。
論文 参考訳(メタデータ) (2025-08-27T17:39:11Z) - Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning [5.85033069870214]
動的埋め込みと階層型視覚特徴の融合に基づく効率的な視覚言語微調整法を提案する。
少数のパラメータのみを微調整することで、DEHVFはクロスモーダル情報の正確なアライメントと補完を実現する。
論文 参考訳(メタデータ) (2025-08-25T03:57:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。