論文の概要: FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling
- arxiv url: http://arxiv.org/abs/2607.29596v1
- Date: Fri, 31 Jul 2026 16:23:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.796181
- Title: FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling
- Title(参考訳): FibVLA:フィボナッチサンプリングを用いた高能率時間視-言語-反応モデル
- Abstract要約: 視覚言語-アクションモデル(VLA)は、物理世界のアクションを推測するためにマルチモーダル情報の認識を利用する。
本稿では、長いコンテキスト履歴の時間的知覚を特徴とする効率的なフレームワークFibVLAを紹介する。
実験により、FibVLAは大規模な視覚エンコーダを再訓練することなく、動作のスムーズさと成功率を大幅に改善することが示された。
- 参考スコア(独自算出の注目度): 11.3018332690505
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-language-action models (VLAs), which leverage the cognition of multimodal information to infer physical-world actions, provide a generalized solution for embodied AI applications. Conventional VLAs usually concentrate on current digital cognition. While some efforts are made to enhance VLAs' reasoning capabilities by capturing temporal information, encoding the long-context history causes an efficiency-decreasing issue. To reconcile the conflict between capturing temporal information and maintaining inference efficiency in VLAs, this paper introduces FibVLA, an efficient framework featuring temporal perception of long-context history. Specifically, we leverage logarithmic hindsight sampling to both proprioceptive states and visual frames to capture long-term temporal dependencies with minimal redundancy. For the action expert, we introduce the flow matching to produce action distributions, and the Fibonacci recurrent inference strategy to generate long-range planning steps based on real-time closed-loop feedback. Experiments demonstrate that FibVLA significantly improves action smoothness and success rates without retraining large-scale visual encoders. Efficiency analysis demonstrates superior real-time responsiveness compared to video-based baselines in real-world evaluations.
- Abstract(参考訳): 視覚言語アクションモデル(VLA)は、マルチモーダル情報の認識を利用して物理世界のアクションを推論し、具体化されたAIアプリケーションのための一般化されたソリューションを提供する。
従来のVLAは通常、現在のデジタル認知に集中する。
時間的情報を取得することでVLAの推論能力を向上する試みもあるが、長いコンテキスト履歴を符号化すると効率が低下する。
本稿では,VLAにおける時間的情報収集と推論効率の相違を解消するために,長いコンテキスト履歴の時間的知覚を特徴とする効率的なフレームワークであるFibVLAを提案する。
具体的には,対数的後向きサンプリングを主観的状態と視覚的フレームの両方に利用し,長期的時間的依存を最小限の冗長性で捉える。
アクションエキスパートに対しては,アクション分布を生成するためのフローマッチングと,リアルタイム閉ループフィードバックに基づく長距離計画ステップを生成するためのFibonacci繰り返し推論戦略を導入する。
実験により、FibVLAは大規模な視覚エンコーダを再訓練することなく、動作のスムーズさと成功率を大幅に改善することが示された。
実世界の評価において, 映像ベースラインと比較して, 実時間応答性が優れていることを示す。
関連論文リスト
- LoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action Models [13.30873593845724]
LoopVLAは、表現の洗練、アクション予測、十分性推定を学習する、リカレントなVision-Language-Actionアーキテクチャである。
この結果から,LoopVLAはVLAポリシーの効率性向上のフロンティアを推し進め,パラメータを45%削減し,推論スループットを最大1.7倍向上させることを示した。
論文 参考訳(メタデータ) (2026-05-11T03:51:22Z) - Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs [66.15429821530503]
Persistent Visual Memoryは、ビジュアルエビデンスへの持続的でオンデマンドアクセスを強化するために設計された、軽量の学習可能なモジュールである。
Qwen3-VLモデルの実験は、PVMが無視可能なパラメータオーバーヘッドで顕著な改善をもたらすことを示した。
詳細な分析により、PVMはより長い世代で堅牢性が向上し、内部予測収束が加速することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-01T17:54:37Z) - Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models [65.4947731385794]
基礎画像中心モデルであるInsight-Vから進化した統合多エージェント視覚推論フレームワークを提案する。
空間的時間的推論を強化し、評価ロバスト性を向上させる2つの新しいアルゴリズムST-GRPOとJ-GRPOを導入する。
LLaVA-NeXTやQwen2.5-VLといったベースモデルの実験は、挑戦的な画像とビデオの推論ベンチマーク間で大きなパフォーマンス向上を示している。
論文 参考訳(メタデータ) (2026-03-18T15:28:07Z) - Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models [69.58413440457828]
VLA(Vision-Language-Action)モデルは、チェーン・オブ・思想(CoT)推論の恩恵を受けるが、既存のアプローチでは高い推論オーバーヘッドが生じる。
本稿では,マルチモーダル CoT 推論を具体化するための連続潜時表現に内包する統合 VLA フレームワークである Latent Reasoning VLA (textbfLaRA-VLA) を提案する。
論文 参考訳(メタデータ) (2026-02-01T11:34:37Z) - AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation [21.23747444669735]
VLAモデル(AC2-VLA)に対するアクションコンテキスト対応適応計算を提案する。
AC2-VLAは、タイムステップ間の認識再利用、トークンプルーニング、統一メカニズム内のモデルコンポーネントの選択的な実行を適応的に行う。
ロボット操作ベンチマークの実験では、AC2-VLAはFLOPを29.4%まで減らし、最大1.79倍のスピードアップを達成した。
論文 参考訳(メタデータ) (2026-01-27T14:10:39Z) - HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models [39.350965975615104]
HiF-VLAは、双方向の時間的推論に動きを利用する統一的なフレームワークである。
過去のダイナミクスを後見の先行を通してエンコードし、前見の推論を通して将来の動きを予測し、後見の変調された共同専門家を通して統合する。
現実世界の長距離操作タスクにおいて大幅な改善を実現し、実用的なロボット設定においてその幅広い効果を実証している。
論文 参考訳(メタデータ) (2025-12-10T18:59:32Z) - FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization [61.10456021136654]
本稿では,効率的で汎用的なロボット学習のための統合フレームワークであるFASTerを紹介する。
FASTerVQは、アクションチャンクをシングルチャネルイメージとしてエンコードし、高い圧縮比を維持しながら、グローバルな時間的依存関係をキャプチャする。
FASTerVLAはブロックワイドの自動回帰デコーディングと軽量アクションエキスパートを備えたトークンライザ上に構築されており、推論の高速化とタスクパフォーマンスの向上を実現している。
論文 参考訳(メタデータ) (2025-12-04T16:21:38Z) - ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context [54.58057019521198]
時間的コンテキストを活用することは、部分的に観察可能なロボットタスクの成功に不可欠である。
動作のクローン化に関する以前の研究は、複数フレームの観測で不整合のパフォーマンス向上を示した。
マルチフレーム観測を効果的に活用することにより、ロボットタスクのパフォーマンスを堅牢に向上するポリシーモデルであるContextVLAを紹介する。
論文 参考訳(メタデータ) (2025-10-05T15:29:57Z) - CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling [84.51372201195132]
CronusVLAは、単一フレームのVLAモデルをマルチフレームパラダイムに拡張する統合フレームワークである。
CronusVLAは70.9%の成功率で先進的な性能と優れた堅牢性を達成する。
これらの結果は、より強力で堅牢な実世界展開のためのVLAモデルにおける効率的なマルチフレーム適応の可能性を強調している。
論文 参考訳(メタデータ) (2025-06-24T17:30:27Z) - Perceiver-VL: Efficient Vision-and-Language Modeling with Iterative
Latent Attention [100.81495948184649]
本稿では,長いビデオやテキストなどの高次元マルチモーダル入力を効率的に処理する視覚・言語フレームワークPerceiver-VLを提案する。
我々のフレームワークは、多くの最先端のトランスフォーマーベースモデルで使用される自己注意の二次的な複雑さとは対照的に、線形複雑性でスケールする。
論文 参考訳(メタデータ) (2022-11-21T18:22:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。