論文の概要: LoopVL: Recurrent Visual Intelligence
- arxiv url: http://arxiv.org/abs/2609.38426v1
- Date: Tue, 29 Sep 2026 19:17:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.651471
- Title: LoopVL: Recurrent Visual Intelligence
- Title(参考訳): LoopVL: リカレントビジュアルインテリジェンス
- Abstract要約: LoopVLはModule-LoopとModel-Loopの計算を組み合わせて、共有モジュールを通じて統合された視覚言語状態を更新する。
LoopVLをゼロからトレーニングするには、言語事前学習、マルチモーダルトレーニング、ポストトレーニングが必要です。
ループを横断する視覚的注意の変化を特徴とする、LoopVLにおける視覚的Aha Momentsの観察を行った。
- 参考スコア(独自算出の注目度): 94.9302812425057
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We introduce LoopVL to study whether Loop Transformers can be effectively extended to vision- language models. LoopVL combines Module-Loop and Model-Loop computation to iteratively update a unified vision-language state through shared modules. We train LoopVL from scratch through language pre-training, multimodal training, and post-training. LoopVL outperforms a range of similarly sized and larger non-recurrent models on multimodal understanding and visual reasoning benchmarks. We also observe Visual Aha Moments in LoopVL, characterized by pronounced shifts in visual attention across loops. LoopVL provides practical evidence for recurrent vision-language modeling and offers an intuitive perspective on how shared parameters can support deeper multimodal computation over continuously evolving visual-language states.
- Abstract(参考訳): 本稿では,ループトランスフォーマーを視覚言語モデルに効果的に拡張できるかどうかを検討するためにLoopVLを導入する。
LoopVLはModule-LoopとModel-Loopの計算を組み合わせることで、共有モジュールを通じて統一された視覚言語状態を反復的に更新する。
LoopVLをゼロからトレーニングするには、言語事前学習、マルチモーダルトレーニング、ポストトレーニングが必要です。
LoopVLは、マルチモーダル理解と視覚的推論のベンチマークにおいて、同様の大きさで大規模な非リカレントモデルよりも優れている。
また、ループ間の視覚的注意の変化を特徴とする、LoopVLにおける視覚的Aha Momentsも観察した。
LoopVLは、繰り返し発生する視覚言語モデリングの実践的なエビデンスを提供し、共有パラメータが連続的に進化する視覚言語状態よりも深いマルチモーダル計算をサポートする方法について直感的な視点を提供する。
関連論文リスト
- ContextVLA: Vision-Language-Action Model with Amortized Multi-Frame Context [54.58057019521198]
時間的コンテキストを活用することは、部分的に観察可能なロボットタスクの成功に不可欠である。
動作のクローン化に関する以前の研究は、複数フレームの観測で不整合のパフォーマンス向上を示した。
マルチフレーム観測を効果的に活用することにより、ロボットタスクのパフォーマンスを堅牢に向上するポリシーモデルであるContextVLAを紹介する。
論文 参考訳(メタデータ) (2025-10-05T15:29:57Z) - MindVL: Towards Efficient and Effective Training of Multimodal Large Language Models on Ascend NPUs [20.842336447426682]
MindVLは、Ascend NPUでエンドツーエンドに訓練されたマルチモーダルな大規模言語モデルである。
我々は,安定かつ高性能なトレーニングを支援する,高効率なトレーニングフレームワークであるMindSpeed-MLLMを紹介した。
異なるシーケンス長でトレーニングされたチェックポイントから平均的な重み付けが特に有効であることが判明した。
論文 参考訳(メタデータ) (2025-09-15T08:00:31Z) - Unified Vision-Language-Action Model [86.68814779303429]
我々は、視覚、言語、行動信号を離散トークンシーケンスとして自動回帰モデル化する、統一的でネイティブなマルチモーダルVLAモデルUniVLAを提案する。
提案手法は, CALVIN, LIBERO, Simplenv-Bridge など, 広く使用されているシミュレーションベンチマークにまたがって, 最新の結果を設定する。
さらに、現実世界のALOHA操作と自律運転に適用可能であることを実証する。
論文 参考訳(メタデータ) (2025-06-24T17:59:57Z) - CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models [89.44024245194315]
視覚言語行動モデル(VLA)に明示的な視覚連鎖(CoT)推論を組み込む手法を提案する。
視覚およびアクショントークンの理解と生成が可能な最先端の7B VLAであるCoT-VLAを紹介する。
実験の結果,CoT-VLAは実世界の操作タスクでは17%,シミュレーションベンチマークでは6%,最先端のVLAモデルでは6%,高い性能を示した。
論文 参考訳(メタデータ) (2025-03-27T22:23:04Z) - VL-Mamba: Exploring State Space Models for Multimodal Learning [22.701028299912398]
本研究では,状態空間モデルに基づく多モーダル大規模言語モデルであるVL-Mambaを提案する。
具体的には、まず、LLamaやVicunaのようなトランスフォーマーベースのバックボーン言語モデルを、事前訓練されたMamba言語モデルに置き換える。
論文 参考訳(メタデータ) (2024-03-20T13:48:50Z) - Localized Symbolic Knowledge Distillation for Visual Commonsense Models [150.18129140140238]
ローカル化されたVisual Commonsenseモデルを構築し、ユーザが入力として(複数の)リージョンを指定できるようにします。
大規模言語モデルから局所的なコモンセンス知識を抽出してモデルを訓練する。
局所化コモンセンスコーパスのトレーニングにより,既存の視覚言語モデルを抽出し,リファレンス・アズ・インプット・インタフェースをサポートできることが判明した。
論文 参考訳(メタデータ) (2023-12-08T05:23:50Z) - MetaVL: Transferring In-Context Learning Ability From Language Models to
Vision-Language Models [74.89629463600978]
視覚言語領域では、ほとんどの大規模事前学習された視覚言語モデルは、文脈内学習を行う能力を持っていない。
本稿では,言語領域から視覚領域へコンテキスト内学習能力を移行できるのか,という興味深い仮説を考察する。
論文 参考訳(メタデータ) (2023-06-02T07:21:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。