論文の概要: Successive Capacity Growth: Task-Complexity-Driven Width and Depth Expansion for Vision Transformer Encoders in JEPA World Models
- arxiv url: http://arxiv.org/abs/2608.27367v1
- Date: Thu, 27 Aug 2026 17:04:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.500496
- Title: Successive Capacity Growth: Task-Complexity-Driven Width and Depth Expansion for Vision Transformer Encoders in JEPA World Models
- Title(参考訳): 連続的な容量成長:JEPAワールドモデルにおけるタスク複雑度駆動幅とビジョントランスフォーマーエンコーダの深さ拡大
- Authors: Frederik Berenz,
- Abstract要約: 世界モデリングのためのJEPA(Joint-Embedding Predictive Architectures)は通常、単純なタスクのために過剰に計画された固定サイズのビジョントランスフォーマーエンコーダを使用する。
本稿では,最小エンコーダ(1ヘッド,2レイヤ,283Kパラメータ)から始まり,その幅を漸進的に成長させる手法である逐次容量成長(SCG)を提案する。
60次元多目的ダイナミックスタスクでは、SCGは自然に深さ拡大をトリガーし、固定された小さなベースライン上での予測損失を20.3%改善する。
2次元ナビゲーションタスクにおいて、単一幅展開は固定大モデルよりも23%改善する
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Joint-Embedding Predictive Architectures (JEPAs) for world modeling typically employ fixed-size Vision Transformer encoders that are over-provisioned for simple tasks and under-provisioned for complex ones, with significant redundancy across attention heads. We propose Successive Capacity Growth (SCG), a method that starts from a minimal encoder (1 head, 2 layers, 283K parameters) and grows incrementally in width (adding attention heads for low-level semantic capacity) or depth (adding transformer blocks for higher-order semantic abstraction), driven by a task-agnostic test-and-verify mechanism that exploits function-preserving expansion to safely trial architectural changes and roll back if they do not improve prediction loss. The Sketched Isotropic Gaussian Regularizer (SIGReg) ensures that all learned semantic dimensions remain statistically independent and aligned with the predictive objective, preventing collapse even as the architecture grows. On a 60-dimensional multi-object dynamics task, SCG naturally triggers depth expansion, improving prediction loss by 20.3% over the fixed small baseline with 56 times greater parameter efficiency than scaling to the fixed large model; on a 2D navigation task, a single width expansion yields even an 23% improvement over the fixed large model. Across all three tested environments of increasing complexity, the adaptive encoder matches or exceeds the fixed small baseline, with zero false-positive expansions and bit-exact function preservation (ratio = 1.0, absolute difference = 0.0). The take-away is that JEPA world model encoders need not be pre-allocated at maximum capacity - they can grow successively as the task demands, achieving significant compute and data efficiency while maintaining representation quality.
- Abstract(参考訳): 世界モデリングのためのJEPA(Joint-Embedding Predictive Architectures)は、通常、単純なタスクに過剰にプロビジョンされ、複雑なタスクに過度にプロビジョンされる固定サイズのビジョントランスフォーマーエンコーダを使用する。
本稿では,最小エンコーダ(1層,2層,283Kパラメータ)から始まり,最小エンコーダ(1層,2層,283Kパラメータ)の幅(低レベルのセマンティックキャパシティに対する注目ヘッドの追加)や深度(高次のセマンティック抽象化のためのトランスフォーマブロックの追加)を漸進的に成長させる手法であるSuccessive Capacity Growth(SCG)を提案する。
Sketched Isotropic Gaussian Regularizer (SIGReg) は、学習されたすべての意味的次元が統計的に独立であり、予測目的と一致していることを保証する。
60次元マルチオブジェクトダイナミックスタスクでは、SCGが自然に深度拡大をトリガーし、固定された小さなベースライン上での予測損失を20.3%改善し、固定された大きなモデルへのスケーリングよりも56倍のパラメータ効率を実現した。
複雑性が増大する3つのテスト環境の中で、適応エンコーダは固定された小さなベースラインに一致または超え、ゼロの偽陽性展開とビットエクサクティヴ関数保存(ratio = 1.0, absolute difference = 0.0)を持つ。
重要なのは、JEPAの世界モデルエンコーダが最大容量で事前配置される必要はないことだ。
関連論文リスト
- RecurrentGPT: Expressive Depth through Recurrent Modulation in Transformers [8.085475675888045]
リカレントGPT(RecurrentGPT)は、固定深度前処理とコダブロックが1つの共有コア繰り返しR回ブラケットする再カレント深さ変換器である。
ゲート型リカレントニューラルネットワークにインスパイアされた私たちは、ライトウェイトプロジェクションとエレメントワイズ更新ゲートを使用して、リカレント更新を変調する。
この結果から,適応的深度再利用は品質の取引パラメータの原則的戦略であることが示唆された。
論文 参考訳(メタデータ) (2026-08-15T06:22:00Z) - Learning to Adaptively Allocate Gaussians for Arbitrary-Scale Image Super-Resolution [8.784098322731909]
コンピュータグラフィックスでは、ビジュアルコンテンツは継続的にワープされ、ズームされ、再サンプリングされる。
これらの変換の処理には任意スケール超解法(ASR)が必要である
固定スケール用に設計された伝統的なモデルは、一般に低い整数スケールで予測し、連続分解能に準最適に依存する。
論文 参考訳(メタデータ) (2026-06-28T13:47:43Z) - Variable-Width Transformers [57.07167443557886]
本稿では,$times$-shaped > former architectureを提案する。
我々の設計は、パラメータフリーの残留リサイズ機構を利用して、中間層を狭めながら、より広い早期層と後期層を維持している。
平均的な層幅を減らすことで、このアーキテクチャは全体のFLOPを少なくし、KVキャッシュメモリを小さくし、I/Oコストを削減できる。
論文 参考訳(メタデータ) (2026-06-16T17:59:03Z) - Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders [123.58723804218151]
ビジョンファウンデーションモデルは、自己注意の二次的なコストによってボトルネックとなる。
2次元空間伝搬伝搬に基づくC-GSPNを提案する。
論文 参考訳(メタデータ) (2026-05-30T14:29:43Z) - Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction [9.96771578356719]
既存のアプローチは、深度マップを回帰するために、ますます複雑なネットワークアーキテクチャに依存している。
本論文では,Swin Transformerのバックボーン上に構築したマルチレベル条件付きランダムフィールド(CRF)モデルを提案する。
本稿では,Abs Relを0.088ドル(約7.4%)に,RMSEを0.316ドル(約5.4%)に削減し,ほぼ完全なしきい値精度を実現した。
論文 参考訳(メタデータ) (2026-04-03T07:59:26Z) - SGR-OCC: Evolving Monocular Priors for Embodied 3D Occupancy Prediction via Soft-Gating Lifting and Semantic-Adaptive Geometric Refinement [9.891265334631889]
3Dセマンティック占有予測は、具現化されたAIの基盤である。
我々は,SGR-OCC(Soft-Gating and Ray-Refinement Occupancy)を提案する。
局所予測タスクでは、SGR-OCCは58.55$%の完了IoUと49.89$%のセマンティックmIoUを達成し、それぞれ3.65$%と3.69$%の前のベストメソッドであるEmbodiedOcc++を上回っている。
論文 参考訳(メタデータ) (2026-03-14T18:45:03Z) - Architecture-Aware Multi-Design Generation for Repository-Level Feature Addition [53.50448142467294]
RAIMは、リポジトリレベルの機能追加のための、多設計およびアーキテクチャ対応のフレームワークである。
複数の多様な実装設計を生成することで、線形パッチから切り離される。
NoCode-bench Verifiedデータセットの実験では、RAIMが新しい最先端のパフォーマンスを確立することが示されている。
論文 参考訳(メタデータ) (2026-03-02T12:50:40Z) - Beyond Quantity: Trajectory Diversity Scaling for Code Agents [51.71414642763219]
Trajectory Diversity Scalingは、コードエージェントのためのデータ合成フレームワークである。
TDScalingは、(1)実際のサービスの論理的依存関係をキャプチャするBusiness Clusterメカニズム、(2)軌道コヒーレンスを強制するブループリント駆動のマルチエージェントパラダイム、(3)ロングテールシナリオを指向する適応的な進化メカニズムの4つの革新を統合しています。
論文 参考訳(メタデータ) (2026-02-03T07:43:03Z) - A Lightweight Convolution and Vision Transformer integrated model with Multi-scale Self-attention Mechanism [41.02402160100821]
Vision Transformer (ViT) は、長距離依存モデリング能力の強いコンピュータビジョンタスクで普及している。
本稿では,細かな注意(SAEViTと呼ばれる)と畳み込みブロックを持つ効率的なViTモデルを提案する。
主流データセットの実験では、SAEViTはImageNet-1K分類タスクで76.3%と79.6%のTop-1アキュラシーを達成した。
論文 参考訳(メタデータ) (2025-08-23T03:05:34Z) - Collaborative Decoding Makes Visual Auto-Regressive Modeling Efficient [52.96232442322824]
CoDe(Collaborative Decoding)は、Visual Auto-Regressive (VAR)フレームワーク用に設計された、新しい効率的なデコーディング戦略である。
CoDeは、大規模でのパラメータ要求の大幅な削減と、異なるスケールでの排他的生成パターンという、2つの重要な観察に乗じている。
CoDeは1.7倍のスピードアップを実現し、メモリ使用量を約50%削減し、画像品質を1.95から1.98に改善した。
論文 参考訳(メタデータ) (2024-11-26T15:13:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。