論文の概要: Training Crossroads for Recurrent Vision Transformers: Recurrence, Neural ODEs, and Deep Supervision
- arxiv url: http://arxiv.org/abs/2608.04879v1
- Date: Wed, 05 Aug 2026 14:06:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.955016
- Title: Training Crossroads for Recurrent Vision Transformers: Recurrence, Neural ODEs, and Deep Supervision
- Title(参考訳): リカレントビジョントランスのためのクロスロードトレーニング:リカレンス、ニューラルODE、ディープスーパービジョン
- Authors: Grzegorz Gruszczynski, Pawel Olszowiec, Michal Byra, Grzegorz Stefanski, Alberto Presta,
- Abstract要約: シングルブロックリカレントViT (bViT) は、1つの共有ブロックを繰り返し適用することで、この成長を除去する。
FLOPが主制約である場合、標準のVTは引き続き好ましいが、繰り返しのVTはメモリ制約下でのパラメータのトレードオフよりも精度がよい。
- 参考スコア(独自算出の注目度): 2.1465474237525113
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision Transformers (ViTs) achieve strong image-recognition performance, but their parameter count grows linearly with depth when each block is independently parameterized. Single-block recurrent ViTs (bViT) remove this growth by repeatedly applying one shared block. Rather than proposing a new architecture, we fix a bViT and provide a controlled empirical characterization of three training and inference regimes under a common CIFAR-100 protocol, asking: (i)~when does recurrence beat independently parameterized depth---at matched FLOPs or at matched parameter memory? (ii)~when a residual recurrent block is trained through an ODE solver, does solver order act as numerical refinement or as an architectural bias? and (iii)~what does robustness beyond the training horizon cost in nominal accuracy? We find that standard ViTs remain preferable when FLOPs are the primary constraint, whereas recurrent ViTs offer a better accuracy--parameter trade-off under memory constraints. Consistent with the standard view of residual networks as Euler discretizations of ODEs, the continuous-time analogue of a residual recurrent block is the state-subtracted vector field $\dot{z}=F_θ(z)-z$; although known in principle, this distinction is easy to violate when the block is wrapped as a black-box vector field, and we qualify the cost at few accuracy points. Because the vector field is learned jointly with the solver, higher-order solvers act as a solver-induced architectural bias rather than a numerical-accuracy improvement, and their gains are not uniform. Finally, stage-wise deep supervision traces an accuracy--robustness frontier: it does not improve nominal accuracy, but degrades gracefully far beyond the training horizon, where naive recurrence collapses to near-random performance.
- Abstract(参考訳): 視覚変換器(ViT)は画像認識性能は高いが,各ブロックが独立にパラメータ化されると,そのパラメータ数は深さとともに線形に増加する。
シングルブロックリカレントViT (bViT) は、1つの共有ブロックを繰り返し適用することで、この成長を除去する。
新しいアーキテクチャを提案するのではなく、bViTを修正し、共通のCIFAR-100プロトコルの下で3つのトレーニングと推論の仕組みを制御した経験的特徴を提供する。
(i)〜どの繰り返しが独立にパラメータ化された深さ--一致したFLOPや一致したパラメータメモリをビートするか?
(ii)—残留再帰ブロックがODEソルバによって訓練された場合、ソルバ順序は数値的な洗練やアーキテクチャ上のバイアスとして機能するのか?
そして
(iii)—訓練用地平線を超えるロバスト性は、何のコストがかかるか。
FLOPが主制約である場合,標準のVTは依然として好ましいが,再帰的なVTはメモリ制約下でのパラメータトレードオフよりも精度がよい。
ODEのオイラー離散化(Euler discretizations of ODEs)のように、残留再帰ブロックの連続時間的類似は、状態置換ベクトル場 $\dot{z}=F_θ(z)-z$ である。
ベクトル場は解法とともに学習されるので、高次解法は数値精度の向上よりも解法によるアーキテクチャバイアスとして機能し、その利得は均一ではない。
最後に、ステージワイドの深い監督は、精度-難易度フロンティアを辿る: 名目精度は向上しないが、トレーニングの地平線を越えて優雅に劣化し、そこではナイーブな再発がほぼランダムなパフォーマンスに崩壊する。
関連論文リスト
- Learning to Solve Generative ODEs Beyond the Linear Span [50.13853710831612]
空間残留演算子を用いてスカラー係数更新を増強する軽量ニューラルソルバであるSpanLiftを提案する。
SpanLiftは、ピクセル空間の拡散、潜水流のマッチング、降水は今、最先端の数ステップのサンプリングを実現している。
論文 参考訳(メタデータ) (2026-06-07T15:22:13Z) - Replacement Learning: Training Neural Networks with Fewer Parameters [15.09968642484538]
Replacement Learning (RepL) は、選択したブロックを置き換えることで、完全な冗長性を減らす訓練時間パラダイムである。
RepLは、不要なフルレイヤを避けながら、局所的なコンテキスト連続性を維持する。
RepLはトレーニング可能なパラメータ、GPUメモリ使用量、トレーニング時間を削減し、標準のエンドツーエンドトレーニングを適合または超過することを示す。
論文 参考訳(メタデータ) (2026-05-19T08:34:31Z) - bViT: Investigating Single-Block Recurrence in Vision Transformers for Image Recognition [2.1465474237525113]
本稿では,1つの変圧器ブロックを繰り返し適用して画像処理を行う単一ブロックリカレントViTであるbViTを紹介する。
ImageNet-1Kでは、12ステップのbViT-Bが、同じトレーニングレシピと計算予算の下で標準のViT-Bに匹敵する精度を達成する。
我々は、リカレント性能が表現幅で向上し、より広いbViTが、より狭い変種よりも標準ViTの性能を回復するのを観察する。
論文 参考訳(メタデータ) (2026-05-11T14:43:36Z) - Score-Guided Proximal Projection: A Unified Geometric Framework for Rectified Flow Editing [1.0312968200748118]
Rectified Flowモデルは最先端の世代品質を実現するが、正確なタスクのためにそれらを制御することは依然として困難である。
現在のアプローチは「幾何学的ロック」に苦しむ逆法に基づくガイダンスに分岐する
Score-Guided Proximal Projectionは,決定論的最適化と縮尺サンプリングのギャップを埋める統一フレームワークである。
論文 参考訳(メタデータ) (2026-03-05T23:44:45Z) - Block-Recurrent Dynamics in Vision Transformers [42.261020313952976]
我々は、トレーニングされたViTは、元の$L$ブロックの計算を、繰り返し適用された$k ll L$ブロックのみを使用して正確に書き直せるようにブロック再帰的な深さ構造を許容していると主張している。
DINOv2 ImageNet-1kの線形プローブ精度を同等の計算コストで2ブロックで回収するために、Raptorモデルを訓練する。
論文 参考訳(メタデータ) (2025-12-23T00:18:23Z) - INC: An Indirect Neural Corrector for Auto-Regressive Hybrid PDE Solvers [61.84396402100827]
本稿では,学習した補正を支配方程式に統合する間接ニューラルコレクタ(mathrmINC$)を提案する。
$mathrmINC$は、$t-1 + L$の順番でエラー増幅を減らし、$t$はタイムステップ、$L$はリプシッツ定数である。
大規模なベンチマークで$mathrmINC$をテストし、1Dカオスシステムから3D乱流まで、多くの異なる解法、神経バックボーン、テストケースをカバーした。
論文 参考訳(メタデータ) (2025-11-16T20:14:28Z) - Stable Video Infinity: Infinite-Length Video Generation with Error Recycling [76.91310169118408]
本研究では、高時間一貫性、可視的シーン遷移、制御可能なストリーミングストーリーラインを有する無限長ビデオを生成することができる安定ビデオインフィニティ(SVI)を提案する。
SVIにはError-Recycling Fine-Tuningが組み込まれており、これはDiffusion Transformerの自己生成エラーをスーパーバイザのプロンプトにリサイクルする、新しいタイプの効率的なトレーニングである。
我々は、一貫性、創造性、条件設定を含む3つのベンチマークでSVIを評価し、その汎用性と最先端の役割を徹底的に検証した。
論文 参考訳(メタデータ) (2025-10-10T09:45:46Z) - Towards Continual Learning Desiderata via HSIC-Bottleneck
Orthogonalization and Equiangular Embedding [55.107555305760954]
本稿では,レイヤワイドパラメータのオーバーライトや決定境界の歪みに起因する,概念的にシンプルで効果的な手法を提案する。
提案手法は,ゼロの指数バッファと1.02倍の差が絶対的に優れていても,競争精度が向上する。
論文 参考訳(メタデータ) (2024-01-17T09:01:29Z) - Softmax-free Linear Transformers [90.83157268265654]
視覚変換器(ViT)は、視覚知覚タスクの最先端を推し進めている。
既存の手法は理論的に欠陥があるか、視覚認識に経験的に効果がないかのいずれかである。
我々はSoftmax-Free Transformers (SOFT) のファミリーを提案する。
論文 参考訳(メタデータ) (2022-07-05T03:08:27Z) - Robust Implicit Networks via Non-Euclidean Contractions [63.91638306025768]
暗黙のニューラルネットワークは、精度の向上とメモリ消費の大幅な削減を示す。
彼らは不利な姿勢と収束の不安定さに悩まされる。
本論文は,ニューラルネットワークを高機能かつ頑健に設計するための新しい枠組みを提供する。
論文 参考訳(メタデータ) (2021-06-06T18:05:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。