論文の概要: GeoShrink: Accelerating Diffusion Transformers with Two Lines of Code
- arxiv url: http://arxiv.org/abs/2609.33723v1
- Date: Sun, 27 Sep 2026 16:25:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 17:17:26.265125
- Title: GeoShrink: Accelerating Diffusion Transformers with Two Lines of Code
- Title(参考訳): GeoShrink: 2行のコードで拡散変換器を高速化
- Abstract要約: そこで,GeoShrinkは,所定のアンカーセットでのみモデルを評価しながら,元のソルバグリッドを保持できる学習自由加速法である。
スキップされた段階でGeoShrinkは、最新の正確な出力に最新の観測されたイノベーションの幾何的に保持された部分を追加することで、解決者対応の出力を予測する。
実験では、画像、ビデオ、モーション、オーディオ生成、そして適応された3Dバックエンドをカバーしている。
- 参考スコア(独自算出の注目度): 9.000549924941934
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion transformers incur substantial inference cost through repeated model evaluations along a sampling trajectory. We introduce GeoShrink, a training-free acceleration method that retains the original solver grid while evaluating the model only at a prescribed set of anchors. At skipped stages, GeoShrink predicts the solver-facing output by adding a geometrically retained fraction of the latest observed innovation to the most recent exact output. We derive this rule from chordal tangent transport and round-trip line projection, and establish a geometric anchor-spacing principle that minimizes the largest adjacent gap expansion under fixed coverage and first span. The analysis characterizes the geometric closure and propagation of prediction errors without assuming access to future model outputs. Experiments cover image, video, motion, and audio generation, together with adapted 3D backends. At approximately $5\times$ acceleration, GeoShrink improves FLUX PSNR by 3.10 dB over the strongest listed baseline. On HunyuanVideo, it achieves a reported $4.99\times$ speedup and improves ChronoMagic-Bench-150 PSNR by 5.44 dB over the strongest listed fidelity baseline. Comparisons at fixed evaluation budgets further show substantial gains on motion, audio, music, and 3D generation.
- Abstract(参考訳): 拡散変圧器はサンプリング軌道に沿った繰り返しモデル評価によりかなりの推算コストを発生させる。
そこで,GeoShrinkは,所定のアンカーセットでのみモデルを評価しながら,元のソルバグリッドを保持できる学習自由加速法である。
スキップされた段階でGeoShrinkは、最新の正確な出力に最新の観測されたイノベーションの幾何的に保持された部分を追加することで、解決者対応の出力を予測する。
我々は,この規則を弦の接線輸送とラウンドトリップ線投影から導出し,固定被覆および第1スパンにおける最大の近接ギャップ拡大を最小化する幾何アンカー・スポーピング原理を確立する。
この分析は、将来のモデル出力へのアクセスを仮定することなく、幾何的クロージャと予測誤差の伝搬を特徴付ける。
実験では、画像、ビデオ、モーション、オーディオ生成、そして適応された3Dバックエンドをカバーしている。
約5\times$Accelerationで、GeoShrinkはFLUX PSNRを3.10dB改善した。
HunyuanVideoでは、4.99\times$ Speedupを達成し、ChronoMagic-Bench-150 PSNRを5.44dB改善した。
固定評価予算における比較は、運動、オーディオ、音楽、および3D生成において、さらに顕著な増加を示している。
関連論文リスト
- Off-Manifold Refinement: Guiding Video Generators with a Frozen World Model [2.4870727053423236]
Off-Manifold Refinement (OMR)は、単一のサンプリング軌道に直接ワールドモデルフィードバックを注入する推論時間法である。
固定された400-prompt VideoPhy-2の詳細部分集合では、OMRはSemantic-Adherence-and-Physical-Commonsenseを47.0%から52.0%に引き上げる。
論文 参考訳(メタデータ) (2026-08-30T17:00:09Z) - GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors [27.10799700736534]
Diffusion ModelsやFlow Matchingのような生成モデルは、高忠実度駆動ビデオの合成において顕著な能力を示している。
この非効率性は、連続するフレームが独立なガウスノイズである標準ガウス音源分布への依存から生じる。
明示的な幾何学的事前情報を活用することにより,効率的な運転映像生成を実現するための新しいフレームワークであるGeoFlowを提案する。
論文 参考訳(メタデータ) (2026-08-12T15:57:08Z) - Level-Crossing Density as a Mesh-Free High-Frequency Auxiliary Loss for Implicit Neural Representations [0.0]
格子も複雑も永続性もない連続神経場に対するスムーズなモンテカルロ推定器を導出する。
推定器は2Dと3Dの正確なトポロジーに対して1-3%の精度で、1イテレーションあたり約3ミリ秒の費用がかかる。
しかし、3Dニューラル-SDFフィッティングでは、任意のサンプルソフトトポロジーの目的に対して一般的な障害モードが現れると信じている。
論文 参考訳(メタデータ) (2026-07-07T04:23:23Z) - Total Generalized Variation regularization closes the gap between neural-eld and classical methods in seismic travel-time tomography [0.0]
トモグラフィーはメッシュ分解能と安定性のトレードオフを強制し、レギュレータの選択が回復可能なものを支配します。
本稿では,Fourier-Feature Neural Networkとして,2次元速度場を表す差別化可能なフレームワークMIMIRを紹介する。
論文 参考訳(メタデータ) (2026-05-11T04:13:52Z) - Scalable Adaptation of 3D Geometric Foundation Models via Weak Supervision from Internet Video [76.32954467706581]
本稿では,生のビデオストリームからGEometric foundationモデルのスケーラブル適応を行うフレームワークであるSAGEを提案する。
階層的なマイニングパイプラインを使用して、ビデオをトレーニングトラジェクトリやハイブリッド監視に変換します。
実験の結果、SAGEはゼロショットの一般化を著しく向上し、チェムファー距離を20-42%削減した。
論文 参考訳(メタデータ) (2026-02-08T09:53:21Z) - Structure-Informed Estimation for Pilot-Limited MIMO Channels via Tensor Decomposition [51.56484100374058]
本稿では、スパース観測から低ランクテンソル完備化としてパイロットリミテッドチャネル推定を定式化する。
合成チャネル実験による最小二乗平均二乗誤差(NMSE)の最小二乗平均誤差(LS)に対する改善
DeepMIMO線トレーシングチャネルの評価では、純粋なテンソル法よりも24-44%NMSEが減少している。
論文 参考訳(メタデータ) (2026-02-03T23:38:05Z) - Quantized Visual Geometry Grounded Transformer [67.15451442018258]
本稿では,VGGTの最初の量子化フレームワーク,すなわちQuantVGGTを提案する。
球状前アダマール回転と局所流路平滑化を統合したDual-Smoothed Fine-Grained Quantizationを導入する。
また、重層統計量を用いて外周をフィルタするノイズフィルタディバースサンプリングを設計する。
論文 参考訳(メタデータ) (2025-09-25T15:17:11Z) - Trans${^2}$-CBCT: A Dual-Transformer Framework for Sparse-View CBCT Reconstruction [10.744510913722817]
コーンビームCT(CBCT)は、少数のX線プロジェクションビューしか使用していないため、放射線線量が少ないほど高速なスキャンが可能であるが、重度のアンダーサンプリングの結果、強いアーティファクトと空間的カバレッジが低下する。
まず、従来のUNet/ResNetエンコーダをハイブリッドCNN-TransformerモデルであるTransUNetに置き換える。
LUNA16 と ToothFairy の実験では、6 から 10 のビューで一貫した利得を示し,CNN-Transformer 特徴と特異なビュー CBCT 再構成のための点ベース幾何推論の有効性を検証した。
論文 参考訳(メタデータ) (2025-06-20T18:45:12Z) - CityGaussianV2: Efficient and Geometrically Accurate Reconstruction for Large-Scale Scenes [53.107474952492396]
CityGaussianV2は大規模なシーン再構築のための新しいアプローチである。
分解段階の密度化・深さ回帰手法を実装し, ぼやけたアーチファクトを除去し, 収束を加速する。
本手法は, 視覚的品質, 幾何学的精度, ストレージ, トレーニングコストの両立を図っている。
論文 参考訳(メタデータ) (2024-11-01T17:59:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。