論文の概要: GeoCache: Training-Free Acceleration of Multi-View Texture Diffusion via Geometric Delta Transport
- arxiv url: http://arxiv.org/abs/2608.13255v1
- Date: Thu, 13 Aug 2026 13:57:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-14 18:29:38.548673
- Title: GeoCache: Training-Free Acceleration of Multi-View Texture Diffusion via Geometric Delta Transport
- Title(参考訳): ジオキャッシュ:幾何デルタ輸送による多視点テクスチャ拡散の学習自由加速
- Authors: Haotang Li, Zhenyu Qi, Shaohan Henry Wang, Kebin Peng, Yutong Zhao, Zi Wang, Bo Liu, Huanrui Yang, Sen He,
- Abstract要約: マルチビューアクセラレーターでは、ステップをスキップすると時間的冗長性が除去される。
クロスビュー相互作用は、同じ表面の異なる観測を継続的に整列させ、急速に劣化した一貫性をもたらす。
本分析では, 予測表面信号のサブセットを同定する。
- 参考スコア(独自算出の注目度): 11.49513685031293
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Geometry-conditioned multi-view diffusion enables high-quality 3D texture generation, but its repeated per-view denoiser evaluations introduce substantial computational cost. Existing training-free accelerators primarily exploit temporal redundancy by reusing computation across denoising steps. In multi-view texturing, however, skipping a step also removes the cross-view interaction that continually aligns different observations of the same surface, leading to rapidly degraded consistency and fidelity. Our analysis identifies a complementary source of redundancy: although intermediate features remain view-specific, geometrically corresponding surface points exhibit transferable evolution in their predicted clean signals. Based on this observation, we introduce \gc{}, a training-free plugin that evaluates a rotating subset of anchor views and transports their geometry-aligned per-step $\xz$ updates to the remaining views. Periodic full-view computation controls accumulated error, while sampler-consistent reconstruction preserves the denoising trajectory. \gc{} requires neither retraining nor architectural modification and uses the position maps already available in geometry-conditioned texturing pipelines. Across Hunyuan3D-2.1, SyncMVD, and MVPainter, \gc{} achieves a stronger speed--fidelity trade-off than temporal caches and step reduction at operating points above $2\times$. On Hunyuan3D-2.1, it delivers a $2.21\times$ denoiser-loop speedup with an MV-LPIPS of 0.0293 and an MV-PSNR of 33.60 dB, providing the best fidelity among all tested methods above $2\times$. The same transferred configuration reaches the highest speedup and lowest FLOPs on SyncMVD, while \gc{} achieves the lowest FLOPs and best fidelity among the accelerated methods on MVPainter. These results establish cross-view geometry as an effective acceleration axis for multi-view texture diffusion.
- Abstract(参考訳): 幾何条件付きマルチビュー拡散は高品質な3次元テクスチャ生成を可能にするが、ビューごとの評価を繰り返し、かなりの計算コストをもたらす。
既存のトレーニングフリーアクセラレータは、主にデノナイジングステップをまたいだ計算を再利用することで、時間的冗長性を利用する。
しかし、マルチビューのテクスチャリングでは、ステップをスキップすることで、同じ表面の異なる観察を継続的に整列させるクロスビューの相互作用が取り除かれ、急速に劣化した一貫性と忠実さがもたらされる。
中間的な特徴はビュー固有であるが、幾何学的に対応する表面点は、予測されたクリーン信号に伝達可能な進化を示す。
この観察に基づいて,アンカービューの回転サブセットを評価し,残りのビューを$\xz$で更新するトレーニング不要なプラグインである \gc{} を紹介した。
周期的なフルビュー計算は累積誤差を制御し、サンプル・一貫性の再構成はデノイング軌跡を保存する。
\gc{} は再トレーニングもアーキテクチャの変更も必要とせず、幾何条件のテクスチャパイプラインで既に利用可能な位置マップを使用する。
Hunyuan3D-2.1, SyncMVD, MVPainter 全体では、 \gc{} は時間キャッシュよりも高速で忠実なトレードオフを実現し、演算ポイントが 2\times$ を超えるとステップダウンする。
Hunyuan3D-2.1では、MV-LPIPSが0.0293、MV-PSNRが33.60dBの2.21\times$ denoiser-loopのスピードアップが提供され、2.60dB以上のテスト手法の中で最高の忠実さを提供する。
同じ転送された構成は SyncMVD 上では最高速度と最低FLOPに到達し、 \gc{} は MVPainter 上で加速されたメソッドの中で最低FLOPと最高忠実度を達成する。
これらの結果は、多視点テクスチャ拡散のための効果的な加速度軸として、クロスビュー幾何学を確立した。
関連論文リスト
- ASTRA: Asynchronous Spatio-Temporal Reconstruction via Trajectory Alignment [86.35109211408489]
本稿では,非同期動的再構成のための2次元運動軌跡を明示的かつテクスチャに依存しない監視として導入するフレームワークであるASTRAを提案する。
ASTRAは高周波空間の詳細を保存し、25フレームのオフセットを持つ重度の非同期でも強い堅牢性を保ち、約1.4dBのPSNRの改善を実現し、時間オフセットMAEを54.0%削減し、同期成功率をほぼ4倍にしている。
論文 参考訳(メタデータ) (2026-08-03T10:06:45Z) - Surflo: Consistent 3D Surface Flow Model with Global State [57.57234680235885]
Surfloは、方向付けられた3次元表面点を、ノイズからフローマッチングを通じて独立して表面へ輸送することでデコードする。
独立なポイント単位の復号化に固有の局所的不整合を抑制するために、光度勾配を注入することにより、推定時間誘導項が近傍の点と相関する。
Surfloは、サーフェスメトリクスのフィードフォワードベースラインにマッチし、数百のビューを必要とする最適化ベースのメソッドよりも桁違いに高速に動作し、グローバルなラテントと任意の解像度のデコーディングを組み合わせた唯一のフィードフォワードアプローチである。
論文 参考訳(メタデータ) (2026-06-11T17:48:38Z) - Accelerating Rectified Flow Models via Trajectory-Aware Caching [35.13071059415995]
我々は,スキップ・then-compensateパラダイムに従って,トレーニング不要なアクセラレーションフレームワークであるTACacheを提案する。
Trajectory-Aware Cacheは、テキスト・ツー・イメージ・ジェネレーションで最大4.14スピードアップ、テキスト・ツー・ビデオ・ジェネレーションで2.11スピードアップを達成する。
論文 参考訳(メタデータ) (2026-05-16T03:44:58Z) - Geometrically Consistent Multi-View Scene Generation from Freehand Sketches [58.98194920417429]
フリーハンドスケッチは、マルチビュージェネレータを提供することができる最も幾何学的に不十分な入力である。
学習データの欠如、歪んだ2次元入力からの幾何学的推論の必要性、ビュー間の整合性という3つの複合的な課題に対処する。
本フレームワークは,参照画像,反復的精細化,シーンごとの最適化を必要とせず,単一のデノナイジングプロセスですべてのビューを合成する。
論文 参考訳(メタデータ) (2026-04-15T18:00:45Z) - Leveraging Consistent Spatio-Temporal Correspondence for Robust Visual Odometry [7.517597541959445]
S-Temporal Visual Odometry (STVO) は,マルチフレームフローマッチングの精度と一貫性を高めるための,新しいディープネットワークアーキテクチャである。
我々のSTVOはETH3Dベンチマークの最先端性能とKITTI Odometryベンチマークの38.9%を実現している。
論文 参考訳(メタデータ) (2024-12-22T08:47:13Z) - Multi-view Depth Estimation using Epipolar Spatio-Temporal Networks [87.50632573601283]
一つのビデオから多視点深度を推定する新しい手法を提案する。
提案手法は,新しいEpipolar Spatio-Temporal Transformer(EST)を用いて時間的コヒーレントな深度推定を行う。
最近のMixture-of-Expertsモデルにインスパイアされた計算コストを削減するため、我々はコンパクトなハイブリッドネットワークを設計する。
論文 参考訳(メタデータ) (2020-11-26T04:04:21Z) - Dense Hybrid Recurrent Multi-view Stereo Net with Dynamic Consistency
Checking [54.58791377183574]
1)DRENet(Dense Reception Expanded)モジュールで,原サイズの密集した特徴マップをマルチスケールのコンテキスト情報で抽出し,2)HU-LSTM(Hybrid U-LSTM)を用いて3次元マッチングボリュームを予測深度マップに変換する。
R-MVSNetのメモリ消費は19.4%しかかからないが,本手法は最先端の手法と競合する性能を示し,メモリ消費を劇的に削減する。
論文 参考訳(メタデータ) (2020-07-21T14:59:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。