論文の概要: When Geometry Aligns: Dihedral Hidden-State Transformations in UNet, ViT, and DiT Architectures
- arxiv url: http://arxiv.org/abs/2607.03580v1
- Date: Fri, 03 Jul 2026 19:47:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.653161
- Title: When Geometry Aligns: Dihedral Hidden-State Transformations in UNet, ViT, and DiT Architectures
- Title(参考訳): 幾何整合性:UNet, ViT, DiTアーキテクチャにおける二面隠れ状態変換
- Abstract要約: 拡散変圧器(DiT)における構造的幾何摂動の影響について検討する。
一貫性のある変換では安定性が向上する一方、一貫性のない変換では予測可能なアーキテクチャ固有の障害が発生します。
これらの結果は、ViTのサポートと制御されたDiT分析とともに、安定な隠れ状態干渉の鍵原理として幾何整合性を確立する。
- 参考スコア(独自算出の注目度): 20.803275645784694
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion architectures now encompass convolutional UNets as well as transformer-based designs such as Diffusion Transformers (DiTs), inspired by Vision Transformers (ViTs), yet the effects of structured geometric perturbations within these architectures remain poorly understood. We study this question through a unified framework that applies reflection-based elements of the dihedral group to intermediate hidden states as controlled internal interventions, contrasting geometrically consistent and inconsistent variants. Using activation-level diagnostics, including Self-Consistency Shift (SCS), Activation Mass Scatter (AMS), and Drift, we analyze feature stability and geometric drift. We find that consistent transformations improve stability, while inconsistent ones induce predictable, architecture-specific failures. In the main Stable Diffusion 2.1 U-Net study, we evaluate seven intervention modes over three seeds and complement the internal diagnostics with image-level FID, KID, CLIP score, and LPIPS diversity. Taken together with supporting ViT and controlled DiT analyses, these results establish geometric consistency as a key principle for stable hidden-state interventions in spatially structured vision and diffusion models.
- Abstract(参考訳): 拡散アーキテクチャは現在では、畳み込みユニセットや、ビジョントランスフォーマー(ViT)にインスパイアされたディフュージョントランスフォーマー(DiT)のようなトランスフォーマーベースの設計を含んでいるが、これらのアーキテクチャにおける構造的幾何摂動の影響は理解されていない。
この問題は、二面体群の反射に基づく要素を制御された内部介入として中間隠れ状態に適用する統一的な枠組みを通じて研究され、幾何学的に一貫した変種と矛盾しない変種を対比する。
自己整合性シフト(SCS)、アクティベーションマス散乱(AMS)、ドリフトなどのアクティベーションレベル診断を用いて、特徴安定性と幾何学的ドリフトを分析する。
一貫性のある変換では安定性が向上する一方、一貫性のない変換では予測可能なアーキテクチャ固有の障害が発生します。
本研究は, 安定拡散2.1U-Net研究において, 3種の種子に対する7つの介入モードを評価し, 内部診断を画像レベルのFID, KID, CLIPスコア, LPIPSの多様性で補完するものである。
これらの結果は, 空間的に構造化された視覚と拡散モデルにおいて, 安定な隠れ状態干渉の鍵原理として, 幾何学的整合性を確立した。
関連論文リスト
- PathAR: Structure-First Autoregressive Synthesis of Multimodal Pathology Images [51.428093790826814]
そこで我々は, モーダリティ・ラベル条件付き病理モデル (PathAR) を用いて, 構造と外観を分解し, 自己回帰モデル(PathAR)を提案する。
PathARは、不均一なモダリティ固有の外観下で形態を安定化し、空間的に整列したイメージマスクペア生成を可能にする。
論文 参考訳(メタデータ) (2026-06-01T01:43:48Z) - Positional Encodings Anchor Spatial Structure in Vision Transformers: A Geometric Perspective on Robustness [0.0]
位置埋め込み(PE)の異なる形態が視覚変換器(ViT)の表現幾何学に与える影響について検討する。
PEを使わずにトレーニングしたViTは、まだ非自明な空間構造を発達しているが、この構造は、視覚的内容によって駆動され、トークンの置換の下で崩壊する。
すべてのPE(学習絶対, 正弦波, 回転)が, 指数アンコールされた空間構造への一貫したシフトに関連していることがわかった。
論文 参考訳(メタデータ) (2026-05-28T13:17:23Z) - Hierarchical Consistency Learning for Test-time Adaptation in Camouflage Perception [50.278200968044665]
カモフラージュされた物体検出(COD)は、物理的属性を通して背景から最小限の知覚差を示すターゲットをローカライズすることを目的としている。
既存のメソッドは、静的なTrain-then-freezeパラダイムによって制約されており、ドメインの剛性と依存性のアノテーションに悩まされている。
動的表現再構成のためのテスト時間適応を統合した階層的一貫性学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-05-25T09:57:46Z) - High-Dimensional Latents Should Be Diagnosed Through Phase Structure [56.362776482614976]
スピングラス理論のレンズによるオートエンコーダと変分オートエンコーダの潜在空間について検討した。
固定復号器用の潜時空間スピングラス辞書を定式化する。
トポロジカルな自明化機構のエッジ・オブ・ステイティに向けて潜伏系を駆動することは、下流に具体的な結果をもたらすことを示す。
論文 参考訳(メタデータ) (2026-05-23T06:17:23Z) - Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers [93.3976834364707]
本稿では,特徴写像のリレーショナル幾何における整合性を実現する構造的RePresentation AlignmentフレームワークであるsREPAを提案する。
モデルが事前訓練された特徴から全体的空間配置と構造的相関を内包するように促すことにより、sREPAはより高速でより安定した収束を達成する。
論文 参考訳(メタデータ) (2026-05-16T12:01:04Z) - Beyond Defenses: Manifold-Aligned Regularization for Intrinsic 3D Point Cloud Robustness [7.747242279123295]
古典的逆説と点雲の内在的構造を結びつける3次元ロバストネスの幾何学的解釈を開発する。
そこで本研究では, 固有摂動にまたがる予測を整列させることにより, 潜時幾何学を規則化するフレームワーク, Manifold-Aligned Point Recognition (MAPR) を紹介する。
論文 参考訳(メタデータ) (2026-05-08T11:02:53Z) - Structural Instability of Feature Composition [2.5754366051855837]
球状辞書モデルに基づく合成-崩壊しきい値について検討する。
高バイアス状態においては、ReLUは顕微鏡的相関による変動変動を系統的なドリフトに変換する。
CLEVRから抽出した構造化セマンティックな特徴に対するスケーリングの予測傾向を検証した。
論文 参考訳(メタデータ) (2026-04-18T05:53:31Z) - When Fine-Tuning Changes the Evidence: Architecture-Dependent Semantic Drift in Chest X-Ray Explanations [5.127836966483091]
医用画像分類において, 転帰学習と微調整は, 診断性能が一貫した向上により広く採用されている。
重なり合う視覚的特徴を持つ多クラス設定では、精度の向上は、予測をサポートするために使用される視覚的証拠の安定性を保証するものではない。
我々は,意味的ドリフトを,伝達学習とフル微調整の間のモデルの予測を支援する帰属構造における体系的な変化として定義する。
論文 参考訳(メタデータ) (2026-04-09T17:53:02Z) - Measuring 3D Spatial Geometric Consistency in Dynamic Generated Videos [67.7364297817535]
ビデオにおける3D textbfSpatial textbfGeometric textbfConsistencyを評価するためのメトリクスであるSGCを紹介する。
SGCは幾何的不整合を頑健に定量化し、既存のメトリクスで欠落した臨界故障を効果的に特定する。
論文 参考訳(メタデータ) (2026-03-19T15:44:39Z) - Structural Action Transformer for 3D Dexterous Manipulation [80.07649565189035]
クロス・エボディメント・スキル・トランスファーは、ハイDoFロボットハンドの課題である。
既存の手法は、しばしば2次元の観測と時間中心の行動表現に依存し、3次元の空間的関係を捉えるのに苦労する。
本稿では、構造中心の視点を導入することで、このパラダイムに挑戦する新しい3Dデクスタラスな操作ポリシーを提案する。
論文 参考訳(メタデータ) (2026-03-04T11:38:12Z) - Scale-Consistent State-Space Dynamics via Fractal of Stationary Transformations [9.983526161001997]
最近のディープラーニングモデルは、中間表現の妥当性に関する構造的な保証なしに、ますます深度に依存している。
我々は、状態空間モデルのスケール一貫性潜在力学の構造的要件を定式化することにより、この制限に対処する。
我々は予測されたスケール一貫性の挙動を実証的に検証し、適応効率がアライメントされた潜在幾何学から現れることを示す。
論文 参考訳(メタデータ) (2026-01-27T12:44:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。