論文の概要: MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality
- arxiv url: http://arxiv.org/abs/2605.05646v1
- Date: Thu, 07 May 2026 03:53:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-08 22:27:11.511142
- Title: MUSE: Resolving Manifold Misalignment in Visual Tokenization via Topological Orthogonality
- Title(参考訳): MUSE:トポロジカル直交による視覚的トークン化におけるマニフォールドミスサライメントの解消
- Authors: Panqi Yang, Haodong Jing, Jiahao Chao, Tingyan Xiang, Li Lin, Yao Hu, Yang Luo, Yongqiang Ma,
- Abstract要約: 統一された視覚的トークン化は、高忠実度画素再構成とセマンティック抽象化の基本的なトレードオフに直面している。
トポロジカル直交に基づくフレームワーク MUSE を提案する。
実験によると、MUSEはトレードオフを破り、最先端の世代品質を達成する。
- 参考スコア(独自算出の注目度): 26.66519234315558
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unified visual tokenization faces a fundamental trade-off between high-fidelity pixel reconstruction (spatial equivariance) and semantic abstraction (conceptual invariance). We attribute this conflict to Manifold Misalignment: naive joint optimization induces opposing gradients, creating a zero-sum game between reconstruction and perception. To address this, we propose MUSE, a framework based on Topological Orthogonality. By treating Structure as an orthogonal bridge, MUSE decouples optimization within Transformers: structural gradients refine attention topology, while semantic gradients update feature values. This turns destructive interference into Mutual Reinforcement. Experiments show that MUSE breaks the trade-off, achieving state-of-the-art generation quality (gFID 3.08) and surpassing its teacher InternViT-300M in linear probing (85.2\% vs. 82.5\%), demonstrating that structurally aligned reconstruction can enhance semantic perception. Code is available at https://github.com/PanqiYang1/MUSE.
- Abstract(参考訳): 統一された視覚的トークン化は、高忠実度画素再構成(空間的等分散)と意味的抽象(概念的不変性)の基本的なトレードオフに直面している。
直感的な共同最適化は、反対の勾配を誘導し、再構成と知覚の間にゼロサムゲームを生成する。
そこで本稿では,トポロジカル直交に基づくフレームワークであるMUSEを提案する。
構造勾配は注目トポロジを洗練させ、セマンティック勾配は特徴値を更新する。
これは破壊的な干渉を相互強化に変換する。
実験により、MUSEはトレードオフを破り、最先端の生成品質(gFID 3.08)を達成し、リニアプローブ(85.2\% vs. 82.5\%)で教師のInternViT-300Mを上回っ、構造的に整列された再構成が意味知覚を高めることを示した。
コードはhttps://github.com/PanqiYang1/MUSEで入手できる。
関連論文リスト
- Hyperbolic Enhanced Representation Learning for Incomplete Multi-view Clustering [57.38215918201251]
本稿では,不完全なマルチビュークラスタリングのためのハイパーボリック拡張表現学習フレームワークであるHERLを提案する。
ポアンカレボール内で操作すると、HERLは表現学習を強化するために構造を意識した潜在空間を構築する。
HERLは最先端のアプローチよりも一貫して優れていることを示す。
論文 参考訳(メタデータ) (2026-04-18T10:50:46Z) - The Topology of Multimodal Fusion: Why Current Architectures Fail at Creative Cognition [0.0]
本稿では、パラメトリックではなくトポロジカルな現在のマルチモーダルAIアーキテクチャの限界を特定する。
十字架の枠組みは、Xang を病理的交点に配置し、両軸に沿って 2 つの huacai (変換と切断) を実行する。
これは二重層力学を生み出す:チュアンフア(自然の出来事としての創造的変容)とフアカイ(制度化して繰り返し形にする)である。
トポロジカル正規化を用いたLIPによるUOO実装,エラー型計量を用いたANALOGYベンチマーク,アーキタイプ-TOP3層ベンチマークによるクロスシビライズ型トポロジカル同型試験を提案する。
論文 参考訳(メタデータ) (2026-04-06T06:23:55Z) - TORA: Topological Representation Alignment for 3D Shape Assembly [48.12655111974345]
3次元形状集合のためのフローマッチング法は、部品を組み立てられた構成に向かって輸送する点方向の速度場を学習するが、どの部分間の相互作用が運動を駆動すべきかについて明確なガイダンスは得られない。
ToRAは,凍結した3Dエンコーダから,トレーニング中のフローマッチングバックボーンにリレーショナル構造を蒸留するトポロジファースト表現アライメントフレームワークである。
幾何学的、意味論的、オブジェクト間アセンブリにまたがる5つのベンチマークの実験は、最先端のパフォーマンスを示し、特に目に見えない現実世界や合成データセットへのゼロショット転送が顕著である。
論文 参考訳(メタデータ) (2026-04-05T10:47:52Z) - Structural Action Transformer for 3D Dexterous Manipulation [80.07649565189035]
クロス・エボディメント・スキル・トランスファーは、ハイDoFロボットハンドの課題である。
既存の手法は、しばしば2次元の観測と時間中心の行動表現に依存し、3次元の空間的関係を捉えるのに苦労する。
本稿では、構造中心の視点を導入することで、このパラダイムに挑戦する新しい3Dデクスタラスな操作ポリシーを提案する。
論文 参考訳(メタデータ) (2026-03-04T11:38:12Z) - RecTok: Reconstruction Distillation along Rectified Flow [85.51292475005151]
本稿では2つの重要な革新を通じて高次元視覚トークン化の限界を克服するRecTokを提案する。
提案手法は,VFMにおける意味情報を,フローマッチングにおける前方流路に抽出する。
我々のRecTokは画像再構成、生成品質、識別性能に優れています。
論文 参考訳(メタデータ) (2025-12-15T15:14:20Z) - Learning to Align and Refine: A Foundation-to-Diffusion Framework for Occlusion-Robust Two-Hand Reconstruction [50.952228546326516]
単眼画像からの両手再建は、複雑でダイナミックな手の位置が原因で、永続的な課題に直面している。
既存のアプローチはそのようなアライメントの問題に悩まされ、しばしば不整合と侵入の成果物をもたらす。
本稿では,視覚基礎モデルからの2次元事前ガイダンスを正確に整合させる2段階のファンデーション・ツー・ディフュージョンフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-22T14:42:27Z) - Perception-Oriented Video Frame Interpolation via Asymmetric Blending [20.0024308216849]
ビデオフレーム補間(VFI)の従来の手法は、特にぼやけやゴースト効果の顕在化といった問題に直面している。
本稿では,これらの課題を軽減するためにPerVFI(Perception-oriented Video Frame Interpolation)を提案する。
実験により,PerVFIの優位性が検証され,既存の手法に比べて知覚品質が有意に向上した。
論文 参考訳(メタデータ) (2024-04-10T02:40:17Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。