論文の概要: Twins: Learn to Predict Unified Representations with Focal Loss
- arxiv url: http://arxiv.org/abs/2607.22531v1
- Date: Fri, 24 Jul 2026 17:59:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:57.210839
- Title: Twins: Learn to Predict Unified Representations with Focal Loss
- Title(参考訳): Twins氏: 雇用損失で統一表現を予測することを学ぶ
- Authors: Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue,
- Abstract要約: 統一マルチモーダルモデルは、マルチモーダル理解と画像生成の両方をサポートする共有ビジュアルトークン空間を求める。
我々は、同一のトークングリッド上にVTとVAEの機能をチャネル的に連結した、統一された連続トークン空間であるTwinsを提案する。
- 参考スコア(独自算出の注目度): 36.63304689132002
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Unified multimodal models seek a shared visual token space that supports both multimodal understanding and image generation. Discrete methods unify the interface via a shared codebook, whereas continuous pipelines often rely on two disparate representations -- semantic features (e.g., ViT) for understanding and low-level latents (e.g., VAE) for synthesis -- resulting in mismatched latent spaces. We propose Twins, a unified continuous token space formed by channel-wise concatenating ViT and VAE features on the same token grid, so the sequence length is unchanged and attention cost does not increase. However, jointly modeling Twins in a Diffusion Transformer exposes a severe optimization imbalance: the model fits the ViT component well but struggles to match the VAE latent distribution. We trace this imbalance to three sources of heterogeneity: frequency bias, intrinsic dimensionality, and condition-aligned vs condition-independent uncertainty. To address it, we adapt a focal regression objective for flow matching that upweights large-error VAE dimensions, better balancing optimization across the ViT and VAE components. On ImageNet, this yields up to 10.57 gFID gain over naive MSE loss without classifier-free guidance. Twins also performs competitively on multimodal understanding benchmarks and improves reconstruction fidelity, narrowing the gap between understanding- and generation-oriented representations.
- Abstract(参考訳): 統一マルチモーダルモデルは、マルチモーダル理解と画像生成の両方をサポートする共有ビジュアルトークン空間を求める。
離散的なメソッドは共有コードブックを介してインターフェースを統一するが、連続的なパイプラインはしばしば2つの異なる表現に依存している。
我々は、同一のトークングリッド上にViTとVAEの機能をチャネル的に連結した統合された連続トークン空間であるTwinsを提案し、シーケンス長が変化せず、注意コストが上昇しない。
しかし、拡散変換器でツインを共同でモデル化すると、厳密な最適化の不均衡が明らかになる。
この不均衡は、周波数バイアス、内在次元、条件整合対条件非依存の不確実性という3つの不均一性の源に遡る。
そこで本研究では,重み付けされた大誤差VAE次元のフローマッチングに焦点回帰目標を適用し,ViTおよびVAEコンポーネント間の最適化のバランスを良くする。
ImageNetでは、10.57gFIDのゲインを10.57gFIDに抑えている。
ツインズはマルチモーダル理解ベンチマークで競争力を発揮し、再構成の忠実度を改善し、理解指向と生成指向の表現のギャップを狭める。
関連論文リスト
- Rarity-Aware Discrete Diffusion with Spatially Consistent Decoding for Photo-Realistic Image Super-Resolution [80.28905986756685]
DiMOO-SRは光リアル画像超解法のための多モード離散拡散フレームワークである。
広く使われている実世界のSRベンチマークの実験では、DiMOO-SRはいくつかの並列デコードステップで競合する知覚品質を達成する。
論文 参考訳(メタデータ) (2026-07-20T07:01:01Z) - MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging [41.25982557850732]
本稿では,エンコーダ・デコーダアーキテクチャ内で連続(VAE)および離散(VQ)トークンを共同で最適化する統合トークン化ツールであるMergeTokを紹介する。
MergeTokはImageNet-256上で、強力なVAEやVQモデルよりもかなり低いrFIDで、競合する再構築と生成性能を示している。
論文 参考訳(メタデータ) (2026-05-29T06:38:10Z) - DUET: Dual-Paradigm Adaptive Expert Triage with Single-cell Inductive Prior for Spatial Transcriptomics Prediction [6.028508407069093]
組織像から空間的に解決された遺伝子発現を推定することは空間転写学に費用対効果をもたらす。
本稿では,パラメトリック予測とメモリベース検索を共役する新しいデュアルパラダイムフレームワークDUETを提案する。
論文 参考訳(メタデータ) (2026-05-13T20:43:29Z) - V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising [65.5867130156805]
統合JTフレームワークにおける視覚的コデノゲーションの体系的研究であるV-Coについて述べる。
本研究は,視覚的コデノジングを効果的に行うための4つの重要な要素を明らかにする。
V-Coは、基礎となる画素空間拡散ベースラインと強い前の画素拡散法より優れている。
論文 参考訳(メタデータ) (2026-03-17T17:01:54Z) - UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations [45.861324782424326]
現在の統合マルチモーダルモデルは、通常、モダリティギャップを埋めるために離散的な視覚トークン化器に依存している。
圧縮された連続表現によるマルチモーダル理解と生成を調和させる統一フレームワークUniComを導入する。
論文 参考訳(メタデータ) (2026-03-11T12:14:26Z) - DiffusionDriveV2: Reinforcement Learning-Constrained Truncated Diffusion Modeling in End-to-End Autonomous Driving [65.7087560656003]
エンドツーエンドの自動運転のための生成拡散モデルは、しばしばモード崩壊に悩まされる。
強化学習を利用して低品質モードを制約し,優れた軌道探索を行うDiffusionDriveV2を提案する。
これにより、そのコアであるガウス混合モデル固有の多重モード性を維持しながら、全体的な出力品質が大幅に向上する。
論文 参考訳(メタデータ) (2025-12-08T17:29:52Z) - VAEVQ: Enhancing Discrete Visual Tokenization through Variational Modeling [22.005420177236804]
VAEVQは,(1)変分潜時量子化(VLQ),AEを量子化用VOEに置き換えて構造的かつスムーズな潜時空間を活用し,より効率的なコーデックアクティベーションを促進する,(2)表現コヒーレンス戦略(RCS),(2)先行および後列化特徴間のアライメント強度を適応的に調整して整合性を高め,ノイズへの過度適合を防止する,(3)分布整合性正規化(DCR),といった3つの重要なコンポーネントから構成される。
論文 参考訳(メタデータ) (2025-11-10T09:07:23Z) - Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials [34.77694214755808]
MHSA(Multi-Head Self-Attention)の代替品であるVCA(Visual-Contrast Attention)を導入する。
VCAは、O(N N C) から O(N n C) への理論複雑性を n N で減少させながら、識別の明示的な概念を注入する。
モジュールはDeiT-Tinyのバックボーンに0.3M以下のパラメータを追加し、追加のFLOPを必要とせず、完全にアーキテクチャに依存しない。
論文 参考訳(メタデータ) (2025-11-02T07:04:12Z) - Can We Achieve Efficient Diffusion without Self-Attention? Distilling Self-Attention into Convolutions [94.21989689001848]
従来の自己アテンションモジュールをピラミッド畳み込みブロック((Delta)ConvBlocks)に置き換えるための(Delta)ConvFusionを提案する。
ローカライズされた畳み込み操作に注意パターンを蒸留し、他のコンポーネントを凍結させながら、(Delta)ConvFusionは、トランスフォーマーベースの処理に匹敵する性能を達成し、計算コストを6929$times$、LinFusionを5.42$times$の効率で上回る。
論文 参考訳(メタデータ) (2025-04-30T03:57:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。