論文の概要: Test-Time Registers as Global Priors for Tokenized Image Generation
- arxiv url: http://arxiv.org/abs/2607.16824v2
- Date: Tue, 21 Jul 2026 09:16:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 14:48:36.362255
- Title: Test-Time Registers as Global Priors for Tokenized Image Generation
- Title(参考訳): トークン化画像生成におけるグローバルプライオリティとしてのテストタイムレジスタ
- Abstract要約: テストタイムレジスタの特徴は, 画素空間の読み出し値とパッチ平均値の両方よりも強い低周波濃度を示す。
これらの診断に動機づけられたRegTokenは、レジスタ構造をグローバルな先行トークンの小さなセットに変換する訓練手順である。
- 参考スコア(独自算出の注目度): 25.626464690706484
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Attention-based models often develop attention sinks, where a small number of tokens repeatedly attract attention and accumulate unusually large activations. In vision transformers, these outliers are closely related to registers, which have been diagnostically linked to global, low-frequency image structure. Existing work has largely studied registers through interpretability analyses and linear probes, leaving open whether they can be operationalized as plug-and-play signals for generation without retraining. We revisit this question in tokenized image generation. Using OpenCLIP and DINOv2 on ImageNet, we find that test-time register features exhibit stronger low-frequency concentration than both [CLS] readouts and patch-mean features, and show a consistent (albeit moderate) correlation with pixel-space DCT low-frequency energy. Motivated by these diagnostics, we introduce RegToken, a training-free procedure that converts register structure into a small set of global prior tokens by (i) NFN-based layer localization, (ii) TokenRank-guided subspace extraction, and (iii) a projection-and-conservation update on the register subspace. Inserted into a frozen compact 1D token generation pipeline, RegToken improves ImageNet generation and alignment metrics (e.g., FID-5k 20.5 to 20.1, SigLIP 3.6 to 3.9) without modifying pretrained weights, and accelerates test-time optimization (Steps@$τ$ 74 to 52). Overall, our results suggest that structures often viewed as attention artifacts can be repurposed as lightweight global priors for tokenized generation.
- Abstract(参考訳): 注意に基づくモデルはしばしば注意シンクを発生させ、少数のトークンが繰り返し注意を引き付け、異常に大きな活性化を蓄積する。
視覚変換器では、これらの異常値は、グローバルで低周波な画像構造と診断的に関連付けられているレジスタと密接に関連している。
既存の研究は、解釈可能性分析と線形プローブを通じてレジスタを主に研究し、再学習することなく、プラグアンドプレイ信号として動作可能かどうかを公開している。
我々はこの問題をトークン化画像生成で再考する。
ImageNet上のOpenCLIPとDINOv2を用いて、テストタイムレジスタは[CLS]リードアウトとパッチ平均の両方よりも強い低周波濃度を示し、ピクセル空間DCT低周波エネルギーと一貫した(中程度の)相関を示す。
これらの診断に動機づけられたRegTokenは、レジスタ構造をグローバルな先行トークンの小さなセットに変換するトレーニング不要の手順である。
(i)NFNベースの層ローカライゼーション
(二)TokenRank誘導部分空間抽出、及び
(iii)レジスタサブスペースのプロジェクション・アンド・保存更新。
凍結されたコンパクトな1Dトークン生成パイプラインに組み込まれたRegTokenは、事前トレーニングされた重量を変更することなく、ImageNetの生成とアライメントのメトリクス(例えば、FID-5k 20.5から20.1、SigLIP 3.6から3.9)を改善し、テスト時の最適化を加速する(Steps@$τ$74から52)。
以上の結果から,注目成果物と見なされる構造を,トークン生成のための軽量なグローバルな先駆体として再利用できることが示唆された。
関連論文リスト
- Images as Tables: In-Context Learning with TabPFN for Low-Data Detection of AI-Generated Images [21.11425002008934]
1つのジェネレータでトレーニングされた検出器は、新しいジェネレータが現れると失敗することが多い。
本稿では, 凍結したDINOv3バックボーンによって各画像が符号化される, 簡単な画像からテーブルへの定式化について検討する。
DINOv3-PCA-TabPFNは,実用上重要な低データ体制において強くなっている。
論文 参考訳(メタデータ) (2026-05-30T20:00:25Z) - Taming Outlier Tokens in Diffusion Transformers [55.42341508886889]
画像生成のための拡散変換器(DiT)の外部トークンについて検討する。
この現象は、現代の表現オートエンコーダ(RAE)-DiTパイプラインのエンコーダとデノイザの両方に現れる。
両コンポーネントのレジスタベースの介入であるDSR(Dual-Stage Registers)を導入する。
論文 参考訳(メタデータ) (2026-05-06T17:59:42Z) - Position-Aware Scene-Appearance Disentanglement for Bidirectional Photoacoustic Microscopy Registration [6.677604052097574]
光分解能高速光顕微鏡(OR-PAM)
既存の登録法は、輝度コンスタント性仮定に制約され、アライメント品質が制限されている。
GPEReg-Netは、ドメイン固有の外見コードとドメイン固有の外見的特徴を分離する、シーン・外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的外見的特徴を分離するフレームワークである。
OR-PAM-Reg-4Kベンチマークでは、GPEReg-Netが0.953、0.932、PSNRが34.49dB、SSIMが3.8%、SSIMが1.99dBを突破した。
論文 参考訳(メタデータ) (2026-02-17T19:20:23Z) - Self-Supervised Learning via Flow-Guided Neural Operator on Time-Series Data [57.85958428020496]
Flow-Guided Neural Operator (FGNO)は、演算子学習とフローマッチングを組み合わせた新しいフレームワークである。
FGNOは、短時間フーリエ変換を用いて関数空間のマッピングを学習し、異なる時間分解能を統一する。
推論中にノイズのある入力を使用する以前の生成SSL法とは異なり、ノイズのある表現を学習しながら、クリーンな入力を用いて表現抽出を行う。
論文 参考訳(メタデータ) (2026-02-12T18:54:57Z) - SMKC: Sketch Based Kernel Correlation Images for Variable Cardinality Time Series Anomaly Detection [0.0]
運用環境では、監視システムはセンサーチャーンを頻繁に経験する。
本稿では,異常検出器から動的入力構造を分離するフレームワークSMKCを提案する。
SMKC表現におけるランダムプロジェクションと近傍近傍の検出器は、完全に訓練されたベースラインと競合する。
論文 参考訳(メタデータ) (2026-01-28T21:15:11Z) - ResTok: Learning Hierarchical Residuals in 1D Visual Tokenizers for Autoregressive Image Generation [64.84095852784714]
Residual Tokenizer (ResTok)は、画像トークンと潜在トークンの両方の階層的残基を構築する1Dビジュアルトークンライザである。
視覚的トークン化における階層的残差の復元はAR画像生成を著しく改善し,ImageNet-256ではわずか9ステップで2.34gFIDを達成した。
論文 参考訳(メタデータ) (2026-01-07T14:09:18Z) - Trainable Log-linear Sparse Attention for Efficient Diffusion Transformers [36.26426380985327]
Diffusion Transformers (DiTs) は、視覚生成における技術の状態を設定しているが、その二次的な自己注意コストは、長いトークンシーケンスへのスケーリングを制限している。
最近のTop-Kスパースアテンションアプローチは、トークンをブロックワイズ表現に圧縮することで、DiTの計算を減らす。
極長トークン列に対するトレーニング可能なスパースアテンション機構であるログ線形スパースアテンション(LLSA)を導入する。
論文 参考訳(メタデータ) (2025-12-18T14:53:12Z) - REAR: Rethinking Visual Autoregressive Models via Generator-Tokenizer Consistency Regularization [130.46612643194973]
reARはトークン単位の正規化目標を導入する単純なトレーニング戦略です。
ImageNetでは、gFIDを3.02から1.86に削減し、標準化ベースのトークンーザを使用してISを316.9に改善している。
高度なトークン化器に適用すると、177Mパラメータしか持たない1.42のgFIDが達成され、その性能はより大きな最先端拡散モデル(675M)と一致する。
論文 参考訳(メタデータ) (2025-10-06T02:48:13Z) - Robust Latent Matters: Boosting Image Generation with Sampling Error Synthesis [57.7367843129838]
最近の画像生成方式は、凍結した画像トークン化器に依存した事前構築された潜在空間における画像分布を典型的に捉えている。
本稿では,遅延空間構築を容易にするための新しいプラグ・アンド・プレイ・トークンライザ・トレーニング手法を提案する。
論文 参考訳(メタデータ) (2025-03-11T12:09:11Z) - Modulated Periodic Activations for Generalizable Local Functional
Representations [113.64179351957888]
我々は,複数のインスタンスに一般化し,最先端の忠実性を実現する新しい表現を提案する。
提案手法は,画像,映像,形状の汎用的な機能表現を生成し,単一信号に最適化された先行処理よりも高い再構成品質を実現する。
論文 参考訳(メタデータ) (2021-04-08T17:59:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。