論文の概要: RefRoute: Decoupling Conditioning Cost from References via Compact Residual Conditioning and Spatial Routing
- arxiv url: http://arxiv.org/abs/2610.07720v1
- Date: Tue, 06 Oct 2026 04:16:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.796238
- Title: RefRoute: Decoupling Conditioning Cost from References via Compact Residual Conditioning and Spatial Routing
- Title(参考訳): RefRoute: コンパクトな残留条件と空間的ルーティングによる参照からのコンディショニングコストの分離
- Abstract要約: RefRouteは参照表現コストと注意のオーバーヘッドの両方に対処するフレームワークである。
我々は、多参照生成モデルのトレーニングを行うRefRoute-Dataと、人間、オブジェクト、混合合成を10-17参照で対象とするベンチマークであるManyRef100を紹介する。
- 参考スコア(独自算出の注目度): 45.37193171162415
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multi-reference image generation requires preserving the appearance of multiple subjects while composing them into a coherent scene. However, existing diffusion transformers commonly encode references as dense visual token grids and jointly process them with global attention, making conditioning increasingly expensive as the number and resolution of references grow. We present RefRoute, a framework that addresses both reference representation cost and attention overhead through two complementary mechanisms. Compact residual conditioning combines low-resolution latent tokens with lightweight residual features extracted from full-resolution pixels, reducing reference token counts while retaining fine-grained appearance cues. Condition routing and attention routing align reference tokens with their assigned target regions and restrict cross-reference interactions, while allowing selective reference access beyond region boundaries for scene integration. We further introduce RefRoute-Data for training many-reference generation models and ManyRef100, a benchmark spanning human, object, and mixed compositions with 10-17 references. After many-reference fine-tuning, RefRoute achieves an overall Weighted-Ref-VIEScore of 36.06 on ManyRef100, compared with 8.88 for FLUX.2-Klein-9B. Separate inference-cost evaluations show substantially slower latency growth as the reference count increases: at 16 references, our 50-step and 4-step configurations achieve $18.3\times$ and $14.2\times$ speedups over their corresponding FLUX baselines, respectively. These results establish compact reference representations and spatially routed attention as an effective approach to scalable many-reference image generation.
- Abstract(参考訳): マルチ参照画像生成には、複数の被写体の外観を保ちながら、それらをコヒーレントなシーンに構成する必要がある。
しかし、既存の拡散トランスフォーマーは、一般的に、高密度な視覚的トークングリッドとして参照を符号化し、それらをグローバルな注目と共に共同処理することで、参照の数や解像度が増加するにつれて、条件付けがますます高価になる。
RefRouteは、参照表現コストと2つの相補的なメカニズムによる注意オーバーヘッドの両方に対処するフレームワークである。
コンパクトな残留条件付けは、解像度の低い潜在トークンとフル解像度の画素から抽出された軽量な残留特徴を組み合わせることで、微細な外観を保ちながら参照トークン数を削減する。
コンディションルーティングとアテンションルーティングは、指定されたターゲット領域に参照トークンをアライメントし、クロスリファレンスインタラクションを制限すると同時に、シーン統合のための領域境界を越えた選択的参照アクセスを可能にする。
さらに、多参照生成モデルのトレーニングを行うRefRoute-Dataと、人間、オブジェクト、混合合成を10-17参照で対象とするベンチマークであるManyRef100を紹介する。
マルチ参照の微調整の後、RefRouteはMandRef100で36.06の重み付きVIESスコアを達成したが、FLUX.2-Klein-9Bでは8.88であった。
16の参照では、50ステップ構成と4ステップ構成がそれぞれ、対応するFLUXベースラインよりも18.3\times$と14.2\times$のスピードアップを達成する。
これらの結果は、コンパクトな参照表現を確立し、拡張性のあるマルチ参照画像生成への効果的なアプローチとして、空間的に注意をルーティングする。
関連論文リスト
- RefAdapt-DiT: Adaptive Joint Attention for Reference-Conditioned Diffusion Transformers [25.946135618207723]
RefAdaptは、参照とターゲット間の共同注意を適応的に制御するための、トレーニング不要のフレームワークである。
RefAdaptは4ステップのMiniMax H3で2.097times$と8ステップのQwen Image Editで3.54times$のスピードアップを可能にする。
論文 参考訳(メタデータ) (2026-09-26T09:44:33Z) - RefCompose: Multi-Reference Image Generation via LoRA-Conditioned Diffusion [0.7922558880545528]
RefComposeはピクセル空間のコンポジションコンディショニングフレームワークである。
これは、ひとつの固定解像度参照キャンバスを通じて、EmphからEmphを分離する。
レイアウトベースと、色、テクスチャ、形状、空間精度、およびより高い参照数でのアイデンティティ/コンテンツ保存の多基準ベースラインの状態を一貫して上回る。
論文 参考訳(メタデータ) (2026-09-26T09:07:48Z) - MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation [27.198976547095565]
MR2AV(Multi-Reference-to-audio-video)生成は,複数の参照とテキスト命令を条件としたコヒーレントなオーディオビデオコンテンツを生成することを目的としている。
既存のベンチマークは主にテキスト駆動生成、単一参照主題保存、孤立したオーディオビデオアライメントに焦点を当てている。
MR2AV生成のための統合ベンチマークであるMultiRef-を導入する。
論文 参考訳(メタデータ) (2026-07-15T16:02:45Z) - Representation and Reference Selection in Training-Free Synthetic Image Attribution [20.117588342501758]
合成画像属性は、与えられたAI生成画像に責任があるジェネレータを特定することを目的としている。
我々は、参照とオフザシェルフ事前学習表現を用いて、この相互作用を制御した分析を行う。
その結果, 帰属精度は中間表現レベルで常にピークとなることがわかった。
論文 参考訳(メタデータ) (2026-07-13T18:10:39Z) - Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation [65.7390808636333]
マルチラウンド・リフレクティブ・ビジュアル・ジェネレーション(RVG)を実現するためのコア・フレームワークとしてReason-Reflect-Rectify(R3)ループを形式化する。
R3-Benchは600以上のエキスパートアノテーション付きインスタンスのベンチマークで、反復的推論と修正機能を定量化します。
実験の結果、R3-RefinerはR3-Benchを大幅に改善した。
論文 参考訳(メタデータ) (2026-05-19T10:24:31Z) - UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation [65.53694602893042]
VLMエンコーディングの前にVTとVAE機能を融合した統合ビジュアルコンディショニングフレームワークを提案する。
2つのマルチ参照生成ベンチマークの実験により、UniCustomは主題の一貫性、命令従順、構成の忠実さを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-05-12T13:10:05Z) - RefAlign: Representation Alignment for Reference-to-Video Generation [53.368296137314225]
RefAlignは、DiT参照ブランチ機能を視覚基礎モデルのセマンティック空間に整列する表現アライメントフレームワークである。
OpenS2V-Evalベンチマークの実験では、RefAlignがTotalScoreの最先端メソッドより優れていることが示されている。
論文 参考訳(メタデータ) (2026-03-26T17:59:57Z) - TokenAR: Multiple Subject Generation via Autoregressive Token-level enhancement [87.82338951215131]
TokenARは、参照ID混乱問題に対処するための、単純だが効果的なトークンレベル拡張機構である。
Token Injectionのインストラクションは、参照トークンの詳細なおよび補完的な事前を注入する、余分な視覚的特徴コンテナの役割として機能する。
Identity-token disentanglement Strategy(ITD)は、トークン表現を個々のアイデンティティの特徴を独立に表現するために明示的にガイドする。
論文 参考訳(メタデータ) (2025-10-18T03:36:26Z) - MASA-SR: Matching Acceleration and Spatial Adaptation for
Reference-Based Image Super-Resolution [74.24676600271253]
本稿では、RefSRのためのMASAネットワークを提案し、これらの問題に対処するために2つの新しいモジュールを設計する。
提案したMatch & extract Moduleは、粗大な対応マッチング方式により計算コストを大幅に削減する。
空間適応モジュールは、LR画像とRef画像の分布の差を学習し、Ref特徴の分布を空間適応的にLR特徴の分布に再マップする。
論文 参考訳(メタデータ) (2021-06-04T07:15:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。