論文の概要: Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation
- arxiv url: http://arxiv.org/abs/2603.18627v1
- Date: Thu, 19 Mar 2026 08:50:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-20 17:19:06.041467
- Title: Agentic Flow Steering and Parallel Rollout Search for Spatially Grounded Text-to-Image Generation
- Title(参考訳): テキスト・画像生成のためのエージェントフローステアリングと並列ロールアウト探索
- Abstract要約: FLUX.1-dev上に構築されたトレーニング不要のクローズドループフレームワークであるAFS-Searchを紹介する。
AFS-Searchには、トレーニング不要の並列ロールアウト検索とフローステアリング機構が組み込まれている。
また,高速化のためのAFS-Search-Proや,高速化のためのAFS-Search-Fastも提供する。
- 参考スコア(独自算出の注目度): 35.279534263459716
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Precise Text-to-Image (T2I) generation has achieved great success but is hindered by the limited relational reasoning of static text encoders and the error accumulation in open-loop sampling. Without real-time feedback, initial semantic ambiguities during the Ordinary Differential Equation trajectory inevitably escalate into stochastic deviations from spatial constraints. To bridge this gap, we introduce AFS-Search (Agentic Flow Steering and Parallel Rollout Search), a training-free closed-loop framework built upon FLUX.1-dev. AFS-Search incorporates a training-free closed-loop parallel rollout search and flow steering mechanism, which leverages a Vision-Language Model (VLM) as a semantic critic to diagnose intermediate latents and dynamically steer the velocity field via precise spatial grounding. Complementarily, we formulate T2I generation as a sequential decision-making process, exploring multiple trajectories through lookahead simulations and selecting the optimal path based on VLM-guided rewards. Further, we provide AFS-Search-Pro for higher performance and AFS-Search-Fast for quicker generation. Experimental results show that our AFS-Search-Pro greatly boosts the performance of the original FLUX.1-dev, achieving state-of-the-art results across three different benchmarks. Meanwhile, AFS-Search-Fast also significantly enhances performance while maintaining fast generation speed.
- Abstract(参考訳): 高精度テキスト・トゥ・イメージ(T2I)生成は成功したが、静的テキストエンコーダの限定的なリレーショナル推論と、オープンループサンプリングにおけるエラー蓄積によって妨げられている。
実時間フィードバックがなければ、正規微分方程式軌道の初期意味的曖昧さは必然的に空間的制約から確率的偏差へとエスカレートする。
このギャップを埋めるために、FLUX.1-dev上に構築されたトレーニング不要のクローズドループフレームワークであるAFS-Search(Agentic Flow Steering and Parallel Rollout Search)を紹介する。
AFS-Searchにはトレーニング不要なクローズドループ並列ロールアウト探索とフローステアリング機構が組み込まれており、VLM(Vision-Language Model)を意味論的批判として活用し、中間潜伏者を診断し、正確な空間接地により速度場を動的に操縦する。
相補的に、T2I生成を逐次決定過程として定式化し、ルックアヘッドシミュレーションにより複数の軌道を探索し、VLM誘導報酬に基づいて最適経路を選択する。
さらに,高速化のためのAFS-Search-Proと,高速化のためのAFS-Search-Fastを提供する。
AFS-Search-Proは、元のFLUX.1-devの性能を大幅に向上させ、3つの異なるベンチマークで最先端の結果を得ることを示した。
一方、AFS-Search-Fastは高速な生成速度を維持しながら性能を大幅に向上させる。
関連論文リスト
- FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation [33.92221208368759]
Vision-Language Navigation (VLN)は、言語命令をリアルタイムの視覚入力にマッピングすることで、未知の環境での自律的なナビゲーションである。
既存の方法は、グローバルマルチモーダル理解とシーケンシャルアクション生成の間の構造的不整合に悩まされている。
FSD-VLNは,セマンティック推論と低高度飛行コマンド生成を混在させる高速なデュアルシステムアーキテクチャである。
論文 参考訳(メタデータ) (2026-07-09T11:17:04Z) - Drifting Models for Surrogate Flow Modeling [0.4925906256430175]
学習されたVAE潜在空間でドリフトを行う条件付きアーキテクチャを導入し,ラベル認識マスキングを用いて生成したサンプルを境界条件に整列させる。
我々のモデルは、2桁の精度と流れの整合性の反復拡散に一致し、2桁の速度で実行することができる。
論文 参考訳(メタデータ) (2026-06-05T17:35:09Z) - Accelerating Rectified Flow Models via Trajectory-Aware Caching [35.13071059415995]
我々は,スキップ・then-compensateパラダイムに従って,トレーニング不要なアクセラレーションフレームワークであるTACacheを提案する。
Trajectory-Aware Cacheは、テキスト・ツー・イメージ・ジェネレーションで最大4.14スピードアップ、テキスト・ツー・ビデオ・ジェネレーションで2.11スピードアップを達成する。
論文 参考訳(メタデータ) (2026-05-16T03:44:58Z) - Relatron: Automating Relational Machine Learning over Relational Databases [50.94254514286021]
本稿では, RDL と DFS を共有設計空間に統合し, 多様な RDB タスクを対象としたアーキテクチャ中心の検索を行う。
RDLはDFSを一貫して上回り、高いタスク依存性を持つ。(2)タスク全体において単一のアーキテクチャが支配的であり、タスク認識モデル選択の必要性を強調し、精度は選択アーキテクチャの信頼性の低いガイドである。
論文 参考訳(メタデータ) (2026-02-26T02:45:22Z) - Formalizing the Sampling Design Space of Diffusion-Based Generative Models via Adaptive Solvers and Wasserstein-Bounded Timesteps [4.397130429878499]
拡散に基づく生成モデルは、様々な領域で顕著な性能を達成してきたが、その実践的展開は、しばしば高いサンプリングコストによって制限されている。
本稿では,数値解法を拡散軌道の固有特性と整合する原理的枠組みであるSDMを提案する。
ODE のダイナミクスを解析することにより,低次解法は初期高雑音で十分であり,高次解法は後段の非線形性の増加に対応するために段階的に展開可能であることを示す。
論文 参考訳(メタデータ) (2026-02-13T05:02:07Z) - FlowConsist: Make Your Flow Consistent with Real Trajectory [99.22869983378062]
現在の高速フロートレーニングパラダイムには,2つの根本的な問題がある,と我々は主張する。
ランダムにペアリングされたノイズデータサンプルから構築された条件付き速度は、系統的な軌跡ドリフトを導入する。
本研究では,高速フローにおける軌道整合性を実現するためのトレーニングフレームワークであるFlowConsistを提案する。
論文 参考訳(メタデータ) (2026-02-06T03:24:23Z) - Real-Time LiDAR Super-Resolution via Frequency-Aware Multi-Scale Fusion [0.4078247440919472]
FLASH (Frequency-aware LiDAR Adaptive Super- resolution with Hierarchical fusion) は、二重ドメイン処理による制限を克服する新しいフレームワークである。
FLASHは、2つの重要なイノベーションを統合する: (i) 局所的な空間的注意とFFTによるグローバルな周波数領域分析を組み合わせ、細粒度の幾何と周期的な走査パターンの両方をログ線形複雑度で捉え、 (ii) 学習された位置特異的な特徴集約による従来のスキップ接続を置き換え、CBAMによる動的特徴選択のために強化する適応的マルチスケールフュージョン。
論文 参考訳(メタデータ) (2025-11-10T18:38:15Z) - FLEX: A Backbone for Diffusion-Based Modeling of Spatio-temporal Physical Systems [51.15230303652732]
FLEX (F Low Expert) は、時間物理系の生成モデリングのためのバックボーンアーキテクチャである。
拡散モデルにおける速度場の分散を低減し、トレーニングの安定化に役立つ。
少数の特徴を2つの逆拡散ステップとして用いて、超解像および予測タスクの正確な予測を行う。
論文 参考訳(メタデータ) (2025-05-23T00:07:59Z) - Towards Low-Latency Event Stream-based Visual Object Tracking: A Slow-Fast Approach [32.91982063297922]
我々は,SFTrackと呼ばれる,異なる運用要件に柔軟に対応する新しいスローファストトラッキングパラダイムを提案する。
提案するフレームワークは2つの補完モード,すなわち,十分な計算資源を持つシナリオを対象とした高精度なスロートラッカと,レイテンシを意識したリソース制約のある環境に適した効率的な高速トラッカをサポートする。
このフレームワークは,まず高時間分解能イベントストリームからグラフベースの表現学習を行い,学習したグラフ構造化情報を2つのFlashAttentionベースのビジョンバックボーンに統合する。
論文 参考訳(メタデータ) (2025-05-19T09:37:23Z) - Fast T2T: Optimization Consistency Speeds Up Diffusion-Based Training-to-Testing Solving for Combinatorial Optimization [83.65278205301576]
雑音レベルから与えられたインスタンスの最適解への直接写像を学習し、最小限のショットで高品質な生成を容易にすることを提案する。
これは、サンプル間の差を最小限に抑える最適化一貫性トレーニングプロトコルによって達成される。
The Traveling Salesman Problem (TSP) と Maximal Independent Set (MIS) は、ソリューションの品質と効率の両方に関して、Fast T2Tの優位性を実証している。
論文 参考訳(メタデータ) (2025-02-05T07:13:43Z) - DiffuSeq-v2: Bridging Discrete and Continuous Text Spaces for
Accelerated Seq2Seq Diffusion Models [58.450152413700586]
ガウス空間に基づく離散突然変異を再構成する学習において拡散モデルを容易にする軟吸収状態を導入する。
我々は、サンプリングプロセスの高速化のために、連続空間内で最先端のODEソルバを用いている。
提案手法は, トレーニング収束率を4倍に向上させ, 類似品質のサンプルを800倍高速に生成する。
論文 参考訳(メタデータ) (2023-10-09T15:29:10Z) - Robust Fully-Asynchronous Methods for Distributed Training over General Architecture [11.480605289411807]
分散機械学習問題における完全な同期は、レイテンシ、パッケージの損失、ストラグラーの存在のため、非効率であり、不可能である。
本稿では,R-FAST (Fully-Asynchronous Gradient Tracking Method) を提案する。
論文 参考訳(メタデータ) (2023-07-21T14:36:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。