論文の概要: ATHENA: Adaptive Test-Time Steering for Improving Count Fidelity in Diffusion Models
- arxiv url: http://arxiv.org/abs/2603.19676v1
- Date: Fri, 20 Mar 2026 06:20:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 19:48:39.022992
- Title: ATHENA: Adaptive Test-Time Steering for Improving Count Fidelity in Diffusion Models
- Title(参考訳): AtheNA:拡散モデルにおけるカウント忠実度向上のための適応的テスト時間ステアリング
- Authors: Mohammad Shahab Sepehri, Asal Mehradfar, Berk Tinaz, Salman Avestimehr, Mahdi Soltanolkotabi,
- Abstract要約: AtheNAは、モデルアーキテクチャの変更や再トレーニングを必要とせずに、オブジェクトカウントの忠実度を改善する、モデルに依存しない、テスト時適応型ステアリングフレームワークである。
AtheNAは、特に高い目標数において、複数の拡散バックボーン間の良好な精度-実行時のトレードオフを維持しながら、カウント忠実度を一貫して改善することを示す。
- 参考スコア(独自算出の注目度): 33.6472089558906
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-to-image diffusion models achieve high visual fidelity but surprisingly exhibit systematic failures in numerical control when prompts specify explicit object counts. To address this limitation, we introduce ATHENA, a model-agnostic, test-time adaptive steering framework that improves object count fidelity without modifying model architectures or requiring retraining. ATHENA leverages intermediate representations during sampling to estimate object counts and applies count-aware noise corrections early in the denoising process, steering the generation trajectory before structural errors become difficult to revise. We present three progressively more advanced variants of ATHENA that trade additional computation for improved numerical accuracy, ranging from static prompt-based steering to dynamically adjusted count-aware control. Experiments on established benchmarks and a new visually and semantically complex dataset show that ATHENA consistently improves count fidelity, particularly at higher target counts, while maintaining favorable accuracy-runtime trade-offs across multiple diffusion backbones.
- Abstract(参考訳): テキスト・ツー・イメージ拡散モデルは高い視覚的忠実度を達成するが、明示的な対象数を指定するプロンプトによって数値制御の体系的な失敗を示す。
この制限に対処するため、モデルアーキテクチャの変更や再トレーニングを必要とせずに、オブジェクトのカウント忠実度を改善する、モデルに依存しない、テスト時適応型ステアリングフレームワークであるATHENAを導入する。
AtheNAは、サンプリング中の中間表現を利用してオブジェクト数を推定し、復調過程の早い段階でカウントアウェアノイズ補正を適用し、構造誤差が修正される前に生成軌道を操縦する。
静的なプロンプトベースステアリングから動的に調整されたカウント・アウェア制御に至るまで,AtheNAのより高度な3つの変種について述べる。
確立されたベンチマークと、新しい視覚的かつセマンティックな複雑なデータセットの実験により、ATHENAは複数の拡散バックボーン間の良好な精度-実行時のトレードオフを維持しながら、特に高いターゲット数でのカウント忠実度を一貫して改善している。
関連論文リスト
- Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models [60.25003813232697]
本稿では,Masked Diffusion Models (MDMs) のトレーニング自由適応ガイダンスフレームワークとして,適応検索型Masked Diffusion (ARAM) を提案する。
ARAMは、検索した文脈によって誘導される分布シフトのSNR(Signal-to-Noise Ratio)に従って、雑音発生時の誘導スケールを校正する。
複数の知識集約型QAベンチマークの実験は、ARAMが競争力のあるRAGベースラインよりも全体的なQA性能を改善することを示している。
論文 参考訳(メタデータ) (2026-03-18T12:54:50Z) - ResAD: Normalized Residual Trajectory Modeling for End-to-End Autonomous Driving [64.42138266293202]
ResADは正規化された残留軌道モデリングフレームワークである。
学習タスクを再編成し、慣性参照からの残留偏差を予測する。
NAVSIMベンチマークでは、ResADはバニラ拡散ポリシーを用いて最先端のPDMS 88.6を達成している。
論文 参考訳(メタデータ) (2025-10-09T17:59:36Z) - Towards Foundation Models for Zero-Shot Time Series Anomaly Detection: Leveraging Synthetic Data and Relative Context Discrepancy [33.68487894996624]
時系列異常検出(TSAD)は重要な課題であるが、見えないデータに一般化するモデルを開発することは大きな課題である。
我々は、新しい事前学習パラダイムの上に構築されたTSADの新たな基盤モデルであるtextttTimeRCDを紹介した。
textttTimeRCD はゼロショット TSAD において,既存の汎用および異常固有の基盤モデルよりも大幅に優れていることを示す。
論文 参考訳(メタデータ) (2025-09-25T14:05:15Z) - CALM: A Framework for Continuous, Adaptive, and LLM-Mediated Anomaly Detection in Time-Series Streams [0.42970700836450476]
本稿では,リアルタイム異常検出のための新しいエンドツーエンドフレームワークであるCALMを紹介する。
CALMはApache Beam分散処理フレームワーク上に構築されている。
クローズドループで連続的な微調整機構を実装し、異常検出モデルがほぼリアルタイムで進化するデータパターンに適応できるようにする。
論文 参考訳(メタデータ) (2025-08-29T00:27:35Z) - Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models [57.49136894315871]
テストタイムスケーリングの新しいパラダイムは、推論モデルと生成視覚モデルにおいて驚くべきブレークスルーをもたらした。
本稿では,テスト時間スケーリングの知識をモデルに組み込むことの課題に対する1つの解決策を提案する。
拡散モデルにおいて、初期入力ノイズを変調するノイズハイパーネットワークにより、報酬誘導試験時間雑音の最適化を行う。
論文 参考訳(メタデータ) (2025-08-13T17:33:37Z) - Inference-Time Scaling of Diffusion Language Models with Particle Gibbs Sampling [70.8832906871441]
我々は、モデルを再訓練することなく、所望の報酬に向けて世代を操る方法を研究する。
従来の手法では、通常は1つの認知軌道内でサンプリングやフィルタを行い、軌道レベルの改善なしに報酬をステップバイステップで最適化する。
本稿では,拡散言語モデル(PG-DLM)の粒子ギブスサンプリングについて紹介する。
論文 参考訳(メタデータ) (2025-07-11T08:00:47Z) - Stochastic Control for Fine-tuning Diffusion Models: Optimality, Regularity, and Convergence [19.484676783876306]
拡散モデルは生成モデリングの強力なツールとして登場してきた。
微調整拡散モデルのための制御フレームワークを提案する。
PI-FTは線形速度で大域収束することを示す。
論文 参考訳(メタデータ) (2024-12-24T04:55:46Z) - Fast-Slow Test-Time Adaptation for Online Vision-and-Language Navigation [67.18144414660681]
オンラインビジョン・アンド・ランゲージナビゲーション(VLN)のためのFSTTA(Fast-Slow Test-Time Adaptation)アプローチを提案する。
提案手法は,4つのベンチマークにおいて顕著な性能向上を実現する。
論文 参考訳(メタデータ) (2023-11-22T07:47:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。