論文の概要: Attention Dynamics in Diffusion Models: A Visual Analytics Framework for Human-AI Collaboration
- arxiv url: http://arxiv.org/abs/2607.02563v1
- Date: Sun, 28 Jun 2026 23:11:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.324604
- Title: Attention Dynamics in Diffusion Models: A Visual Analytics Framework for Human-AI Collaboration
- Title(参考訳): 拡散モデルにおける注意ダイナミクス:人間-AI協調のためのビジュアル分析フレームワーク
- Authors: Yiran Xiao, George Legrady,
- Abstract要約: 拡散モデルにおける注意動態を探索するための視覚分析フレームワークを提案する。
提案手法は,世代間における注意行動の構造化解析を可能にする。
ケーススタディは、時間的視点と空間的視点がどのようにして生成過程の観察と議論を促進するかを示す。
- 参考スコア(独自算出の注目度): 1.7188280334580195
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Diffusion-based text-to-image models can synthesize complex and highly structured visual content, yet the emergence and evolution of semantic structure remain difficult to interpret. Many existing workflows rely on aggregated attention or scalar summaries that separate temporal change from image-space evidence. To address this gap, we present a visual analytics framework for exploring attention dynamics in diffusion models: the step-indexed evolution of token-level cross-attention maps, their temporal concentration, and their spatial relationships. Our approach enables structured analysis of attention behavior across generation steps by integrating quantitative measures with data-driven stage identification in an interactive workflow. Case studies on a structured 60-prompt Stable-Diffusion-class benchmark illustrate recurring, interpretable patterns within this setting and show how linked temporal and spatial views facilitate the observation and discussion of generative processes, supporting more effective human-AI collaboration.
- Abstract(参考訳): 拡散に基づくテキスト・ツー・イメージ・モデルは複雑で高度に構造化された視覚コンテンツを合成することができるが、意味構造の出現と進化は解釈が難しいままである。
既存のワークフローの多くは、画像空間の証拠から時間的変化を分離する集約された注意またはスカラーの要約に依存している。
このギャップに対処するために,トークンレベルのクロスアテンションマップの段階的進化,時間的集中,空間的関係など,拡散モデルにおける注意力のダイナミクスを探索する視覚分析フレームワークを提案する。
本手法は,対話型ワークフローにおいて,データ駆動型ステージ識別と定量的測度を統合することにより,生成ステップ間での注意行動の構造化解析を可能にする。
構造化された60発の安定拡散型ベンチマークのケーススタディでは、この設定内で繰り返し、解釈可能なパターンが示され、時間的・空間的な視点が生成過程の観察と議論をいかに促進し、より効果的な人間とAIの協調を支援するかが示される。
関連論文リスト
- STAG: Spatio-temporal Evolving Structural Representation of Action Units for Micro-expression Recognition [0.7799711162530713]
微小な表情認識は、微妙で短命な顔面筋運動のために困難である。
既存の手法は頂点オンセットのフレームに大きく依存し、微粒なフレーム間ダイナミクスを見落とし、空間情報と時間情報を別々にモデル化する。
本稿では,動的ROI-AU結合型時空間ネットワークSTAGを提案する。
論文 参考訳(メタデータ) (2026-06-26T13:46:48Z) - K-Models: a Flexible and Interpretable Method for Ordinal Clustering with Application to Antigen-Antibody Interaction Profiles [65.21921642886367]
K-Modelsは、順序的制約を統合し、観察された機能プロファイルを生成するランダムプロセスの基本的な要素を推定する新しいフレームワークである。
提案手法はシミュレーションと実世界の応用を通して評価する。
論文 参考訳(メタデータ) (2026-05-14T13:35:44Z) - VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success [33.810242609054924]
VLA(Vision-Language-Action)モデルは、視覚知覚、言語理解、行動決定を統合し、モーダルなセマンティックアライメントを実現する。
この問題に対処するために、画像エントロピーを用いて、各視覚トークンのグレースケール分布特性を定量化する。
提案手法は推論パラメータを減らし,推論速度を高速化し,既存の手法より優れていることを示す。
論文 参考訳(メタデータ) (2026-04-07T01:52:42Z) - Online Segment Any 3D Thing as Instance Tracking [60.20416622842975]
オンライン3Dセグメンテーションをインスタンス追跡問題として再認識する(AutoSeg3D)。
視覚基礎モデルに固有の断片化問題を緩和するために,空間整合性学習を導入する。
ScanNet200上でESAMを2.8 AP上回る新しい最先端技術を確立する。
論文 参考訳(メタデータ) (2025-12-08T14:48:51Z) - Community-Aware Temporal Walks: Parameter-Free Representation Learning on Continuous-Time Dynamic Graphs [3.833708891059351]
Community-Aware Temporal Walks (CTWalks)は、連続時間動的グラフ上での表現学習のための新しいフレームワークである。
CTWalksは、コミュニティベースのパラメータフリー時間ウォークサンプリング機構、コミュニティラベルに富んだ匿名化戦略、エンコーディングプロセスを統合する。
ベンチマークデータセットの実験では、CTWalksは時間リンク予測タスクにおいて確立された手法よりも優れていた。
論文 参考訳(メタデータ) (2025-01-21T04:16:46Z) - Detecting Neurocognitive Disorders through Analyses of Topic Evolution and Cross-modal Consistency in Visual-Stimulated Narratives [83.15653194899126]
神経認知障害(NCD)の早期発見は、時間的介入と疾患管理に不可欠である。
現在のVSNベースのNCD検出法は主にボトムアップ、刺激駆動認知プロセスと密接に結びついている言語マイクロ構造に焦点を当てている。
本稿では,話題の時間的変化を追跡する動的トピックモデル(DTM)と,物語と視覚刺激の相互整合性を測定するテキスト画像時間アライメントネットワーク(TITAN)の2つの新しいマクロ構造手法を提案する。
論文 参考訳(メタデータ) (2025-01-07T12:16:26Z) - Neuron: Learning Context-Aware Evolving Representations for Zero-Shot Skeleton Action Recognition [64.56321246196859]
本稿では,dUalスケルトン・セマンティック・セマンティック・セマンティック・セマンティック・シンジスティック・フレームワークを提案する。
まず、時空間進化型マイクロプロトタイプを構築し、動的コンテキスト認識側情報を統合する。
本研究では,空間的圧縮と時間的記憶機構を導入し,空間的時間的マイクロプロトタイプの成長を導く。
論文 参考訳(メタデータ) (2024-11-18T05:16:11Z) - Learning In-between Imagery Dynamics via Physical Latent Spaces [0.7366405857677226]
本稿では,連続した時間ステップで観察される2つの画像間の基礎となるダイナミクスを学習するためのフレームワークを提案する。
偏微分方程式(PDE)で表される物理モデルに従う潜在変数を組み込むことにより,本手法は学習モデルの解釈可能性を保証する。
地質画像データを用いた数値実験により,学習フレームワークの堅牢性と有効性を示す。
論文 参考訳(メタデータ) (2023-10-14T05:14:51Z) - Temporal Relevance Analysis for Video Action Models [70.39411261685963]
まず,CNNに基づく行動モデルにより捉えたフレーム間の時間的関係を定量化する手法を提案する。
次に、時間的モデリングがどのように影響を受けるかをよりよく理解するために、包括的な実験と詳細な分析を行います。
論文 参考訳(メタデータ) (2022-04-25T19:06:48Z) - Multiple Object Tracking with Correlation Learning [16.959379957515974]
本研究では,局所相関モジュールを用いて,対象と周辺環境のトポロジカルな関係をモデル化する。
具体的には,各空間の位置とその文脈の密接な対応を確立し,自己教師付き学習を通じて相関量を明確に制約する。
提案手法は, 相関学習と優れた性能の相関学習の有効性を示し, MOT17では76.5%, IDF1では73.6%の最先端MOTAが得られる。
論文 参考訳(メタデータ) (2021-04-08T06:48:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。