論文の概要: DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation
- arxiv url: http://arxiv.org/abs/2608.04622v1
- Date: Wed, 05 Aug 2026 09:27:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.800369
- Title: DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation
- Title(参考訳): DAC-Pose: Pose-Guided Human Generationのためのデュアルエージェント協調フレームワーク
- Authors: Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun,
- Abstract要約: ポーズ誘導型ヒューマンジェネレーションにおいて、従来の手法は必然的に劇的な視点シフトの下で深刻な視覚的アーティファクトを創出する。
エージェント駆動型マルチモーダルフレームワークであるDAC-Poseを提案する。
DAC-Poseは, 劇的な視点変化の下で, テクスチャアライメントとアイデンティティの整合性を維持するのに優れていることを示す。
- 参考スコア(独自算出の注目度): 14.847948534749001
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI agents have emerged as a powerful new paradigm in generative image synthesis, enabling systems to perform complex semantic reasoning rather than passive pixel-level mapping. In pose-guided human generation, conventional methods inevitably produce severe visual artifacts under drastic viewpoint shifts, fundamentally because they lack the cognitive capacity to logically deduce unseen regions and model complex spatial deformations. To bridge this gap, we propose DAC-Pose, a novel agent-driven multimodal framework that reformulates single-view human generation as a collaborative dual-agent system. DAC-Pose integrates two complementary components, namely, the Prior Semantic Reasoning (PSR) agent and the Discrepancy-Aware Visual Encoding (DAVE) agent. Functioning as a cognitive engine, PSR utilizes collaborative reasoning to deduce the fine-grained attributes of unseen regions. Concurrently, acting as a specialized visual perception agent, DAVE quantifies and encodes viewpoint-induced spatial misalignments, continuously feeding robust spatial constraints back into the generative process. This autonomous feedback loop between semantic deduction and visual perception ensures high-fidelity detail synthesis. Extensive experiments on the DeepFashion and Market-1501 benchmarks validate the superiority of our agent-driven paradigm. Notably, DAC-Pose excels in preserving texture alignment and identity consistency under drastic viewpoint changes. The code is available at https://github.com/AIVRC/DAC-Pose.
- Abstract(参考訳): AIエージェントは、生成画像合成において強力な新しいパラダイムとして登場し、システムは受動的ピクセルレベルのマッピングではなく、複雑なセマンティック推論を実行することができる。
ポーズ誘導型ヒューマンジェネレーションでは、従来の方法では、目立たない領域を論理的に推論し、複雑な空間的変形をモデル化する認知能力が欠如しているため、劇的な視点シフトの下で必然的に深刻な視覚的アーティファクトを生成する。
このギャップを埋めるため,DAC-Poseというエージェント駆動型マルチモーダルフレームワークを提案する。
DAC-Poseは2つの補完的なコンポーネント、すなわち、Presideed Semantic Reasoning (PSR)エージェントとDisdisrepancy-Aware Visual Encoding (DAVE)エージェントを統合している。
認知エンジンとして機能するPSRは、協調推論を利用して、目に見えない領域のきめ細かい特性を推論する。
同時に、特殊視覚認知エージェントとして機能するDAVEは、視点によって引き起こされる空間的不一致を定量化し、エンコードし、連続的に堅牢な空間的制約を生成プロセスにフィードバックする。
この意味推論と視覚知覚の間の自律的なフィードバックループは、高忠実度詳細合成を保証する。
DeepFashionとMarket-1501ベンチマークに関する大規模な実験は、エージェント駆動のパラダイムの優位性を検証する。
特に、DAC-Poseは、劇的な視点変化の下でテクスチャアライメントとアイデンティティ一貫性を維持するのに優れている。
コードはhttps://github.com/AIVRC/DAC-Poseで公開されている。
関連論文リスト
- ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models [11.15585863355844]
エンボディード・ワールド・モデル(EWM)は、エンボディード・インテリジェンスを促進するためのスケーラブルでリスクのないパラダイムとして登場した。
EWMは、低次元アクションと高次元ビデオ合成の間の表現ギャップによってしばしば妨げられる。
本稿では,一貫した長軸生成を実現するフレームワークであるViPSimを提案する。
論文 参考訳(メタデータ) (2026-06-27T08:18:09Z) - SUP-MCRL: Subject-aware Unified Pseudo-feature Coded Multimodal Contrastive Representation Learning for EEG Visual Decoding [4.793866271591739]
非侵襲的な脳-コンピュータインタフェースは、制御された実験室の刺激から現実世界の自然画像に移行する際に顕著な性能劣化を示す。
この劣化は、マルチモーダル・コントラッシブな表現学習モデルが、神経表現と選択的注意における意味的一貫性とオブジェクト間の変動を考慮できないために起こる。
本稿では,これらの制約を克服するための3つの協調機構を統合した統合フレームワークSUP-MCRLを提案する。
論文 参考訳(メタデータ) (2026-06-15T12:06:08Z) - CPC-VAR:Continual Personalized and Compositional Generation in Visual Autoregressive Models [69.9266117908314]
VAR(Visual Autoregressive)モデルは、テキスト・ツー・イメージ生成の効率的なパラダイムとして登場した。
既存のVARベースのパーソナライズ方法は、進化するユーザ要求に対応できない。
VARモデルにおける連続的パーソナライズ生成に関する最初の体系的研究について述べる。
論文 参考訳(メタデータ) (2026-05-19T12:18:15Z) - V-Co: A Closer Look at Visual Representation Alignment via Co-Denoising [65.5867130156805]
統合JTフレームワークにおける視覚的コデノゲーションの体系的研究であるV-Coについて述べる。
本研究は,視覚的コデノジングを効果的に行うための4つの重要な要素を明らかにする。
V-Coは、基礎となる画素空間拡散ベースラインと強い前の画素拡散法より優れている。
論文 参考訳(メタデータ) (2026-03-17T17:01:54Z) - Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning [56.24016465596292]
視覚的メタファーは、抽象概念をインパクトのある視覚的レトリックに変換するために、クロスドメインなセマンティックフュージョンを用いて、人間の創造性の高階形式を構成する。
本稿では,参照画像から「創造的本質」を自律的に分離し,その抽象論理をユーザ特定対象に再物質化する,視覚メタファー伝達(VMT)の課題を紹介する。
提案手法は, メタファーの整合性, アナロジーの適切性, 視覚的創造性においてSOTAのベースラインを著しく上回り, 広告・メディアにおける高度にインパクトのある創造的アプリケーションを自動化するための道を開いた。
論文 参考訳(メタデータ) (2026-02-01T17:01:36Z) - VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction [83.50898344094153]
VQRAEは、イメージ理解のための連続的セマンティック機能と、統一トークン化器内での視覚生成のためのトークンを生成する。
デザインは、多モーダル理解、離散トークンの能力を維持するために、無視可能な意味情報を可能にする。
VQRAEは、視覚的理解、生成、再構築のベンチマークで競合性能を示す。
論文 参考訳(メタデータ) (2025-11-28T17:26:34Z) - S^2Former-OR: Single-Stage Bi-Modal Transformer for Scene Graph Generation in OR [50.435592120607815]
外科手術のシーングラフ生成(SGG)は、手術室(OR)におけるホモロジー認知知能の増強に不可欠である
これまでの研究は主に多段階学習に依存しており、生成したセマンティックシーングラフはポーズ推定とオブジェクト検出を伴う中間プロセスに依存している。
本研究では,S2Former-OR(S2Former-OR)と呼ばれるORにおけるSGGのための新しいシングルステージバイモーダルトランスフォーマフレームワークを提案する。
論文 参考訳(メタデータ) (2024-02-22T11:40:49Z) - A Generically Contrastive Spatiotemporal Representation Enhancement for 3D Skeleton Action Recognition [10.403751563214113]
本稿では, 比較時空間表現拡張(CSRE)フレームワークを提案する。
具体的には、その表現を空間的特徴と時間的特徴に分解し、微細な動きパターンを探索する。
潜伏したデータ分布を明示的に活用するために、コントラスト学習に注意的特徴を用いて、クロスシーケンスセマンティックリレーションをモデル化する。
論文 参考訳(メタデータ) (2023-12-23T02:54:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。