論文の概要: Form and Void: Entangled Composition through an Autonomous AI Agent
- arxiv url: http://arxiv.org/abs/2610.02045v2
- Date: Fri, 02 Oct 2026 02:02:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:30.004192
- Title: Form and Void: Entangled Composition through an Autonomous AI Agent
- Title(参考訳): フォームとヴォイド:自律型AIエージェントによる絡み合った構成
- Abstract要約: 正負空間生成のためのマルチモーダルエージェントである textbfFaV-A を提案する。
FaV-Aはまずベースオブジェクトを生成し、次にその形状と空間構造を分析して、候補の負空間の意味を識別する。
実験結果とアブレーション分析により,FaV-Aは直接ゼロショットMLLMベースラインよりも効果的なフレームワークを提供することが示された。
- 参考スコア(独自算出の注目度): 25.1932920907602
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Positive and negative space is a fundamental principle in visual composition, supporting visually coherent forms and layered semantic relationships. Generating such compositions is challenging because it requires coordinated control over two semantic concepts that share a common boundary. Although recent text-to-image models and multimodal large language models (MLLMs) have achieved strong performance in image generation and visual understanding, positive-negative space generation remains difficult, particularly under direct single-pass prompting. In this work, we present the \textbf{F}orm \textbf{a}nd \textbf{V}oid \textbf{A}gent (\textbf{FaV-A}), a multimodal agent designed for staged positive-negative space generation. FaV-A follows a progressive workflow: it first generates a base object, then analyzes its shape and spatial structure to identify candidate negative-space semantics, and finally produces compositional instructions for the final image generation stage. Experimental results and ablation analyses suggest that FaV-A provides a more effective framework than direct zero-shot MLLM baselines for producing visually coherent and semantically aligned positive-negative space compositions.
- Abstract(参考訳): 正の空間と負の空間は視覚構成の基本的な原理であり、視覚的に一貫性のある形式と階層化された意味的関係をサポートする。
このような構成を生成することは、共通の境界を共有する2つの意味概念を協調的に制御する必要があるため、難しい。
近年のテキスト・ツー・イメージモデルとマルチモーダル・大規模言語モデル(MLLM)は画像生成や視覚的理解において高い性能を保っているが、特に直接シングルパスプロンプトの下では、肯定的な空間生成は難しいままである。
本研究では, 正負の空間生成のためのマルチモーダルエージェントである \textbf{F}orm \textbf{a}nd \textbf{V}oid \textbf{A}gent (\textbf{FaV-A}) を提案する。
FaV-Aは、まずベースオブジェクトを生成し、次にその形状と空間構造を分析して、候補の負空間の意味を識別し、最終的に最終画像生成段階の合成命令を生成する。
実験結果とアブレーション分析の結果から,FaV-Aは視覚的に整合的で意味的に整合した正負の空間組成を生成するために,直接ゼロショットMLLMベースラインよりも効果的なフレームワークを提供することが示された。
関連論文リスト
- Less Is More: Balancing Positive and Negative Space in Visual Concept Blending [6.1161573972598875]
グラフィックデザイナは視覚的概念をブレンドして、単一のイメージ内で複数のアイデアを伝達することが多い。
混合プロセス全体を通して正負の空間を明示的に適用する自動パイプラインを提案する。
肯定的空間と否定的空間を効果的に活用することにより、表現性、創造性、概念認識性を向上する。
論文 参考訳(メタデータ) (2026-08-31T23:25:28Z) - DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation [53.011370226020695]
DINOdeは、CLIPテキストの埋め込みをDINO視覚多様体と整合させるODEベースのフレームワークである。
提案手法では, (i) Semantic Text Flow (STF) と (ii) Global Context Flow (GCF) の2つの相補的要素を用いて, DINO の CLS トークンが持つ全体像表現を洗練する。
連続軌道としてアライメントをモデル化することにより、ディノドは離散射影に固有の絡み合いを回避し、より堅牢なクロスモーダルアライメントをもたらす。
論文 参考訳(メタデータ) (2026-07-23T14:37:27Z) - OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following [59.53720386342017]
拡張性のある多対人視線推論に基礎的な視覚言語モデルを適用する統合視覚言語フレームワークを提案する。
すべての個人をモデル化することにより、OmniGFは正確な空間的視線目標推定、意味的視線予測、複雑な社会的視線推定をシームレスに統合する。
論文 参考訳(メタデータ) (2026-05-26T00:08:06Z) - Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency [53.28076739140119]
本稿では,視覚・言語モデル(VLM)における論理的一貫性を幾何学的・言語的双対性演算によって実現する枠組みを提案する。
SAGEは、従来のGRPO法に比べてモデルに依存しず、データ効率が良く、既存のVLMに軽量な後学習段階として適用することができる。
ビデオおよび空間推論ベンチマークの実験では、強いベースラインよりも一貫した改善が示されている。
論文 参考訳(メタデータ) (2026-05-18T10:05:21Z) - SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation [62.55421542903781]
生成された画像の空間的レイアウトを評価するために明示的に設計された検証可能な報酬モデルである textbfSpatialReward を提案する。
安定拡散とFLUXの実験により、空間的リワードをRLトレーニングに組み込むことで、空間的一貫性と全体的な生成品質が一貫して向上することが示された。
論文 参考訳(メタデータ) (2026-03-23T17:26:35Z) - SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models [73.19044613922911]
大規模視覚言語モデル(VLM)は、転送ベースの対向摂動に対して脆弱である。
SGHA-Attackは、複数のターゲット参照を採用し、中間層一貫性を強制するフレームワークである。
オープンソースおよび商用のブラックボックスVLMの実験は、SGHA-Attackが従来の方法よりも強力な目標転送性を実現することを示している。
論文 参考訳(メタデータ) (2026-02-02T03:10:41Z) - Growing Visual Generative Capacity for Pre-Trained MLLMs [60.826355079902505]
Bridgeは純粋な自己回帰統合MLLMであり、学習済みの視覚的理解モデルを生成能力で強化する。
本稿では,コンパクトなセマンティックトークンと微細なピクセルトークンを統合するセマンティック・ツー・ピクセルの離散表現を提案する。
論文 参考訳(メタデータ) (2025-10-02T00:40:02Z) - Not Only Text: Exploring Compositionality of Visual Representations in Vision-Language Models [26.525531111141717]
ビジョンランゲージモデルは、テキストと画像の共有機能空間を学習し、異なるモードの入力の比較を可能にする。
画像領域における構成性について検討し、合成特性の分析は視覚データのノイズと空間性によって挑戦される。
本稿では,GDE(Geodesically Decomposable Embeddings)と呼ばれるフレームワークを提案する。
論文 参考訳(メタデータ) (2025-03-21T13:46:53Z) - BIFRÖST: 3D-Aware Image compositing with Language Instructions [27.484947109237964]
Bifr"ostは、命令ベースの画像合成を実行するために拡散モデルに基づいて構築された、新しい3D対応フレームワークである。
Bifr"ostは、MLLMを2.5D位置予測器として訓練し、デプスマップを生成プロセス中に余分な条件として統合することで問題に対処する。
論文 参考訳(メタデータ) (2024-10-24T18:35:12Z) - Improving Compositional Text-to-image Generation with Large
Vision-Language Models [26.202725136839632]
合成テキスト画像モデルは、入力テキストと整合した高品質な画像を生成するのにしばしば困難に直面する。
生成した画像と対応する入力テキストのアライメントの多次元評価には,大規模視覚言語モデル(LVLM)を用いる。
提案手法は,合成画像生成におけるテキスト画像のアライメントを大幅に改善することを確認した。
論文 参考訳(メタデータ) (2023-10-10T05:09:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。