論文の概要: Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning
- arxiv url: http://arxiv.org/abs/2608.26993v1
- Date: Thu, 27 Aug 2026 11:41:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.37426
- Title: Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning
- Title(参考訳): Aphanta:マルチモーダル推論のためのタスク対応画像編集中間体診断
- Abstract要約: 明示的な視覚中間体は、空間的エビデンスと更新された視覚状態の外部化に役立つ。
MLLM -> Image Editor -> MLLMパイプラインのための自動タスク発見およびクローズドループ診断フレームワークである textbfAphanta を紹介する。
Aphantaは、直接推論、エディタ生成中間による推論、理想化された参照中間による推論の3つの条件を評価する。
- 参考スコア(独自算出の注目度): 40.55876706740581
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Explicit visual intermediates can help multimodal large language models (MLLMs) externalize spatial evidence and updated visual states, but their utility depends on whether an image editor can faithfully realize the required transformation. We introduce \textbf{Aphanta}, an automated task-discovery and closed-loop diagnostic framework for the MLLM -> image editor -> MLLM pipeline. Aphanta evaluates three conditions---direct reasoning, reasoning with an editor-generated intermediate, and reasoning with an idealized reference intermediate---to separate potential visual headroom from the practical utility of current editors. Across 20 candidate tasks and multiple editor--MLLM combinations, we find that utility is strongly task-conditioned. Gains concentrate in visual cue injection, grounding, and counterfactual state realization, whereas intermediates requiring symbol-sensitive construction or structural extrapolation are substantially less reliable. On the selected positive-task subset, our consolidated Qwen pipeline improves the mean task score from 0.343 to 0.445 ($+10.2$ points; $+29.7\%$ relative), while the full study also retains filtered and unsuccessful tasks to expose the boundary. These results position image editing as a specialized visual workspace rather than a universal reasoning mechanism, and establish Aphanta as a reusable protocol for measuring task--representation alignment, editor realization, and downstream pipeline utility.
- Abstract(参考訳): 明示的な視覚中間体は、空間的証拠や更新された視覚状態の外部化に役立つが、画像エディターが要求される変換を忠実に実現できるかどうかによって異なる。
MLLM -> Image Editor -> MLLMパイプラインのための自動タスク発見およびクローズドループ診断フレームワークである \textbf{Aphanta} を紹介する。
Aphanta は,編集者生成中間体による直接推論,理想化された参照中間体による推論,および現在の編集者の実用性から潜在的視覚ヘッドルームを分離する3つの条件を評価する。20の候補タスクと複数の編集者-MLLM の組み合わせにより,有効性が強いことが分かる。
ゲインは視覚的キュー注入、接地、反ファクト的状態実現に集中しているが、シンボルに敏感な構造や構造的外挿を必要とする中間体は信頼性が著しく低い。
選択されたポジティブタスクサブセットでは、統合されたQwenパイプラインが平均タスクスコアを0.343から0.445(+10.2$ポイント;$+29.7\%$リレーショナル)に改善します。
これらの結果は、画像編集を普遍的な推論機構ではなく、特殊な視覚ワークスペースとして位置づけ、タスク表現アライメント、エディタ実現、下流パイプラインユーティリティを計測するための再利用可能なプロトコルとしてAphantaを確立した。
関連論文リスト
- CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration [11.992882604393003]
CanvasCraftは、複雑な画像の作成と編集のための大規模マルチモーダル・ツール・データセットである。
また,マルチターンインタラクションによる異種視覚ツールのオーケストレーションを学習するマルチモーダルエージェントCanvasAgentについても紹介する。
論文 参考訳(メタデータ) (2026-07-06T04:57:18Z) - IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment [16.199788035961564]
我々は、パラメータ化されたツールを明示的かつ解釈可能なアクション空間で操作することを学ぶ対話型画像編集エージェントIEAを提案する。
IEAは3段階のマルチタスクパイプラインを通じて訓練される: 蒸留された専門家編集のSFT、類似性の改善、ツール有用性、意図の要約のための報奨付きGRPO、(3)画像編集、精細化、ユーザ意図の要約を共同でマスターするための大規模合成微調整。
論文 参考訳(メタデータ) (2026-06-06T07:11:08Z) - MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning [37.02901476078596]
MM-CondChainは、視覚的に深い合成推論のためのベンチマークである。
MM-CondChainは多層推論チェーンとして構成され、各層は非自明な構成条件を含む。
プランナーは構成条件の層間生成をオーケストレーションし、検証可能なプログラム中間表現(VPIR)は各層の状態が機械的に検証可能であることを保証する。
論文 参考訳(メタデータ) (2026-03-12T17:59:56Z) - IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection [40.21337735524356]
IMAGAgentは、"plan-execute-reflect"クローズドループメカニズムに基づいたマルチターン画像編集エージェントフレームワークである。
命令解析、ツールスケジューリング、および統一パイプライン内の適応補正の深いシナジーを実現する。
構築した textbfMTEditBench と MagicBrush データセットによる実験により,IMAGAgent が既存の手法よりもはるかに優れた性能を発揮することが示された。
論文 参考訳(メタデータ) (2026-02-12T02:37:38Z) - VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement [66.13644883379087]
MLLMを用いた3次元オブジェクト配置における3つの課題に対処する。
まず、MLLMの弱い視覚的基盤に対処するために、MPPベースのAPIを導入する。
第2に、MLLMの3Dシーン理解を、特殊な視覚ツール群で強化する。
第3に,反復的かつエラーを起こしやすい更新を管理するために,協調的なマルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-26T19:22:39Z) - Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection [59.04089915447622]
ForenAgentはインタラクティブなIFDフレームワークで、MLLMが検出対象に関するPythonベースの低レベルツールを自律的に生成、実行、洗練することができる。
人間の推論にインスパイアされた我々は、グローバルな認識、局所的な焦点、反復的探索、そして全体論的偏見を含む動的推論ループを設計する。
実験の結果,ForenAgent は IFD 課題に対する創発的なツール利用能力と反射的推論を示すことがわかった。
論文 参考訳(メタデータ) (2025-12-18T08:38:44Z) - Visual Document Understanding and Question Answering: A Multi-Agent Collaboration Framework with Test-Time Scaling [83.78874399606379]
テスト時間スケーリングを備えたマルチエージェント協調フレームワークであるMACTを提案する。
4つの異なる小規模エージェントから構成され、明確に定義された役割と効果的なコラボレーションがある。
一般および数学的タスクの能力を犠牲にすることなく、より小さなパラメータスケールで優れた性能を示す。
論文 参考訳(メタデータ) (2025-08-05T12:52:09Z) - FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation [55.01077993490845]
最近のLVLM(Large Vision Language Models)は、視覚的理解と生成的モデリングを統一する有望な能力を示している。
本稿では,分割認識と制御可能なオブジェクト中心生成をエンドツーエンドフレームワークに統合した統合LVLMであるFOCUSを紹介する。
論文 参考訳(メタデータ) (2025-06-20T07:46:40Z) - Towards Text-Image Interleaved Retrieval [49.96332254241075]
テキスト画像検索(TIIR)タスクを導入し、クエリと文書をインターリーブしたテキスト画像シーケンスとする。
我々は、自然にインターリーブされたwikiHowチュートリアルに基づいてTIIRベンチマークを構築し、インターリーブされたクエリを生成するために特定のパイプラインを設計する。
異なる粒度で視覚トークンの数を圧縮する新しいMMEを提案する。
論文 参考訳(メタデータ) (2025-02-18T12:00:47Z) - Good Visual Guidance Makes A Better Extractor: Hierarchical Visual
Prefix for Multimodal Entity and Relation Extraction [88.6585431949086]
本稿では,視覚的な実体と関係抽出のための階層型ビジュアルプレフィックス融合NeTwork(HVPNeT)を提案する。
視覚的表現をプラグ可能な視覚的接頭辞とみなして, 誤りに敏感な予測決定のためのテキスト的表現を導出する。
3つのベンチマークデータセットの実験により,本手法の有効性が実証され,最先端の性能が得られた。
論文 参考訳(メタデータ) (2022-05-07T02:10:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。