論文の概要: Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders
- arxiv url: http://arxiv.org/abs/2607.06445v1
- Date: Tue, 07 Jul 2026 16:11:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.582581
- Title: Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders
- Title(参考訳): プロオキシ分析:条件エンコーダとして動作するVLMにおける局在信号
- Abstract要約: VLM(Vision-Language Models)は、拡散に基づく画像編集の条件付バックボーンとしてますます利用されている。
スタンドアロンのVLMは強力なローカライゼーション機能を示しているが、パイプラインの編集はこの精度を維持するのに苦労することが多い。
本研究では,VLMを条件エンコーダとして扱うことに起因することを仮説として,この性能ギャップについて検討する。
- 参考スコア(独自算出の注目度): 54.06522068041745
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Vision-Language Models (VLMs) are increasingly utilized as the conditioning backbone for diffusion-based image editing due to their remarkable multimodal reasoning capabilities. While standalone VLMs demonstrate strong localization capabilities, editing pipelines frequently struggle to maintain this accuracy, particularly in complex, multi-entity scenes. In this work, we investigate this performance gap, hypothesizing that it stems from treating the VLM as a condition encoder. In this role, the model is restricted to a single forward pass, preventing the autoregressive generation process for which it was optimized, thereby failing to fully expose its capabilities. To investigate whether this spatial understanding persists when the VLM is used as a condition encoder, we introduce Analysis-by-Proxy. In this framework, we train a lightweight, interpretable proxy model on the VLM's intermediate representations using an auxiliary localization task. By analyzing the VLM through this proxy, we uncover the specific VLM representations that encode localization information. Our findings expose a fundamental mismatch between how spatial knowledge is represented within a VLM condition encoder and how it is extracted by current editing pipelines. We reveal that under single-pass constraints, the localization signal does not reliably propagate to the predefined layer configurations commonly used for conditioning. Instead, this crucial signal remains hidden within intermediate representations, at locations that vary depending on the input prompt. Using our introduced Analysis-by-Proxy framework, we reveal the fundamental failures of existing condition extraction strategies in editing pipelines, opening the door to more principled design of conditioning architectures.
- Abstract(参考訳): VLM(Vision-Language Models)は、拡散に基づく画像編集の条件付けバックボーンとして利用されてきている。
スタンドアロンのVLMは強力なローカライゼーション機能を示すが、パイプラインの編集は、特に複雑なマルチエンタリティシーンにおいて、この精度を維持するのにしばしば苦労する。
本研究では,VLMを条件エンコーダとして扱うことに起因することを仮説として,この性能ギャップについて検討する。
この役割では、モデルは単一のフォワードパスに制限され、最適化された自己回帰生成プロセスが防止されるため、機能を完全に公開できない。
VLMを条件エンコーダとして使用する場合,この空間的理解が持続するかどうかを調べるため,解析・バイ・プロキシを提案する。
本稿では,VLMの中間表現を補助的ローカライゼーションタスクを用いて,軽量で解釈可能なプロキシモデルを訓練する。
このプロキシを通してVLMを解析することにより、ローカライゼーション情報をエンコードする特定のVLM表現を明らかにする。
本研究は,VLM条件エンコーダにおける空間知識の表現方法と,現行の編集パイプラインによる抽出方法の基本的なミスマッチを明らかにする。
単一パス制約下では、ローカライゼーション信号は、条件付けに一般的に使用される事前定義された層構成に確実に伝播しない。
代わりに、この重要な信号は、入力プロンプトによって異なる位置にある中間表現の中に隠されている。
導入したAnalytic-by-Proxyフレームワークを用いて、パイプラインの編集における既存の条件抽出戦略の根本的な失敗を明らかにし、より原則化された条件付けアーキテクチャの設計への扉を開く。
関連論文リスト
- Continual Video-MLLM Adaptation over Evolving Domains [42.6837206153246]
ビデオマルチモーダルな大言語モデルは、ビデオ理解において強力な能力を示してきたが、逐次進化する領域への適応は未定である。
本稿では、進化するドメインに対する連続的ビデオMLLM適応のためのパラメータ効率の高いフレームワークであるDistributed-Aware Expert Routingを提案する。
2つの強力なビデオ-MLLMバックボーンの実験は、DAERが従来手法より一貫して優れていることを示している。
論文 参考訳(メタデータ) (2026-07-21T05:16:36Z) - What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing [59.40855219373921]
フローマッチングに基づくビデオ生成モデルは、複雑な命令ベースのビデオ編集を扱うために、事前のビジョンランゲージモデルに依存している。
一般的な仮定は、コネクタモジュールがVLMのリッチなマルチモーダル推論を、元のテキスト埋め込み空間であるDiTとシームレスに一致させることができるということである。
本稿では,関係に基づく編集に焦点を当てた診断データセットであるTRACE-Editをビデオ合成に基づく制御データ処理パイプラインとして提案する。
論文 参考訳(メタデータ) (2026-05-20T06:42:15Z) - Domain Restriction via Multi SAE Layer Transitions [0.20052993723676893]
レイヤ遷移は、ドメイン固有のシグネチャを抽出するための有望な道を提供することを示す。
具体的には、スパースオートエンコーダを用いて符号化された内部力学の軽量な学習方法を提案する。
本手法を網羅的に解析し,gemma-2Bおよび9Bモデルでベンチマークする。
論文 参考訳(メタデータ) (2026-05-12T10:36:02Z) - Where to Place the Query? Unveiling and Mitigating Positional Bias in In-Context Learning for Diffusion LLMs via Decoding Dynamics [5.345984783628041]
本稿では,クエリ位置が実際にdLLMの1次変数であることを示す包括的解析について述べる。
本稿では,反復復号プロセスを追跡する新しいメトリクスである平均信頼度(overlineC$)を提案する。
基礎となる空間的ICLベースラインを確立することにより、トレーニング不要な適応ルーティング戦略であるAuto-ICLを導入する。
論文 参考訳(メタデータ) (2026-04-26T20:22:47Z) - Rethinking VLMs for Image Forgery Detection and Localization [55.32700985102152]
本稿では,視覚言語モデル(VLM)をフル活用して画像偽造検出・局所化(IFDL)タスクを支援する方法について検討する。
これらの知見に基づいて,IFDL-VLMと呼ばれる新しいIFDLパイプラインを提案する。
実験結果から, 検出, 局所化, 解釈可能性において, 常に新しい最先端性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2026-03-13T12:21:31Z) - Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection [52.5174167737992]
ビデオ異常検出(VAD)は、ビデオ内の異常事象を特定することを目的としている。
本稿では,MLLMに基づくVADを受動的に読み上げから内部表現を積極的に操り,修正するSteerVADを提案する。
本手法は、トレーニングデータの1%しか必要としないチューニングフリーアプローチにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-27T13:48:50Z) - EPRBench: A High-Quality Benchmark Dataset for Event Stream Based Visual Place Recognition [54.55914886780534]
イベントストリームに基づく視覚的位置認識(VPR)は、従来の可視光カメラの不安定性に対して、低照度、過剰露光、高速モーションといった困難な条件下で魅力的な解決策を提供する、新たな研究方向である。
イベントストリームベースのVPR用に特別に設計された高品質なベンチマークであるEPRBenchを紹介する。
EPRBenchは10Kのイベントシーケンスと65Kのイベントフレームで構成され、ハンドヘルドと車載のセットアップを使用して収集され、さまざまな視点、気象条件、照明シナリオで現実世界の課題を包括的にキャプチャする。
論文 参考訳(メタデータ) (2026-02-13T13:25:05Z) - Linear Mechanisms for Spatiotemporal Reasoning in Vision Language Models [16.73630874846666]
視覚言語モデル(VLM)のある時点で空間構造の視覚的・幾何学的・テキスト的表現を組み合わせなければならない
本稿では,VLMがオブジェクト位置をテキストのアクティベーションに線形に結合し,言語トークンによる推論を行うことにより,オブジェクト位置を符号化することを示す。
解析をビデオVLMに拡張し、類似の線形時間ID機構を同定する。
論文 参考訳(メタデータ) (2026-01-18T23:48:38Z) - On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations [53.611451075703314]
VLM(Vision-Language Models)は、視覚コンテンツ推論のための知覚モジュールとして使われることが多い。
これらの特徴変換が,画像の自動キャプションタスクの信頼度/ディープフェイク検出にどのような影響を及ぼすかを示す。
論文 参考訳(メタデータ) (2025-07-30T05:41:29Z) - Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor [32.34399128209528]
本研究では,事前学習したテキスト・画像拡散モデルが,命令認識型ビジュアルエンコーダとして機能するかどうかを検討する。
拡散機能はセマンティクスに富み、強い画像テキストアライメントを符号化できる。
次に,これらの特徴と大規模言語モデルとの整合性について検討し,漏洩現象を明らかにする。
論文 参考訳(メタデータ) (2025-07-09T17:59:47Z) - Prior Knowledge Integration via LLM Encoding and Pseudo Event Regulation for Video Moment Retrieval [23.94611751368491]
本稿では,大言語モデル(LLM)を一般知識の統合に活用し,擬似イベントを時間的コンテンツ配信の先駆けとして活用する可能性について検討する。
これらの制限を克服するために,デコーダの代わりにLLMエンコーダを提案する。
LLMエンコーダを既存のVMRアーキテクチャ、特に核融合モジュールに組み込むための一般的なフレームワークを提案する。
論文 参考訳(メタデータ) (2024-07-21T04:39:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。