論文の概要: HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models
- arxiv url: http://arxiv.org/abs/2608.02124v1
- Date: Mon, 03 Aug 2026 12:15:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.524254
- Title: HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models
- Title(参考訳): HAFI-VLM:視覚言語モデルにおける視覚知覚の診断と促進のための周波数視点
- Abstract要約: 視覚言語モデル(VLM)は、予測がきめ細かい視覚的証拠を必要とする場合、信頼性が低いままである。
これまでに見過ごされた原因は、スペクトル応答剛性である。
本稿では,事前学習した意味表現を保存しながらタスク条件付き周波数経路を導入するHAFI-VLMを提案する。
- 参考スコア(独自算出の注目度): 9.926121668688772
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision-language models (VLMs) remain unreliable when predictions require fine-grained visual evidence. We identify a previously overlooked cause: spectral response rigidity. Despite substantial frequency variation across images and tasks, pretrained vision encoders exhibit persistent, encoder-specific layerwise spectral profiles that change only marginally under downstream fine-tuning. Since pretrained vision encoders only receive images, they cannot adapt spectral extraction to the evidence required by the current query. We therefore propose HAFI-VLM, which introduces a task-conditioned frequency pathway while preserving the pretrained semantic representation. Hierarchical Adaptive Frequency Injection (HAFI) retrieves complementary low-, mid-, and high-frequency evidence at multiple encoder depths using text-modulated, spatially aligned cross-attention. A Visual Enrichment Layer Adapter further recalibrates shallow LLM attention to effectively utilize the enriched visual tokens. Experiments on LLaVA-1.5 and Qwen2.5-VL demonstrate consistent improvements in general VQA, text-rich understanding, and hallucination robustness, outperforming representation-level enhancement methods and most resolution- or cropping-based approaches without additional high-resolution encoding. Mechanistic analyses show that HAFI restores task-dependent spectral allocation while retaining semantic attention, establishing frequency enrichment as a distinct and effective route for improving VLM perception.
- Abstract(参考訳): 視覚言語モデル(VLM)は、予測がきめ細かい視覚的証拠を必要とする場合、信頼性が低いままである。
これまでに見過ごされた原因は、スペクトル応答剛性である。
画像やタスク間でかなりの周波数変化があるにもかかわらず、事前訓練された視覚エンコーダは、下流の微調整の下でのみわずかに変化する、エンコーダ固有の層回りのスペクトルプロファイルを示す。
事前訓練された視覚エンコーダは画像のみを受け取るため、現在のクエリで要求されるエビデンスにスペクトル抽出を適用することはできない。
そこで我々は,事前学習した意味表現を維持しつつ,タスク条件付き周波数経路を導入するHAFI-VLMを提案する。
Hierarchical Adaptive Frequency Injection (HAFI) はテキスト変調された空間的に整列されたクロスアテンションを用いて、複数のエンコーダ深さにおける相補的低・中・高周波エビデンスを検索する。
Visual Enrichment Layer Adapterは、さらに浅いLCMの注意を校正し、リッチ化されたビジュアルトークンを効果的に活用する。
LLaVA-1.5とQwen2.5-VLの実験では、一般的なVQA、テキストリッチな理解、幻覚の堅牢性、表現レベル向上法、高解像度符号化を伴わないほとんどの解像度またはトリッピングに基づくアプローチが一貫した改善を示している。
機械的解析により、HAFIは意味的注意を保ちながらタスク依存のスペクトル割当を復元し、VLM知覚を改善するための明確な効果的な経路として周波数富化を確立した。
関連論文リスト
- Frequency-Domain Dual-Branch Fusion for Medical Visual Question Answering [2.5820404110321413]
VQA(Medicical Visual Question Answering)は、病変のテクスチャ、境界の鋭さ、拡散密度の変化などの微妙な視覚的証拠を臨床言語と整合させることを必要とする。
空間領域で動作している既存のマルチモーダル融合アプローチは、視覚的およびテキスト的表現に存在する相補的な周波数情報を完全に活用できない可能性がある。
本稿では,大域低周波構造と細粒度高周波ディテールの適応選択を可能とし,応答生成のための空間表現を再構成する二分岐周波数領域融合モジュールを提案する。
論文 参考訳(メタデータ) (2026-08-08T19:36:23Z) - TRUST: Efficient Abdominal Trauma Recognition via Image-to-Ultrasound-Video Transfer Learning [9.697220089288564]
本稿では,超音波映像の信頼性を高めるために,微細時間変動を明示的にモデル化するスキャン対応PEIVTLフレームワークを提案する。
社内の超音波外傷データセットの実験では、TRUSTは最先端の手法よりも9.63%優れ、計算効率が優れていることが示されている。
論文 参考訳(メタデータ) (2026-06-26T07:06:34Z) - SpecPL: Disentangling Spectral Granularity for Prompt Learning [11.908475229249161]
本稿では,プロンプト学習のための離散スペクトル粒度(Disentangling Spectral Granularity for Prompt Learning, SPPL)を紹介する。
具体的には、凍結されたVAEを利用して視覚信号を意味的な低周波帯域と粒度の高周波細部に分解する。
11ベンチマークの実験では、競争力のある最先端のパフォーマンスが示され、新しいパフォーマンス天井は81.51%のハーモニック平均精度を実現した。
論文 参考訳(メタデータ) (2026-05-06T05:13:40Z) - Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs [66.15429821530503]
Persistent Visual Memoryは、ビジュアルエビデンスへの持続的でオンデマンドアクセスを強化するために設計された、軽量の学習可能なモジュールである。
Qwen3-VLモデルの実験は、PVMが無視可能なパラメータオーバーヘッドで顕著な改善をもたらすことを示した。
詳細な分析により、PVMはより長い世代で堅牢性が向上し、内部予測収束が加速することが明らかとなった。
論文 参考訳(メタデータ) (2026-05-01T17:54:37Z) - From Attenuation to Attention: Variational Information Flow Manipulation for Fine-Grained Visual Perception [12.4823697158657]
MLLM(Multimodal Large Language Models)は、一般的な視覚的理解において印象的な能力を示す。
彼らはしばしば、小さな物体を識別したり、微妙な視覚的関係を識別する必要のある、きめ細かい知覚タスクに干渉する。
この制限は、ネットワーク伝搬中の支配的なテキストトークンによって、細粒度の細かい視覚信号が早期に抑制または希釈される現象である、視覚減衰に起因している。
既存の入力中心のソリューションは、情報損失の本質的なメカニズムを根本的に逆転させることができない。
本稿では,この課題に対処するための変動情報フロー(VIF)フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-14T09:32:13Z) - Rethinking VLMs for Image Forgery Detection and Localization [55.32700985102152]
本稿では,視覚言語モデル(VLM)をフル活用して画像偽造検出・局所化(IFDL)タスクを支援する方法について検討する。
これらの知見に基づいて,IFDL-VLMと呼ばれる新しいIFDLパイプラインを提案する。
実験結果から, 検出, 局所化, 解釈可能性において, 常に新しい最先端性能を達成できることが示唆された。
論文 参考訳(メタデータ) (2026-03-13T12:21:31Z) - High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding [64.13126192228604]
本稿では,出力画像に対する拡散復号器のみを訓練することにより,画像の忠実度を向上させる拡散復号化フレームワークを提案する。
軽量なLogitは、VQ-VAEエンコーダからのトレーニング時間プロキシロジットとVLM生成ロジットをアライメントすることで、トレイン推論ギャップを緩和する。
提案手法は,VLM予測トークンからVQ-VAE再構成とテキスト・ツー・画像生成の両方の視覚的忠実度を継続的に向上する。
論文 参考訳(メタデータ) (2026-03-11T07:02:48Z) - Suppressing VLM Hallucinations with Spectral Representation Filtering [49.52703800684483]
視覚言語モデル(VLM)は、画像に存在しないオブジェクト、属性、関係の記述の形で幻覚をしばしば生成する。
本稿では,モデル表現の共分散構造を解析し,補正することにより,このような幻覚を抑制するための軽量な訓練不要な手法であるスペクトル表現フィルタ(SRF)を提案する。
論文 参考訳(メタデータ) (2025-11-15T13:49:27Z) - On the Reliability of Vision-Language Models Under Adversarial Frequency-Domain Perturbations [53.611451075703314]
VLM(Vision-Language Models)は、視覚コンテンツ推論のための知覚モジュールとして使われることが多い。
これらの特徴変換が,画像の自動キャプションタスクの信頼度/ディープフェイク検出にどのような影響を及ぼすかを示す。
論文 参考訳(メタデータ) (2025-07-30T05:41:29Z) - Adaptive Frequency Learning in Two-branch Face Forgery Detection [66.91715092251258]
本稿では、AFDと呼ばれる2分岐検出フレームワークにおいて、周波数情報を適応的に学習する手法を提案する。
我々は、固定周波数変換からネットワークを解放し、データおよびタスク依存の変換層でより良いパフォーマンスを達成する。
論文 参考訳(メタデータ) (2022-03-27T14:25:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。