論文の概要: Geometric Similarity in VLM Low-Level Vision Representations
- arxiv url: http://arxiv.org/abs/2610.00848v1
- Date: Thu, 01 Oct 2026 00:06:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.812893
- Title: Geometric Similarity in VLM Low-Level Vision Representations
- Title(参考訳): VLM低レベル視覚表現における幾何学的類似性
- Abstract要約: ビジョン言語モデル(VLM)は、ユニバーサルビジョンバックボーンの強力な候補として登場した。
我々は,グローバルな類似性,局所幾何学,スパース特徴分解,およびトポロジカル検証の観点から,タスク条件付き表現を解析するフレームワークGeoSimを提案する。
その結果,低レベル視覚表現の体系的原則を明らかにするとともに,クロスタスクおよびクロスモデル合意における限界を明らかにした。
- 参考スコア(独自算出の注目度): 15.781258219027942
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Vision-language models (VLMs) have emerged as powerful candidates for universal vision backbones, with representative architectures including autoregressive (AR) models and diffusion transformers (DiTs). Yet, adapting them efficiently for all-in-one low-level image restoration remains a challenge. Crucially, the field lacks an understanding of how VLMs organize hidden-layer representations and whether these structurally distinct paradigms share a common geometric organization for pixel-level perception. Such shared organization is a prerequisite for building highly transferable, unified restoration VLMs and adapters. In this paper, we systematically investigate representational similarity across 24 low-level tasks spanning 5 categories. We propose GeoSim, a unified four-level framework that analyzes task-conditioned representations from global similarity, local geometry, sparse feature decomposition, and topological verification perspectives. Our formulation applies to the analysis of hidden states in AR models and feature maps in DiTs across same- and cross-task/model settings. Our results reveal the organizing principles of low-level visual representations while exposing their limits in cross-task and cross-model agreement. Ultimately, GeoSim provides an interpretability lens for probing latent transferability in low-level vision and diagnosing model limitations in task- or model-specific scenarios.
- Abstract(参考訳): 視覚言語モデル(VLM)は、自己回帰(AR)モデルや拡散トランスフォーマー(DiT)など、視覚バックボーンの強力な候補として登場した。
しかし、これらをオールインワンの低レベル画像復元に効率的に適用することは、依然として課題である。
重要なことに、VLMが隠れた層表現をどのように整理するか、そしてこれらの構造的に異なるパラダイムがピクセルレベルの知覚に対して共通の幾何学的構造を共有しているかどうかの理解が欠如している。
このような共有組織は、高度に転送可能で統一された復元VLMとアダプタを構築するための前提条件である。
本稿では,5つのカテゴリにまたがる24の低レベルタスクにおける表現的類似性を体系的に検討する。
我々は,グローバルな類似性,局所幾何学,スパース特徴分解,トポロジカル検証の観点から,タスク条件付き表現を解析する4段階統合フレームワークGeoSimを提案する。
我々の定式化は、ARモデルにおける隠れ状態の分析と、同一およびクロスタスク/モデル設定におけるDiTにおける特徴マップに適用される。
その結果,低レベル視覚表現の体系的原則を明らかにするとともに,クロスタスクおよびクロスモデル合意における限界を明らかにした。
最終的にGeoSimは、低レベル視覚における潜伏トランスファービリティの探索とタスクやモデル固有のシナリオにおけるモデル制限の診断のための解釈可能性レンズを提供する。
関連論文リスト
- The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning [65.67266333751569]
現在のLRM(Large Reasoning Models)は、空間推論タスクにおいて顕著な汎用性を示すが、性能は著しく劣る。
本研究では,内的推論プロセスを対象とした自己指導型強化学習フレームワークを提案する。
このラベルのない整合性トレーニングは,地道的な監督によって訓練されたモデルの精度にアプローチし,多様なタスクやデータ領域にまたがる同様の一般化を実現することを示す。
論文 参考訳(メタデータ) (2026-06-10T10:50:06Z) - GeoMamba: A Geometry-driven MambaVision Framework and Dataset for Fine-grained Optical-SAR Object Retrieval [54.741349848771144]
GeoMambaは光学SAR微細検索のための幾何学駆動フレームワークである。
GFIモジュールは、クロスモーダルな機能相互作用を強化し、構造的な事前を組み込む。
GeoMambaは既存の手法を上回り、全検索環境で63.3% mAPと77.0% Rank-1の精度を達成した。
論文 参考訳(メタデータ) (2026-05-19T12:08:09Z) - Semantic Generative Tuning for Unified Multimodal Models [62.18894352635965]
統一マルチモーダルモデル(UMM)は、単一のアーキテクチャ内で視覚的理解と視覚的生成を統合する。
訓練パラダイムは 独立して テキスト信号を通して 理解を最適化する 密集したピクセルの目的を通して 生成する
本研究は,UMMの分離を橋渡しするための生成プロキシとして階層的視覚タスクを定式化する,生成後学習に関する最初の体系的な研究である。
論文 参考訳(メタデータ) (2026-05-18T17:46:46Z) - SEMASIA: A Large-Scale Dataset of Semantically Structured Latent Representations [12.185380843937196]
約1,700個の事前学習された視覚モデルから抽出した潜在表現の大規模コレクションであるSEMASIAを紹介する。
個々の潜在空間の概念的構造を解析し、一貫したプロトタイプのようなクラスタリングを示す。
プレトレーニングデータの複雑性,特殊化,伝達学習,拡張,モデルスケールが,埋め込みの幾何学的および探索的特性とどのように関係しているかを,大規模回帰分析により解析する。
論文 参考訳(メタデータ) (2026-05-10T11:42:36Z) - Geometry-Aware State Space Model: A New Paradigm for Whole-Slide Image Representation [8.483387656208363]
全スライド画像(WSI)は、組織標本をギガピクセル解像度でデジタル化する。
現在の方法では、パッチ表現を同質ユークリッド空間に暗黙的に埋め込む。
双対幾何学空間にWSI特徴を埋め込むハイブリッド双曲型ユークリッド表現を導入する。
論文 参考訳(メタデータ) (2026-05-06T17:33:30Z) - Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance [4.177067537825386]
本研究は, 基本幾何学的変換に基づく最先端のビジョン・ランゲージモデル(VLM)の基本的脆弱性について検討する。
現代のVLMはセマンティックなタスクに優れていますが、より基本的なレベルで体系的な失敗を示します。
論文 参考訳(メタデータ) (2026-04-02T10:02:49Z) - GeoDiT: A Diffusion-based Vision-Language Model for Geospatial Understanding [14.436063587920005]
地理空間領域に適した初めての拡散型視覚言語モデルであるGeoDiTを紹介する。
画像キャプション、視覚的接地、多物体検出において大きな進歩を遂げる。
本研究は, 複雑な地理空間解析において, 生成過程とデータ固有の構造との整合性が, 優れた性能の鍵となることを検証する。
論文 参考訳(メタデータ) (2025-12-02T07:59:46Z) - GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks [84.86699025256705]
本稿では,地理空間的タスクの視覚言語モデル(VLM)を評価するためのベンチマークであるGEOBench-VLMを提案する。
私たちのベンチマークでは、手動で検証された命令が1万以上あり、さまざまな視覚条件、オブジェクトタイプ、スケールにまたがっています。
地理空間固有の課題における性能を評価するために,いくつかの最先端のVLMを評価した。
論文 参考訳(メタデータ) (2024-11-28T18:59:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。