論文の概要: Canonical Color as a Lens into Concept Decodability in Vision Encoders and VLMs
- arxiv url: http://arxiv.org/abs/2609.09124v1
- Date: Tue, 08 Sep 2026 17:50:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.709206
- Title: Canonical Color as a Lens into Concept Decodability in Vision Encoders and VLMs
- Title(参考訳): 視覚エンコーダとVLMにおけるレンズとしてのカノニカルカラー
- Abstract要約: 我々は、視覚エンコーダが正準色情報を線形にアクセスできるようにするかどうかを問うために、制御されたテストケースとして正準色を使用する。
標準色は、グレースケール画像からデオード可能なままであり、予測対象のアイデンティティと結びついており、概念的リンクを示している。
- 参考スコア(独自算出の注目度): 8.349666931303583
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual encoders construct a representation of the image input for Vision-Language models. How much conceptual, as opposed to immediately visible, information does this representation contain? We use canonical color as a controlled test case to ask whether vision encoders make canonical-color information linearly accessible, even when color is removed from the input image. We construct a dataset of objects with canonical colors, and probe vision encoders for both color and object identity using color and grayscale images. We find that canonical color remains decodable from grayscale images, and is tied to predicted object identity, indicating a conceptual link. Extending this analysis to full VLMs, we find that VLM post-training can have a surprisingly large effect on color decodability in the vision encoder. Overall, canonical color provides a usefully controllable lens for tracing object-level conceptual semantic information in vision encoders and VLMs.
- Abstract(参考訳): 視覚エンコーダはビジョンランゲージモデルのための画像入力の表現を構成する。
即座に見えるのとは対照的に、この表現にはどの程度の概念があるのか?
我々は、入力画像から色が除去された場合でも、視覚エンコーダが正準色情報を線形にアクセスできるようにするかどうかを判断するために、制御されたテストケースとして正準色を使用する。
我々は、標準色を持つオブジェクトのデータセットを構築し、カラー画像とグレースケール画像を用いて、色と物体の同一性の両方に対するプローブビジョンエンコーダを構築した。
標準色は、グレースケール画像からデオード可能なままであり、予測対象のアイデンティティと結びついており、概念的リンクを示している。
この分析をフルVLMに拡張すると、VLM後トレーニングは視覚エンコーダの色調に驚くほど大きな影響を与えることが分かる。
全体として、標準色は視覚エンコーダやVLMのオブジェクトレベルのセマンティック情報をトレースするのに有用な制御可能なレンズを提供する。
関連論文リスト
- Stateful Visual Encoders for Vision-Language Models [85.81539882553659]
視覚言語モデル(VLM)は、意思決定が視覚的変化に依存するマルチイメージ、マルチターンエージェント設定において、ますます使われている。
既存のオープンウェイトなVLMでは、ビジュアル比較は言語モデル内でのみ行われ、ビジュアルエンコーダ自体はステートレスのままである。
我々は、先行する視覚的特徴に対して各視覚的表現を条件付けるステートフルビジュアルを導入する。
論文 参考訳(メタデータ) (2026-06-03T04:31:15Z) - White-Balance First, Adjust Later: Cross-Camera Color Constancy via Vision-Language Evaluation [37.38870850999494]
VLM-CCは、反復的な精錬プロセスとして色の一貫性を定式化するフィードバック誘導フレームワークである。
直接RGB推定をVLM誘導の知覚フィードバックに置き換えることで、VLM-CCはクロスカメラカラーの不安定性を実現する。
論文 参考訳(メタデータ) (2026-05-19T09:53:35Z) - UIKA: Fast Universal Head Avatar from Pose-Free Images [65.03770342532134]
フィードフォワードでアニマタブルなガウスヘッドモデルであるウイカを任意の数の未入力から提示する。
従来のアバター法とは異なり、モデル表現、ネットワーク設計、データ準備のレンズを通してタスクを再考する。
本手法は,モノクロ・マルチビュー・セッティングにおいて既存手法よりも優れていた。
論文 参考訳(メタデータ) (2026-01-12T14:53:56Z) - ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness [36.4864789593103]
視覚言語モデル(VLM)が人間の色を知覚し、理解し、活用できるかどうかは不明である。
本稿では,色理解におけるVLMの性能を評価するベンチマークであるColorBenchを紹介する。
論文 参考訳(メタデータ) (2025-04-10T16:36:26Z) - Color Universal Design Neural Network for the Color Vision Deficiencies [0.7366405857677227]
CUD-Netと呼ばれるカラーユニバーサルデザインネットワークを提案し、色不足の個人によって視覚的に理解可能な画像を生成する。
CUD-Netは、色を保存し、入力画像の色を区別できる畳み込みディープニューラルネットワークである。
我々のアプローチは、色とコントラストの安定性を維持する高品質なCUD画像を作成することができる。
論文 参考訳(メタデータ) (2025-02-12T01:53:15Z) - Leveraging Color Channel Independence for Improved Unsupervised Object Detection [7.030688465389997]
コンピュータビジョンにおける教師なし学習において,RGB画像が最適な色空間であるという一般的な仮定に挑戦する。
新たなカラーチャネルの予測を行う場合には,モデルの改善が期待できる。
合成色空間の使用は、基本的に計算オーバーヘッドを伴わずに実装することができる。
論文 参考訳(メタデータ) (2024-12-19T18:28:37Z) - VLM's Eye Examination: Instruct and Inspect Visual Competency of Vision Language Models [19.291697178628546]
ビジョン言語モデル(VLM)は、様々なベンチマークで有望な推論能力を示している。
本研究では,VLMがどのようにイメージを知覚するかを調べるために,視線検査プロセスを提案する。
論文 参考訳(メタデータ) (2024-09-23T07:15:29Z) - OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding [112.87441334765693]
OMG-LLaVAは、強力なピクセルレベルの視覚理解と推論能力を組み合わせた新しいフレームワークである。
フレキシブルなユーザインタラクションのために、さまざまな視覚的およびテキストプロンプトを受け入れることができる。
OMG-LLaVAは1つのモデルで画像レベル、オブジェクトレベル、ピクセルレベルの推論と理解を実現する。
論文 参考訳(メタデータ) (2024-06-27T17:59:01Z) - Color Equivariant Convolutional Networks [50.655443383582124]
CNNは、偶然に記録された条件によって導入された色の変化の間にデータ不均衡がある場合、苦労する。
カラースペクトル間の形状特徴共有を可能にする新しいディープラーニングビルディングブロックであるカラー等変畳み込み(CEConvs)を提案する。
CEConvsの利点は、様々なタスクに対するダウンストリーム性能と、列車-テストの分散シフトを含む色の変化に対するロバスト性の改善である。
論文 参考訳(メタデータ) (2023-10-30T09:18:49Z) - Name Your Colour For the Task: Artificially Discover Colour Naming via
Colour Quantisation Transformer [62.75343115345667]
そこで本研究では,色空間を定量化しつつ,画像上での認識を維持しつつ,色空間を定量化する新しい色量子化変換器CQFormerを提案する。
人工色システムと人間の言語における基本色用語との一貫性のある進化パターンを観察する。
我々のカラー量子化法は、画像記憶を効果的に圧縮する効率的な量子化法も提供する。
論文 参考訳(メタデータ) (2022-12-07T03:39:18Z) - Semantic-driven Colorization [78.88814849391352]
最近の着色は、白黒画像の着色を学習しながら意味情報を暗黙的に予測する。
そこで本研究では,まず,人間の動作をシミュレートして,画像の理解を学習し,色づけする。
論文 参考訳(メタデータ) (2020-06-13T08:13:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。