論文の概要: Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
- arxiv url: http://arxiv.org/abs/2607.01503v1
- Date: Wed, 01 Jul 2026 22:02:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.604483
- Title: Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task
- Title(参考訳): 深度順序付けタスクによるVLMにおける言語バイアスからの画像の理解の遠ざかる
- Abstract要約: 本研究では,視覚言語モデル(VLM)の深度知覚について検討し,画像深度手がかりの影響を分離し,視覚と言語がモデル性能に与える影響について検討した。
刺激を生成するために,シミュレーションと実写3Dシーンから2Dビューを生成し,個々の画像深度手がかりの存在を制御した。
- 参考スコア(独自算出の注目度): 4.585831039439083
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: In this paper, we study depth perception of vision-language models (VLMs) to isolate the effects of pictorial depth cues and disentangle vision and language influences on model performance. To this end, we combine depth-ordering and odd-one-out psychophysical tasks: the VLMs are presented with images where one object is at different depth relative to other, otherwise identical, objects, and must determine whether the odd-one-out target is closer or farther to the observer. To create stimuli, we generate 2D views from simulated and real 3D scenes while controlling the presence of individual pictorial depth cues, enabling a fine-grained analysis of cue-level contributions. Language effects are examined by varying referring expression clarity. We also introduce a novel metric to quantify vision-vs-language sensitivities. Applying this methodology, we create the Odd-One-Out Depth (O3-D) dataset with 37K real and synthetic images and 147K image-question pairs. Evaluation of 12 open-source and commercial models on O3-D shows under-utilization of depth cues and depth-ordering accuracies between 47% and 56%, with no model above chance level. At the same time, our metric reveals strong linguistic bias in the answers. Neither chain-of-thought (CoT) nor in-context learning (ICL) significantly improves performance, suggesting that static image data alone may be insufficient for depth understanding. All code, the image generation pipeline, and the O3-D dataset are publicly released at https://github.com/lyiqian/o3-d.
- Abstract(参考訳): 本稿では,視覚言語モデル(VLM)の深度知覚について検討し,画像深度キューと遠方視と言語の影響がモデル性能に与える影響を分離する。
この目的のために、我々は、深度順序付けと奇数ワンアウトの精神物理学的なタスクを組み合わせる:VLMは、ある物体が他の物体と異なる深さの物体である画像で示され、奇数ワンアウトの対象が観測者より近いか遠いかを決定する必要がある。
刺激を生成するために,各画像深度手がかりの存在を制御しながら,シミュレーションおよび実写3Dシーンから2Dビューを生成し,キューレベルのコントリビューションのきめ細かい分析を可能にする。
言語効果は,様々な参照表現の明瞭さによって検証される。
また、視覚-vs言語感性を定量化する新しい尺度も導入する。
この手法を適用して、37Kの実画像と合成画像と147Kの画像検索ペアを備えたOdd-One-Out Depth(O3-D)データセットを作成する。
O3-D上での12種類のオープンソースおよび商用モデルの評価は、深度キューと深度順の精度を47%から56%と低用量化している。
同時に、我々の指標は、回答の強い言語バイアスを明らかにします。
チェーン・オブ・シント(CoT)もイン・コンテクスト・ラーニング(ICL)も性能を著しく向上させておらず、静的画像データだけでは深度理解に不十分である可能性が示唆されている。
すべてのコード、画像生成パイプライン、O3-Dデータセットはhttps://github.com/lyiqian/o3-dで公開されている。
関連論文リスト
- When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning [6.31175027115879]
自然な治療法はモデルに深度マップを示すことですが、パフォーマンスを悪化させる可能性があることが分かりました。
言語モデルに到達するが、下流の推論へのアクセスが困難になる。
単眼深度を1つの質問対象順序テキストキューに変換する訓練不要なDOP(Depth-Ordinal Prompting)を提案する。
論文 参考訳(メタデータ) (2026-07-13T07:13:01Z) - Masked Point-Entity Contrast for Open-Vocabulary 3D Scene Understanding [31.40722103849691]
MPECはオープンな3次元セマンティックセグメンテーションのための新しい学習手法である。
3Dエンティティ言語アライメントと、異なるポイントクラウドビュー間でのポイントエンテント一貫性の両方を使用する。
本手法は,オープンな3次元セマンティックセマンティックセグメンテーションのためのScanNetの最先端結果を実現する。
論文 参考訳(メタデータ) (2025-04-28T05:43:14Z) - Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation [41.98740330990215]
本研究は,2次元視覚基礎モデルと3次元タスクをブリッジする新しい手法を提案する。
視覚言語モデルのゼロショット機能を画像意味論に活用する。
我々は、再構成されたメートル法深度を用いて意味を3次元空間に投影し、3次元の監視を行う。
論文 参考訳(メタデータ) (2025-03-10T09:54:40Z) - PriorDiffusion: Leverage Language Prior in Diffusion Models for Monocular Depth Estimation [10.856377349228927]
拡散モデルのテキスト・ツー・イメージ事前学習において得られた帰納的バイアスを活用することにより,先行言語は単眼深度推定を向上させることができると論じる。
本稿では,アフィン不変深度を推定するために,画像と対応するテキスト記述を併用した事前学習型テキスト・画像拡散モデルを提案する。
論文 参考訳(メタデータ) (2024-11-24T05:07:10Z) - DistillNeRF: Perceiving 3D Scenes from Single-Glance Images by Distilling Neural Fields and Foundation Model Features [65.8738034806085]
DistillNeRFは、自動運転シーンにおける3D環境を理解するための自己教師型学習フレームワークである。
本手法は,スパースで単一フレームのマルチビューカメラ入力からリッチなニューラルシーン表現を予測する一般化可能なフィードフォワードモデルである。
論文 参考訳(メタデータ) (2024-06-17T21:15:13Z) - Sculpting Holistic 3D Representation in Contrastive Language-Image-3D Pre-training [51.632418297156605]
コントラスト型言語画像3D事前学習において, ホロリスティックな3D表現を彫刻するMixCon3Dを提案する。
相補的な視点から3次元オブジェクトレベルの表現を開発する。
次に、MixCon3Dは言語3Dのコントラスト学習を行い、現実世界の3Dオブジェクトを包括的に表現し、テキストアライメントを強化する。
論文 参考訳(メタデータ) (2023-11-03T06:05:36Z) - Lowis3D: Language-Driven Open-World Instance-Level 3D Scene
Understanding [57.47315482494805]
オープンワールドのインスタンスレベルのシーン理解は、アノテーション付きデータセットに存在しない未知のオブジェクトカテゴリを特定し、認識することを目的としている。
モデルは新しい3Dオブジェクトをローカライズし、それらのセマンティックなカテゴリを推論する必要があるため、この課題は難しい。
本稿では,3Dシーンのキャプションを生成するために,画像テキストペアからの広範な知識を符号化する,事前学習型視覚言語基盤モデルを提案する。
論文 参考訳(メタデータ) (2023-08-01T07:50:14Z) - CLIP$^2$: Contrastive Language-Image-Point Pretraining from Real-World
Point Cloud Data [80.42480679542697]
現実シナリオにおける3Dポイントクラウド表現の伝達を学習するために,Contrastive Language-Image-Point Cloud Pretraining (CLIP$2$)を提案する。
具体的には、2Dおよび3Dシナリオで自然に存在する対応を利用して、それらの複雑なシナリオから、適切に整列されたインスタンスベースのテキストイメージポイントプロキシを構築します。
論文 参考訳(メタデータ) (2023-03-22T09:32:45Z) - PLA: Language-Driven Open-Vocabulary 3D Scene Understanding [57.47315482494805]
オープン語彙シーン理解は、アノテートされたラベル空間を超えて見えないカテゴリをローカライズし、認識することを目的としている。
最近の2次元オープン語彙認識のブレークスルーは、リッチな語彙概念を持つインターネットスケールのペア画像テキストデータによって駆動される。
本稿では,3次元からの多視点画像のキャプションにより,事前学習された視覚言語(VL)基盤モデルに符号化された知識を抽出することを提案する。
論文 参考訳(メタデータ) (2022-11-29T15:52:22Z) - DID-M3D: Decoupling Instance Depth for Monocular 3D Object Detection [34.01288862240829]
単眼の3D検出は、低コストで設定の単純さのため、コミュニティから多くの注目を集めている。
最も難しいサブタスクは、インスタンスの深さ推定にある。
本稿では,インスタンスの視覚表面深度とインスタンス属性深度の組み合わせにより,インスタンスの深度を再構成する。
論文 参考訳(メタデータ) (2022-07-18T11:49:18Z) - Virtual Normal: Enforcing Geometric Constraints for Accurate and Robust
Depth Prediction [87.08227378010874]
深度予測における高次3次元幾何学的制約の重要性を示す。
単純な幾何学的制約を強制する損失項を設計することにより、単眼深度推定の精度とロバスト性を大幅に改善する。
The-of-the-art results of learning metric depth on NYU Depth-V2 and KITTI。
論文 参考訳(メタデータ) (2021-03-07T00:08:21Z) - Predicting Relative Depth between Objects from Semantic Features [2.127049691404299]
2D画像に描かれた物体の3D深度は、そのような特徴の一つです。
この領域における技術の現状は、ステレオ画像データに基づいて訓練された複雑なニューラルネットワークモデルであり、ピクセルごとの深さを予測する。
モノディープスモデルから計算した相対深度に対する相対深度精度の14%の総合的な増加が達成された。
論文 参考訳(メタデータ) (2021-01-12T17:28:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。