論文の概要: Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions
- arxiv url: http://arxiv.org/abs/2607.28285v1
- Date: Thu, 30 Jul 2026 14:32:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.608452
- Title: Beyond Visual Ambiguity: Guiding Robust Monocular Depth Estimation in Challenging Scenarios via Detailed Long Captions
- Title(参考訳): 視覚的曖昧性を超えて : 細長いキャプションを介する連鎖シナリオにおけるロバストな単眼深度推定を導く
- Authors: Junrui Zhang, Jiaqi Li, Yiran Wang, Liao Shen, Zhiguo Cao,
- Abstract要約: 本稿では,ロバストな単分子深度推定のための新しいフレームワークであるCapDepthを提案する。
まず,豊富な空間関係を明示的に伝達する詳細なロングキャプション入力テンプレートを設計する。
次に、ダイナミックキャプションエンコーダを導入し、微細な深さ関連テキスト特徴を抽出する。
第3に,テキスト機能による深度復号化を誘導するテキスト適応デコーダを提案する。
- 参考スコア(独自算出の注目度): 29.25944177199987
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Monocular depth estimation (MDE) faces challenges with non-Lambertian surfaces and adverse weather conditions due to the visual ambiguities inherent in single-image limited information. Existing works address them in isolation via image inpainting or augmentation, yielding limited robustness gains. Language, as a powerful complementary modality to vision, is demonstrated to enhance the visual perception capabilities of vision-language models (VLMs) via detailed long captions. However, prior language-integrated MDE methods fail to fully harness this potential due to short text input with limited information, coarse global text feature learning, and limited language guidance during depth decoding. To address these limitations, we propose CapDepth, a novel framework for robust MDE that leverages guidance from detailed long captions to alleviate visual ambiguities in both challenging scenarios. First, we design a detailed long caption input template that explicitly conveys rich spatial relationships among multiple atom sentences. Second, a dynamic caption encoder is introduced to extract fine-grained depth-relevant text features via progressive masked attention. Finally, we propose a text-adaptive decoder that guides enhanced depth decoding with text features via stable adaptive layer normalization. Extensive experiments validate the efficacy of CapDepth, which outperforms state-of-the-art methods, achieving depth error reductions of 25.0% on non-Lambertian surfaces and 22.0% under adverse weather conditions.
- Abstract(参考訳): 単眼深度推定(MDE)は、非ランベルト面と、単一画像の限られた情報に固有の視覚的あいまいさによる悪天候条件との課題に直面している。
既存の作業は、イメージのインペイントや拡張を通じて、それらを分離して処理することで、ロバスト性の向上が制限される。
言語は視覚を補完する強力なモダリティとして、視覚言語モデル(VLM)の視覚知覚能力を高めるために、詳細な長いキャプションを通して実証される。
しかし、事前の言語統合MDE手法では、限られた情報を含む短いテキスト入力、粗大なグローバルテキスト特徴学習、深度復号化時の言語指導の制限により、この可能性を十分に活用できない。
これらの制約に対処するため、我々は、細かな長いキャプションからのガイダンスを利用して、両難題の視覚的曖昧さを軽減する、堅牢なMDEのための新しいフレームワークであるCapDepthを提案する。
まず,複数の原子文間の空間的関係を明瞭に表現する,詳細な長字幕入力テンプレートを設計する。
次に、動的キャプションエンコーダを導入し、プログレッシブマスクによる詳細な深度関連テキスト特徴を抽出する。
最後に,安定な適応層正規化によるテキスト特徴による拡張深度復号を導出するテキスト適応デコーダを提案する。
広範囲な実験によりCapDepthの有効性が検証され、これは最先端の手法よりも優れており、非ランベルト面の深さ誤差は25.0%、悪天候条件下では22.0%である。
関連論文リスト
- When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models [38.20863524973651]
画面上に埋め込まれたテキストが視覚シーンと矛盾する場合、既存の視覚言語モデル(VLM)は体系的に幻覚を与える。
大規模な人為的なサンプルを含む,最初の包括的なベンチマークである VisualTextTrap を提案する。
また,視覚テキスト変換フレームワークであるVTHM-MoE(Visual Text Hallucination Mitigation Mixture-of-Experts)を提案する。
論文 参考訳(メタデータ) (2026-04-19T10:58:40Z) - Dual-Granularity Semantic Prompting for Language Guidance Infrared Small Target Detection [102.1314414263959]
限られた特徴表現と厳しい背景干渉のため、赤外線小目標検出は依然として困難である。
エンドツーエンドの言語プロンプト駆動フレームワークであるDGSPNetを提案する。
提案手法は検出精度を大幅に向上し、3つのベンチマークデータセットの最先端性能を実現する。
論文 参考訳(メタデータ) (2025-11-24T16:58:23Z) - Mitigating Hallucination of Large Vision-Language Models via Dynamic Logits Calibration [8.192590936983347]
LVLM(Large Vision-Language Models)はマルチモーダル理解において大きな進歩を見せている。
視覚的な入力に反する幻覚、すなわちテキストの生成によってしばしば妨げられる。
既存のトレーニング不要のデコード戦略には、重大な制限がある。
本稿では,テキスト生成と推論時の視覚的エビデンスを整合させる新しいトレーニングフリーデコードフレームワークであるDynamic Logits (DLC)を紹介する。
論文 参考訳(メタデータ) (2025-06-26T17:35:40Z) - Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs [51.93737995405164]
LVLM(Large Vision-Language Models)は幻覚の影響を受けやすいモデルである。
本稿では,条件付きポイントワイド・ミューチュアル・インフォメーション(C-PMI)キャリブレーション・デコーディング・ストラテジーを導入する。
提案手法は,復号効率を保ちながら,LVLMの幻覚を著しく低減することを示す。
論文 参考訳(メタデータ) (2025-05-26T08:36:10Z) - PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training [56.172959986096316]
本稿では,マルチモーダル大規模言語モデル(MLLM)における幻覚の課題を解決することを目的とする。
HalFscoreは言語グラフ上に構築された新しい計量であり、密度の高いキャプションの精度と完全性の両方を粒度レベルで評価するように設計されている。
PerturboLLaVAは、生成されたキャプションの忠実度を著しく改善し、マルチモーダル幻覚に対する既存のアプローチよりも優れている。
論文 参考訳(メタデータ) (2025-03-09T07:07:03Z) - Leveraging Stable Diffusion for Monocular Depth Estimation via Image Semantic Encoding [1.0445560141983634]
視覚的特徴から直接文脈情報を抽出する画像に基づくセマンティック埋め込みを提案する。
提案手法は,屋外シーンの処理におけるCLIP埋め込みの欠点に対処しながら,最先端モデルに匹敵する性能を実現する。
論文 参考訳(メタデータ) (2025-02-01T15:37:22Z) - Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding [14.701135083174918]
LVLM(Large Vision-Language Models)は、視覚入力から詳細でコヒーレントな応答を生成する。
言語に対する依存度が高すぎるため、幻覚を起こす傾向にある。
そこで我々は,SumGD (Slide-Guided Decoding) という新しい手法を提案する。
論文 参考訳(メタデータ) (2024-10-17T08:24:27Z) - Linguistic More: Taking a Further Step toward Efficient and Accurate
Scene Text Recognition [92.6211155264297]
Scene Text Recognition (STR) タスクの単純さと効率性から,視覚モデルへの注目が高まっている。
最近の視覚モデルでは,(1)純粋な視覚に基づく問合せによって注意のドリフトが発生し,認識不良が生じ,言語的不感なドリフト(LID)問題として要約される。
我々は,正確なテキスト認識のための視覚モデルの言語的能力を検討するために,$textbfL$inguistic $textbfP$erception $textbfV$ision model (LPV)を提案する。
論文 参考訳(メタデータ) (2023-05-09T02:52:47Z) - Length-Controllable Image Captioning [67.2079793803317]
簡単な長さレベルの埋め込みを用いて,その能力を実現することを提案する。
自己回帰的な性質のため、既存のモデルの計算複雑性は、生成されたキャプションの長さが大きくなるにつれて線形的に増加する。
さらに,非自己回帰的画像キャプション手法を考案し,キャプションを時間的無関係な複雑さで生成する。
論文 参考訳(メタデータ) (2020-07-19T03:40:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。