論文の概要: Geometric Collapse: When Vision Models Fail to Verify Physical Causality
- arxiv url: http://arxiv.org/abs/2607.06871v1
- Date: Wed, 08 Jul 2026 00:04:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 22:50:30.239629
- Title: Geometric Collapse: When Vision Models Fail to Verify Physical Causality
- Title(参考訳): 幾何学的崩壊:視覚モデルが物理的因果関係の検証に失敗したとき
- Abstract要約: スクランブルドエッジ(Scrambled Edges)は、サリアントエッジのようなキューを注入する制御されたカウンターファクトである。
エネルギー整合制御と構造整合制御により, 高周波エネルギーとエッジ間隔から支持エッジエビデンスの効果を分離する。
CNN/ViT/SSL深度予測器を通して、Scrambled Edgesはエネルギー整合ノイズよりもクリーンな予測から最大3.2倍大きな偏差を誘導する。
- 参考スコア(独自算出の注目度): 52.43819179934414
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent progress in large-scale self-supervised learning has improved dense geometric prediction, but it remains unclear whether such scaling yields inference-time physical plausibility checks. We propose Scrambled Edges, a controlled counterfactual that injects salient edge-like cues while violating surface continuity, illumination coherence, and occlusion ordering. With energy-matched and structure-matched controls, we isolate the effect of unsupported edge evidence from high-frequency energy and edge sparsity. Across CNN/ViT/SSL depth predictors on NYU Depth v2 and KITTI, Scrambled Edges induce up to 3.2x larger deviation from clean predictions than energy-matched noise; additional diffusion and flow-matching depth estimators show attenuated but still significant collapse. The resulting Geometric Collapse propagates globally: even with oracle knowledge of the corrupted region, output-level repair recovers only 47%, with substantial error outside the mask. These findings provide controlled behavioral evidence that current dense predictors lack reliable mechanisms to quarantine physically unsupported edge cues, motivating explicit plausibility scoring and selective cue integration.
- Abstract(参考訳): 大規模自己教師型学習の最近の進歩は、密集した幾何学的予測を改善しているが、そのようなスケーリングが推論時間物理的妥当性チェックをもたらすかどうかは不明だ。
Scrambled Edgesは、表面の連続性、照明コヒーレンス、オクルージョン順序に違反しながら、サルエントエッジのようなキューを注入する制御されたカウンターファクトである。
エネルギー整合制御と構造整合制御により, 高周波エネルギーとエッジ間隔から支持エッジエビデンスの効果を分離する。
NYU Depth v2とKITTIのCNN/ViT/SSL深度予測器全体で、スクランブルエッジはエネルギーマッチングノイズよりもクリーンな予測から最大3.2倍大きな偏差を誘導する。
結果として得られた幾何崩壊は世界中に伝播し、腐敗した領域のオラクルの知識があっても、出力レベルの修復はマスクの外側でかなりの誤差を伴ってわずか47%しか回復しない。
これらの知見は、現在の高密度予測器は、物理的に支持されていないエッジキューを隔離する信頼性のあるメカニズムを欠いていること、明確な可視性スコアリングと選択的キュー積分を動機付けていることを制御された行動証拠を提供する。
関連論文リスト
- Hidden Axis of Uncertainty: Latent-Posterior Alignment in Graph Neural Networks with Bayesian Output Layers [2.308349143406933]
平均場ベイズ出力層を持つグラフニューラルネットワーク(GNN)における不確実性ダイナミクスについて検討する。
我々は、潜在表現が低分散後方向に向かうにつれて予測の不確実性が減少するのを観察する。
本稿では、このアライメントをトレーニング中に明示的に促進するアライメントガイド学習(AGL)を提案する。
論文 参考訳(メタデータ) (2026-08-21T05:39:26Z) - The impact of observation density on Bayesian inversion of latent dynamics in shock-dominated flows [0.6008132390640294]
スパースおよびノイズ測定による衝撃支配圧縮性流れの未知の初期状態の推測は、困難な逆問題である。
本研究では,不確実性を伴うベイズ初期状態の効率的なインバージョンのための非侵襲的低次モデリングフレームワークを開発する。
論文 参考訳(メタデータ) (2026-05-18T20:05:52Z) - ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop [55.468404995694975]
我々は,OmniGibson上に構築された10のタスクカテゴリと29のサブカテゴリにまたがる空間知能の具体化ベンチマークを開発した。
我々は最先端のMLLMの実験を行い、活発な探索が受動的に優れていることを発見した。
矛盾した視点を求め、信念を改定する人間とは異なり、モデルは証拠の品質に関わらず、高い信頼をもって早々に行動する。
論文 参考訳(メタデータ) (2026-05-18T17:59:02Z) - DOC-GS: Dual-Domain Observation and Calibration for Reliable Sparse-View Gaussian Splatting [80.43237927269575]
本稿では,新しい視点からスパースビュー3DGSの再構築について再考する。
我々は、ガウスの原始的信頼性の観測不能性として、コアチャレンジを識別する。
この観測を動機として、レンダリング画像フレームワークにおける統合されたデュアルドメイン観測と幾何学的手法を提案する。
論文 参考訳(メタデータ) (2026-04-08T07:01:24Z) - Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination [60.197429875410286]
大規模言語モデルにおける視覚と幻覚の対立的脆弱性は、伝統的に別の問題と見なされている。
損失誘起状態下でのニューラル不確実性原理(NUP)の定式化により, ほぼバウンド状態においては, さらなる圧縮は感度分散の増大を伴うことが判明した。
視覚では、高度に結合したコンポーネントをマスキングすることで、コストのかかる敵の訓練なしに堅牢性を向上させる。
言語では、任意の応答トークンを生成する前に、同じプレフィルステージプローブが幻覚リスクを検出する。
論文 参考訳(メタデータ) (2026-03-20T02:07:10Z) - The Phenomenology of Hallucinations [2.5782420501870296]
言語モデルが幻覚の原因となるのは、不確実性の検出に失敗するだけでなく、出力生成への統合に失敗するためである。
アーキテクチャ全体では、不確実な入力が確実に特定され、2-3$timesの高次元領域を実数入力の本質的な次元として占有する。
しかし、この内部信号は出力層と弱い結合であり、不確実性は低感度な部分空間に移行し、幾何学的に増幅されるが機能的にサイレントになる。
論文 参考訳(メタデータ) (2026-03-14T11:55:55Z) - Uncertainty-Aware 4D Gaussian Splatting for Monocular Occluded Human Rendering [20.390068289144484]
本稿では,確率的変形ネットワークとダブルラスタライズパイプラインを統合したフレームワークであるU-4DGSを提案する。
このアーキテクチャは、適応変調器として機能する画素整列不確実性マップを描画し、信頼できない観測からアーチファクトを自動的に減衰させる。
ZJU-MoCapとOcMotionの実験は、U-4DGSがSOTAレンダリングの忠実性と堅牢性を達成することを示した。
論文 参考訳(メタデータ) (2026-02-06T03:14:37Z) - Analyzing the Mechanism of Attention Collapse in VGGT from a Dynamics Perspective [13.434698786044107]
Visual Geometry Grounded Transformer (VGGT)は、最先端のフィードフォワード3D再構成を提供する。
グローバルな自己保持層は、入力シーケンスが数百フレームを超えると、劇的な崩壊現象に悩まされる。
我々は,グローバルアテンションを退化拡散過程と見なして,崩壊の厳密な数学的説明を確立する。
論文 参考訳(メタデータ) (2025-12-25T14:34:27Z) - Towards Adversarial Robustness and Uncertainty Quantification in DINOv2-based Few-Shot Anomaly Detection [6.288045889067255]
DINOv2のような基礎モデルは、数発の異常検出において強い性能を示している。
本研究は, 敵攻撃と不確実性評価に関する最初の体系的研究である。
生の異常スコアは校正が不十分で、信頼性と正しさのギャップが明らかになり、安全クリティカルな使用が制限されることがわかりました。
論文 参考訳(メタデータ) (2025-10-15T15:06:45Z) - Adaptive Dual Uncertainty Optimization: Boosting Monocular 3D Object Detection under Test-Time Shifts [80.32933059529135]
TTA(Test-Time Adaptation)メソッドが出現し、推論中にターゲット分布に適応する。
我々は、堅牢なM3ODの両不確実性を共同で最小化するために設計された、最初のTTAフレームワークであるDual Uncertainity Optimization (DUO)を提案する。
並列に,明瞭な意味的手がかりを持つ領域における幾何学的コヒーレンスを保存する意味認識型正規場制約を設計する。
論文 参考訳(メタデータ) (2025-08-28T07:09:21Z) - Neuro-Symbolic Entropy Regularization [78.16196949641079]
構造化予測では、目的は構造化されたオブジェクトをエンコードする多くの出力変数を共同で予測することである。
エントロピー正則化(Entropy regularization)という1つのアプローチは、決定境界が低確率領域にあるべきであることを示唆している。
我々は、モデルが有効対象を確実に予測することを奨励する損失、ニューロシンボリックエントロピー正規化を提案する。
論文 参考訳(メタデータ) (2022-01-25T06:23:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。