論文の概要: Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning
- arxiv url: http://arxiv.org/abs/2608.09011v2
- Date: Wed, 19 Aug 2026 06:36:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-20 15:48:19.507392
- Title: Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning
- Title(参考訳): 視覚言語表現学習における動的分布認識の不確かさ追跡
- Abstract要約: 不確実性定量化は、モデル予測の信頼性を測定することを目的としている。
ポストホックなアプローチは、その軽量さから広く採用されている。
本稿では,動的分布認識不確実性定量化フレームワーク(DDA-UQ)を提案する。
- 参考スコア(独自算出の注目度): 13.524679557181997
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Uncertainty Quantification (UQ) aims to measure the reliability of model predictions, serving as a critical safeguard for deploying Vision-Language Models (VLMs) in safety-critical scenarios. Post-hoc approaches are widely adopted due to their lightweight nature, mapping the outputs of VLMs to uncertainty measures through learnable modules or inductive summarization. However, Post-hoc approaches remain inherently confined to fitting the failure patterns of the source domain, ignoring the dynamic nature of test distributions. To address this challenge, we propose a Dynamic Distribution-Aware Uncertainty Quantification framework (DDA-UQ) that shifts the paradigm from static mapping to a dynamic distribution-aware process. During training, we leverage a Gaussian Mixture Model to model the VVLMs'embedding space and extract distributional evidence, thereby dynamically deriving uncertainty estimates. During inference, the design dynamically responds to changes in the data distribution. Extensive experiments demonstrate that our approach significantly outperforms state-of-the-art methods.
- Abstract(参考訳): 不確実性定量化(Uncertainty Quantification, UQ)は、モデル予測の信頼性を測定することを目的としており、VLM(Vision-Language Models)を安全クリティカルなシナリオにデプロイするための重要なセーフガードとして機能する。
ポストホックアプローチは、VLMの出力を学習可能なモジュールや帰納的要約を通じて不確実性尺度にマッピングすることで、その軽量性のために広く採用されている。
しかし、ポストホックアプローチは、テスト分布の動的性質を無視して、ソースドメインの障害パターンに適合することに本質的に限定されている。
この課題に対処するために,動的分布認識不確実性定量化フレームワーク(DDA-UQ)を提案する。
トレーニング中、我々はガウス混合モデルを用いてVVLMの埋め込み空間をモデル化し、分布証拠を抽出し、不確実性推定を動的に導出する。
推論中、設計はデータ分散の変化に動的に対応します。
大規模な実験により,本手法は最先端の手法よりも大幅に優れていることが示された。
関連論文リスト
- Estimating Semantic Ambiguity via Gaussian Context Distributions for VLM-Driven Traversability Analysis [14.31446990918297]
本稿では、文脈の不確実性を明示的にモデル化した、視覚に基づくトラバーサビリティ推定のための新しいパイプラインを提案する。
提案手法では,概念アンチョリングを用いて,開語彙VLM予測を連続的物理的トラバーサビリティ尺度上に構築する。
分布の統計的性質に基づいて,高密度トラバーサビリティマップと高密度不確実性マップの両方を導出する。
論文 参考訳(メタデータ) (2026-09-08T11:18:32Z) - DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models [16.097057987606714]
textbfDecoupled textbfUpdate textbfDynamics textbf(DUD)を導入する。
各モジュールの独立復元能力を定量化することにより、モデルの内部の不安定性を捉えるデュアルストリーム動的プロファイルを構築する。
論文 参考訳(メタデータ) (2026-08-04T10:04:33Z) - Perturbation-Based Uncertainty for Failure Detection in Vision-Language-Action Models [5.736588561666141]
隠れ活性化摂動による推定時間不確実性推定のためのモデルに依存しないフレームワークを提案する。
摂動に基づく不確実性は、サンプリングに基づく不確実性と比較して、分布シフト時の故障検出を一貫して改善することを示す。
論文 参考訳(メタデータ) (2026-06-18T05:41:45Z) - FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty [20.637224080557534]
ロボット工学などの多くの応用において、視覚言語モデルの出力の不確かさを定量化することが不可欠である。
視覚言語モデリングにおける2つの相補的不確実性源を捉えるための確率的フレームワークであるFUSEを開発した。
論文 参考訳(メタデータ) (2026-06-01T22:11:00Z) - Quantifying Aleatoric Uncertainty of In-Context Learning for Robust Measure of LLM Prediction Confidence [6.28866496877782]
In-Context Learning (ICL)は、LCMがいくつかのデモから新しいタスクに適応できるようにするが、信頼性は依然として懸念されている。
我々は、ベイズ的視点とICLの機械的解釈可能性に基づく自己関数ベクトルの概念を導入する。
これらのベクトルは内部モデル表現を利用して、コンテキスト内プロンプトで学んだ潜在概念をモデル化する。
提案手法は,従来の代替手法よりも信頼性の高いLCM予測の不確かさを計測できることを示す。
論文 参考訳(メタデータ) (2026-04-28T09:47:40Z) - Reshaping Action Error Distributions for Reliable Vision-Language-Action Models [69.38615670891038]
ロボット操作において、視覚言語アクション(VLA)モデルは、一般化可能でスケーラブルなロボットポリシーを学ぶための有望なパラダイムとして登場した。
連続動作型VLAモデルに焦点をあて、トレーニング中の動作誤差分布を再構成することにより、従来のMSEベースの回帰を超越する。
複数の代表的VLAアーキテクチャ上で、標準、少数ショット、ノイズの多い設定にまたがるアプローチを評価します。
論文 参考訳(メタデータ) (2026-02-04T05:37:09Z) - From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models [77.04403907729738]
このサーベイは、受動的診断基準からリアルタイムモデル動作を導くアクティブ制御信号への不確実性の進化をグラフ化する。
3つのフロンティアにまたがるアクティブ制御信号として不確実性がいかに活用されているかを示す。
この調査は、次世代のスケーラブルで信頼性があり、信頼できるAIを構築するためには、新しい不確実性のトレンドを習得することが不可欠である、と論じている。
論文 参考訳(メタデータ) (2026-01-22T06:21:31Z) - Model-Based Diffusion Sampling for Predictive Control in Offline Decision Making [48.998030470623384]
オフラインの意思決定は、さらなるインタラクションを伴わずに、固定データセットからの信頼性の高い振る舞いを必要とする。
i)タスク整列軌道を多様に生成するプランナー,(ii)システム力学との整合性を強制するダイナミクスモデル,(iii)タスク目標に整合した動作を選択するランサーモジュールからなる構成モデルに基づく拡散フレームワークを提案する。
論文 参考訳(メタデータ) (2025-12-09T06:26:02Z) - ESI: Epistemic Uncertainty Quantification via Semantic-preserving Intervention for Large Language Models [23.44710972442814]
不確実性定量化(UQ)はモデルの信頼性を向上させるための有望なアプローチであるが、Large Language Models(LLM)の不確実性は自明ではない。
本稿では,意味保存介入前後のモデル出力の変動を計測する新しいグレイボックス不確実性定量化手法を提案する。
論文 参考訳(メタデータ) (2025-10-15T02:46:43Z) - Advancing Reliable Test-Time Adaptation of Vision-Language Models under Visual Variations [67.35596444651037]
視覚言語モデル(VLM)は、素晴らしいゼロショット機能を示すが、ラベル付きデータが利用できない場合、下流タスクの分散シフトに苦慮する。
本稿では,信頼性を両面から高めるReliable Test-Time Adaptation (ReTA)法を提案する。
論文 参考訳(メタデータ) (2025-07-13T05:37:33Z) - Consistent World Models via Foresight Diffusion [56.45012929930605]
我々は、一貫した拡散に基づく世界モデルを学習する上で重要なボトルネックは、最適下予測能力にあると主張している。
本稿では,拡散に基づく世界モデリングフレームワークであるForesight Diffusion(ForeDiff)を提案する。
論文 参考訳(メタデータ) (2025-05-22T10:01:59Z) - HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model [54.64088247291416]
操作ポリシー設計の基本的な目的は、ロボットに人間の指示を理解し、シーンの手がかりを推論し、動的な環境で一般化されたアクションを実行することである。
近年の自己回帰的視覚言語行動(VLA)法は、視覚言語モデル(VLM)から常識推論能力を継承し、次の行動予測を行う。
拡散に基づく行動の連続的な性質と自己回帰の文脈的推論を吸収する統合フレームワークであるHybridVLAを紹介する。
論文 参考訳(メタデータ) (2025-03-13T17:59:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。