論文の概要: DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models
- arxiv url: http://arxiv.org/abs/2608.03411v1
- Date: Tue, 04 Aug 2026 10:04:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.121308
- Title: DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models
- Title(参考訳): DUD:大規模言語モデルにおける信頼性不確実性定量化のための分離された更新ダイナミクス
- Abstract要約: textbfDecoupled textbfUpdate textbfDynamics textbf(DUD)を導入する。
各モジュールの独立復元能力を定量化することにより、モデルの内部の不安定性を捉えるデュアルストリーム動的プロファイルを構築する。
- 参考スコア(独自算出の注目度): 16.097057987606714
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Accurate Uncertainty Quantification (UQ) is critical for reliable deployment of Large Language Models (LLMs), yet traditional probability-based metrics often fail to capture the model's true epistemic state. While recent mechanistic approaches leverage hidden state dynamics, they typically aggregate residual stream updates, conflating the distinct roles of parametric memory (Feed-Forward Networks) and contextual processing (Attention). We argue that this aggregation obscures fine-grained mechanistic conflicts, such as memory-context misalignment, that are fundamental indicators of uncertainty. To address this, we introduce \textbf{D}ecoupled \textbf{U}pdate \textbf{D}ynamics \textbf{(DUD)}, a framework that explicitly decouples FFN and Attention contributions via noise-induced causal interventions. By quantifying the independent restoration capabilities of each module, we construct a dual-stream dynamic profile that captures the model's internal fragility. Extensive experiments demonstrate that DUD significantly outperforms state-of-the-art baselines in both uncertainty estimation and calibration, while exhibiting superior cross-dataset generalization, validating decoupled dynamics as a robust proxy for model faithfulness.
- Abstract(参考訳): 高精度不確実性定量化(UQ)は、LLM(Large Language Models)の信頼性の高いデプロイには不可欠であるが、従来の確率ベースのメトリクスは、しばしばモデルの真のエピステミック状態のキャプチャに失敗する。
最近のメカニスティックアプローチは隠れ状態のダイナミクスを活用するが、通常、残余ストリームの更新を集約し、パラメトリックメモリ(Feed-Forward Networks)とコンテキスト処理(Attention)の異なる役割を融合させる。
このアグリゲーションは、不確実性の基本的な指標であるメモリ・コンテクストのミスアライメントのような、きめ細かいメカニスティックな競合を曖昧にします。
そこで本稿では,FFNを明示的に分離するフレームワークであるtextbf{D}ecoupled \textbf{U}pdate \textbf{D}ynamics \textbf{(DUD)}を紹介する。
各モジュールの独立復元能力を定量化することにより、モデルの内部の不安定性を捉えるデュアルストリーム動的プロファイルを構築する。
大規模な実験により、DUDは不確実性推定とキャリブレーションの両方において最先端のベースラインを著しく上回り、優れたクロスデータセットの一般化を示し、モデル忠実性の堅牢なプロキシとして疎結合力学を検証した。
関連論文リスト
- A Hybrid PEM-GP Framework for Uncertainty-Aware System Identification of Quadcopters [0.0]
本稿では,物理モデルとデータ駆動学習を組み合わせたフレームワークを提案する。
提案したフレームワークはDuckiedroneのような実験装置で検証される。
論文 参考訳(メタデータ) (2026-08-31T08:26:03Z) - Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning [13.524679557181997]
不確実性定量化は、モデル予測の信頼性を測定することを目的としている。
ポストホックなアプローチは、その軽量さから広く採用されている。
本稿では,動的分布認識不確実性定量化フレームワーク(DDA-UQ)を提案する。
論文 参考訳(メタデータ) (2026-08-10T01:53:28Z) - One Step Closer to Ground Truth: A Multi-Scale Residual-Aware Representation Learning Pipeline for Predicting Time Series Data [6.704099492625706]
本稿では,予測と残差学習を表現学習の異なる段階に明確に分離する2段階のモデル非依存フレームワークを提案する。
このパイプラインを仮説空間拡張として定式化することにより、我々のフレームワークは単一ステージアーキテクチャに固有の近似制限に対処する。
論文 参考訳(メタデータ) (2026-06-09T10:31:54Z) - Multimodal Learning on Low-Quality Data with Conformal Predictive Self-Calibration [72.0672328514289]
マルチモーダル学習は、しばしば低品質データの課題に悩まされる。
コンフォーマル予測自己校正(Conformal Predictive Self-Calibration)と呼ばれる統合フレームワークを提案する。
私たちのフレームワークは、既存の最先端メソッドを一貫して上回ります。
論文 参考訳(メタデータ) (2026-05-05T14:48:52Z) - Noise Titration: Exact Distributional Benchmarking for Probabilistic Time Series Forecasting [1.5939955861266883]
本稿では,介入主義的,厳密な統計的ベンチマークへのパラダイムシフトを提案する。
我々は,ブラックボックスシーケンスマッチングゲームから正確な分布推定タスクに予測を変換する。
我々は、最先端のゼロショットモデルがコンテキストパロッキング機構と一貫して振る舞うことを発見した。
論文 参考訳(メタデータ) (2026-03-23T17:14:11Z) - Breaking Contextual Inertia: Reinforcement Learning with Single-Turn Anchors for Stable Multi-Turn Interaction [49.03500737694832]
textbfReinforcement textbfLearning with textbfTurn textbfRLSTA。
実験の結果,RTSTAは標準微調整法や禁忌法よりも有意に優れていた。
論文 参考訳(メタデータ) (2026-03-05T04:04:59Z) - The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models [0.0]
現在の言語モデル評価は、理想的な条件下でモデルが知っていることを計測するが、現実的なストレス下でそれをどれだけ堅牢に知っているかは測定しない。
本稿では,ロバスト性を測定するプロトコルであるDrill-Down Fabricate Test (DDFT)を紹介する。
フラッグシップモデルはスケールにもかかわらず脆さを示すのに対して、小さなモデルは堅牢なパフォーマンスを実現することができる。
論文 参考訳(メタデータ) (2025-12-29T20:29:09Z) - Adapformer: Adaptive Channel Management for Multivariate Time Series Forecasting [49.40321003932633]
Adapformerは、効果的なチャネル管理を通じてCIとCD方法論のメリットをマージする、トランスフォーマーベースの高度なフレームワークである。
Adapformerは既存のモデルよりも優れた性能を実現し、予測精度と計算効率の両方を向上させる。
論文 参考訳(メタデータ) (2025-11-18T16:24:05Z) - MaP: A Unified Framework for Reliable Evaluation of Pre-training Dynamics [72.00014675808228]
大規模言語モデルの不安定性評価プロセスは、真の学習力学を曖昧にする。
textbfMaPは、アンダーラインMergingアンダーラインとアンダーラインPass@kメトリックを統合するフレームワークです。
実験により、MaPはよりスムーズな性能曲線を示し、ラン間分散を低減し、より一貫性のあるランキングを保証する。
論文 参考訳(メタデータ) (2025-10-10T11:40:27Z) - Elucidated Rolling Diffusion Models for Probabilistic Weather Forecasting [52.6508222408558]
Eucidated Rolling Diffusion Models (ERDM)を紹介する。
ERDMはEucidated Diffusion Models (EDM) の原理的, 性能的設計とローリング予測構造を統一する最初のフレームワークである
2D Navier-StokesシミュレーションとERA5グローバル気象予報の1.5円解像度では、ERDMはキー拡散ベースラインを一貫して上回っている。
論文 参考訳(メタデータ) (2025-06-24T21:44:31Z) - Prototype-based Aleatoric Uncertainty Quantification for Cross-modal
Retrieval [139.21955930418815]
クロスモーダル検索手法は、共通表現空間を共同学習することにより、視覚と言語モダリティの類似性関係を構築する。
しかし、この予測は、低品質なデータ、例えば、腐敗した画像、速いペースの動画、詳細でないテキストによって引き起こされるアレタリック不確実性のために、しばしば信頼性が低い。
本稿では, 原型に基づくAleatoric Uncertainity Quantification (PAU) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:41:19Z) - Disentanglement via Latent Quantization [60.37109712033694]
本研究では,組織化された潜在空間からの符号化と復号化に向けた帰納的バイアスを構築する。
本稿では,基本データレコーダ (vanilla autoencoder) と潜時再構成 (InfoGAN) 生成モデルの両方に追加することで,このアプローチの広範な適用性を実証する。
論文 参考訳(メタデータ) (2023-05-28T06:30:29Z) - At the Intersection of Deep Sequential Model Framework and State-space
Model Framework: Study on Option Pricing [2.3224617218247126]
非線形力学系の推論と予測問題は様々な文脈で発生してきた。
深層シーケンシャルモデルと状態空間モデルの両方を統一し、両方のフレームワークの優位性を実現するモデルを提案する。
論文 参考訳(メタデータ) (2020-12-14T18:21:41Z) - Trust but Verify: Assigning Prediction Credibility by Counterfactual
Constrained Learning [123.3472310767721]
予測信頼性尺度は統計学と機械学習において基本的なものである。
これらの措置は、実際に使用される多種多様なモデルを考慮に入れるべきである。
この研究で開発されたフレームワークは、リスクフィットのトレードオフとして信頼性を表現している。
論文 参考訳(メタデータ) (2020-11-24T19:52:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。