論文の概要: Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model
- arxiv url: http://arxiv.org/abs/2607.22951v1
- Date: Fri, 24 Jul 2026 23:34:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:14.947283
- Title: Modeling Memory-Dependent Reliability of LLMs: A Hidden Markov Model
- Title(参考訳): LLMのメモリ依存信頼性のモデリング:隠れマルコフモデル
- Abstract要約: 大規模言語モデル(LLM)の信頼性評価は、モデルが正しい応答を生成する確率を推定しようとする。
ベンチマーク構成されたインタラクションセッションにおけるシーケンシャルな依存を捉えるための隠れマルコフモデルを提案する。
その結果, 逐次依存を無視すると信頼度が過度に低下する可能性が示唆された。
- 参考スコア(独自算出の注目度): 3.294954749518474
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Reliability assessment of large language models (LLMs) seeks to estimate the probability that a model produces correct responses under a specified operational profile. Conventional benchmark-based evaluation, often summarized by aggregate accuracy, provides a point estimate of performance but does not characterize the uncertainty associated with reliability claims. Currently, statistical inference methods for LLM reliability assessment are emerging. However, a key assumption underlying these models is that test outcomes can be treated as independent repeated trials. This assumption may be inappropriate in sequential settings, where later responses depend on earlier interactions through retained context, error propagation, or an evolving interaction state. We extend a hierarchical Bayesian framework for LLM reliability assessment by relaxing the assumption of independent task outcomes and introducing a Hidden Markov Model to capture sequential dependence in benchmark-constructed interaction sessions. In this formulation, outcomes are generated from a latent interaction state evolving according to a first-order Markov process, capturing changes in interaction context. Through experiments using Anthropic Claude and OpenAI on four datasets, we demonstrate the potential impact of sequential dependence on reliability assessment. The results suggest that ignoring sequential dependence may lead to overconfident reliability estimates.
- Abstract(参考訳): 大規模言語モデル(LLM)の信頼性評価は、あるモデルが特定の操作プロファイルの下で正しい応答を生成する確率を推定しようとする。
従来のベンチマークに基づく評価は、しばしば集計精度によって要約され、性能の点推定を提供するが、信頼性クレームに関連する不確実性を特徴づけるものではない。
LLM信頼性評価のための統計的推測手法が現在出現している。
しかしながら、これらのモデルの基礎となる重要な前提は、テスト結果が独立した繰り返し試行として扱われることである。
この仮定はシーケンシャルな設定では不適切であり、後続の応答は保持されたコンテキスト、エラーの伝播、または進化する相互作用状態を通じて以前の相互作用に依存する。
我々は、独立タスク結果の仮定を緩和し、ベンチマーク構築されたインタラクションセッションにおけるシーケンシャル依存を捉えるための隠れマルコフモデルを導入することで、LCM信頼性評価のための階層的ベイズフレームワークを拡張した。
この定式化では、1次マルコフ過程に従って進化する潜在相互作用状態から結果が生成され、相互作用コンテキストの変化をキャプチャする。
4つのデータセット上でのArthhropic ClaudeとOpenAIを用いた実験を通じて、シーケンシャルな依存が信頼性評価に与える影響を実証する。
その結果, 逐次依存を無視すると信頼度が過度に低下する可能性が示唆された。
関連論文リスト
- Latent Confidence Alignment for LLM Self-Assessment [8.73168195475753]
本稿では,モデル能力と項目難易度を指標として,モデル自己評価と潜在誤り確率との整合性を測定するためのモデルベース潜在能力フレームワークとメタ認知的視点を提案する。
20モデルを用いた医療領域データセットの実験は,提案手法がモデル能力に影響を与えることなく自己評価品質を向上させることを示す。
論文 参考訳(メタデータ) (2026-06-20T08:13:31Z) - Joint Model and Data Sparsification via the Marginal Likelihood [53.29070892356214]
本稿では,個々の特徴とサンプルの相違点を同時学習し,同時にモデルとデータスペーシングを実現することを提案する。
このモデルとデータの対称的なプルーニングは、共役を保存する自然な拡張を提供する。
多様な回帰タスクにわたる経験的結果は、共同ARDアプローチがスパースモデルとロバスト予測モデルの両方を一貫して生成することを確認した。
論文 参考訳(メタデータ) (2026-05-28T13:26:53Z) - Confidence Estimation in Automatic Short Answer Grading with LLMs [0.0]
生成型大言語モデル(LLM)を用いた自動短解像(ASAG)は,タスク固有の微調整を伴わずに高い性能を示した。
LLMのグレーディングは依然として不完全であり、安全で効果的な人間とAIのコラボレーションには信頼性の高い信頼度推定が不可欠である。
本稿では,モデルに基づく信頼度信号とデータセット由来のアレータ的不確実性の明示的な推定を統合したハイブリッド信頼フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-30T20:26:10Z) - Quantifying Aleatoric Uncertainty of In-Context Learning for Robust Measure of LLM Prediction Confidence [6.28866496877782]
In-Context Learning (ICL)は、LCMがいくつかのデモから新しいタスクに適応できるようにするが、信頼性は依然として懸念されている。
我々は、ベイズ的視点とICLの機械的解釈可能性に基づく自己関数ベクトルの概念を導入する。
これらのベクトルは内部モデル表現を利用して、コンテキスト内プロンプトで学んだ潜在概念をモデル化する。
提案手法は,従来の代替手法よりも信頼性の高いLCM予測の不確かさを計測できることを示す。
論文 参考訳(メタデータ) (2026-04-28T09:47:40Z) - Stage-Adaptive Reliability Modeling for Continuous Valence-Arousal Estimation [11.761508894410182]
本稿では,マルチモーダル統合におけるモダリティの信頼度を明示的に推定・校正する段階適応型信頼度モデリングフレームワークを提案する。
SAGEは、ステージ依存の情報量に応じて音声と視覚の表現を動的に再バランスする信頼性に配慮した融合機構を導入している。
Aff-Wild2ベンチマークの実験では、SAGEは既存のマルチモーダル融合法と比較して、一致相関係数のスコアを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-03-12T02:45:41Z) - On Calibration of Large Language Models: From Response To Capability [66.59139960234326]
大規模言語モデル(LLM)は汎用的な問題解決手段として広くデプロイされている。
本稿では,クエリ上でモデルが期待する精度を目標とするキャリブレーションを提案する。
我々の結果は、キャパシティ校正された信頼度がpass@$k$予測と推論予算割り当てを改善することを示している。
論文 参考訳(メタデータ) (2026-02-14T01:07:45Z) - STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction [78.0692157478247]
本稿では,知識駆動型エージェント推論を用いて,データ駆動型静的予測を橋渡しするフレームワークSTARを提案する。
STARはスコアベースとランクベースの両方の基準線を一貫して上回ることを示す。
論文 参考訳(メタデータ) (2026-02-12T16:30:07Z) - Reference-Specific Unlearning Metrics Can Hide the Truth: A Reality Check [60.77691669644931]
本研究では,非学習モデルと参照モデル間の分布類似度を測定する新しい尺度であるFADE(Functional Alignment for Distributional Equivalence)を提案する。
FADEは出力分布全体の機能的アライメントをキャプチャし、真の未学習の原則的評価を提供する。
これらの知見は、現在の評価実践における根本的なギャップを明らかにし、FADEが真に効果的な未学習手法を開発し評価するための、より堅牢な基盤を提供することを示した。
論文 参考訳(メタデータ) (2025-10-14T20:50:30Z) - Can LLMs Detect Their Confabulations? Estimating Reliability in Uncertainty-Aware Language Models [24.72990207218907]
LLM(Large Language Models)は、畳み込み(confabulation)として知られる、流動的だが不正なコンテンツを生成する傾向にある。
本研究では、文脈内情報がモデル行動にどのように影響するか、LLMが信頼できない応答を識別できるかを検討する。
論文 参考訳(メタデータ) (2025-08-11T16:12:36Z) - Aurora: Are Android Malware Classifiers Reliable and Stable under Distribution Shift? [51.12297424766236]
AURORAは、その信頼性と運用上のレジリエンスに基づいて、マルウェア分類器を評価するためのフレームワークである。
AURORAは、ポイント・イン・タイムのパフォーマンスを超えるように設計されたメトリクスのセットによって補完される。
さまざまなドリフトのデータセットにわたるSOTAフレームワークの脆弱性は、ホワイトボードへの復帰の必要性を示唆している。
論文 参考訳(メタデータ) (2025-05-28T20:22:43Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。