論文の概要: Code-MUE: Measuring Code LLMs' Uncertainty through Execution-based Semantic Interaction Graphs
- arxiv url: http://arxiv.org/abs/2607.12273v2
- Date: Fri, 17 Jul 2026 07:34:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-20 13:50:44.171717
- Title: Code-MUE: Measuring Code LLMs' Uncertainty through Execution-based Semantic Interaction Graphs
- Title(参考訳): Code-MUE:Execution-based Semantic Interaction GraphsによるLLMの不確かさの測定
- Abstract要約: コード大言語モデル(LLM)は、現代のソフトウェア工学の中心である。
LLMは、小さなエラーでさえ深刻な機能的、セキュリティ、あるいは安全性をもたらすような、現実世界の重大なリスクを生じさせる。
我々は,実行ベースのセマンティックインタラクショングラフを通じて不確実性を測定する,純粋にブラックボックスフレームワークであるCode-MUEを紹介する。
- 参考スコア(独自算出の注目度): 11.089870694576797
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: As Code Large Language Models (LLMs) become central to modern software engineering, their inherent stochasticity poses significant real-world risks, where even minor errors can lead to severe functional, security, or safety consequences. Reliable automation, therefore, demands the ability to distinguish between confident, well-supported predictions and stochastic guessing. However, existing uncertainty estimation methods face a critical gap: white and grey-box techniques are often inapplicable to closed-source models, while standard "black-box" text metrics fail to capture the unique fragility of code, where syntactic variation does not always imply semantic divergence. To bridge this syntax-semantics gap, we introduce Code-MUE, a purely black-box framework that measures uncertainty through execution-based Semantic Interaction Graphs. Different from prior approaches that rely on superficial textual similarity, Code-MUE grounds uncertainty in observable runtime behavior, calculating the Von Neumann entropy of the solution space to quantify global semantic diversity. A large-scale empirical study across eight state-of-the-art LLMs demonstrates that Code-MUE achieves a strong negative correlation with functional correctness (Spearman's correlation up to -0.98), significantly outperforming lexical and embedding-based baselines while enabling robust risk detection and selective prediction in practical workflows.
- Abstract(参考訳): Code Large Language Models (LLMs) が現代のソフトウェアエンジニアリングの中心となるにつれ、その固有の確率性は、小さなエラーでさえ重大な機能的、セキュリティ、あるいは安全性をもたらすような、現実世界の重大なリスクを生じさせる。
したがって、信頼性の高い自動化は、自信があり、支持された予測と確率的な推測を区別する能力を必要とする。
しかし、既存の不確実性推定手法は重要なギャップに直面している: 白とグレーのボックスのテクニックは、しばしばクローズドソースモデルには適用できない。
この構文とセマンティックのギャップを埋めるために、私たちは、実行ベースのセマンティックインタラクショングラフを通して不確実性を測定する純粋にブラックボックスフレームワークであるCode-MUEを紹介します。
表面的なテキスト的類似性に依存する従来のアプローチとは異なり、Code-MUEは観測可能な実行時の振る舞いの不確実性を根拠として、解空間のフォン・ノイマンエントロピーを計算し、グローバルな意味的多様性を定量化する。
8つの最先端LCMに対する大規模な実証研究は、Code-MUEが機能的正しさと強い負の相関(スピアマンの相関は-0.98まで)を達成し、語彙ベースと埋め込みベースラインを著しく上回り、実用的なワークフローにおける堅牢なリスク検出と選択的予測を可能にしたことを示している。
関連論文リスト
- The Illusion of Certainty: Uncertainty quantification for LLMs fails under ambiguity [48.899855816199484]
そこで本研究では,第1の曖昧な質問応答(QA)データセットであるMAQA*とAmbigQA*を紹介する。
予測分布とアンサンブルに基づく推定器は、あいまいさの下では基本的に限定的であることを示す。
論文 参考訳(メタデータ) (2025-11-06T14:46:35Z) - Towards Reliable LLM-based Robot Planning via Combined Uncertainty Estimation [68.106428321492]
大規模言語モデル (LLM) は高度な推論能力を示し、ロボットが自然言語の命令を理解し、適切な接地で高レベルな計画を生成することができる。
LLMの幻覚は重大な課題であり、しばしば過度に信頼され、不一致または安全でない計画に繋がる。
本研究は, 信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性・信頼性評価を別々に評価するものである。
論文 参考訳(メタデータ) (2025-10-09T10:26:58Z) - Theoretical Insights in Model Inversion Robustness and Conditional Entropy Maximization for Collaborative Inference Systems [89.35169042718739]
協調推論により、クラウドサーバに機密データを公開することなく、エンドユーザは強力なディープラーニングモデルを活用することができる。
近年の研究では、これらの中間機能は、情報が漏洩し、生データをモデル反転攻撃(MIA)によって再構築できるため、プライバシーを十分に保持できないことが判明している。
この研究はまず、与えられた中間特徴の入力の条件エントロピーが、任意のMIAの下での再構成平均二乗誤差(MSE)の保証された下界を与えることを理論的に証明する。
そして、ガウス混合推定に基づいて、この条件付きエントロピーを有界化するための微分可能かつ可解な尺度を導出し、逆ロバスト性を高める条件付きエントロピーアルゴリズムを提案する。
論文 参考訳(メタデータ) (2025-03-01T07:15:21Z) - Assessing Correctness in LLM-Based Code Generation via Uncertainty Estimation [0.0]
LLM生成符号の正確性のプロキシとして不確実性推定を検討する。
自然言語生成からコード生成領域への2つの最先端技術を適用する。
これらの手法を用いて計算した不確実性と正確性との間には強い相関関係があることが示唆された。
論文 参考訳(メタデータ) (2025-02-17T10:03:01Z) - Improving Uncertainty Quantification in Large Language Models via Semantic Embeddings [11.33157177182775]
大規模言語モデル(LLM)における正確な不確実性の定量化は、信頼性の高いデプロイメントに不可欠である。
LLMにおける意味的不確実性を測定するための現在の最先端手法は、厳密な双方向の包含基準に依存している。
本研究では,意味的不確実性のよりスムーズでロバストな推定を実現するためにセマンティックな埋め込みを利用する新しい手法を提案する。
論文 参考訳(メタデータ) (2024-10-30T04:41:46Z) - Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities [79.9629927171974]
大規模言語モデル(LLM)の不確実性は、安全性と信頼性が重要であるアプリケーションには不可欠である。
ホワイトボックスとブラックボックス LLM における不確実性評価手法である Kernel Language Entropy (KLE) を提案する。
論文 参考訳(メタデータ) (2024-05-30T12:42:05Z) - Decomposing Uncertainty for Large Language Models through Input Clarification Ensembling [69.83976050879318]
大規模言語モデル(LLM)では、不確実性の原因を特定することが、信頼性、信頼性、解釈可能性を改善するための重要なステップである。
本稿では,LLMのための不確実性分解フレームワークについて述べる。
提案手法は,入力に対する一連の明確化を生成し,それらをLLMに入力し,対応する予測をアンサンブルする。
論文 参考訳(メタデータ) (2023-11-15T05:58:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。