論文の概要: On the Robustness of LLMs' Internal Representation of Code Correctness
- arxiv url: http://arxiv.org/abs/2608.08266v1
- Date: Sat, 08 Aug 2026 17:56:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.752188
- Title: On the Robustness of LLMs' Internal Representation of Code Correctness
- Title(参考訳): LLMの内部コード表現のロバスト性について
- Authors: Francisco Ribeiro, Sohaila Abdulsattar, Renata Gonzalez, Mahmoud Kassem, Sarah Nadi,
- Abstract要約: 研究によると、モデル自身の信頼信号は、実際の正確さで十分に校正されていない。
最近の研究は、モデルのトークンレベルや記述された信頼度よりも、候補ソリューションを判断できるコード正当性の内部シグナルを捉えている。
本研究では, モデル内部からどのように信号が抽出されるかを, 系統的に検討する。
- 参考スコア(独自算出の注目度): 0.3653697742557465
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Code generated by modern language models often reads naturally. Yet, it also often fails to implement what was asked. This should be no surprise, as research shows the models' own confidence signals are poorly calibrated with actual correctness. A promising way to assess correctness looks inside the model: by contrasting the hidden states of correct and incorrect programs, recent work captured an internal signal of code correctness that is able to judge candidate solutions better than the model's token-level or stated confidence, with no test execution. However, this signal was captured under one particular way, leaving open an important question: whether it reflects a robust property of the model or an artifact of that choice. We study this question systematically, varying how the signal is extracted from the model internals. Besides this, we also ask if the signal's quality is limited by the data used to extract it, by constructing program pairs that differ only in the fault that makes them incorrect. Our results show that no single configuration is best, and that isolating the fault does not help.
- Abstract(参考訳): 現代の言語モデルによって生成されたコードは、しばしば自然に読む。
しかし、要求されたことを実装するのに失敗することが多い。
モデル自身の信頼性信号が、実際の正確さで十分に校正されていないことが研究で示されているので、これは驚くことではないだろう。
正しいプログラムと間違ったプログラムの隠された状態を対比することにより、最近の研究は、テスト実行なしで、モデルのトークンレベルや宣言された信頼度よりも優れた解を判断できるコード正当性の内部シグナルをキャプチャした。
しかし、この信号は特定の方法で捕捉され、モデルの堅牢性やその選択の人工物を反映するかどうかという重要な疑問が残る。
本研究では, モデル内部からどのように信号が抽出されるかを, 系統的に検討する。
これに加えて、信号の品質が抽出に使用するデータによって制限されているかどうかも問う。
以上の結果から,単一構成が最善であり,障害の分離は役に立たないことが明らかとなった。
関連論文リスト
- CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction [51.56484100374058]
既存のLLM(Large Language Models)のキャリブレーション手法は、しばしば信頼性の重要な次元、すなわちモデルの振舞いの堅牢性を見落としている。
我々は,モデルが注意をそらす可能性を直接測定し,罰する,新しいポストホックキャリブレーション手法であるtextscCaliDistを紹介した。
textscCaliDistは、強いベースラインと比較して、期待の低いエラー(ECE)とBrier Scoreを一貫して達成します。
論文 参考訳(メタデータ) (2026-06-04T07:27:53Z) - How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals [6.467495925520036]
大規模な言語モデルは、自身のエラーを検出し、時には外部からのフィードバックなしに修正することができる。
我々は、決定神経科学からの信頼の2階モデルのレンズを通してこれを調査する。
論文 参考訳(メタデータ) (2026-04-24T06:33:32Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Probing for Arithmetic Errors in Language Models [86.8227317662622]
言語モデルの内部アクティベーションは、算術誤差を検出するために使用できる。
単純なプローブはモデルが予測した出力と正解の両方を隠蔽状態から正確に復号できることを示す。
モデル精度を90%以上の精度で予測する軽量エラー検出器を訓練する。
論文 参考訳(メタデータ) (2025-07-16T16:27:50Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z) - How Can We Know When Language Models Know? On the Calibration of
Language Models for Question Answering [80.82194311274694]
言語モデルがいつ、自信を持って、特定のクエリに対する答えを知っているか、どのように知ることができるか?
我々は,T5,BART,GPT-2の3つの強力な生成モデルを検討した。
次に、そのようなモデルの校正方法を検討し、その信頼性スコアを正しさの確率と相関させる。
論文 参考訳(メタデータ) (2020-12-02T03:53:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。