論文の概要: A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal
- arxiv url: http://arxiv.org/abs/2609.21996v2
- Date: Wed, 23 Sep 2026 08:00:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.649979
- Title: A Lie Detector Test for Language Models: Reading Knowledge a Model Won't Reveal
- Title(参考訳): 言語モデルのためのリー・ディテクタ・テスト:モデルが明らかにならない知識を読む
- Abstract要約: 内部認識のプローブ (Probe of Internal Recognition, PIR) は、有罪な知識を識別する法医学的手法である。
モデルの内部状態から、モデルが正しいと認識する候補に質問を提示し、読み出す。
PIRは、認識された回答を0.70から0.87のバランスの取れた精度で回復し、0.28から0.40の未知の基準線と0.25の確率速度よりもはるかに高い。
- 参考スコア(独自算出の注目度): 0.11280931253550518
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models can hold knowledge they do not report. A model may sandbag on a capability evaluation, or answer against what it internally knows, and its outputs alone cannot tell whether it is hiding an answer or simply does not have one. We borrow the Concealed Information Test, a forensic method that identifies guilty knowledge by presenting a suspect with the true detail among plausible decoys and measuring a stronger response to the item they recognize. Our method, Probe of Internal Recognition (PIR), does the same inside a model. It presents a question with its candidate answers and reads, from the model's internal states, which candidate the model recognizes as correct. PIR is reference-free, needing no honest reference model and no labeled truth corpus. Across eight models from five families (Gemma, Qwen, Llama, Mistral, and Phi), PIR recovers the recognized answer at 0.70 to 0.87 balanced accuracy, well above the 0.28 to 0.40 unknown-item baseline and the 0.25 chance rate. It stays readable across every form of concealment we test, from prompted deception and trained sandbagging to external password-locked and circuit-broken checkpoints, with recognition between 0.85 and 0.93. When the model hides a known answer, recognition stays high. When unlearning removes the knowledge, recognition drops to the level of a question the model never knew. PIR therefore separates a model that will not answer from one that cannot, which supports sandbagging audits and unlearning verification. The signal is causal, adds information beyond black-box behavioral cues, and extends from multiple-choice questions to free-form generation.
- Abstract(参考訳): 大規模な言語モデルは、報告しない知識を保持することができる。
モデルは能力評価に固執したり、内部で知っていることに対して答えたりし、そのアウトプットだけでは、それが答えを隠しているか単に持っていないのかを判断できない。
本研究では, 被疑者に対して, 疑わしいデコイの真の詳細を提示し, 認識した項目に対するより強い反応を測定することによって, 有罪な知識を識別する法医学的手法であるConcealed Information Testを借用する。
内部認識のプローブ (Probe of Internal Recognition, PIR) はモデル内でも同様に動作する。
モデルの内部状態から、モデルが正しいと認識する候補に質問を提示し、読み出す。
PIRは参照なしで、正直な参照モデルやラベル付き真理コーパスを必要としない。
5つのファミリー(Gemma、Qwen、Llama、Mistral、Phi)の8モデルにわたって、PIRは認識された回答を0.70から0.87のバランスの取れた精度で回収する。
シークレットは、偽装やサンドバッグの訓練から外部のパスワードロックやサーキットブレークチェックポイントまで、テスト対象の隠蔽のあらゆる形態で読み取り可能であり、認識は0.85から0.93である。
モデルが既知の答えを隠すとき、認識は高いままである。
アンラーニングが知識を取り除くと、認識はモデルが知らなかった質問のレベルに低下する。
したがって、PIRは、解答できないモデルと、サンドバッグの監査と未学習の検証をサポートするモデルを分離する。
シグナルは因果的であり、ブラックボックスの行動キューを超えて情報を追加し、複数の質問からフリーフォーム生成まで拡張する。
関連論文リスト
- Probing for Knowledge Attribution in Large Language Models [45.47366023067617]
大規模言語モデル(LLM)は、しばしば流動的だが根拠のないクレームや幻覚を生成する。
適切な緩和は、モデルの答えがプロンプトまたは内部の重みに基づいているかどうかを知ることに依存する。
モデル隠れ表現に基づいて訓練された単純な線形分類器であるプローブは、帰納的帰属を確実に予測できることを示す。
論文 参考訳(メタデータ) (2026-02-26T09:21:12Z) - LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models [69.68379406317682]
暗黙的および明示的な信頼マーカーを校正するリスナー対応微調整法 (LACIE) を提案する。
我々は,LACIEがリスナーをモデル化し,回答が正しいかどうかだけでなく,リスナーに受け入れられるかどうかを考察する。
LACIEによるトレーニングの結果、正しい回答の受け入れレベルを維持しながら、誤った回答が受け入れられる割合が47%減少することがわかった。
論文 参考訳(メタデータ) (2024-05-31T17:16:38Z) - Eliciting Latent Knowledge from Quirky Language Models [1.8035046415192353]
潜在知識の排除は、世界の本当の状態を確実に追跡する能力のあるニューラルネットワークのアクティベーションのパターンを見つけることを目的としている。
12のデータセットと、質問に答える際の体系的なエラーを微調整した「奇抜な」言語モデル(LM)スイートを導入します。
特に中層では、線形プローブは通常、LMが出力するものとは無関係に、LMの知識を報告する。
論文 参考訳(メタデータ) (2023-12-02T05:47:22Z) - Improving the Reliability of Large Language Models by Leveraging
Uncertainty-Aware In-Context Learning [76.98542249776257]
大規模言語モデルはしばしば「ハロシン化」の課題に直面している
本研究では,不確実性に応答してモデルが出力を拡張あるいは拒否することを可能にする,不確実性を考慮したコンテキスト内学習フレームワークを提案する。
論文 参考訳(メタデータ) (2023-10-07T12:06:53Z) - Discovering Latent Knowledge in Language Models Without Supervision [72.95136739040676]
既存の言語モデルをトレーニングするテクニックは、真実と正しく一致していない可能性がある。
本稿では,言語モデルの内部アクティベーション内部の潜伏知識を,純粋に教師なしの方法で直接見つけることを提案する。
本手法は, 教師なし, モデル出力がないにもかかわらず, 大規模言語モデルで表される多様な知識を復元できることを示す。
論文 参考訳(メタデータ) (2022-12-07T18:17:56Z) - How Can We Know When Language Models Know? On the Calibration of
Language Models for Question Answering [80.82194311274694]
言語モデルがいつ、自信を持って、特定のクエリに対する答えを知っているか、どのように知ることができるか?
我々は,T5,BART,GPT-2の3つの強力な生成モデルを検討した。
次に、そのようなモデルの校正方法を検討し、その信頼性スコアを正しさの確率と相関させる。
論文 参考訳(メタデータ) (2020-12-02T03:53:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。