論文の概要: Stress-Testing LLM Lie Detectors: Role-Play Failures and Spurious Correlations
- arxiv url: http://arxiv.org/abs/2609.39807v1
- Date: Wed, 30 Sep 2026 14:17:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.880938
- Title: Stress-Testing LLM Lie Detectors: Role-Play Failures and Spurious Correlations
- Title(参考訳): ストレス試験LDMリー検出器:ロールプレイ障害とスプリアス相関
- Abstract要約: リー検出プローブは、言語モデルの内部状態からその出力が真実か不正直かを予測することを目的としている。
本研究では,このような反実的ペルソナの下で発生した偽造を確実にフラグ付けする嘘検出プローブについて検討する。
- 参考スコア(独自算出の注目度): 22.355227700874796
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Lie detection probes aim to predict from a language model's internal states whether its output is truthful or dishonest. However, role-play complicates what "truth" means for an LLM: language models can adopt a wide range of personas that take very different claims to be true, including personas whose beliefs clearly contradict reality, such as a conspiracy theorist. In this work, we investigate whether lie detection probes reliably flag falsehoods generated under such an anti-factual persona or whether they instead follow the persona's beliefs. We introduce a dataset of 8,916 human-reviewed, on-policy responses from three LLMs adopting anti-factual personas. Evaluating eight probes from prior work, we find that many fail in this setting, particularly when correct and incorrect answers are evaluated under the same persona prompt. To investigate why, we construct three novel confounder datasets in which truth is anti-correlated with a potential confounding concept. Our experiments reveal that many existing probes strongly track concepts that are spuriously correlated with truth in their training data, such as instruction compliance or response likelihood. Based on these findings, we introduce a simple linear probe that achieves the strongest overall performance on both the persona and confounder stress tests. Our results suggest that current lie detection probes are far from reliable and highlight the need for training data in which truth is decorrelated from confounding concepts.
- Abstract(参考訳): リー検出プローブは、言語モデルの内部状態からその出力が真実か不正直かを予測することを目的としている。
しかし、ロールプレイは「真実」がLLMにとって何を意味するのかを複雑にしている:言語モデルは非常に異なる主張を真とする幅広いペルソナを、陰謀論者のような現実と明確に矛盾するペルソナを含め、採用することができる。
本研究では,このような反現実的ペルソナの下で発生した偽りを確実にフラグ付けする嘘検出プローブが,その代わりにそのペルソナの信念に従うかどうかを検討する。
そこで本研究では, 対実的ペルソナを取り入れた3つのLCMから, 8,916人の人間レビュー・オン・ポリティクス・レスポンスのデータセットを提案する。
先行作業から8つのプローブを評価すると,特に正解と誤解が同一のペルソナプロンプトで評価された場合,この設定で多くのプローブが失敗することがわかった。
理由を解明するために、真理が潜在的に矛盾する概念と反相関する3つの新しい共同設立データセットを構築した。
実験の結果,既存の多くのプローブは,命令順守や応答可能性などのトレーニングデータにおいて,真理と突発的に相関する概念を強く追跡していることがわかった。
これらの結果から,ペルソナおよび共同ファウンダーのストレステストにおいて,最強の総合的な性能を達成できる簡単な線形プローブを提案する。
以上の結果から,現在の嘘検出プローブは信頼性には程遠いことが示唆され,真理が相反する概念とは無関係なトレーニングデータの必要性が浮き彫りになった。
関連論文リスト
- Censored LLMs as a Natural Testbed for Secret Knowledge Elicitation [10.262565099386702]
この問題の2つのアプローチは、正直な推論と嘘検出である。
我々は、政治的に敏感なトピックを検閲するために訓練された中国の開発者によるオープンウェイトLSMについて研究する。
正直な説明として、チャットテンプレートのないサンプリング、数発のプロンプト、一般的な正直なデータの微調整は、真実の反応を確実に増加させる。
論文 参考訳(メタデータ) (2026-03-05T18:58:14Z) - Probing the Limits of the Lie Detector Approach to LLM Deception [0.0]
本稿では,大言語モデルが偽文を生成せずに騙すことができるかどうかを実験的に検討する。
いくつかのモデルは、特に数発のプロンプトで誘導された場合に、誤った非虚偽を発生させることによって確実に欺くことが示されている。
今後の研究は、非行の偽装を対話的設定に組み込んで、偽装の概念的構成要素をより直接的に対象とするプローブトレーニングを行うことが提案されている。
論文 参考訳(メタデータ) (2026-02-16T19:01:55Z) - The Facade of Truth: Uncovering and Mitigating LLM Susceptibility to Deceptive Evidence [49.94160400740222]
MisBeliefは、協調的な多ラウンドの相互作用によって誤解を招く証拠を生成するフレームワークである。
MisBeliefを用いて、3つの難易度で4,800のインスタンスを生成し、7つの代表的なLCMを評価する。
結果は、モデルは直接的な誤報に対して堅牢であるが、この洗練された証拠に非常に敏感であることを示している。
本稿では,疑似意図を証拠裏で推測することにより早期警告信号を提供するガバナンス機構である,認知的意図遮蔽(DIS)を提案する。
論文 参考訳(メタデータ) (2026-01-09T02:28:00Z) - Beyond Prompt-Induced Lies: Investigating LLM Deception on Benign Prompts [79.1081247754018]
大規模言語モデル(LLM)は、推論、計画、意思決定のタスクに広くデプロイされている。
そこで我々は, 接触探索質問(CSQ)に基づく枠組みを提案し, 騙しの可能性を定量化する。
論文 参考訳(メタデータ) (2025-08-08T14:46:35Z) - Are the Hidden States Hiding Something? Testing the Limits of Factuality-Encoding Capabilities in LLMs [48.202202256201815]
大型言語モデル(LLM)における実名幻覚
不正確なコンテンツや偽造コンテンツを生成することによって、信頼性とユーザ信頼を損なう。
近年の研究では、偽文を生成する際、LLMの内部状態が真偽に関する情報を符号化していることが示唆されている。
論文 参考訳(メタデータ) (2025-05-22T11:00:53Z) - Truth-value judgment in language models: 'truth directions' are context sensitive [2.324913904215885]
大規模言語モデルは、文の真理を予測する方向を含む。
複数の手法がそのような方向を復元し、モデルの「知識」や「信条」を明らかにすると説明されるプローブを構築する。
本研究では、この現象を調査し、文脈がプローブに与える影響を詳しく検討する。
論文 参考訳(メタデータ) (2024-04-29T16:52:57Z) - Cognitive Dissonance: Why Do Language Model Outputs Disagree with
Internal Representations of Truthfulness? [53.98071556805525]
ニューラルネットワークモデル(LM)は、事実文の真偽を評価するために用いられる。
それらは、文の確率を問い合わせたり、真理の表現を内部で探したりすることができる。
過去の研究によると、これらの2つの手順は時折不一致であり、プローブはLM出力よりも正確である。
この結果、一部の研究者は、LMが非協力的なコミュニケーション意図を「十分」あるいは他の方法でコード化していると結論付けている。
論文 参考訳(メタデータ) (2023-11-27T18:59:14Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。