論文の概要: Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs
- arxiv url: http://arxiv.org/abs/2607.20479v1
- Date: Fri, 29 May 2026 12:44:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.192643
- Title: Beyond Liars' Bench: The Impact of Lie Typology, Depth, and Sparsity on Deception Detection in LLMs
- Title(参考訳): リー・タイポロジー, 深さ, 疎度がLLMの誤認検出に及ぼす影響
- Abstract要約: 大規模言語モデルからの偽りの出力を検出するための訓練プローブは、依然として未解決の問題である。
最近の研究は、特にドメイン外のシナリオで検出プローブが失敗することを実証している。
- 参考スコア(独自算出の注目度): 2.644306510353322
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Training probes to detect deceptive outputs from large language models is still an open problem. Recent work has demonstrated that detection probes fail especially in out-of-domain scenarios -- training on one type of lie does not transfer well to deception scenarios involving other types of lies. In this work, we conduct a systematic study on how various factors impact detection performance: representation depth, probe expressivity, sparse feature representations, and the lie typology of the training data. To this end, we augment standard benchmark training data with a supplementary dataset containing diverse types of deception, including fabrication, omission, and exaggeration examples. Analyzing these factors across seven probe types, our experimental results show that the optimal representation depth is highly dataset-dependent, more expressive probes provide only selective gains over linear baselines, and sparse autoencoder features perform similarly to dense hidden states. Ultimately, we demonstrate that the choice of training data and lie typology substantially changes detectability, highlighting that deception detection is a highly representation-dependent problem.
- Abstract(参考訳): 大規模言語モデルからの偽りの出力を検出するための訓練プローブは、依然として未解決の問題である。
最近の研究は、検出プローブが特にドメイン外のシナリオで失敗することを実証している。
本研究では,各因子が検出性能に与える影響について,表現深度,プローブ表現率,スパース特徴表現,トレーニングデータの偽型といった系統的研究を行った。
この目的のために、我々は標準ベンチマークトレーニングデータを、製造、省略、誇張例を含む様々な種類の偽装を含む補足的データセットで強化する。
これらの因子を7種類のプローブタイプで分析した結果、最適な表現深度はデータセットに依存しており、より表現力の高いプローブは線形ベースラインよりも選択的な利得しか得られず、スパースオートエンコーダは密閉状態と同様に機能することがわかった。
最終的に、トレーニングデータの選択と型付けが検出可能性を大幅に変化させることを実証し、偽造検出が表現に依存した問題であることを強調した。
関連論文リスト
- Foundation Models are Implicit Deepfake Detectors [8.86239184578671]
複数の事前訓練されたモデル、データセット、および画像とビデオの両方の領域において、偽のサンプルは実際のモデルよりも低緯度表現を体系的に生成する。
そこで,本研究では, より高度なディープフェイク検出手法を用いて, 特徴量の単純な統計値が競合性能を達成することを示す。
論文 参考訳(メタデータ) (2026-08-10T10:55:27Z) - Building Better Deception Probes Using Targeted Instruction Pairs [1.610762469264735]
線形プローブは、騙し行動のためのAIシステムを監視するための有望なアプローチである。
本稿では,トレーニング中に使用する命令ペアの重要性を明らかにする。
本研究は,人為的に解釈可能な擬人化分類による特定の擬人化行動のターゲティングが,評価データセットの改善につながることを示す。
論文 参考訳(メタデータ) (2026-02-01T20:18:11Z) - When Personalization Tricks Detectors: The Feature-Inversion Trap in Machine-Generated Text Detection [64.23509202768945]
パーソナライズされた設定における検出ロバスト性を評価するための最初のベンチマークであるデータセットを紹介する。
実験により, 個別設定における検出器間の性能差が大きいことが示された。
パーソナライズされた設定における検出性能変化を簡易かつ信頼性の高い予測方法を提案する。
論文 参考訳(メタデータ) (2025-10-14T13:10:23Z) - Spatial-Temporal-Spectral Unified Modeling for Remote Sensing Dense Prediction [20.1863553357121]
リモートセンシングのための現在のディープラーニングアーキテクチャは、基本的に堅固である。
本稿では,統合モデリングのための空間時間スペクトル統一ネットワーク(STSUN)について紹介する。
STSUNは任意の空間サイズ、時間長、スペクトル帯域で入力および出力データに適応することができる。
様々な密集した予測タスクと多様な意味クラス予測を統一する。
論文 参考訳(メタデータ) (2025-05-18T07:39:17Z) - Downstream-Pretext Domain Knowledge Traceback for Active Learning [138.02530777915362]
本稿では、下流知識と事前学習指導のデータ相互作用をトレースするダウンストリーム・プレテキスト・ドメイン知識トレース(DOKT)手法を提案する。
DOKTは、トレースバックの多様性指標とドメインベースの不確実性推定器から構成される。
10のデータセットで行った実験は、我々のモデルが他の最先端の手法よりも優れていることを示している。
論文 参考訳(メタデータ) (2024-07-20T01:34:13Z) - Transcending Forgery Specificity with Latent Space Augmentation for Generalizable Deepfake Detection [57.646582245834324]
LSDAと呼ばれる簡易で効果的なディープフェイク検出器を提案する。
より多様な偽の表現は、より一般化可能な決定境界を学べるべきである。
提案手法は驚くほど有効であり, 広く使用されている複数のベンチマークで最先端の検出器を超越することを示す。
論文 参考訳(メタデータ) (2023-11-19T09:41:10Z) - Automated Deception Detection from Videos: Using End-to-End Learning
Based High-Level Features and Classification Approaches [0.0]
深層学習と識別モデルを組み合わせたマルチモーダル手法を提案する。
我々は畳み込み学習を用いて、視線、頭ポーズ、表情を解析する。
提案手法は, 経済要因による新しいローリングディース実験を含む5つのデータセットで評価される。
論文 参考訳(メタデータ) (2023-07-13T08:45:15Z) - On the Universal Adversarial Perturbations for Efficient Data-free
Adversarial Detection [55.73320979733527]
本稿では,UAPに対して正常サンプルと逆サンプルの異なる応答を誘導する,データに依存しない逆検出フレームワークを提案する。
実験結果から,本手法は様々なテキスト分類タスクにおいて,競合検出性能を実現することが示された。
論文 参考訳(メタデータ) (2023-06-27T02:54:07Z) - Reinforcement Guided Multi-Task Learning Framework for Low-Resource
Stereotype Detection [3.7223111129285096]
ステレオタイプ検出」データセットは主に、大規模な事前学習言語モデルに対する診断アプローチを採用している。
信頼できるデータセットに注釈をつけるには、テキストでステレオタイプがどのように現れるかという微妙なニュアンスを正確に理解する必要がある。
我々は「ステレオタイプ検出」における経験的性能を改善するために、データ豊富な隣接タスクの多元性を活用するマルチタスクモデルを提案する。
論文 参考訳(メタデータ) (2022-03-27T17:16:11Z) - Learning What Makes a Difference from Counterfactual Examples and
Gradient Supervision [57.14468881854616]
ニューラルネットワークの一般化能力を改善するための補助的学習目標を提案する。
我々は、異なるラベルを持つ最小差の例のペア、すなわち反ファクトまたはコントラストの例を使用し、タスクの根底にある因果構造を示す信号を与える。
このテクニックで訓練されたモデルは、配布外テストセットのパフォーマンスを向上させる。
論文 参考訳(メタデータ) (2020-04-20T02:47:49Z) - Utilizing Network Properties to Detect Erroneous Inputs [0.76146285961466]
我々は線形SVM分類器を訓練し、事前学習されたニューラルネットワークの隠れおよびソフトマックス特徴ベクトルを用いて誤データを検出する。
以上の結果から,これらのデータ型は一般に正しい例から線形に分離可能なアクティベーション特性を示すことが示唆された。
我々は、さまざまなデータセット、ドメイン、事前訓練されたモデル、および敵対的攻撃にまたがって、我々の発見を実験的に検証した。
論文 参考訳(メタデータ) (2020-02-28T03:20:55Z) - Stance Detection Benchmark: How Robust Is Your Stance Detection? [65.91772010586605]
Stance Detection (StD) は、あるトピックやクレームに対する著者の姿勢を検出することを目的としている。
マルチデータセット学習環境において、さまざまなドメインの10のStDデータセットから学習するStDベンチマークを導入する。
このベンチマーク設定では、5つのデータセットに新しい最先端結果を表示することができます。
論文 参考訳(メタデータ) (2020-01-06T13:37:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。