論文の概要: Weakly Supervised Distillation of Hallucination Signals into Transformer Representations
- arxiv url: http://arxiv.org/abs/2604.06277v1
- Date: Tue, 07 Apr 2026 08:14:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-09 17:30:51.143141
- Title: Weakly Supervised Distillation of Hallucination Signals into Transformer Representations
- Title(参考訳): 弱教師付き幻覚信号の変圧器表現への蒸留
- Authors: Shoaib Sadiq Salehmohamed, Jinal Prashant Thakkar, Hansika Aredla, Shaik Mohammed Omar, Shalmali Ayachit,
- Abstract要約: 大規模言語モデルに対する幻覚検出法は,推論時の外部検証に依存する。
幻覚検出信号は変圧器表現に蒸留でき、推論時に外部の検証なしに内部検出が可能であることを示す。
トランスフォーマーベースのプローブは,5倍平均AUC/F1でM2が,シングルフォールド検証とホールドアウトテスト評価の両方でM3が最善である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Existing hallucination detection methods for large language models (LLMs) rely on external verification at inference time, requiring gold answers, retrieval systems, or auxiliary judge models. We ask whether this external supervision can instead be distilled into the model's own representations during training, enabling hallucination detection from internal activations alone at inference time. We introduce a weak supervision framework that combines three complementary grounding signals: substring matching, sentence embedding similarity, and an LLM as a judge verdict to label generated responses as grounded or hallucinated without human annotation. Using this framework, we construct a 15000-sample dataset from SQuAD v2 (10500 train/development samples and a separate 5000-sample test set), where each example pairs a LLaMA-2-7B generated answer with its full per-layer hidden states and structured hallucination labels. We then train five probing classifiers: ProbeMLP (M0), LayerWiseMLP (M1), CrossLayerTransformer (M2), HierarchicalTransformer (M3), and CrossLayerAttentionTransformerV2 (M4), directly on these hidden states, treating external grounding signals as training-time supervision only. Our central hypothesis is that hallucination detection signals can be distilled into transformer representations, enabling internal detection without any external verification at inference time. Results support this hypothesis. Transformer-based probes achieve the strongest discrimination, with M2 performing best on 5-fold average AUC/F1, and M3 performing best on both single-fold validation and held-out test evaluation. We also benchmark inference efficiency: probe latency ranges from 0.15 to 5.62 ms (batched) and 1.55 to 6.66 ms (single sample), while end-to-end generation plus probe throughput remains approximately 0.231 queries per second, indicating negligible practical overhead.
- Abstract(参考訳): 既存の大規模言語モデル(LLM)の幻覚検出手法は、金の回答、検索システム、補助的な判断モデルを必要とする、推論時の外部検証に依存している。
トレーニング中に、この外部監視をモデル自身の表現に蒸留して、推論時にのみ内部の活性化から幻覚を検出することができるかどうかを問う。
提案手法では,文の一致,文の埋め込み類似性,LLMの3つの相補的接地信号を組み合わせて,人間のアノテーションを使わずに生成した応答を接地あるいは幻覚としてラベル付けすることを判断する。
このフレームワークを用いて、SQuAD v2(列車/開発サンプル10500と5000サンプルテストセット)から15,000サンプルデータセットを構築し、各サンプルがLLaMA-2-7B生成した解と、その全層隠れ状態と構造化幻覚ラベルをペアリングする。
ProbeMLP (M0)、LayerWiseMLP (M1)、CrossLayerTransformer (M2)、HierarchicalTransformer (M3)、CrossLayerAttentionTransformerV2 (M4)の5つのプロブリング分類器をこれらの隠れ状態に直接トレーニングし、外部グラウンドシグナルをトレーニング時間監視のみとして扱う。
我々の中心的な仮説は、幻覚検出信号は変圧器表現に蒸留することができ、推論時に外部の検証なしに内部検出できるということである。
結果はこの仮説を支持する。
トランスフォーマーベースのプローブは,5倍平均AUC/F1でM2が,シングルフォールド検証とホールドアウトテスト評価の両方でM3が最善である。
プローブレイテンシは0.15msから5.62ms(バッチ)と1.55msから6.66ms(単一サンプル)であるのに対し、エンドツーエンド生成とプローブスループットは1秒あたり約0.231クエリであり、実用的なオーバーヘッドは無視できない。
関連論文リスト
- Kestrel: Grounding Self-Refinement for LVLM Hallucination Mitigation [86.37623966653688]
大規模視覚言語モデル(LVLM)はますます強まりつつあるが、マルチモーダルタスクにおいて幻覚を起こす傾向にある。
幻覚を避けるためにこれらのLVLMを訓練することは、より大きなモデルでは違法に高価になるため、トレーニングフリーな手法はこの問題に対して安価で柔軟な解決策を提供する。
我々は,視覚的視覚的接地剤とエビデンスを検証した自己修復機構を組み合わせた,LVLM幻覚軽減のためのトレーニングフリーフレームワークであるKestrelを提案する。
論文 参考訳(メタデータ) (2026-03-17T15:30:47Z) - Aligning to Illusions: Choice Blindness in Human and AI Feedback [2.912535004465788]
人間の選択失明研究では、過度にスワップされた好みの91%が発見されず、選択失明は不慣れなテキストの第三者による評価比較にまで及ぶ。
検出は、真の自己監視ではなく、浅いテキストマッチングに依存している。
2つのアーキテクチャにわたる線量応答実験では、報奨信号が半減する前にラベルの6分の1から3分の1を破損させなければならない。
Best-of-N評価では、これは下流の政策劣化につながると確認されている。
論文 参考訳(メタデータ) (2026-03-09T14:10:36Z) - Predictive Coding and Information Bottleneck for Hallucination Detection in Large Language Models [0.8552050317027305]
大規模言語モデル(LLM)における幻覚は、高レベルのデプロイメントにとって重要な障壁である。
ニューロサイエンスにインスパイアされた信号設計と教師付き機械学習を組み合わせたハイブリッド検出フレームワークである[Model Name]を紹介する。
論文 参考訳(メタデータ) (2026-01-22T05:00:21Z) - DRIFT: Detecting Representational Inconsistencies for Factual Truthfulness [5.785021425715989]
LLMは流動性があるが誤った答えを出すことが多いが、このような幻覚を検出するには、通常、複数のサンプリングパスやポストホック検証が必要である。
隠れ状態から直接これらの信号を読み取るための軽量なプローブを提案する。
信頼性の高い問合せを即座に答えるとともに,不確実な問合せをより強力なモデルに委譲するLLMルータを開発した。
論文 参考訳(メタデータ) (2026-01-20T18:16:10Z) - A Single Direction of Truth: An Observer Model's Linear Residual Probe Exposes and Steers Contextual Hallucinations [0.0]
ジェネレータ非依存オブザーバモデルは、その残留ストリーム上の1つのフォワードパスと線形プローブを介して幻覚を検出する。
本発明のプローブは、忠実テキストから幻覚を分離した1つの直線方向を分離し、ベースラインを5〜27ポイント上回る。
論文 参考訳(メタデータ) (2025-07-31T03:26:57Z) - Backdoor Cleaning without External Guidance in MLLM Fine-tuning [76.82121084745785]
Believe Your Eyes (BYE)は、アテンションエントロピーパターンを自己教師信号として活用して、バックドアサンプルを特定してフィルタリングするデータフィルタリングフレームワークである。
クリーンタスクのパフォーマンスを維持しながら、ほぼゼロの攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:11:58Z) - DC-Solver: Improving Predictor-Corrector Diffusion Sampler via Dynamic Compensation [68.55191764622525]
拡散モデル(DPM)は、視覚合成において顕著な性能を示すが、サンプリング中に複数の評価を必要とするため、計算コストが高い。
最近の予測器合成・拡散サンプリング装置は,要求される評価回数を大幅に削減したが,本質的には誤調整の問題に悩まされている。
我々はDC-CPRrと呼ばれる新しい高速DPMサンプリング装置を導入する。
論文 参考訳(メタデータ) (2024-09-05T17:59:46Z) - Cross-Shaped Windows Transformer with Self-supervised Pretraining for Clinically Significant Prostate Cancer Detection in Bi-parametric MRI [6.930082824262643]
前立腺癌 (bpMRI) における臨床的に重要な前立腺癌 (csPCa) を検出するために, CSwin 変圧器 UNet モデル (CSwin 変圧器 UNet モデル) を導入した。
1500人の患者を対象とした大規模前立腺bpMRIデータセットを用いて、まずマルチタスク自己教師型学習を用いてCSwin変換器を事前訓練し、データ効率とネットワークの一般化性を向上させる。
5倍のクロスバリデーションは、自己教師型CSwin UNetが0.888 AUCと0.545 Average Precision(AP)を達成し、4つの同等モデル(Swin U)を著しく上回っていることを示している。
論文 参考訳(メタデータ) (2023-04-30T04:40:32Z) - The Lazy Neuron Phenomenon: On Emergence of Activation Sparsity in
Transformers [59.87030906486969]
本稿では,Transformer アーキテクチャを用いた機械学習モデルにおいて,アクティベーションマップが疎いという興味深い現象について考察する。
本稿では, 自然言語処理と視覚処理の両方において, スパーシリティが顕著な現象であることを示す。
本稿では,変換器のFLOP数を大幅に削減し,効率を向上する手法について論じる。
論文 参考訳(メタデータ) (2022-10-12T15:25:19Z) - Disentangle Your Dense Object Detector [82.22771433419727]
深層学習に基づく高密度物体検出器はここ数年で大きな成功を収め、ビデオ理解などのマルチメディアアプリケーションにも応用されてきた。
しかし、現在の高密度検出器の訓練パイプラインは、保持できない多くの接続に妥協されている。
そこで本研究では, 簡易かつ効果的な遠心分離機構を設計し, 現在の最先端検出器に統合するDED(Disentangled Dense Object Detector)を提案する。
論文 参考訳(メタデータ) (2021-07-07T00:52:16Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。