論文の概要: Low-Cost Black-Box Detection of LLM Hallucinations via Dynamical System Prediction
- arxiv url: http://arxiv.org/abs/2605.05134v1
- Date: Wed, 06 May 2026 17:07:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.953492
- Title: Low-Cost Black-Box Detection of LLM Hallucinations via Dynamical System Prediction
- Title(参考訳): 力学系予測によるLDM幻覚の低コストブラックボックス検出
- Abstract要約: LLM(Large Language Models)は、幻覚(幻覚)として知られる、可塑性だが非実効的な内容を生成する現象である。
我々は,LCMをブラックボックス力学系として扱う新しい手法を提案する。
本手法は,資源のオーバーヘッドを低減し,最先端の性能を実現する。
- 参考スコア(独自算出の注目度): 3.6209977238182276
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) frequently generate plausible but non-factual content, a phenomenon known as hallucination. While existing detection methods typically rely on computationally expensive sampling-based consistency checks or external knowledge retrieval, we propose a new method that treats the LLM as a black-box dynamical system. By projecting LLM responses into a high-dimensional manifold via an embedding model, we characterize the resulting vector sequences as observable realizations of the model's latent state-space dynamics. Leveraging Koopman operator theory, we fit the transition operators for both factual and hallucinated regimes and define a differential residual score based on their respective prediction errors. To accommodate varying user requirements and domain-specific sensitivities, we introduce a preference-aware calibration mechanism that optimizes the classification threshold based on a small set of demonstrations. This approach enables low-cost hallucination detection in a single-sample pass, avoiding the need for secondary sampling or external grounding. Extensive testing across three data benchmarks demonstrates that our method achieves state-of-the-art performance with reduced resource overhead.
- Abstract(参考訳): LLM(Large Language Models)は、幻覚(幻覚)として知られる、可塑性だが非実効的な内容を生成する現象である。
既存の検出手法は,通常,計算コストのかかるサンプリングベース整合性チェックや外部知識検索に頼っているが,我々はLCMをブラックボックス力学系として扱う新しい手法を提案する。
埋め込みモデルを介してLLM応答を高次元多様体に投影することにより、得られたベクトル列をモデルの潜在状態空間力学の観測可能実現として特徴づける。
クープマン作用素理論を利用すると、遷移作用素を実数と実数の両方に適合させ、それぞれの予測誤差に基づいて差分残差スコアを定義する。
ユーザ要求やドメイン固有感性の変化に対応するため,少数のデモに基づいて分類しきい値の最適化を行う優先認識キャリブレーション機構を導入する。
このアプローチにより、単一サンプルパスにおける低コストな幻覚検出が可能となり、二次サンプリングや外部接地が不要になる。
3つのデータベンチマークにまたがる広範囲なテストにより、我々の手法はリソースのオーバーヘッドを減らして最先端のパフォーマンスを達成できることが示される。
関連論文リスト
- MLLM-Guided Semantic Correction for Text-to-Video Generation [66.7723669725808]
マルチモーダルな大規模言語モデルフィードバックを統合した,トレーニングフリーで解釈可能な中間世代補正フレームワークを提案する。
セマンティック・アセスメント・スーパーバイザ (Semantic Assessment Supervisor) とセマンティック・アセスメント・アシスタント (Semantic Modification Assistant) という,セマンティック・アセスメント・スーパーバイザ (Semantic Assessment Supervisor) の2つの重要なモジュールを提案する。
本手法は, モデルパラメータを変更することなく, セマンティックアライメント, 視覚的忠実度, 時間的一貫性を改善する。
論文 参考訳(メタデータ) (2026-08-17T12:54:10Z) - Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular Feedback [56.69850045068714]
逐次的2段階プロセスとして方程式発見をフレーム化する方法である textitInfluence-Guided Regression (IGSR) を導入する。
LLM-SRBench, 薬理学的PKPDモデル, 疫学シミュレーション, 実世界のゲノムデータなど, IGSRの有効性を示す。
論文 参考訳(メタデータ) (2026-05-27T23:48:01Z) - Efficient Hallucination Detection: Adaptive Bayesian Estimation of Semantic Entropy with Guided Semantic Exploration [13.272542054938258]
本稿では,セマンティック・エントロピーをガイドとした適応ベイズ推定フレームワークを提案する。
提案手法では,階層型ベイズフレームワークを用いて意味分布をモデル化し,サンプリング繰り返しの動的制御を可能にする。
低予算のシナリオでは、既存の手法に匹敵する検出性能を達成するために、我々の手法はサンプルを約50%削減する必要がある。
論文 参考訳(メタデータ) (2026-03-24T05:21:19Z) - Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection [52.5174167737992]
ビデオ異常検出(VAD)は、ビデオ内の異常事象を特定することを目的としている。
本稿では,MLLMに基づくVADを受動的に読み上げから内部表現を積極的に操り,修正するSteerVADを提案する。
本手法は、トレーニングデータの1%しか必要としないチューニングフリーアプローチにおける最先端性能を実現する。
論文 参考訳(メタデータ) (2026-02-27T13:48:50Z) - HADSF: Aspect Aware Semantic Control for Explainable Recommendation [4.75127493865044]
大規模言語モデル(LLM)の最近の進歩は、推薦システムに対してより効果的な情報抽出を約束している。
本稿では,適応選択によるコンパクトなコーパスレベルのアスペクトボキャブラリを誘導し,構造化アスペクトオピニオン三重項のボキャブラリ誘導,明示的に制約された抽出を行う2段階アプローチを提案する。
1.5B-70Bパラメータにまたがる約300万のレビューに関する実験では、標準評価予測器に統合された場合、HADSFは予測エラーを一貫して減少させる。
論文 参考訳(メタデータ) (2025-10-30T20:49:33Z) - HiProbe-VAD: Video Anomaly Detection via Hidden States Probing in Tuning-Free Multimodal LLMs [8.18063726177317]
ビデオ異常検出(VAD)は、ビデオシーケンス内の通常のパターンから逸脱を識別し、特定することを目的としている。
本稿では,VADのための事前学習型マルチモーダル大言語モデル(MLLM)を,微調整を必要とせずに活用する新しいフレームワークであるHiProbe-VADを提案する。
論文 参考訳(メタデータ) (2025-07-23T10:41:46Z) - Data-efficient Meta-models for Evaluation of Context-based Questions and Answers in LLMs [1.6332728502735252]
大規模言語モデル(LLM)とレトリーバル拡張生成(RAG)システムは、産業アプリケーションにますます多くデプロイされている。
その信頼性は、幻覚検出の課題によって妨げられている。
本稿では,データアノテーションのボトルネックを,トレーニングデータ要件の低減の可能性を検討することによって解決する。
論文 参考訳(メタデータ) (2025-05-29T09:50:56Z) - ReEval: Automatic Hallucination Evaluation for Retrieval-Augmented Large Language Models via Transferable Adversarial Attacks [91.55895047448249]
本稿では,LLMベースのフレームワークであるReEvalについて述べる。
本稿では、ChatGPTを用いてReEvalを実装し、2つの人気のあるオープンドメインQAデータセットのバリエーションを評価する。
我々の生成したデータは人間可読であり、大きな言語モデルで幻覚を引き起こすのに役立ちます。
論文 参考訳(メタデータ) (2023-10-19T06:37:32Z) - AdjointDPM: Adjoint Sensitivity Method for Gradient Backpropagation of Diffusion Probabilistic Models [103.41269503488546]
既存のカスタマイズ方法は、事前訓練された拡散確率モデルをユーザが提供する概念に合わせるために、複数の参照例にアクセスする必要がある。
本論文は、DPMカスタマイズの課題として、生成コンテンツ上で定義された差別化可能な指標が唯一利用可能な監督基準である場合に解決することを目的とする。
本稿では,拡散モデルから新しいサンプルを初めて生成するAdjointDPMを提案する。
次に、随伴感度法を用いて、損失の勾配をモデルのパラメータにバックプロパゲートする。
論文 参考訳(メタデータ) (2023-07-20T09:06:21Z) - Unsupervised Anomaly Detection with Adversarial Mirrored AutoEncoders [51.691585766702744]
本稿では,識別器のミラー化ワッサースタイン損失を利用して,よりセマンティックレベルの再構築を行う逆自動エンコーダの変種を提案する。
我々は,再建基準の代替として,異常スコアの代替尺度を提案した。
提案手法は,OOD検出ベンチマークにおける異常検出の最先端手法よりも優れている。
論文 参考訳(メタデータ) (2020-03-24T08:26:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。