論文の概要: A Controlled Study of Decoding-Time Truthfulness Methods on Instruction-Tuned LLMs
- arxiv url: http://arxiv.org/abs/2606.12160v2
- Date: Thu, 11 Jun 2026 13:44:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 13:39:59.688164
- Title: A Controlled Study of Decoding-Time Truthfulness Methods on Instruction-Tuned LLMs
- Title(参考訳): インストラクション調整LDMにおける復号時間真理性手法の制御に関する研究
- Abstract要約: レイヤコントラスト復号、推論時間介入、学習ロジットアダプタは、TrathfulQAで10~30ポイントのゲインを示した。
現代の命令調整型LLMは、既にかなり高いベースラインを実現している。
熟考的推進法は、評価体制においてより堅牢であるように見える。
- 参考スコア(独自算出の注目度): 3.4007995136788
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Decoding-time truthfulness methods -- layer-contrast decoding, inference-time intervention, and learned logit adapters -- have demonstrated 10-30 point gains on TruthfulQA when applied to base language models. However, modern instruction-tuned LLMs already achieve substantially higher baselines (61-76%), raising the question of whether these methods remain effective in practice. We design a six-control evaluation framework -- out-of-distribution training, multi-judge validation, simple decoding baselines, confound controls, bootstrap confidence intervals, and seed variance -- and apply it across 5 models (1B-70B), 3 benchmarks, and 15 methods. We find that previously reported gains shrink substantially under strict controls: on the full TruthfulQA benchmark (N=817), no token-level method achieves statistically significant improvement, and the best learned adapter scores -2.0 points below greedy (p=.23). We identify five evaluation sensitivities -- contamination, judge choice, missing baselines, confounds, and statistical noise -- that individually or jointly account for these discrepancies. Cross-benchmark validation on HaluEval QA and TriviaQA confirms that these patterns extend beyond TruthfulQA. Deliberative prompting methods (chain-of-thought, self-critique) appear more robust in the evaluated regime, with CoT achieving +5.6-19pp across benchmarks as a training-free, single-pass method. We release a seven-point evaluation checklist and discuss implications for future truthfulness research.
- Abstract(参考訳): Decoding-time truthfulnessメソッド -- レイヤコントラストデコーディング、推論時インタプリタ、学習ロジットアダプタ -- は、ベース言語モデルに適用した場合、TruthfulQAで10~30ポイントのゲインを示した。
しかし、現代の命令チューニング LLM は、既にかなり高いベースライン(61-76%)を達成しており、これらの手法が実際に有効であるかどうかという疑問が提起されている。
アウト・オブ・ディストリビューショントレーニング、マルチジャッジ検証、シンプルなデコードベースライン、コンファウンドコントロール、ブートストラップの信頼性間隔、シード分散といった6つの評価フレームワークを設計し、それを5つのモデル(1B-70B)、3つのベンチマーク、15のメソッドに適用します。
また,TruthfulQAベンチマーク(N=817)では,トークンレベルの手法では統計的に有意な改善が得られず,最も学習度の高いアダプタスコアはgreedyより2.0ポイント低い(p=.23)。
汚染、判断の選択、ベースラインの欠如、欠点、統計的ノイズの5つの評価感度が、これらの相違点を個人的または共同的に考慮している。
HaluEval QA と TriviaQA のクロスベンチマーク検証では、これらのパターンが TruthfulQA を超えて拡張されていることが確認されている。
リベラルなプロンプト法(チェーン・オブ・シンク、自己批判)は評価体制においてより堅牢に見え、CoTはトレーニングフリーのシングルパス法としてベンチマークで+5.6-19ppを達成している。
本研究では,7点評価チェックリストを公開し,今後の真理性研究の意義について論じる。
関連論文リスト
- DataFlex-RL: An Evaluation Platform for RLVR Data Policies [11.073211317719393]
検証可能な報酬を伴う強化学習のためのデータポリシーは、どのロールアウトが使用されるか、どれくらい重み付けされているか、どのドメインがその後のトレーニングバッチに寄与するかを決定する。
我々は、共通のGRPOレシピの下でこれらの選択を比較するための評価プラットフォームであるDataFlex-RLを紹介します。
Qwen2.5-7B-Base と 12 の数学,論理,科学ベンチマークを用いて,12 個のマッチした種子の13 個の構成を評価した。
論文 参考訳(メタデータ) (2026-09-05T14:04:50Z) - FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding [19.559643217912114]
既存のMultiple-choice question (MCQ)ベンチマークは、質問や候補オプションを通じて、意図的にターゲットイベントをリークする。
本稿では, 対実的発見と説明のための効果的なトレーニングフレームワークであるFADEを紹介する。
FADEは、DualityVidQA-test と IPV-Bench の3つのタスクにまたがる、最先端の厳密なペアスコアを達成し、GPT-5.6を上回った。
論文 参考訳(メタデータ) (2026-08-11T10:22:08Z) - A Nash Equilibrium Framework For Training-Free Multimodal Step Verification [36.36755437383068]
本研究では,段階的検証を専門審査員間の協調問題として扱う,訓練不要な検証手法を提案する。
提案手法はベースラインモデルよりも2.4%から5.2%の一貫性のある改善を実現している。
論文 参考訳(メタデータ) (2026-05-19T15:54:22Z) - Scalable Token-Level Hallucination Detection in Large Language Models [63.3426544914783]
内部幻覚は推論集約的なタスクでは検出が難しい。
TokenHDはトークンレベルの幻覚検出器を訓練するための全体論的パイプラインである。
論文 参考訳(メタデータ) (2026-05-12T16:47:40Z) - Evaluating Prompt Injection Defenses for Educational LLM Tutors: Security-Usability-Latency Trade-offs [51.56484100374058]
ガードレールの設計には、敵の堅牢性、良質なタスクのユーザビリティ、応答レイテンシの明確なトレードオフが伴う。
決定論的パターンフィルタ,構造検証,コンテキストサンドボックス,セッションレベルの動作チェックを組み合わせた,ドメイン固有のマルチレイヤセーフガードパイプラインの評価を行った。
NeMoは16.22パーセントのFPRと1.5パーセントのレイテンシで0パーセントのバイパスに達し、Prompt Guardは38.48パーセントのFPRと3.60パーセントのバイパスを実現している。
論文 参考訳(メタデータ) (2026-03-29T18:52:01Z) - Locate-then-Sparsify: Attribution Guided Sparse Strategy for Visual Hallucination Mitigation [68.41785694664011]
機能ステアリングのためのLate-Then-Sparsify(LTS-FS)と呼ばれるプラグアンドプレイフレームワークを提案する。
各層の幻覚関係に応じて操舵強度を制御する。
我々の枠組みは、強い性能を維持しながら幻覚を効果的に緩和する。
論文 参考訳(メタデータ) (2026-03-17T09:16:50Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Confident Rankings with Fewer Items: Adaptive LLM Evaluation with Continuous Scores [25.638175689769934]
IRTベースの適応テストの原則的拡張を連続有界スコア(ROUGE, BLEU, LLM-as-a-Judge)に適用する。
本稿では,信頼性の高いモデルランキングを実現するための適応的停止基準付き不確実性意識ランクアを導入し,できるだけ少数の項目をテストする。
提案手法では,各項目の2%をランダムサンプリングよりも格付け相関を0.12改善し,95%の精度で信頼度予測を行う。
論文 参考訳(メタデータ) (2026-01-20T11:59:13Z) - Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements [78.87065404966002]
既存のベンチマークは、主に質問レベルで質問をキュレートする。
ベンチマーク構築をゼロから再考するステートメントベースのベンチマークであるEncyclo-Kを提案する。
論文 参考訳(メタデータ) (2025-12-31T13:55:54Z) - Verifying Large Language Models' Reasoning Paths via Correlation Matrix Rank [71.09032766271493]
大規模言語モデル (LLM) は誤りや幻覚を引き起こす傾向がある。
アウトプットを効果的かつ効率的にチェックする方法は、アプリケーションにとって重要な問題となっている。
論文 参考訳(メタデータ) (2025-10-28T11:01:10Z) - SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs [52.03164192840023]
LVLM(Large Vision-Language Models)は、いまだ幻覚に悩まされている。
本稿では,スケーラブルで制御可能で多様な評価データを生成する自動データ構築パイプラインを提案する。
我々は,忠実度と事実性幻覚の両方を評価するためのベンチマークであるSHALEを構築した。
論文 参考訳(メタデータ) (2025-08-13T07:58:01Z) - ICR Probe: Tracking Hidden State Dynamics for Reliable Hallucination Detection in LLMs [50.18087419133284]
隠れた状態を活用する幻覚検出法は、主に静的および孤立した表現に焦点を当てている。
隠れ状態の更新に対するモジュールの寄与を定量化する新しいメトリック ICR Score を導入する。
本稿では,隠れ状態の層間進化を捉えた幻覚検出手法 ICR Probe を提案する。
論文 参考訳(メタデータ) (2025-07-22T11:44:26Z) - Robust Hallucination Detection in LLMs via Adaptive Token Selection [35.06045656558144]
大きな言語モデル(LLM)の幻覚は、より広範なデプロイメントを妨げる重要な安全性上の懸念を引き起こす。
本研究では,適応的選択とクリティカルトークンの学習を通じて,幻覚の堅牢な検出を可能にする新しいアプローチであるHaMIを提案する。
本研究では,ハロシン化検出タスクの革新的な定式化により,このロバスト性を実現する。
論文 参考訳(メタデータ) (2025-04-10T15:39:10Z) - CHAIR -- Classifier of Hallucination as Improver [1.397828249435483]
トークンの各層からの内部ロジットを分析し,幻覚を検出するための教師付きフレームワークであるCHAIR(Classifier of Hallucination As ImproveR)を紹介する。
本手法は,すべての層にまたがるトークンロジットから,最大,最小,平均,標準偏差,傾斜といった,コンパクトな特徴セットを抽出し,過剰に収まることなく効果的な幻覚検出を可能にする。
論文 参考訳(メタデータ) (2025-01-05T12:15:02Z) - Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification [52.095460362197336]
大規模言語モデル(LLM)は一貫性と正確な推論に苦しむ。
LLMは、主に正しいソリューションに基づいて訓練され、エラーを検出して学習する能力を減らす。
本稿では,CoT(Chain-of-Thought)とPoT(Program-of-Thought)を組み合わせた新しい協調手法を提案する。
論文 参考訳(メタデータ) (2024-10-05T05:21:48Z) - On Speeding Up Language Model Evaluation [48.51924035873411]
我々はこの空間を探索するために$textitadaptive$アプローチを提案する。
我々は、マルチアームの包帯に頼り、次の(メソッド、バリデーションサンプル)ペアを順次識別して評価する。
典型的資源の5~15%のみを用いて,トップパフォーマンスの手法を同定できることを示す。
論文 参考訳(メタデータ) (2024-07-08T17:48:42Z) - A New Benchmark and Reverse Validation Method for Passage-level
Hallucination Detection [63.56136319976554]
大きな言語モデル(LLM)は幻覚を発生させ、ミッションクリティカルなタスクにデプロイすると大きなダメージを与える可能性がある。
本稿では,逆検証に基づく自己チェック手法を提案し,ゼロリソース方式で事実誤りを自動的に検出する。
提案手法と既存のゼロリソース検出手法を2つのデータセット上で実証的に評価した。
論文 参考訳(メタデータ) (2023-10-10T10:14:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。