論文の概要: Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in Automated Personal Document Rewriting
- arxiv url: http://arxiv.org/abs/2607.01457v1
- Date: Wed, 01 Jul 2026 20:22:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.589379
- Title: Grounded Optimization: A Layered Engineering Framework for Reducing LLM Hallucination in Automated Personal Document Rewriting
- Title(参考訳): Grounded Optimization: 自動文書書き換えにおけるLLM幻覚の低減のための階層化エンジニアリングフレームワーク
- Authors: Shashank Indukuri, Adarsh Agrawal,
- Abstract要約: 本稿では, 時間的文脈検証, 決定論的汚染検出, 構造的不変性, プロンプトレベルの接地, 評価エージェントを組み合わせた5層フレームワークを提案する。
3つのLSM、温度設定4つ、14の産業にまたがる25の合成履歴書の6つの層構成に関するアブレーション実験では、未修正のベースラインが履歴書ごとに2.48-5.36の幻覚を発生させる。
能動防御とは無関係な検出器の中で、時間幻覚は全ての条件で50-95%減少し、検出された幻覚率は0.04-0.24に低下する。
- 参考スコア(独自算出の注目度): 0.10210859604701106
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models (LLMs) are increasingly applied to resume optimization for applicant tracking systems, introducing hallucination failures distinct from general text generation: anachronistic technology injection, cross-domain terminology contamination, structural mutation, and content fabrication. We present Grounded Optimization, a five-layer framework combining temporal context validation, deterministic contamination detection, structural invariant enforcement, prompt-level grounding, and an evaluator agent. In ablation experiments across three LLMs, four temperature settings, and six layer configurations on 25 synthetic resumes spanning 14 industries, undefended baselines produce 2.48-5.36 detected hallucinations per resume. Among detectors independent of the active defenses, temporal hallucinations are reduced by 50-95% across all conditions; overall detected hallucination rate falls to 0.04-0.24. Prompt-level grounding alone achieves zero detected hallucinations at low temperature with a capable instruction-following model; higher temperatures and weaker models reveal the need for the deterministic layers as a complement. We release the contamination taxonomy, evaluation code, and raw data.
- Abstract(参考訳): 大規模言語モデル (LLMs) は、一般的なテキスト生成と異なる幻覚障害、すなわちアクロニスティックな技術注入、ドメイン間の用語汚染、構造突然変異、コンテンツ生成を導入し、応募者追跡システムの最適化を再開するためにますます応用されている。
時間的文脈検証, 決定論的汚染検出, 構造的不変性, プロンプトレベルのグラウンド化, 評価エージェントを組み合わせた5層フレームワークであるグラウンドド・最適化を提案する。
3つのLSM、温度設定4つ、14の産業にまたがる25の合成履歴書の6つの層構成に関するアブレーション実験では、未修正のベースラインが履歴書ごとに2.48-5.36の幻覚を発生させる。
能動防御とは無関係な検出器の中で、時間幻覚は全ての条件で50-95%減少し、検出された幻覚率は0.04-0.24に低下する。
プロンプトレベルの接地だけでは、能力のある指示追従モデルで低温で検出された幻覚がゼロとなる。
汚染分類,評価コード,生データを公表する。
関連論文リスト
- Hallucination Cascade: Analyzing Error Propagation in Multi-Agent LLM Systems [6.047611029478951]
GPT-5.3, DeepSeek-V3, LLaMA-3-70B-Instruct を用いて, 知識領域10のカスケード実験を行った。
より深いカスケードは, 正常化幻覚スコアを第1剤で0.422から最終薬で0.272まで下げることを示した。
この減少は、実際の精度が0.789から0.769に低下し、幻覚抑制と事実保存のトレードオフが明らかになる。
論文 参考訳(メタデータ) (2026-06-06T01:56:55Z) - Hallucination Detection-Guided Preference Optimization for Clinical Summarization [16.75280184390529]
幻覚は、専門の医療応用における信頼性を制限する、サポートされていない、または誤った声明である。
本稿では,幻覚検出装置を利用した実写修正に向けての要約リビジョンを導出する推測時間手法であるHDSRを紹介する。
そこで我々は,HDSR for Preference Learning (HDSR-PL)を提案する。
論文 参考訳(メタデータ) (2026-05-27T17:24:26Z) - Automatic Layer Selection for Hallucination Detection [41.55956839406409]
幻覚関連信号は、大言語モデルの最終層(LLM)よりも中間層に強く符号化されている
提案する選択基準は, 最適層, 準最適層を連続的に同定するFEPoID (First Effective Peak of Intrinsic Dimension) である。
FEPoIDはトレーニング不要で、計算オーバーヘッドは無視できる。
論文 参考訳(メタデータ) (2026-05-25T22:28:23Z) - Locate-then-Sparsify: Attribution Guided Sparse Strategy for Visual Hallucination Mitigation [68.41785694664011]
機能ステアリングのためのLate-Then-Sparsify(LTS-FS)と呼ばれるプラグアンドプレイフレームワークを提案する。
各層の幻覚関係に応じて操舵強度を制御する。
我々の枠組みは、強い性能を維持しながら幻覚を効果的に緩和する。
論文 参考訳(メタデータ) (2026-03-17T09:16:50Z) - SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs [52.03164192840023]
LVLM(Large Vision-Language Models)は、いまだ幻覚に悩まされている。
本稿では,スケーラブルで制御可能で多様な評価データを生成する自動データ構築パイプラインを提案する。
我々は,忠実度と事実性幻覚の両方を評価するためのベンチマークであるSHALEを構築した。
論文 参考訳(メタデータ) (2025-08-13T07:58:01Z) - HalluLens: LLM Hallucination Benchmark [49.170128733508335]
大規模言語モデル(LLM)は、しばしばユーザ入力やトレーニングデータから逸脱する応答を生成する。
本稿では,新たな内因性評価タスクと既存内因性評価タスクを併用した総合幻覚ベンチマークを提案する。
論文 参考訳(メタデータ) (2025-04-24T13:40:27Z) - Fine-grained Hallucination Detection and Editing for Language Models [109.56911670376932]
大規模言語モデル(LM)は、しばしば幻覚と呼ばれる事実的誤りを引き起こす傾向にある。
我々は,幻覚の包括的分類を導入し,幻覚が多様な形態で現れることを議論する。
本稿では, 幻覚自動検出のための新しいタスクを提案し, 新たな評価ベンチマークであるFavaBenchを構築した。
論文 参考訳(メタデータ) (2024-01-12T19:02:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。