論文の概要: Improving LLMs via Validator-to-Generator Alignment
- arxiv url: http://arxiv.org/abs/2607.02668v1
- Date: Thu, 02 Jul 2026 18:00:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.383986
- Title: Improving LLMs via Validator-to-Generator Alignment
- Title(参考訳): Validator-to-GeneratorアライメントによるLCMの改善
- Abstract要約: 本稿では、発声周波数の原理的補正を含むG-V整合性の新しい定式化を導入する。
有理性エージェントの自然なモデルの下では,複数の回答で質問に答えることによって,周波数補正ジェネレータスコアを用いた検証器の整合性が自然に現れることを示す。
- 参考スコア(独自算出の注目度): 42.390756533626686
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models are inconsistent: varying prompts or including unrelated information can lead to unexpected changes in model outputs. The generator-validator (G-V) gap is one manifestation of this phenomenon, where LLMs generate responses that they then deem as invalid if re-queried to validate them. In this work, we introduce a new formulation of G-V consistency that involves a principled correction for utterance frequency. Specifically, generators often assign low likelihood to valid strings simply because those strings are a priori unlikely, which makes naive notions of G-V consistency unworkable. We show that under a natural model of rational agents answering questions with multiple answers, consistency of the validator with a frequency-corrected generator score emerges naturally. Our method, \emph{\FCPAname} (\FCPA), is a training objective implementing frequency-corrected G-V consistency for real-world LLMs. Our experimental results show that training with \FCPA{} substantially improves both G-V consistency and generator performance over prior methods, with gains of up to $+27$pp in Pearson correlation on IFEval and HumanEval, while preserving validator quality across all evaluated tasks.
- Abstract(参考訳): 異なるプロンプトや無関係な情報を含む大きな言語モデルは、予期せぬモデル出力の変化を引き起こす可能性がある。
ジェネレータ・バリケータ(G-V)ギャップはこの現象の1つであり、LCMは反応を生成し、再クエリして検証すると無効であると判断する。
本稿では, 発声周波数の原理的補正を含むG-V整合性の新しい定式化を提案する。
具体的には、生成元はしばしば、これらの文字列が前もってありそうにないため、有効文字列に対して低い確率を割り当てるので、G-V整合性の概念は動作不能である。
有理性エージェントの自然なモデルの下では,複数の回答で質問に答えることによって,周波数補正ジェネレータスコアを用いた検証器の整合性が自然に現れることを示す。
本手法は,実世界のLLMに対して,周波数補正G-V整合性を実装した学習目標である。
IFEvalとHumanEvalのPearson相関は最大$27$ppまで向上し, 評価されたすべてのタスクの検証品質を保った上で, FCPA{}によるトレーニングは, 従来の手法よりもG-V整合性とジェネレータ性能を大幅に向上することを示した。
関連論文リスト
- FUSE: Ensembling Verifiers with Zero Labeled Data [11.563701622899295]
FUSE(Fully Unsupervised Score Ensembling)は、正当性ラベルにアクセスせずに検証器をアンサンブルすることで、検証品質を向上させる手法である。
ゼロ・グラウンドの真理ラベルを必要とするが、FUSEは通常テスト時間スケーリングの実験において、半教師ありの代替品と一致または改善する。
論文 参考訳(メタデータ) (2026-04-20T17:40:33Z) - VIGOR+: Iterative Confounder Generation and Validation via LLM-CEVAE Feedback Loop [14.309475903975441]
近年の進歩は、大規模言語モデルを活用して、ドメイン知識に基づいて、もっともらしい隠れた共同設立者を生成する。
我々は,LLMベースの共同創設者生成とCEVAEベースの統計的検証のループを閉じる新しいフレームワークであるVIGOR+を提案する。
フィードバック機構を定式化し、軽微な仮定の下で収束特性を証明し、完全なアルゴリズムの枠組みを提供する。
論文 参考訳(メタデータ) (2025-12-22T12:48:29Z) - EVADE: LLM-Based Explanation Generation and Validation for Error Detection in NLI [36.91800117379075]
EVADEは、大規模な言語モデルを使用してエラーを検出するための説明を生成し、検証するためのフレームワークである。
HLVは、複数のラベルが同じインスタンスに対して有効である場合に発生する。
論文 参考訳(メタデータ) (2025-11-12T03:49:05Z) - Efficient Real-time Refinement of Language Model Text Generation [65.1937138219008]
大規模言語モデル(LLM)は、幅広い自然言語タスクにおいて顕著な性能を示している。
重要な課題は、時に事実的に誤った答えを生じさせることである。
本稿では,LLM出力の検証と改善の効率化を目的とした新しい手法であるStreaming-VRを提案する。
論文 参考訳(メタデータ) (2025-01-14T03:59:48Z) - Generative Verifiers: Reward Modeling as Next-Token Prediction [29.543787728397643]
本研究では,ユビキタスな次世代予測目標を用いて,検証とソリューション生成を併用したトレーニング検証手法を提案する。
標準検証器と比較して、そのような生成検証器(genRM)はLLMのいくつかの利点の恩恵を受けることができる。
我々は、MATHで28%$rightarrow$44.6%、MMLU抽象代数学で37.9%$rightarrow$53.5%の改善を観察する。
論文 参考訳(メタデータ) (2024-08-27T17:57:45Z) - Validating LLM-Generated Programs with Metamorphic Prompt Testing [8.785973653167112]
大規模言語モデル(LLM)は、ソフトウェア開発ライフサイクルにますます統合されています。
本稿では,これらの課題に対処するため,メタモルフィック・プロンプト・テストと呼ばれる新しい手法を提案する。
我々のHumanEvalに対する評価は,GPT-4が生成する誤プログラムの75%を,偽陽性率8.6%で検出できることを示す。
論文 参考訳(メタデータ) (2024-06-11T00:40:17Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z) - Benchmarking and Improving Generator-Validator Consistency of Language
Models [82.73914625520686]
言語モデル(LM)において、解答の生成と検証が一般的である矛盾
最先端のLMであるGPT-4でさえ、GVとの共存率はわずか76%である。
このアプローチはAlpaca-30BのGV一貫性を60%から93%に向上させる。
論文 参考訳(メタデータ) (2023-10-03T07:23:22Z) - HyPoradise: An Open Baseline for Generative Speech Recognition with
Large Language Models [81.56455625624041]
ASRの誤り訂正に外部の大規模言語モデル(LLM)を利用する最初のオープンソースベンチマークを導入する。
提案したベンチマークには、334,000組以上のN-best仮説を含む新しいデータセットHyPoradise (HP)が含まれている。
合理的なプロンプトと生成能力を持つLLMは、N-bestリストに欠けているトークンを修正できる。
論文 参考訳(メタデータ) (2023-09-27T14:44:10Z) - Zero-Shot Logit Adjustment [89.68803484284408]
Generalized Zero-Shot Learning (GZSL) は意味記述に基づく学習技術である。
本稿では,分類器の改良を無視しつつ,ジェネレータの効果を高める新しい世代ベース手法を提案する。
実験により,提案手法が基本生成器と組み合わせた場合の最先端化を実現し,様々なゼロショット学習フレームワークを改良できることが実証された。
論文 参考訳(メタデータ) (2022-04-25T17:54:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。