論文の概要: Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference
- arxiv url: http://arxiv.org/abs/2609.33142v2
- Date: Tue, 29 Sep 2026 12:05:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.644392
- Title: Knowing Is Not Choosing: What Explicit Verification Adds Beyond Generative Preference
- Title(参考訳): Knowing is not Choosing: What Explicit Verification Adds Beyond Generative Preference
- Abstract要約: 事実的リコールは、正しい候補を生成し、利用可能な候補をランク付けし、最終回答を選択する3つのステップに分けます。
P(mathrmTrue)$による明示的な検証は、Gemma、Qwen3、Llamaの平均ログライクなランキングを改善する。
- 参考スコア(独自算出の注目度): 3.3537123444027976
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Generating a correct answer does not mean that a language model will select it. We separate factual recall into three steps: generating a correct candidate, ranking the available candidates, and selecting the final answer. Pre-generation readouts predict factual recall and which questions sampling will cover across three model families, but say little about whether an available correct answer will ultimately be selected. Explicit verification with $P(\mathrm{True})$ improves within-question ranking over mean log-likelihood in Gemma, Qwen3, and Llama, with AUROC gains of $0.08$--$0.12$. In a prospectively defined Gemma cohort, verification raises plurality accuracy by about $5$ points, and still gains about $2$ points over chat-template likelihood, a stronger generative baseline. The advantage is strongest for relations with common-answer priors and depends on access to the entity; masking the entity removes the ranking advantage in larger Qwen models. Finally, the measured benefit depends on how correctness is defined: recall-oriented reference matching can credit option lists favored by likelihood and substantially understate the improvement seen under human semantic judgments. Prior work shows that models can carry latent factual knowledge and judge candidate answers; we show that these capabilities do not collapse into a single notion of ``knowing,'' and trace where information is gained, lost, or mismeasured between availability, ranking, and final choice.
- Abstract(参考訳): 正しい回答を生成することは、言語モデルがそれを選択するという意味ではない。
事実的リコールは、正しい候補を生成し、利用可能な候補をランク付けし、最終回答を選択する3つのステップに分けます。
事前の読み出しは、実際のリコールと、どの質問が3つのモデルファミリーでカバーされるかを予測するが、最終的に正しい回答が選択されるかどうかはほとんど語らない。
P(\mathrm{True})$による明示的な検証は、Gemma、Qwen3、Llamaにおける平均ログライクなランクよりも、クエリ内ランキングを改善し、AUROCは0.08$-$0.12$になった。
将来的に定義されたGemmaコホートでは、検証は複数の精度を約5ドル(約5万5000円)引き上げるが、それでもチャットタイムの確率で約2ドル(約2万2000円)のポイントを獲得している。
アドバンテージは、問い合わせ先との関係において最強であり、エンティティへのアクセスに依存している。
最後に、測定された利点は、どの程度の正確性を定義するかにかかっている。 リコール指向の参照マッチングは、可能性によって好まれ、人間の意味的判断の下で見られる改善を実質的に裏付けるオプションリストを信用することができる。
我々はこれらの能力が‘知識’という単一の概念に崩壊しないことを示し、情報の入手、喪失、そして可用性、ランク付け、最終選択の誤測定を追跡します。
関連論文リスト
- How Correct Is Your Answer? A Semantic Correctness Framework for Open QA Evaluation [38.482877747109946]
本研究では,8つのクラスに有意な回答を割り当てる意味的正当性分類を導入し,有意な内容によって汚染されたものから有意な回答を分離する。
次に、広く使用されているQAデータセットにまたがる8.8kサンプルベンチマークであるCAP-Correctnessと、質問応答ペアを宣言文に変換する11kサンプルデータセットであるCAP-Statementsをリリースする。
第三にCAP(Context-Aware Precision)は、双方向NLIを用いて質問条件文をスコアする参照ベースのメトリクスである。
論文 参考訳(メタデータ) (2026-09-01T15:06:39Z) - HLTCOE Evaluation Team at TREC 2025: VQA Track [76.85337417923331]
HLT評価チームはTREC VQAのAnswer Generation (AG)タスクに参加した。
回答生成における意味的精度とランキングの整合性を改善することを目的としたリストワイズ学習フレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-08T17:25:13Z) - Threading the Needle: Reweaving Chain-of-Thought Reasoning to Explain Human Label Variation [60.18907916989796]
大規模言語モデル(LLM)は最終答を出す前に思考の連鎖(CoT)を生成する。
本稿では,各回答オプションに対するサポート文と反対文を抽出するために,言語的に接頭した談話セグメンタを付加した新しいパイプラインを提案する。
また、正確なスコアよりも回答のランクを優先するランクベースHLV評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-05-29T11:47:18Z) - RankAlign: A Ranking View of the Generator-Validator Gap in Large Language Models [43.89751891729739]
我々は,モデルが生成した解答と,その解答の検証,ジェネレータとバリケータのギャップとの相違について考察する。
この測定結果から,質問応答,語彙意味論タスク,次の単語予測など,さまざまな設定に大きなギャップがあることが分かる。
次にランキングベースのトレーニング手法である RankAlign を提案する。
論文 参考訳(メタデータ) (2025-04-15T16:53:31Z) - Large Language Models Can Self-Correct with Key Condition Verification [39.67266805233599]
単純で効果的な検証手法は,大規模言語モデルの本質的な能力を解き放つことができる。
本稿では, 誤応答を段階的に識別し, 訂正する反復的検証列補正フレームワークを提案する。
論文 参考訳(メタデータ) (2024-05-23T01:43:45Z) - Large Language Models Are Not Robust Multiple Choice Selectors [117.72712117510953]
複数選択質問(MCQ)は、大規模言語モデル(LLM)の評価において、一般的なが重要なタスク形式として機能する。
この研究は、現代のLLMが、その固有の「選択バイアス」によるオプション位置変化に対して脆弱であることを示している。
そこで本研究では,オプションIDに対する事前バイアスを全体予測分布から分離するPriDeという,ラベルのない推論時間脱バイアス手法を提案する。
論文 参考訳(メタデータ) (2023-09-07T17:44:56Z) - Forward-Backward Reasoning in Large Language Models for Mathematical Verification [65.9495774606273]
自己整合性(Self-Consistency)は、さまざまな推論チェーンの回答をサンプリングし、多数決によって最終回答を選択する。
候補解の検証に後方推論を導入する。
検証のための FOrward と BAckward Reasoning は最先端の性能を達成する。
論文 参考訳(メタデータ) (2023-08-15T13:19:59Z) - Large Language Models are not Fair Evaluators [60.27164804083752]
候補回答の品質ランキングは,文脈の出現順序を変えることで容易にハックできることがわかった。
この操作により、評価結果をスキューし、一方のモデルを他方よりもかなり優れているようにすることができる。
この問題を緩和するための3つのシンプルかつ効果的な戦略を持つフレームワークを提案する。
論文 参考訳(メタデータ) (2023-05-29T07:41:03Z) - A Semantic-based Method for Unsupervised Commonsense Question Answering [40.18557352036813]
ラベル付きタスクデータに依存しないため、教師なしのコモンセンス質問応答は魅力的である。
教師なしコモンセンス質問応答のためのSemantic-based Question Answering法(SEQA)を提案する。
論文 参考訳(メタデータ) (2021-05-31T08:21:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。