論文の概要: Prompt Framing Distorts Count-Based Evaluation of LLM Error Detection: Evidence from Numeric Anchoring
- arxiv url: http://arxiv.org/abs/2607.01240v1
- Date: Sun, 03 May 2026 12:21:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:12.973275
- Title: Prompt Framing Distorts Count-Based Evaluation of LLM Error Detection: Evidence from Numeric Anchoring
- Title(参考訳): プロンプトフラミング歪みによるLPM誤差検出の評価:数値アンカリングによる証拠
- Abstract要約: 本稿では,F1をカウントベースとしたF1が,ローカライゼーションの改善を伴わずに劇的に上昇することを示す。
ErrorBenchは、プロンプト誘起カウント歪みの制御されたストレステストプロトコルである。
本研究は,GPT/Claudeシステムにおいて,GPT/Claudeシステムにおいてより大きいカウント応答と,このストレステストプロトコル下でのジェミニファミリーでのより小さな応答を見出した。
- 参考スコア(独自算出の注目度): 0.16921396880325776
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Count-based F1 is widely used as a proxy for LLM error-detection quality, but this paper shows that it can rise dramatically without a corresponding improvement in span localization, a gap termed F1 Inflation. The paper introduces ErrorBench, a controlled stress-test protocol for prompt-induced count distortion. ErrorBench evaluates six contemporary LLMs under five prompt conditions over 4,290 responses from 143 CoNLL-2014 passages. Under CoNLL-2014 M2-style scoring, anchored prompts produce up to 0.79 points of F1 Inflation, and up to 0.96 under strict matching. A 100-passage replication using the official ERRANT 3.0.0 pipeline and multi-reference scoring reproduces the pattern: averaged over six models, the Blind-to-Anchored prompt shift raises Count-F1 by +0.21 while raising multi-reference ERRANT F0.5 by only +0.04. The study finds larger count responses in highly instruction-compliant GPT/Claude systems and smaller responses in the Gemini family under this stress-test protocol. The findings suggest that LLM proofreading and document-review evaluations should avoid pre-populated error counts and should report span-aware metrics alongside count-based metrics.
- Abstract(参考訳): カウントベースF1はLLM誤差検出品質のプロキシとして広く利用されているが,本論文では,F1インフレーション(F1 Inflation)と呼ばれるギャップである局所化の改善を伴わずに劇的に上昇することを示す。
提案するErrorBenchは,プロンプト誘起カウント歪みを制御したストレステストプロトコルである。
ErrorBenchは、143のCoNLL-2014通路からの4,290の応答に対して、5つの刺激条件下で6つの現代のLCMを評価する。
CoNLL-2014 M2スタイルのスコアでは、アンカー付きプロンプトはF1インフレーションの最大0.79ポイント、厳密なマッチングでは最大0.96ポイントとなる。
公式のERRANT 3.0.0パイプラインとマルチリファレンススコアを用いた100パスのレプリケーションでは、パターンを再現する:平均6モデルで、Blind-to-AnchoredプロンプトシフトはカウントF1を+0.21高め、マルチ参照ERRANT F0.5を+0.04高めにする。
本研究は,GPT/Claudeシステムにおいて,GPT/Claudeシステムにおいてより大きいカウント応答と,このストレステストプロトコル下でのジェミニファミリーでのより小さな応答を見出した。
以上の結果から, LLMの証明読解と文書レビュー評価は, 既往の誤り数を回避するとともに, カウントベースメトリクスと並行して, 横断的メトリクスを報告すべきであることが示唆された。
関連論文リスト
- NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment [54.4265627247104]
大規模言語モデル(LLM)は、主要なAIカンファレンスでピアレビューでますます使用されている。
既存のベンチマークでは、ノベルティを1つの総合的なスコアとして評価している。
本報告では,詳細なノベルティアセスメント診断のための人手によるベンチマークであるNovGaugeについて述べる。
論文 参考訳(メタデータ) (2026-09-10T08:34:56Z) - Resolution Diagnostics for Paired LLM Evaluation [0.0]
オープンLLM リーダーボード v1 対比較40点中11点, MMLU-Pro 上位10点中4点を (アルファ, 1-β) = (0.05, 0.8) で未解決であることを示す。
MMLU-Proの数は実際の対象レベルのクラスタリングで6/9まで上昇し、99.9%のカテゴリブートストラップの再サンプリングで9のうち5-6に留まる。
論文 参考訳(メタデータ) (2026-05-28T17:54:09Z) - Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses [6.004875368104112]
大規模な言語モデル(LLM)は治療として提案されているが、完全なサーベイワークフロー全体にわたる厳密な評価はほとんど残っていない。
アンケート設計, サンプル選択, パイロットテスト, 欠落データ計算, および収集後の分析を対象とする, LLM 統合のための5段階フレームワークを提示し, 評価した。
保護モチベーション理論 (PMT) 制約付き共起知識グラフを導入し, ゼロショット推論, 検索拡張ベースライン, 新規な理論インフォームド変種にまたがる7つのLLM構成を開発する。
論文 参考訳(メタデータ) (2026-05-19T00:58:36Z) - Sequential Consensus for Multi-Agent LLM Debates: A Wald-SPRT compute governor with calibration-based failure detection [0.0]
マルチエージェントの議論は事実と推論を改善するが、ほとんどのレシピは固定されたラウンドカウントを選択する。
我々は,LLM討論のプラグイン計算として,Wald's Sequential Probability Ratio Test (SPRT)を適用した。
GSM8Kでは、ルールは1.01ラウンド(4.06 LLMコール)で97.0%の精度で終了するが、15回のコールで固定5の討論では99.0%の精度で終了する。
MMLUでは、キャリブレーションされたKLは約0に崩壊し、ルール上限は2.1倍のコストで99.5%となる。
論文 参考訳(メタデータ) (2026-05-18T23:43:12Z) - Sketch2Feedback: Grammar-in-the-Loop Framework for Rubric-Aligned Feedback on Student STEM Diagrams [0.0]
Sketch2Feedbackは,問題を4段階に分解する文法-イン-ザ-ループフレームワークである。
我々は,FBD-10とCircuit-10の2種類の合成マイクロベンチマークについて,それぞれ500枚の画像が標準値とハードノイズ増大レベルに分散されていることを評価した。
論文 参考訳(メタデータ) (2026-02-19T20:34:24Z) - GLEAN: Grounded Lightweight Evaluation Anchors for Contamination-Aware Tabular Reasoning [0.5414847001704249]
本稿では, 汚染対応プローブ, 弱スーパービジョンガバナンス, 検索推論診断, 構造化エラー属性を統合する軽量な評価プロトコルを提案する。
我々は16GBのGPU予算でTabFact、WTQをSquall、TableBench、RobuT、SciTabで評価した。
論文 参考訳(メタデータ) (2026-01-22T13:56:19Z) - CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal [84.71254539482369]
検証可能な報酬を伴うグループ相対的強化学習(RLVR)は、しばしば、すでに失敗している最も情報に富むデータを浪費する。
エラーを監督するマルチモーダル推論のための,障害中心のポストトレーニングフレームワークであるCAREを提案する。
CAREは正確さを改善し、スムーズさをトレーニングすると同時に、障害からの学習信号のシェアを明示的に増やします。
論文 参考訳(メタデータ) (2025-12-22T16:34:21Z) - RefineBench: Evaluating Refinement Capability of Language Models via Checklists [71.02281792867531]
本研究は,2つの改良モード(ガイドリファインメントと自己リファインメント)を評価する。
ガイド付き改良では、プロプライエタリなLMと大きなオープンウェイトLMの両方が目標フィードバックを利用して、5ターン以内のほぼ完全なレベルへの応答を洗練できる。
これらの結果は、フロンティアLMは誤った反応を自己調整するためにブレークスルーを必要とすることを示唆している。
論文 参考訳(メタデータ) (2025-11-27T07:20:52Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - LLMs as Factual Reasoners: Insights from Existing Benchmarks and Beyond [135.8013388183257]
そこで我々は,SummEditsと呼ばれる10ドメインのベンチマークで不整合検出ベンチマークを作成し,実装する新しいプロトコルを提案する。
ほとんどのLLMはSummEditsで苦労しており、パフォーマンスはランダムに近い。
最も優れたモデルであるGPT-4は、推定された人間のパフォーマンスよりも8%低い。
論文 参考訳(メタデータ) (2023-05-23T21:50:06Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。