論文の概要: Fallacy Benchmarks Measure Scheme Recognition, Not Fallacy Detection
- arxiv url: http://arxiv.org/abs/2609.18644v2
- Date: Sun, 20 Sep 2026 22:33:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-22 20:29:00.006308
- Title: Fallacy Benchmarks Measure Scheme Recognition, Not Fallacy Detection
- Title(参考訳): フェーラシーベンチマークは、フェーラシー検出ではなく、スキーマ認識を計測する
- Abstract要約: Fallacy-detectionベンチマークは、データコレクションを全て取り出す単一の"valid"クラスと"none"クラスをペアリングする。
これらのベンチマークが実際に評価しているのは,第2のジョブの背後にあるスキーム認識であることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fallacy-detection benchmarks pair fallacy classes with a single "valid" or "none" class that takes everything data collection did not label as a fallacy. A detector has two jobs, deciding whether an argument is fallacious and naming which fallacy it commits, and the false-positive rate is meant to measure the first. We show that what these benchmarks actually score is scheme recognition, the ability behind the second job. Their own test sets already show it: when a classifier misses a fallacy, the error lands on "none" rather than on another fallacy type, so detection is failing while classification holds. The reason is what the valid class lacks. The negatives that separate the two jobs are correct arguments using the same argumentation scheme as a fallacy, and they are scarce: nearly absent from the four benchmarks we examined, and rare even under deliberate search. A detector is therefore never tested where recognizing a scheme and judging its use come apart, and can pass on recognition alone. We construct the missing arguments, together with a control condition from the same pipeline that differs only in scheme, so whatever generation contributes, it contributes to both. The classifier labels the scheme-matched negatives as the source fallacy, and labels the wrong-scheme negatives as the scheme they actually use 85.9% of the time and as the source type 0.4%. The classifier has learned which scheme an argument uses, not whether it uses it correctly. The over-flagging follows: a model that scores 16.6% on CoCoLoFa's own valid class flags 58.9% of the constructed arguments. The same dissociation appears in three zero-shot LLM detectors that never saw these benchmarks. We release the items as Scheme Foils. A reported false-positive rate should not be trusted as a measure of detection until the valid class has been audited for scheme-matched coverage.
- Abstract(参考訳): Fallacy-detectionベンチマークは、データコレクションを全て取り出す単一の"valid"クラスと"none"クラスをペアリングする。
検出器は2つのジョブを持ち、引数が誤ったものかどうかを判断し、それがどの誤りを犯しているかを判断し、偽陽性率を最初に測定する。
これらのベンチマークが実際に評価しているのは,第2のジョブの背後にあるスキーム認識であることを示す。
分類器が誤用を見逃した場合、エラーは別の誤用タイプではなく「ゼロ」に着地するので、分類が保たれている間に検出が失敗する。
その理由は、有効なクラスが欠落しているからである。
2つのジョブを分離する否定は、同じ議論スキームを誤用として使う正しい議論であり、これらは、私たちが調査した4つのベンチマークからほとんど欠落している。
したがって、検知器は、スキーマを認識してその使用を判断する場所を検査することはなく、単独で認識をパスすることができる。
我々は、欠落した引数と、スキームのみが異なる同じパイプラインからの制御条件を構築し、どの世代が貢献するにせよ、両方に寄与する。
分類器は、スキームにマッチした負をソースの誤用としてラベル付けし、間違ったスキームの負を実際に85.9%、ソースタイプ0.4%のスキームにラベル付けする。
分類器は、引数が正しく使用するかどうかではなく、どのスキームが使用するかを学習した。
CoCoLoFa自身の有効なクラスフラグで16.6%をスコアするモデルは、構築された引数の58.9%である。
同じ解離は、これらのベンチマークを見たことのない3つのゼロショットLDM検出器に現れる。
アイテムはScheme Foilsとしてリリースします。
報告された偽陽性率は、有効なクラスがスキームマッチングされたカバレッジで監査されるまでは、検出の尺度として信用されてはならない。
関連論文リスト
- Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR [0.0]
報酬付き強化学習(RLVR)と標準ベンチマーク評価はどちらも、無料テキスト回答をバイナリ報酬に変換する自動検証に頼っている。
以前の調査では、1つの評価ハーネスは、自身の真実の答えの94%しか受け入れず、解析を非難している。
モデルではなく検証器にメタモルフィックテストを適用し、検証された等価解の変種を生成する。
我々は、307,420以上の4つの広く使用されている検証結果に対して、回答カテゴリごとの拒絶を計測する。
論文 参考訳(メタデータ) (2026-09-01T14:57:59Z) - Synthetic minority data is redundant or invalid: a data-dependent validity theory and a de-biased test [0.5625796693054093]
20年間、クラス不均衡学習の標準的な治療法は、合成マイノリティの例を作成することである。
有効性はデータの性質であって,その方法ではないことを証明します。
監査をpipインストール可能なテストとしてリリースし、証明の負担を逆転させます。
論文 参考訳(メタデータ) (2026-07-22T23:19:28Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks [0.0]
MathCheckのパラフレーズ品質検査では, 19群で4つの意味的不正確なパラフレーズが検出された。
GPT-4oは2位から4位へと降格し、クロード・ハイクとディープ・シークV3が上昇する。
論文 参考訳(メタデータ) (2026-05-27T18:59:18Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation [0.0]
連鎖忠実性に関する最近の研究は、単一集合数について報告している。
本論文は、忠実性はモデルの客観的かつ測定可能な性質ではないことを示す。
論文 参考訳(メタデータ) (2026-03-20T17:48:43Z) - Is the Performance of My Deep Network Too Good to Be True? A Direct
Approach to Estimating the Bayes Error in Binary Classification [86.32752788233913]
分類問題において、ベイズ誤差は、最先端の性能を持つ分類器を評価するための基準として用いられる。
我々はベイズ誤差推定器を提案する。そこでは,クラスの不確かさを示すラベルの平均値のみを評価できる。
我々の柔軟なアプローチは、弱い教師付きデータであってもベイズ誤差を推定できる。
論文 参考訳(メタデータ) (2022-02-01T13:22:26Z) - Learning with Proper Partial Labels [87.65718705642819]
部分ラベル学習は、不正確なラベルを持つ弱い教師付き学習の一種である。
この適切な部分ラベル学習フレームワークには,従来の部分ラベル学習設定が数多く含まれていることを示す。
次に、分類リスクの統一的非バイアス推定器を導出する。
論文 参考訳(メタデータ) (2021-12-23T01:37:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。