論文の概要: Fallacy Benchmarks Measure Scheme Recognition, Not Fallacy Detection
- arxiv url: http://arxiv.org/abs/2609.18644v1
- Date: Wed, 16 Sep 2026 13:28:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-20 08:55:53.819797
- Title: Fallacy Benchmarks Measure Scheme Recognition, Not Fallacy Detection
- Title(参考訳): フェーラシーベンチマークは、フェーラシー検出ではなく、スキーマ認識を計測する
- Abstract要約: Fallacy-detectionベンチマークは、すべてのデータ収集を偽としてラベル付けしない単一の"valid"または"none"クラスと、クラスをペアリングする。
偽陽性率の低いベンチマークレポートは、検出能力の証拠ではなく、クラスの構築方法の成果であることを示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fallacy-detection benchmarks pair fallacy classes with a single "valid" or "none" class that takes everything data collection did not label as a fallacy. This construction is misleading: a classifier can learn cues that do well on this class without learning to tell a fallacy from a correct argument. We show that the low false-positive rates benchmarks report are an artifact of how the class is built, not evidence of detection ability. The most informative negative for a fallacy is a correct argument using the same argumentation scheme, and such arguments are at most a few percent of the valid class across the four benchmarks we examined. Evaluated on constructed scheme-matched negatives, false-positive rates rise from 16.6% to 58.9% on CoCoLoFa and from 5.7% to 62.0% on Reddit. That rate depends on how the negatives are written, so we also compare two conditions from the same pipeline that differ only in scheme identity. Classifiers label scheme-matched negatives as the source fallacy type 40.9 points more often than wrong-scheme negatives, which are instead identified as the scheme they actually use 85.9% of the time against 0.4% for the source type. The classifier has learned which scheme an argument uses, not whether it uses it correctly, and on the benchmarks' own test sets the two are indistinguishable. The same dissociation appears in three zero-shot LLM detectors that never saw these benchmarks, and the measurement is far lower on a negative class that was built deliberately. We release the items as Scheme Foils. A reported false-positive rate should not be trusted as a measure of detection until the valid class has been audited for scheme-matched coverage.
- Abstract(参考訳): Fallacy-detectionベンチマークは、データコレクションを全て取り出す単一の"valid"クラスと"none"クラスをペアリングする。
この構成は誤解を招く: 分類器はこのクラスでうまく機能するキューを学ぶことができ、正しい引数から誤りを言うことを学ばない。
偽陽性率の低いベンチマークレポートは、検出能力の証拠ではなく、クラスの構築方法の成果であることを示す。
誤りに対する最も有意な否定は、同じ議論スキームを用いた正しい議論であり、これらの議論は、我々が検証した4つのベンチマークにおいて、少なくとも有効クラスの数パーセントである。
CoCoLoFaでは16.6%から58.9%、Redditでは5.7%から62.0%に偽陽性率が上昇した。
このレートは負の書き方に依存するため、スキームの同一性だけが異なる同じパイプラインからの2つの条件も比較する。
分類器は、ソースの誤り型である40.9ポイントが、実際には85.9%がソースの0.4%に対して実際に使用しているスキームとして識別される。
分類器は、引数が正しく使用するかどうかに関わらず、どのスキームを使用するかを学び、ベンチマーク自身のテストセットでは2つが区別できない。
同じ解離は、これらのベンチマークを見たことのない3つのゼロショットLDM検出器に現れ、その測定は意図的に構築された負のクラスよりもはるかに低い。
アイテムはScheme Foilsとしてリリースします。
報告された偽陽性率は、有効なクラスがスキームマッチングされたカバレッジで監査されるまでは、検出の尺度として信用されてはならない。
関連論文リスト
- Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR [0.0]
報酬付き強化学習(RLVR)と標準ベンチマーク評価はどちらも、無料テキスト回答をバイナリ報酬に変換する自動検証に頼っている。
以前の調査では、1つの評価ハーネスは、自身の真実の答えの94%しか受け入れず、解析を非難している。
モデルではなく検証器にメタモルフィックテストを適用し、検証された等価解の変種を生成する。
我々は、307,420以上の4つの広く使用されている検証結果に対して、回答カテゴリごとの拒絶を計測する。
論文 参考訳(メタデータ) (2026-09-01T14:57:59Z) - Synthetic minority data is redundant or invalid: a data-dependent validity theory and a de-biased test [0.5625796693054093]
20年間、クラス不均衡学習の標準的な治療法は、合成マイノリティの例を作成することである。
有効性はデータの性質であって,その方法ではないことを証明します。
監査をpipインストール可能なテストとしてリリースし、証明の負担を逆転させます。
論文 参考訳(メタデータ) (2026-07-22T23:19:28Z) - Catching One in Five: LLM-as-Judge Blind Spots in Production Multi-Turn Transaction Agents [45.148328075418156]
デプロイされた多ターン食品・飲料注文エージェントについて検討し,実際の品質問題の数を測定した。
私たちの盲点分類は、失敗はランダムではなく構造化されていることを示している。
プロダクションマルチターンエージェントでは、自動判断はリグレッションフロアであり、人間のレビューの代わりにはならない。
論文 参考訳(メタデータ) (2026-06-09T02:11:01Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks [0.0]
MathCheckのパラフレーズ品質検査では, 19群で4つの意味的不正確なパラフレーズが検出された。
GPT-4oは2位から4位へと降格し、クロード・ハイクとディープ・シークV3が上昇する。
論文 参考訳(メタデータ) (2026-05-27T18:59:18Z) - Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges [65.92623263645139]
LLM審査員を誤解させるためにセマンティクスを保存する編集を学習するブラックボックスの敵対的フレームワークであるBITEを紹介する。
BITEは65%を超える攻撃成功率を獲得し、9ポイントのスケールでスコアを1-2ポイント上げる。
LLM-as-a-judgeパラダイムの根本的な弱点を明らかにし,ロバストでアタック・アウェアな評価を動機づけた。
論文 参考訳(メタデータ) (2026-05-24T05:24:09Z) - Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation [0.0]
連鎖忠実性に関する最近の研究は、単一集合数について報告している。
本論文は、忠実性はモデルの客観的かつ測定可能な性質ではないことを示す。
論文 参考訳(メタデータ) (2026-03-20T17:48:43Z) - Is the Performance of My Deep Network Too Good to Be True? A Direct
Approach to Estimating the Bayes Error in Binary Classification [86.32752788233913]
分類問題において、ベイズ誤差は、最先端の性能を持つ分類器を評価するための基準として用いられる。
我々はベイズ誤差推定器を提案する。そこでは,クラスの不確かさを示すラベルの平均値のみを評価できる。
我々の柔軟なアプローチは、弱い教師付きデータであってもベイズ誤差を推定できる。
論文 参考訳(メタデータ) (2022-02-01T13:22:26Z) - Learning with Proper Partial Labels [87.65718705642819]
部分ラベル学習は、不正確なラベルを持つ弱い教師付き学習の一種である。
この適切な部分ラベル学習フレームワークには,従来の部分ラベル学習設定が数多く含まれていることを示す。
次に、分類リスクの統一的非バイアス推定器を導出する。
論文 参考訳(メタデータ) (2021-12-23T01:37:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。