論文の概要: Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
- arxiv url: http://arxiv.org/abs/2608.01000v1
- Date: Sun, 02 Aug 2026 05:00:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.04898
- Title: Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets
- Title(参考訳): 判断は数えきれない: LLM承認許容集合における無音光
- Abstract要約: 私たちは、ロールが想定する能力を測定し、通常、ロールが配置されるプロトコルの下でそれを欠いていることを見つけます。
モデルは、その候補がセット自体の作者よりもはるかに優れているかどうかを判断する。
- 参考スコア(独自算出の注目度): 13.85834524293015
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Language models are increasingly promoted from examinees to examiners: they write the test suites, answer keys, rubrics, and reward functions that define correctness for other systems. We measure the capability that role assumes and find it lacking under the protocol the role is usually deployed with, one-shot greedy authoring with no test-time reasoning. Across four reference constructions - two with complete finite truth, one with a hardened executable reference (HumanEval+/MBPP+), one with an explicitly incomplete lexical reference (WordNet) - models judge whether a candidate belongs far better than they author the set itself. On the incompleteness-proof algorithmic construction the gap is +0.34 to +0.29 F1 over a 24x parameter range and does not close; on executable code, models judging at F1 0.74-0.90 author suites admitting only 19-42% of oracle-correct solutions. A control locates the deficit: asked to emit the predicate rather than its extension, the same models reach F1 about 0.99. The failure is not missing knowledge or an inability to specify, but an inability to materialise the region a specification induces. The dominant error is omission, which resists audit: an over-inclusion is a token a reviewer can challenge, a missing member an absence whose discovery is the authoring problem itself. Models detect planted over-inclusions 6-7x more often than planted omissions, and a production deployment of 43,227 items fails omission-first at 10:1. Wired into RLVR, an authored key costs 1.9 points of accuracy against an exact oracle and 18.5 WordNet-relative (six paired seeds, p=0.031). Gating authored verifiers on a known-correct probe cuts false rejection from 58-92% to at most 5%, but keeps only 5-39% of suites. Repairing them instead, by rewriting each wrong expected value to what a reference execution returns, raises yield 3.3-10.6x across four author families.
- Abstract(参考訳): 言語モデルは、テストスイート、応答キー、ルーリック、他のシステムに対する正当性を定義する報酬関数など、検査者から検査者へと、ますます推進されている。
私たちは、ロールが想定する能力を測定し、そのロールが通常デプロイされるプロトコルの下で、テスト時の推論なしで、ワンショットのgreedyオーサリングを行う。
4つの参照構造 - 完全な有限真理を持つ2つ、ハード化された実行可能な参照を持つ1つ(HumanEval+/MBPP+)、明示的な不完全な語彙参照を持つ1つ(WordNet) - 候補が集合自身よりもはるかに優れているかどうかを判断するモデル。
不完全性保護アルゴリズムの構成では、ギャップは24xパラメータ範囲で+0.34から+0.29 F1であり、閉じていない。
制御は、その拡張ではなく述語を出力するよう求められ、同じモデルがF1に約0.99まで達する。
失敗は、知識の欠如や特定できないことではなく、仕様が引き起こす領域を具現化できないことだ。
オーバーインクルージョン(over-inclusion)とは、レビュアーが挑戦できるトークンであり、発見がオーサリング問題そのものである欠席メンバーである。
モデルでは、植えられた過剰包接物は、植えられた脱落物よりも6~7倍多く検出され、43,227個の生産物は10:1で脱落する。
RLVRに変換された鍵は、正確なオラクルに対して1.9ポイントの精度と18.5 WordNet-relative (6対のシード、p=0.031)である。
既知の正当性プローブで認証された検証は、偽の拒絶を58~92%から5%に削減するが、スイートの5~39%しか保持しない。
その代わりに、間違った期待値を参照実行が返した値に書き換えることによって、4つの著者ファミリーで3.3-10.6倍の利得が生じる。
関連論文リスト
- SemVerBench: Benchmarking LLM Comprehension of Version-Constraint Resolution Semantics [15.233613140316791]
SemVerBenchは、3つのエコシステムにわたるバージョン制約解決セマンティクスの最初のベンチマークである。
6つのフロンティアモデルを評価し,統計的に有意な自己評価は得られなかった。
タスクが検証可能で、100%正しいリゾルバが存在するため、ツールデリゲートは100%に達する。
論文 参考訳(メタデータ) (2026-09-10T07:34:44Z) - IBIB: A Protocol for Measuring Enterprise AI Systems by Serving Route, Not Model Identifier [0.0]
監査された18のベンチマークはすべて、広告付きモデルの識別子をスコア付けする。
ゴールドブラインド機能バインディングプレフライトは、どのタスクが到達する前に、ルートが評価契約を実行可能であることを確認する。
信頼性非包括的なファーストパススコアリングルールは、有効性を保ちながらスコアの失敗を維持する。
論文 参考訳(メタデータ) (2026-09-09T17:31:29Z) - Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR [0.0]
報酬付き強化学習(RLVR)と標準ベンチマーク評価はどちらも、無料テキスト回答をバイナリ報酬に変換する自動検証に頼っている。
以前の調査では、1つの評価ハーネスは、自身の真実の答えの94%しか受け入れず、解析を非難している。
モデルではなく検証器にメタモルフィックテストを適用し、検証された等価解の変種を生成する。
我々は、307,420以上の4つの広く使用されている検証結果に対して、回答カテゴリごとの拒絶を計測する。
論文 参考訳(メタデータ) (2026-09-01T14:57:59Z) - MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models [49.47300047353726]
MemToCは、実行時ツールによるポストツール-リターン仲裁のベンチマークである。
MemToCは、542の質制御された事実質問から構築された6,504回の評価エピソードで構成されている。
オープンウェイトな7-9Bモデルでは、ツールが強く支配的なクローズドブックの回答を返す。
論文 参考訳(メタデータ) (2026-08-26T18:22:03Z) - When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs [42.32694162421078]
CALVERは、パールの因果基準に対して構造化されたトレースをスコアする訓練不要なシンボル検証器である。
CALVERは、複数のグラフ正解を許容するCLEAR検索1価クエリにおいて、報酬モデル、LLM審査員、モデルの信頼性が30%近く残っている42.1%に達する。
論文 参考訳(メタデータ) (2026-08-04T11:45:46Z) - The Librarian Who Refused to Code: Model-Dependent Identity Enactment in LLM Code Generation [0.0]
4つの条件(ペルソナなし、2人のエンジニアペルソナ、研究図書館ペルソナ)、12のコード生成タスク、2つのフロンティアモデル、5つのセル実行)をテストした。
事前登録された混合効果分析では, プロバイダが報告した出力トークンに対して, 条件・バイ・モデル相互作用が重要であった。
Claude Opusでは、最小限のエンジニアのペルソナが正確性を改善することなく可視出力を30%削減し、一方、徹底的なエンジニアのペルソナは正確性のないアウトプットを増加させた。
論文 参考訳(メタデータ) (2026-07-19T21:47:58Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - PBT-Bench: Benchmarking AI Agents on Property-Based Testing [29.035258104995204]
PBT-Benchは、40の実際のPythonライブラリにまたがる100のプロパティベースのテスト問題のベンチマークである。
各問題は1つ以上のセマンティックなバグ(総数365、平均3.65)を注入し、デフォルトのストラテジーなランダムな入力がほとんど起こらないように設計する。
PBT指導によるバグリコールは42.1%から83.4%の範囲で、オープンエンドベースラインでは31.4%から76.7%である。
論文 参考訳(メタデータ) (2026-05-13T18:01:05Z) - Beyond Code Reasoning: Specification-Anchored Auditing of Multi-Implementation Distributed Protocols [1.5229705287183657]
SPECAは、明示的で分類されたセキュリティプロパティを自然言語仕様から導き出し、実装間で再利用する監査フレームワークである。
RepoAuditのベンチマークでは、SPECAは100%リコール(F1=0.94)で88.9%の精度に達し、著者が検証した12のバグを地上の真実を超えて表面化している。
Sherlock Fusaka Audit Contest(10のターゲット、366の応募)では、SPECAが専門家が強化した15の脆弱性をすべて回復し、4つの修正確認バグが浮上した。
論文 参考訳(メタデータ) (2026-04-29T09:57:07Z) - BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation [34.429649156970015]
以前の評価では、検索なしでベースモデルをテストしたが、これは現在の慣行を反映していない。
3つの検索可能なフロンティアモデルでは、9つのフィールドと6方向のエラー分類に基づいてBibエントリを生成する。
全体的な精度は83.6%だが、完全な正確さは50.9%に過ぎない。
論文 参考訳(メタデータ) (2026-04-03T16:30:58Z) - HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam [63.84155758655084]
HumanityのLast Exam (HLE)は、フロンティアの大規模言語モデルを評価するために広く使われているベンチマークである。
HLE-Verifiedは,透過的検証プロトコルときめ細かい誤り分類法を備えたHLEの検証および改訂版である。
我々は,HLEとHLE-Verifiedの7つの最先端言語モデルを評価し,平均7~10ポイントの絶対精度を観測した。
論文 参考訳(メタデータ) (2026-02-15T02:50:15Z) - Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models [38.79074982172423]
本稿では,トランスフォーマーを用いた大規模言語モデル (LLM) の内部動作について検討する。
本稿では,制約満足度問題として事実クエリをモデル化することを提案する。
制約トークンに対するLLMの注意と世代毎の事実的正確性との間には,強い正の相関関係が認められた。
論文 参考訳(メタデータ) (2023-09-26T17:48:55Z) - TACRED Revisited: A Thorough Evaluation of the TACRED Relation
Extraction Task [80.38130122127882]
TACREDはリレーショナル抽出(RE)において最も大きく、最も広く使われているクラウドソースデータセットの1つである
パフォーマンスの天井に到達したのか、改善の余地はあるのか?
ラベルエラーは絶対F1テストエラーの8%を占めており、例の50%以上を可逆化する必要がある。
論文 参考訳(メタデータ) (2020-04-30T15:07:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。