論文の概要: Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation
- arxiv url: http://arxiv.org/abs/2607.23386v1
- Date: Sat, 25 Jul 2026 22:40:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.088301
- Title: Confidently Wrong: Exception Chain Collapse in Frontier LLM Rule Evaluation
- Title(参考訳): LLMルール評価における例外連鎖の崩壊
- Authors: Paul Simpson, John Kozak, Lisa Doake,
- Abstract要約: フェデレーションクラスをフロンティアの大規模言語モデルで文書化する。
故障は最初の観測で再現されるが、経験的表面は不安定である。
規制されたフロンティアモデルの正確性は、注意を払わずにシフトする移動したコンプライアンス境界である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We document a failure class in frontier large language models -- exception chain collapse -- observed in eligibility evaluation under nested conditional rules of the form "A is required UNLESS B applies, UNLESS C overrides B". The failure reproduces at first observation, but its empirical surface is unstable: between March and April 2026 several failure cells closed silently under the same model alias, with no version bump (GPT-5.4 on construction insurance moved from 96.6% to 100%, same prompt and harness). For regulated workflows, frontier-model accuracy is a moving compliance boundary that shifts without notice. We present the Aethis Eligibility Module, a neuro-symbolic architecture in which LLMs author rules from authoritative sources and an SMT-based layer executes them deterministically, consistent with the authored specification regardless of model drift, reasoning-effort defaults, or prompt format. Three evidence bases: (i) a controlled benchmark of 225 scenarios across four regulatory domains documents the pattern and, in replication, the drift that partially closed it; (ii) a 20-scenario adversarial extension on construction insurance, where the engine scores 20/20, as does one of four frontier configurations (GPT-5.4 at low reasoning effort), while the other three, including Anthropic's strongest model at evaluation time, fail the same coverage-gap edge case; (iii) external validation on nine peer-reviewed LegalBench tasks, 949 held-out cases, where the engine is significantly more accurate than all three frontier models (combined McNemar's p <= 0.003), with margins up to +41 points on the curated multi-prong tasks against the Anthropic models. The contribution is to relocate uncertainty from the inference boundary, where it is silent, to the specification boundary, where it is deliberate and audited. All scenarios, rule encodings, and results are public and reproducible.
- Abstract(参考訳): 我々は,「A is required UNLESS B apply, UNLESS C overrides B」という形式のネスト条件付き規則の下での可視性評価で観察された,最前線の大規模言語モデル(例外連鎖崩壊)における障害クラスを文書化する。
2026年3月から4月にかけて、いくつかの故障細胞は同じモデルエイリアスの下で静かに閉鎖され、バージョンアップは行われなかった(GPT-5.4は96.6%から100%、同じプロンプトとハーネス)。
規制されたワークフローでは、フロンティアモデルの正確性は、注意を払わずにシフトする、動くコンプライアンス境界である。
提案するAethis Eligibility Moduleは、LLMが権威のあるソースとSMTベースのレイヤからルールを規定するニューロシンボリックアーキテクチャであり、モデルドリフト、推論のデフォルト、あるいはプロンプトフォーマットに関わらず、著者仕様と一致する決定論的にそれらを実行する。
根拠は3つ。
(i)4つの規制ドメインにまたがる225のシナリオの制御されたベンチマークは、そのパターンを文書化し、複製において、部分的に閉じたドリフトを再現する。
2) 建設保険の20シナリオ対向延長であって、エンジンが20/20であり、4つのフロンティア構成のうちの1つ(低推理時のGPT-5.4)であり、その他の3つは、評価時に最も高いモデルを含むが、同じカバーギャップエッジケースに失敗する。
3)9つのピアレビューされたLegalBenchタスクの外部検証、949のホールドアウトケースでは、エンジンは3つのフロンティアモデル(マクネマールのp <= 0.003)よりもはるかに正確であり、そのマージンは最大で41ポイントである。
このコントリビューションは、静かである推論境界から、意図的に監査されている仕様境界へ、不確実性を移すことである。
すべてのシナリオ、ルールエンコーディング、結果は公開され、再現可能である。
関連論文リスト
- Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts [0.0]
学習後の量子化は,タスク精度が保存されている場合でも,大きな言語モデルがどのように推論するかを静かに変更できることを示す。
3つの量子化精度で5つの命令調整LDMから3万のチェーン・オブ・シント出力を分類する。
精度は精度で高いが,Hollow Convergence は NF4 で大きく依存的な変化を示す。
論文 参考訳(メタデータ) (2026-07-10T21:55:05Z) - DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models [6.628401122676601]
ルールベースの論理解法は、ベンチマークの全インスタンスを50マイクロ秒未満で100%精度で解決する。
データセットと生成パイプラインであるDeFAb(Defeasible Abduction Benchmark)を紹介します。
論文 参考訳(メタデータ) (2026-06-17T00:13:40Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Persona-Model Collapse in Emergent Misalignment [0.0]
有害な内容を持つ狭いデータに対する微調整された大きな言語モデルは、無関係なプロンプトに対して広範囲に不整合な振る舞いをもたらす。
モラル・サセプティビリティ(S)とモラル・ロバストネス(R)の2つの指標を用いてこの仮説を検証する。
これらのメトリクスは、与えられた文字(S)と、与えられた文字(R)をシミュレートするときにその一貫性を識別するモデルの能力を形式化する。
論文 参考訳(メタデータ) (2026-05-13T00:48:57Z) - DiagnosticIQ: A Benchmark for LLM-Based Industrial Maintenance Action Recommendation from Symbolic Rules [4.124344125532972]
複雑な工業資産の監視は、センサーの条件に基づいて引き起こされるエンジニアによる象徴的な規則に依存している。
ルールをメンテナンスステップに変換するには、長年の実践を通じて得られた資産固有の知識が必要です。
このルール・ツー・アクション・ステップの意思決定支援としてLLMが有効か検討し,6,690名の専門家による複数選択質問をベンチマークした。
論文 参考訳(メタデータ) (2026-05-09T02:17:39Z) - Prompt Injection Evaluations: Refusal Boundary Instability and Artifact-Dependent Compliance in GPT-4-Series Models [0.0]
GPT-4.1 と GPT-4o の2つのモデルを評価する。
アーティファクトタイプは摂動スタイルよりも断裂の予測が強いことが分かりました。
断熱挙動は安定な二元性というよりは確率的であり, 人工物に依存した境界現象である。
論文 参考訳(メタデータ) (2026-01-25T17:14:33Z) - What Matters For Safety Alignment? [38.86339753409445]
本稿では,AIシステムの安全アライメント能力に関する総合的研究について述べる。
本研究では,6つの重要な内在モデル特性と3つの外部攻撃手法の影響を系統的に検討し,比較した。
LRMs GPT-OSS-20B, Qwen3-Next-80B-A3B-Thinking, GPT-OSS-120Bを最も安全な3つのモデルとして同定した。
論文 参考訳(メタデータ) (2026-01-07T12:31:52Z) - RefusalBench: Generative Evaluation of Selective Refusal in Grounded Language Models [43.76961935990733]
欠陥のあるシステムに基づいて、言語モデルが回答を拒否する能力は、依然として重大な障害点である。
RefusalBenchは、制御された言語コンテキストを通して診断テストケースを作成するジェネレーティブな方法論である。
選択的な拒絶は、改善への明確な道筋を提供する列車で、アライメントに敏感な能力であることがわかった。
論文 参考訳(メタデータ) (2025-10-12T00:53:42Z) - Causal Understanding by LLMs: The Role of Uncertainty [43.87879175532034]
近年の論文では、LLMは因果関係分類においてほぼランダムな精度を達成している。
因果的事例への事前曝露が因果的理解を改善するか否かを検討する。
論文 参考訳(メタデータ) (2025-09-24T13:06:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。