論文の概要: frb100-40 After Two Decades: An Optimality Certificate and a Preregistered Search Study
- arxiv url: http://arxiv.org/abs/2609.02804v1
- Date: Wed, 02 Sep 2026 16:40:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.472807
- Title: frb100-40 After Two Decades: An Optimality Certificate and a Preregistered Search Study
- Title(参考訳): 2年後のfrb100-40:Optimality CertificateとPreregistered Search Study
- Authors: Onur Uğurlu,
- Abstract要約: グループ対応のCSPパイプラインは2,500/2,500を、LibMVC-NuMVCでは2,391/2,500を解決した。
frb100-40では、フルULSA、ベースULSA、NuMVCはそれぞれ0/56の新しい証明書を作成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: For more than 20 years, the Model-RB benchmark frb100-40 remained an open challenge; since 2014, its public record had stood at 99 of 100 variables. We give a directly checkable 100-vertex independent set for its 4,000-vertex graph. Together with a verified partition into 100 cliques of size 40, the witness proves that the maximum independent-set size is 100 and the minimum vertex-cover size is 3,900. The stochastic run that found the witness is kept separate from this proof. We evaluated its added pair and triple repair operators in a preregistered campaign comprising 8,668 valid runs. The primary comparison found no detectable acceleration over base ULSA (hazard ratio 0.967, 95% confidence interval 0.915-1.023; p=0.248), and the factorial ablation reached the same conclusion. On a smaller FRB suite, the group-aware CSP pipeline solved 2,500/2,500 runs, compared with 2,391/2,500 for LibMVC-NuMVC. On frb100-40, full ULSA, base ULSA, and NuMVC each produced 0/56 new certificates. With no events, the planned cross-solver hazard ratios remain unidentified. NuMVC ended with cover size 3,902 in 40 runs and 3,903 in 16. Exhaustive enumeration showed that none of the 108 unique recorded conflict-two states had a strictly improving group-aware CSP neighbor within Hamming radius three. The certificate settles the instance. The experiments characterize the search barrier, and the preregistered comparisons show no heuristic advantage.
- Abstract(参考訳): 20年以上にわたって、Model-RBベンチマークのfrb100-40はオープンな課題であり、2014年以来、その公開記録は100変数の99であった。
4000頂点グラフに対して直接チェック可能な100頂点独立集合を与える。
検証済みの40の100の傾斜角に分割することで、証人は最大独立セットサイズが100であり、最小頂点カバーサイズが3900であることを示す。
証人を見つけた確率的な実行は、この証明とは別物である。
8,668回の有効走行を含む事前登録キャンペーンにおいて,追加のペアと3重補修演算子について検討した。
初回比較では、ベースULSA(ハザード比0.967,95%信頼区間0.915-1.023; p=0.248)の加速度は検出されず、因子的アブレーションは同じ結論に達した。
より小さなFRBスイートでは、グループ対応のCSPパイプラインが2500/2,500を、LibMVC-NuMVCでは2,391/2,500を解決した。
frb100-40では、フルULSA、ベースULSA、NuMVCはそれぞれ0/56の新しい証明書を作成した。
イベントがないため、クロスゾルダーのハザード比は未確認のままである。
NuMVCのカバーサイズは40ランで3,902本、16ランで3,903本となった。
排他的列挙により、ハミング半径3の中で108個の記録された紛争、2つの州のうちのどの州も、群を意識したCSP隣国を厳格に改善していないことが判明した。
証明書がインスタンスを解決します。
実験では探索障壁が特徴づけられ、事前登録された比較ではヒューリスティックな優位性は示されていない。
関連論文リスト
- CropCop: An Auditable 120-Class Plant-Health Model from Benchmark Reconstruction to a Quantised Runtime Artifact [0.0]
本報告では,120のプラント・ヘルス・クラスにまたがるクローズド・セット認識システムであるCropCopについて述べる。
CropCopは、強力な漏洩制御された内部認識とソフトウェア実行時の忠実性を確立する。
論文 参考訳(メタデータ) (2026-08-26T08:51:57Z) - BeTaL-GBI: Admission-Aware Benchmark Tuning and Full-Stack Verification of Geometric Belief Interfaces [2.894286977279531]
本研究は,企業検証アーキテクチャが要求を監査しつつ,インターフェース障害,タスク能力,ポリシー適合性,整合性を分離できるかどうかを検討する。
BeTaL-GBI v0.2 は LLM-in-the-loop を2,218,750,380 以上のグリッドポイントで適用し、条件付き性能からフォーマットの入力を分離する。
512の総合的なタスクにおいて、16ゲートポリシーは、116の激しい矛盾を全て検出し、99のクリーンレコードを全て受け入れる。幻覚剤とエビデンスフォーガーサロゲートは無音のプロモーションでブロックされる。
論文 参考訳(メタデータ) (2026-08-21T16:52:38Z) - An Omitted Mode Is a Rare Rule: The Sampling-Verification Danger Law in Continuous Code World Models [0.0]
GPT-5.xは111モードを含む合成ドローのうち105個の省略された1Dクランプを修復する。
2D領域では、ルールを回復するアーティファクトは存在しない(0/156)。
我々は、入場規則のクラスを、演奏中の全てのサンプルと正確に一致しているが、無害であることを示すので、識別性は楽器の計測可能な特性である。
論文 参考訳(メタデータ) (2026-08-18T16:09:51Z) - Stage-Replay Divergence Follows the KV Cache: Fixed-Prefix Precision Controls and Bidirectional Cache Transplantation [51.56484100374058]
Stage-replayは中間トークンプレフィックスを再構築し、プレフィックスに最初に到達したデコーダ状態からの継続として、新しいプリフィル継続を処理する。
一致した200itemの実験では、保持されたライブキャッシュと同一の整数トークンのワンショットプリフィルを比較し、両側に正確なレプリカを配置する。
論文 参考訳(メタデータ) (2026-07-30T16:41:40Z) - Mapping CVEs to MITRE ATT&CK Techniques: A Curated Gold-Set Classifier and the Limits of LLM-Assisted Label Expansion [46.262619407930266]
我々は、専門家のMITRE Center for Threat-Informed Defense mappingsから1,207 CVEのキュレートされた金のデータセットにマルチラベル分類器をトレーニングする。
その結果得られたモデルは、ゼロショットの埋め込み類似性のベースラインと比較して、おおよそdoubles recall@5である。
次に,LLMによるラベリングが金のデータセットを拡張できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-07-28T10:59:04Z) - Metric Aggregation Divergence: A Hidden Validity Threat in Agent-Based Policy Optimization and a Contractual Remedy [7.1976264551575895]
メートル法アグリゲーション分散(英: Metric aggregate divergence、MAD)は、エージェントベースのモデルにおいて、異なるパイプラインステージで発生するサイレント不整合である。
私たちは、ディスパッチ時に実施される単一の呼び出し可能なランタイムであるメトリックコントラクトを、対策として紹介します。
論文 参考訳(メタデータ) (2026-06-27T18:17:33Z) - Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring [1.0170129555792935]
802.11パケットキャプチャの診断には、専門家のプロトコル知識が必要で、遅く、エンジニア間で一貫性がなく、スケールできない。
LLMベースのアプローチは、キャプチャーから欠落するが製造されたプロトコルイベントを聴取し、未校正された信頼スコアを生成し、テスト中のモデルによって黄金の基準が共同生成されると評価バイアスを被る。
PROBEは3つの障害に対処する多段階パイプラインである。
論文 参考訳(メタデータ) (2026-06-05T03:39:58Z) - Knowledge Index of Noah's Ark [63.143852586221534]
KINAは,261分野にわたる899項目のベンチマークである。
ボーナス・オン・バートーナメントがFOSDを弱く支配していることを示す。
トップモデルであるGemini-3.1-Pro-Previewは53.17%、Claude-Opus-4.6は49.92%、GPT-5.4は48.55%に達した。
論文 参考訳(メタデータ) (2026-06-03T17:06:49Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。