論文の概要: A Reproducibility Protocol for Cross-Implementation Evaluation of Post-Quantum ACVP Test Vectors
- arxiv url: http://arxiv.org/abs/2608.13784v1
- Date: Thu, 13 Aug 2026 21:29:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-17 20:14:29.214019
- Title: A Reproducibility Protocol for Cross-Implementation Evaluation of Post-Quantum ACVP Test Vectors
- Title(参考訳): 量子後ACVPテストベクトルのクロス実装評価のための再現性プロトコル
- Abstract要約: 本研究ではNIST ML-KEMの3つの公開実装のための製品中立プロトコルを定義する。
Protocol v2はプロバイダ固有の機能を凍結し、1つのバリデーションエラーを対称に適用し、選択されたすべてのケースを保存し、バイト、バリデーションバリデーション、サポートされた操作、アダプタエラーを分離する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Independent implementations of a cryptographic standard should reproduce the same known-answer results, yet agreement is meaningful only when the corpus, revisions, public interfaces, exclusions, and evidence are precisely stated. This study defines a product-neutral reproducibility protocol for three public implementations of NIST ML-KEM against a pinned public Automated Cryptographic Validation Protocol corpus. Protocol v2 freezes provider-specific capabilities, applies one validation-error taxonomy symmetrically, preserves every selected case, and separates bytes, validation verdicts, unsupported operations, and adapter errors. The source-built experiment evaluated @noble/post-quantum 0.7.0, liboqs 0.16.0, and Go 1.26.4. Across three repetitions, the required Cartesian product comprised 2,160 base records: all 1,650 declared executable evaluations matched the NIST oracle, and all 510 unsupported records matched Go's predeclared capability boundary. Pairwise agreement was complete on every executable overlap: 720 of 720 noble-liboqs records and 210 of 210 records for each Go pairing. A separate keyGen-ek-projection diagnostic matched all 150 Go encapsulation-key projections without counting them as full key generation. Three frozen controls independently exercised byte comparison, verdict comparison, and malformed-response error separation; each produced its exact predeclared outcome. No base failure, adapter error, or status instability occurred. The evidence establishes bounded author-run repeatability and exposes a practical standards gap: public ML-KEM packages provide materially different deterministic and validation-test surfaces. Independent external reproduction remains unobserved. The results do not establish certification, exhaustive correctness, side-channel resistance, secure integration, or production assurance.
- Abstract(参考訳): 暗号化標準の独立実装は、同じ既知の回答結果を再現する必要があるが、合意はコーパス、リビジョン、公開インターフェース、除外、証拠が正確に記述された場合にのみ意味がある。
本研究では,NIST ML-KEMの3つの公開実装に対する製品中立性プロトコルを定義した。
Protocol v2はプロバイダ固有の機能を凍結し、1つのバリデーションエラー分類を対称に適用し、選択されたすべてのケースを保存し、バイト、バリデーションバリデーション、サポート対象操作、アダプタエラーを分離する。
ソース構築実験では、@noble/post-quantum 0.7.0、Liboqs 0.16.0、Go 1.26.4が評価された。
3回の繰り返しで、要求されたカルテシアン製品は2,160のベースレコードで構成され、全ての1,650はNISTのオラクルと一致し、510のレコードはGoの事前宣言された能力境界と一致した。
720の高貴なリボックレコード、720の高貴なリボックレコード、210の高貴な210のGoペアレコード。
別個のkeyGen-ekプロジェクション診断は、完全なキー生成としてカウントすることなく、150のGoカプセル化キープロジェクションすべてと一致した。
3つの凍結制御は、バイト比較、判定比較、不正応答誤り分離を独立に実行し、それぞれが正確に事前宣言された結果を生み出した。
ベース障害、アダプタエラー、ステータス不安定は発生しない。
公的なML-KEMパッケージは、決定論的および検証テストの面を実質的に異なるものにします。
独立した外部再生は保存されていない。
その結果、認証、徹底的な正当性、サイドチャネル抵抗、セキュアな統合、生産保証が確立されない。
関連論文リスト
- Guardrailed Meta-Agent Loops: Stress-Testing Policy Pinning, Budget Bounds, and Crash Recovery [7.414694666903067]
GuardrailLoopはシミュレーションベースのテストベッドで、3つの運用契約を共同でテスト可能にする。
ハッシュピン付ポリシーは、目標、スコープ、評価アイデンティティ、予算、リリース条件を修正します。
有用な適応、状態回復、反復実行を分離する。
論文 参考訳(メタデータ) (2026-09-10T21:22:08Z) - VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement [57.86962208273888]
テキストのみのプランナが入力された物理義務にプロンプトをコンパイルする監査可能な物理検証システムを提案する。
それぞれのアクションは、ペイロードがタイプされた測定か、明示的にタグ付けされた学習状態である証明付きエビデンスレコードを返す。
我々は, 実発生障害を即時参照, 空間, 時間でローカライズする, 1500クリックの欠陥記録のコーパスにおいて, 評価をアンロックする。
論文 参考訳(メタデータ) (2026-09-02T20:36:45Z) - BeTaL-GBI: Admission-Aware Benchmark Tuning and Full-Stack Verification of Geometric Belief Interfaces [2.894286977279531]
本研究は,企業検証アーキテクチャが要求を監査しつつ,インターフェース障害,タスク能力,ポリシー適合性,整合性を分離できるかどうかを検討する。
BeTaL-GBI v0.2 は LLM-in-the-loop を2,218,750,380 以上のグリッドポイントで適用し、条件付き性能からフォーマットの入力を分離する。
512の総合的なタスクにおいて、16ゲートポリシーは、116の激しい矛盾を全て検出し、99のクリーンレコードを全て受け入れる。幻覚剤とエビデンスフォーガーサロゲートは無音のプロモーションでブロックされる。
論文 参考訳(メタデータ) (2026-08-21T16:52:38Z) - Beyond Local Accuracy: A Protocol-Level Identifiability Audit for Controlled LLM Reasoning Evaluation [6.047519836191728]
有限行動ポリシークラス上でプロトコルレベルの識別可能性監査を形式化する。
監査はモデルコールをゼロにし、診断ケースを解決します。
このケースは、モデル推論の前に、どのように評価設計の妥当性を構造的に確認できるかを示す。
論文 参考訳(メタデータ) (2026-08-13T14:49:47Z) - Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review [0.0]
本稿では,AI符号化エージェントによる大規模建築解体のケーススタディについて報告する。
ここで述べられているプロトコルの下で、エージェントはそれを正常に完了した。
論文 参考訳(メタデータ) (2026-08-12T15:35:48Z) - Does the way we write a theory change the program an LLM builds from it? A prospective randomized study of renderer format in LLM theory-to-program translation [0.0]
言語理論は実行可能モデルに翻訳するには変数、介入、相互作用に関する選択が必要である。
我々は,理論言語モデルによるプログラムを体系的に変更するかどうかを検証した。
論文 参考訳(メタデータ) (2026-08-10T23:37:47Z) - SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification [71.9783246097687]
SEERは、ペアローカライゼーション中の候補関係を隠蔽し、明示的な主観的/対象的役割を持つクエリ固有ビューを構築し、補完的な証拠として完全なイメージとスパースボックス幾何学を保持する。
正確な逆サポートを持つ関係選択プロトコルでは、オプションリファインメントがエンティティロールを交換し、正確に1つの視覚状態が対応する逆関係に従う場合にのみ前方決定を変更する。
変更されていないプロトコルは、3つのモデルにまたがる2,434個のフィルター付きEmbSpatialペア関係質問に対して +4.35 から +11.79 を得る。
論文 参考訳(メタデータ) (2026-08-04T13:16:15Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - Evidence-Grounded Ensemble Diagnosis of 802.11 Packet Captures: A Multi-Stage Pipeline with Deterministic Reliability Scoring [1.0170129555792935]
802.11パケットキャプチャの診断には、専門家のプロトコル知識が必要で、遅く、エンジニア間で一貫性がなく、スケールできない。
LLMベースのアプローチは、キャプチャーから欠落するが製造されたプロトコルイベントを聴取し、未校正された信頼スコアを生成し、テスト中のモデルによって黄金の基準が共同生成されると評価バイアスを被る。
PROBEは3つの障害に対処する多段階パイプラインである。
論文 参考訳(メタデータ) (2026-06-05T03:39:58Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - PBT-Bench: Benchmarking AI Agents on Property-Based Testing [29.035258104995204]
PBT-Benchは、40の実際のPythonライブラリにまたがる100のプロパティベースのテスト問題のベンチマークである。
各問題は1つ以上のセマンティックなバグ(総数365、平均3.65)を注入し、デフォルトのストラテジーなランダムな入力がほとんど起こらないように設計する。
PBT指導によるバグリコールは42.1%から83.4%の範囲で、オープンエンドベースラインでは31.4%から76.7%である。
論文 参考訳(メタデータ) (2026-05-13T18:01:05Z) - Beyond Code Reasoning: Specification-Anchored Auditing of Multi-Implementation Distributed Protocols [1.5229705287183657]
SPECAは、明示的で分類されたセキュリティプロパティを自然言語仕様から導き出し、実装間で再利用する監査フレームワークである。
RepoAuditのベンチマークでは、SPECAは100%リコール(F1=0.94)で88.9%の精度に達し、著者が検証した12のバグを地上の真実を超えて表面化している。
Sherlock Fusaka Audit Contest(10のターゲット、366の応募)では、SPECAが専門家が強化した15の脆弱性をすべて回復し、4つの修正確認バグが浮上した。
論文 参考訳(メタデータ) (2026-04-29T09:57:07Z) - Correction and Corruption: A Two-Rate View of Error Flow in LLM Protocols [51.56484100374058]
そこで本研究では,単一プロトコルステップを正確なマッチングタスクで監査するためのペアアウトカム計測インタフェースを提案する。
各インスタンスについて、インターフェースはベースラインの正当性ビットと後ステップの正当性ビットを記録する。
これらのレートは精度の変化を予測し、種、混合物、パイプライン間でテスト可能な再利用可能な経験的インターフェースを定義する。
論文 参考訳(メタデータ) (2026-04-20T13:25:40Z) - SecCodeBench-V2 Technical Report [43.10947096543533]
SecCodeBench-V2は,セキュアなコードを生成するLarge Language Model (LLM)コピロの能力を評価するためのベンチマークである。
SecCodeBench-V2は、アリババグループの工業生産から派生した98世代および修正シナリオを含む。
各シナリオに対して、SecCodeBench-V2は、機能検証とセキュリティ検証の両方に対して実行可能な概念実証(PoC)テストケースを提供する。
論文 参考訳(メタデータ) (2026-02-17T10:47:06Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。