論文の概要: Seal, Then Sample: Sampled Layerwise Proofs for Verifiable LLM Inference from GPT-2 to 70B
- arxiv url: http://arxiv.org/abs/2609.27367v1
- Date: Wed, 23 Sep 2026 05:11:27 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:17.893583
- Title: Seal, Then Sample: Sampled Layerwise Proofs for Verifiable LLM Inference from GPT-2 to 70B
- Title(参考訳): シール, そしてサンプル: GPT-2 から 70B への検証 LLM 推論のためのサンプリングされたレイヤーワイズ証明
- Abstract要約: SLP(Sampred Layerwise Proofs)は、推論トレースのすべてのチャンクのバウンダリアクティベーションをコミットするプロトコルである。
TinyLlama-1.1Bのトレースでは、47チャンクのうち7チャンクの証明には22.0%の時間と6.8%の証明サイズが必要である。
12の充填された要求は181.9秒で証明され、測定された単一防御コストで12の異なる証明の6.5倍以下である。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Verifying outsourced language-model inference requires a precisely identified computation and an audit whose cost a service can afford. We present Sampled Layerwise Proofs (SLP), a protocol and prototype that commits the boundary activations of every chunk of an inference trace, absorbs all commitments before any challenge is drawn, and then proves a verifier-selected subset of chunks together with the chunks that bind the prompt and the answer. Audit coverage becomes a runtime parameter over one set of commitments: on a TinyLlama-1.1B trace, proving seven of 47 chunks takes 22.0% of the time and 6.8% of the proof size of proving all 47. Because proof cost is dominated by weights rather than tokens, SLP packs concurrent requests into one trace under a block-diagonal causal mask and binds the prompt and answer of each request to its slot. Twelve packed requests are proved in 181.9 s, 6.5 times less than twelve separate proofs at the measured single-proof cost, and a simulated service proves twelve requests at 30.6 s per request with 0.6 s of verification each, rejecting a tampered answer. Disk-backed integer weights and streamed polynomial commitments let a single Llama-2-70B run complete on a 2 TB CPU host: 163 chunks sealed, five proved, a 4.34 MiB proof in 1,259 s, verified in 46.3 s without the weights. The proven object is a fixed-point canonical model; we trace a severe fidelity loss to the residual-stream bit width, repair it with an LLM-aware observer, and measure 84.8-84.9% argmax agreement with the floating-point reference over 334,705 WikiText-2 test positions. The limits are stated as precisely: guarantees cover proven chunks only, a fixed invalid chunk in the 70B setting is covered with probability 3/161, a manifest-only Fiat-Shamir schedule can be ground at 12.5 ms per attempt and needs an externally ordered challenge, and all measurements use a test reference string.
- Abstract(参考訳): アウトソースされた言語モデル推論を検証するには、正確に識別された計算と、サービスが費用を支払うことができる監査が必要である。
SLP(Sampred Layerwise Proofs)は、推論トレースのすべてのチャンクのバウンダリアクティベーションをコミットし、課題が引き出される前にすべてのコミットメントを吸収し、プロンプトと答えをバインドするチャンクとともに、チャンクの検証者選択サブセットを証明するプロトコルとプロトタイプである。
TinyLlama-1.1Bトレースでは、47チャンクの7つが22.0%、47の証明サイズが6.8%である。
証明コストはトークンよりも重みによって支配されるため、SLPはブロック対角の因果マスクの下で1つのトレースに同時リクエストをパックし、各リクエストのプロンプトと応答をスロットにバインドする。
12の満載要求が181.9秒で証明され、測定されたシングルプロテクションコストで12の証明の6.5倍も小さくなり、シミュレートされたサービスはリクエスト毎に30.6秒で12の要求をそれぞれ0.6秒の検証で証明し、改ざんされた回答を拒否する。
ディスクバックの整数重みとストリーム多項式のコミットメントにより、1つのLlama-2-70Bが2TBのCPUホスト上で実行可能となり、163チャンクが封印され、5つの証明が証明され、4.34 MiBが1,259 sで証明され、重量なしで46.3 sで検証された。
得られたオブジェクトは固定点標準モデルであり、残差ストリームビット幅に深刻な忠実度損失をトレースし、LCM対応オブザーバで修復し、334,705 WikiText-2 テスト位置上の浮動小数点参照と 84.8-84.9% argmax の一致を計測する。
70B設定の固定無効なチャンクは確率3/161でカバーされ、マニフェストのみのフィアット・シャミールスケジュールは1回の試行あたり12.5msで接地でき、外部に順序付けられたチャレンジが必要であり、すべての測定値がテスト基準文字列を使用する。
関連論文リスト
- SWE-Proof: Can Language Models Resolve Real-World Issues with Machine-Checked Proofs? [39.004582663385364]
Benchprooferは、既知の正しいパッチでコーディングタスクを正式に認証されたパイプラインに変換するパイプラインです。
SWE-bench Verified に適用すると SWE-Proof が得られる。
論文 参考訳(メタデータ) (2026-09-18T01:16:53Z) - When Agent Metrics Measure Different Things: An Evidence-Grounded Audit of the Praxa AI Pipeline [0.0]
本稿では,選択したPraxa AI実装ファイル,過去の評価アーティファクト,運用記録の振り返り評価を行う。
139ケースのオフラインルーティングレポートには、112回のパスと27回の障害が含まれている。
記録された99番目のパーセンタイルは2,147,483,647 msであり、サーバが保存したコールのうち38,118.31 msである。
論文 参考訳(メタデータ) (2026-09-10T07:55:12Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - BeTaL-GBI: Admission-Aware Benchmark Tuning and Full-Stack Verification of Geometric Belief Interfaces [2.894286977279531]
本研究は,企業検証アーキテクチャが要求を監査しつつ,インターフェース障害,タスク能力,ポリシー適合性,整合性を分離できるかどうかを検討する。
BeTaL-GBI v0.2 は LLM-in-the-loop を2,218,750,380 以上のグリッドポイントで適用し、条件付き性能からフォーマットの入力を分離する。
512の総合的なタスクにおいて、16ゲートポリシーは、116の激しい矛盾を全て検出し、99のクリーンレコードを全て受け入れる。幻覚剤とエビデンスフォーガーサロゲートは無音のプロモーションでブロックされる。
論文 参考訳(メタデータ) (2026-08-21T16:52:38Z) - The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context [45.88028371034407]
コード修復における制御ケーススタディを報告し,新しい現象ではない。
私たちは、同じスタック上の1つのフラグ(1チャンク毎の重複)を切り替えます。
BM25(3.2pp、重要なパラダイム間相互作用)を逆転させる。
厳格な固定予算では、ファイルごとのハードダイドプリケートや、タスクに対するA/Bパッケージングポリシは、メトリックフラグを調整しないことが示されます。
論文 参考訳(メタデータ) (2026-08-14T19:22:50Z) - ZK-SR117: A Chunked Zero-Knowledge Attestation Design for Aggregated Fair-Lending Metrics, with a Control Mapping toward Full SR 11-7 Coverage [0.27998963147546146]
規制された意思決定にMLモデルをデプロイするには、モデルの重みや顧客データを公開することなく、監査者に公正さと堅牢さを示す必要がある。
本研究では,2022HMDA住宅ローンデータのコミット,ナンスサンプリングバッチに対して,集約された公正度統計値を示すチャンクゼロ知識回路の設計を提案する。
論文 参考訳(メタデータ) (2026-08-01T19:39:14Z) - Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair [36.56438114281786]
正しいパッチの発見と保持、検証、提出のギャップについて検討する。
我々はエビデンスバウンド型ループ契約を導出し、その機械的に強制可能なサブセットを参照実装でインスタンス化する。
論文 参考訳(メタデータ) (2026-07-27T16:05:23Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Beyond Code Reasoning: Specification-Anchored Auditing of Multi-Implementation Distributed Protocols [1.5229705287183657]
SPECAは、明示的で分類されたセキュリティプロパティを自然言語仕様から導き出し、実装間で再利用する監査フレームワークである。
RepoAuditのベンチマークでは、SPECAは100%リコール(F1=0.94)で88.9%の精度に達し、著者が検証した12のバグを地上の真実を超えて表面化している。
Sherlock Fusaka Audit Contest(10のターゲット、366の応募)では、SPECAが専門家が強化した15の脆弱性をすべて回復し、4つの修正確認バグが浮上した。
論文 参考訳(メタデータ) (2026-04-29T09:57:07Z) - PCN-Rec: Agentic Proof-Carrying Negotiation for Reliable Governance-Constrained Recommendation [0.0]
PCN-Rec(PCN-Rec)は、自然言語による推論を決定論的執行から切り離す、証明付きネゴシエーションパイプラインである。
MovieLens-100Kでは、PCN-Recが98.55%のパスレートを達成した。
論文 参考訳(メタデータ) (2026-01-14T15:00:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。