論文の概要: ZK-SR117: A Chunked Zero-Knowledge Attestation Design for Aggregated Fair-Lending Metrics, with a Control Mapping toward Full SR 11-7 Coverage
- arxiv url: http://arxiv.org/abs/2608.02664v1
- Date: Sat, 01 Aug 2026 19:39:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.879591
- Title: ZK-SR117: A Chunked Zero-Knowledge Attestation Design for Aggregated Fair-Lending Metrics, with a Control Mapping toward Full SR 11-7 Coverage
- Title(参考訳): ZK-SR117: Aggregated Fair-Lending Metricsのためのチャンクゼロ知識検定設計 : SR 11-7の完全なカバーに向けての制御マッピング
- Abstract要約: 規制された意思決定にMLモデルをデプロイするには、モデルの重みや顧客データを公開することなく、監査者に公正さと堅牢さを示す必要がある。
本研究では,2022HMDA住宅ローンデータのコミット,ナンスサンプリングバッチに対して,集約された公正度統計値を示すチャンクゼロ知識回路の設計を提案する。
- 参考スコア(独自算出の注目度): 0.27998963147546146
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Deploying ML models in regulated decision-making (credit underwriting, fraud detection, loan approval) requires demonstrating fairness and robustness to auditors without exposing model weights or customer data. We address this attestation problem for U.S. bank supervision under SR 11-7 and OCC 2011-12 guidance. We present a chunked zero-knowledge circuit design that attests an aggregated fairness statistic - the demographic-parity gap - on committed, nonce-sampled batches of real 2022 HMDA mortgage data, and demonstrate it end-to-end: 32,768 rows, 32 independently verified zkSNARK proofs, aggregated attested gap within 0.0029 of the true held-out value, per-chunk proving under 4 seconds. We also demonstrate extensibility by attesting a second control on the identical architecture - expected calibration error at 10 bins - with all 32 chunks verified, per-chunk proving at about 14.7 seconds, and attested ECE within 0.00037 of the plaintext value on the same committed rows. We compare this design against two alternatives - a flat summation circuit, which overflows past a few thousand rows, and a tree-reduction circuit, numerically exact but intractable to compile - and find the chunked design is the only one that reached this scale. We discovered and root-caused a genuine data-quality failure (a sentinel-code outlier distorting circuit proving and the fairness statistic itself) and resolved it with a published preprocessing specification. We also propose a fuller mapping from SR 11-7 and OCC 2011-12 control language to zero-knowledge statements (nine control elements spanning soundness, calibration, robustness, and drift), a nonce-based sampling protocol resisting bank-side cherry-picking, and a threat model for deployment, proposed as design work, not implemented results. Two controls, one model class, one task are demonstrated end-to-end; the rest is scoped and left as future work.
- Abstract(参考訳): 規制された意思決定(引受、不正検出、ローン承認)にMLモデルをデプロイするには、モデルの重みや顧客データを公開することなく、監査者に公正さと堅牢さを示す必要がある。
SR 11-7 と OCC 2011-12 指導下での米国の銀行監督におけるこの証明問題に対処する。
実2022HMDA住宅ローンデータの集合的公正性 - 人口間格差 - を証明したチャンクゼロ知識回路設計を行い、32,768行、32個の独立認証されたzkSNARK証明、真保持値の0.0029以内のアサートされたギャップを4秒以内で証明した。
また,各チャンク毎に約14.7秒で検証し,同じコミット行のプレーンテキスト値の0.00037以内でCEを検証した。
我々はこの設計を,数千行を超える平らな総和回路と,数値的に正確だがコンパイルに難渋する木還元回路の2つの選択肢と比較した。
我々は、真のデータ品質の故障(センチネル符号外乱回路の変形証明と公平性統計自体)を発見し、それを公開前処理仕様で解決した。
また,SR 11-7 と OCC 2011-12 制御言語から 0-knowledge 文 (音性,キャリブレーション,ロバスト性,ドリフトにまたがる9つの制御要素) への完全なマッピング,銀行側チェリーピッキングに抵抗するナンスベースのサンプリングプロトコル,設計作業として提案されるデプロイメントの脅威モデルを提案する。
2つのコントロール、1つのモデルクラス、1つのタスクはエンドツーエンドで示されます。
関連論文リスト
- Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - EDGE: a closed-form directed test for the calibration of probabilistic binary classifiers [0.0]
本稿では,正規確率分類器の校正テストであるEDGEを提案し,ロジスティック回帰法を提案する。
EDGEは、同一のビン付き予測観測テーブルを信頼性図のプロットとして読み出し、その標準化されたビン残差をスムーズなキャリブレーション歪みの小さな前提に投影する。
リンクと特徴の相違により、既定のデフォルトが22のシナリオのうち、19のシナリオで全ての競合するビン付きテストに導かれるか、あるいは結び付けられ、再適合ベースのStukelスコアテストが20%から28%のサンプルで分離される場合、計算可能のままであった。
論文 参考訳(メタデータ) (2026-08-20T19:06:05Z) - Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation [0.0]
EU AI Actは、ハイリスクシステムのプロバイダに対して、システムが意思決定にどのように到達したかを説明した技術的なドキュメントを提出することを要求する。
機械的解釈可能性(Mechanistic interpretability)はそのような証拠の明らかな源であり、回路発見は最も発達した道具である。
2人の有能なアナリスト、同じシステム、同じツール、異なる保護可能な設定。
論文 参考訳(メタデータ) (2026-08-13T20:27:56Z) - Hollow-LLM Attack: Computationally Trivial Weights in Zero-Knowledge Verification of LLM Inference [14.550609779533035]
本稿では,不正直なプロバイダが宣言されたアーキテクチャとパラメータ数を保持するが,代数構造が有効証明を崩壊させるゴーストウェイトを埋め込むHollow-LLMアタックを紹介する。
これにより、プロバイダがモデルサイズを過大評価しながら、小さなモデルコストで証明可能な正確なアウトプットを提供するという利益の均衡が生まれる。
我々は,標準変圧器ブロックを構成するゴーストウェイトを具体化して,そのような中空配置により,同一の検証回路下で品質損失ゼロで供用コストを大幅に削減できることを示す。
論文 参考訳(メタデータ) (2026-07-30T23:00:59Z) - Visual Credit Audit for Multimodal Spatial Reasoning [70.16915309526443]
Visual Credit Auditは、ベンチマーク画像がテキストのみとブランクコントロールよりもモデルの宣言された決定をもっとサポートするかどうか、モデルが関係性固有の視覚的エビデンスに反応するかどうかの2つの評価を分離する。
ラベルを適用すれば依存性認定正当性(D-CC)が得られる
4つのオープンMLLMと2つの空間ベンチマーク、12.73-26.25%の判定は正確であるが、証明されていない。
論文 参考訳(メタデータ) (2026-07-29T15:55:31Z) - Where Does Agent Reliability Come From? A Cross-Benchmark Decomposition of Verification Loops, Specialist Models, and Scaffolding in a Production Enterprise Agent [0.0]
アーキテクチャが検証ループをインストールする1つのプロダクションシステムについて検討する。
ループの端から端までを計測し、経験的検証器混同行列を生成する。
論文 参考訳(メタデータ) (2026-07-19T03:20:33Z) - CIAware-Bench: Benchmarking Control Intervention Awareness Across Frontier LLMs [100.38986535324284]
我々は、フロンティアモデル全体でのtextbfcontrol textbfintervention (CI) の認識を測定するベンチマークである textbfCIAware-Bench を紹介する。
CIAware-Benchは、モデルが自身の軌跡を制御介入によって修正されたものと区別できるかどうかをテストする。
論文 参考訳(メタデータ) (2026-06-09T16:24:16Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Deterministic Fuzzy Triage for Legal Compliance Classification and Evidence Retrieval [0.0]
法律チームはますます、大量の契約上の証拠をトリアージするために機械学習を使用している。
多くのモデルは不透明で非決定論的であり、HIPAAやNERC-CIPのようなフレームワークと整合するのは難しい。
決定論的双対エンコーダと透明なファジィトリアージバンドに基づく簡単な再現可能な代替法について検討する。
論文 参考訳(メタデータ) (2026-03-08T00:31:34Z) - DisastQA: A Comprehensive Benchmark for Evaluating Question Answering in Disaster Management [27.25517951457221]
我々は8つの災害タイプにまたがる3000の厳格に検証された質問(2000の多重選択と1,000のオープンエンド)の大規模ベンチマークであるDisastQAを紹介した。
オープンエンドQAでは,冗長性よりも事実的完全性を重視した,人間の検証されたキーポイントに基づく評価プロトコルを提案する。
20モデルを用いた実験では、MMLU-Proのような汎用のリーダーボードとはかなりの相違が見られる。
論文 参考訳(メタデータ) (2026-01-07T07:46:42Z) - DiFR: Inference Verification Despite Nondeterminism [5.879581944824945]
同じ推論プロセスを2回再実行することは、良質な数値ノイズのために異なる結果をもたらすことが多い。
Token-DiFRは、同一のランダムシードに条件付された信頼参照実装による予測と、生成されたトークンを比較して、推論出力を検証する手法である。
さらに,ランダムなプロジェクションを用いてアクティベーションをコンパクトな指紋に圧縮し,その後の検証を行う Activation-DiFR も導入する。
論文 参考訳(メタデータ) (2025-11-25T18:44:22Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal [31.458406135473805]
異種不確実性証拠を正当性の校正確率に変換する統一フレームワークUniCRを提案する。
UniCRは、温度スケーリングと適切なスコアリングを備えた軽量なキャリブレーションヘッドを学習する。
ショートフォームQA、実行テスト付きコード生成、検索強化ロングフォームQAの実験は、キャリブレーションメトリクスの一貫性のある改善を示している。
論文 参考訳(メタデータ) (2025-09-01T13:14:58Z) - Shrinking the Generation-Verification Gap with Weak Verifiers [42.538675831498715]
検証者は、生成された候補から応答をスコア付けしてランク付けすることで、言語モデル機能を改善することができる。
Weaverは、複数の弱い不完全な検証器を組み合わせることで、強力な検証器を設計するためのフレームワークである。
論文 参考訳(メタデータ) (2025-06-22T23:38:15Z) - Robust Conformal Prediction with a Single Binary Certificate [58.450154976190795]
コンフォーマル予測(CP)は、任意のモデルの出力を、真のラベルを(調整可能な)高い確率でカバーすることを保証した予測セットに変換する。
我々は,MCサンプルが著しく低い場合でも,より小さな集合を生成する頑健な共形予測を提案する。
論文 参考訳(メタデータ) (2025-03-07T08:41:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。