論文の概要: Manipulation-Proof Oblivious Audits against Deceptive Model Providers
- arxiv url: http://arxiv.org/abs/2608.04365v1
- Date: Wed, 05 Aug 2026 02:12:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.689415
- Title: Manipulation-Proof Oblivious Audits against Deceptive Model Providers
- Title(参考訳): 認知モデル提供者に対する公開監査の操作
- Authors: Augustin Godinot, Sofiane Azogagh, Julien Ferry, Sébastien Gambs,
- Abstract要約: 規制の文脈では、監査は通常、宣言または容易に検出され、モデルプロバイダがプロセスを操作することができる。
この脆弱性は、フェアネス評価の文脈では特に深刻である。
本稿では,このような操作の聴取後検出可能性を大幅に向上する新しい監査プロトコルを提案する。
- 参考スコア(独自算出の注目度): 4.614773550999029
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Audits have emerged as a critical instrument for algorithmic governance, providing a mechanism for external scrutiny and governance of machine learning models. However, ensuring the integrity of such assessments remains a challenging issue. For instance in regulatory contexts, audits are typically declared or easily detected, thus enabling model providers to manipulate the process, whether intentionally or inadvertently. This vulnerability is particularly acute in the context of fairness evaluations, in which providers can often infer sensitive attributes and strategically equalize allocation rates between groups to satisfy fairness metrics. In this paper, we introduce a novel audit protocol designed to significantly increase the post-audit detectability of such manipulations by enabling the auditor to query the model in an oblivious manner. Our approach leverages a Private Information Retrieval mechanism to require the provider to label a large set of instances, while preventing it from knowing which subset will ultimately be used for the audit. The protocol is efficient, imposes minimal overhead on the auditor, and requires no modification to the audited model, its training procedure, or its inference pipeline. We provide theoretical guarantees showing that, under this protocol, a provider attempting to hide unfairness must falsify a significantly larger number of responses, thereby increasing both the difficulty and the likelihood of detection of manipulation. Experimental results across representative audit scenarios confirm the effectiveness and practicality of our approach.
- Abstract(参考訳): 監査は、外部の精査と機械学習モデルのガバナンスのためのメカニズムを提供する、アルゴリズムガバナンスのための重要な手段として現れている。
しかし、こうした評価の完全性を確保することは依然として難しい問題である。
例えば、規制上のコンテキストでは、監査は通常、宣言されたり、簡単に検出されるため、モデルプロバイダは、意図的であれ、意図的であれ、プロセスを操作することができる。
この脆弱性は、フェアネス評価(英語版)の文脈で特に急激であり、プロバイダはしばしばセンシティブな属性を推測し、フェアネス指標を満たすためにグループ間の割り当て率を戦略的に等化することができる。
本稿では,このような操作の聴取後検出性を大幅に向上するために,監査者が不明瞭な方法でモデルに問い合わせることを可能にした新しい監査プロトコルを提案する。
当社のアプローチでは,プロバイダに大規模なインスタンスのラベル付けを要求するために,プライベート情報検索機構を活用しています。
プロトコルは効率的で、監査者に最小限のオーバーヘッドを課し、監査されたモデルやトレーニング手順、推論パイプラインを変更する必要はない。
このプロトコルでは,不公平性を隠そうとするプロバイダが,応答数を大幅に増加させ,操作の困難さと検出可能性の両方を増大させなければならない,という理論的保証を提供する。
代表的な監査シナリオにまたがる実験結果から,本手法の有効性と実用性が確認された。
関連論文リスト
- Fairness Auditing: Lower Bounds on Company Manipulation [4.867679624126028]
フェアネス監査は、雇用、貸与、自動意思決定といった高度なアプリケーションでますます義務付けられている。
最近の研究はブラックボックスフェアネス監査の基本的な不可能な結果を確立している。
有限監査資源の下では避けられない事後操作の程度を定量化する。
論文 参考訳(メタデータ) (2026-08-01T10:11:20Z) - Sequential Fairness Auditing with Limited Output Access [6.933020649563105]
外部評価は、AIシステムのガバナンスの中心になりつつある。
実際には、独立監査人はデプロイされたモデルへのアクセスに制限があり、クエリベースのインタラクションに頼らなければならない。
既存のフェアネス評価手法の多くは、静的データセットと固定サンプル統計検査を前提としている。
モデル出力アクセスの制限下での耐久性を考慮した逐次仮説検定問題としてフェアネス監査を定式化する。
論文 参考訳(メタデータ) (2026-06-29T14:17:33Z) - Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - IMMACULATE: A Practical LLM Auditing Framework via Verifiable Computation [49.796717294455796]
経済的なモチベーションのある逸脱を検出するための実践的な監査フレームワークIMMACULATEを提案する。
IMMACULATEは、検証可能な計算を用いて少数のリクエストを選択的に監査し、暗号オーバーヘッドを償却しながら強力な検出保証を達成する。
論文 参考訳(メタデータ) (2026-02-26T07:21:02Z) - Governing AI Forgetting: Auditing for Machine Unlearning Compliance [30.173215964349044]
我々は、認定されたアンラーニング理論と規制執行を統合することで、機械のアンラーニングコンプライアンスを監査するための最初の経済枠組みを導入する。
MUの本質的な不確かさを,証明された未学習の仮説検証解釈を用いて特徴付ける。
次に,オーディタとオペレータ間の戦略的相互作用を捉えるゲーム理論モデルを提案する。
論文 参考訳(メタデータ) (2026-02-16T08:32:09Z) - Preventing the Collapse of Peer Review Requires Verification-First AI [49.995126139461085]
我々は、真理結合、すなわち、過度に科学的真理をトラックする場所のスコアの厳密さを提案する。
プロキシ・ソブリン評価に向けた相転移を駆動する2つの力の形式化を行う。
論文 参考訳(メタデータ) (2026-01-23T17:17:32Z) - "Show Me You Comply... Without Showing Me Anything": Zero-Knowledge Software Auditing for AI-Enabled Systems [2.2981698355892686]
本稿では,新しいMLOps検証フレームワークであるZKMLOpsを紹介する。
ZKP(Zero-Knowledge Proofs)暗号プロトコルを運用し、証明者が証明者に対して、文が真実であることを納得させることができる。
我々は、金融リスク監査における規制コンプライアンスの研究を通じて、この枠組みの実践性を評価する。
論文 参考訳(メタデータ) (2025-10-30T15:03:32Z) - The Decisive Power of Indecision: Low-Variance Risk-Limiting Audits and Election Contestation via Marginal Mark Recording [51.82772358241505]
リスクリミット監査(リスクリミット監査、RLA)は、大規模な選挙の結果を検証する技術である。
我々は、効率を改善し、統計力の進歩を提供する監査の新たなファミリーを定めている。
新しい監査は、複数の可能なマーク解釈を宣言できるように、キャストボイトレコードの標準概念を再考することで実現される。
論文 参考訳(メタデータ) (2024-02-09T16:23:54Z) - TrustFed: A Reliable Federated Learning Framework with Malicious-Attack
Resistance [8.924352407824566]
フェデレートラーニング(FL)は、個々のデータのプライバシを確保しながら、複数のクライアント間で協調的な学習を可能にする。
本稿では,階層型監査に基づくFL(HiAudit-FL)フレームワークを提案する。
シミュレーションの結果、HiAudit-FLは、システムオーバーヘッドを小さくして、潜在的悪意のあるユーザを効果的に識別し、対処できることが示されている。
論文 参考訳(メタデータ) (2023-12-06T13:56:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。