論文の概要: Sequential Fairness Auditing with Limited Output Access
- arxiv url: http://arxiv.org/abs/2606.30338v1
- Date: Mon, 29 Jun 2026 14:17:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:16.26209
- Title: Sequential Fairness Auditing with Limited Output Access
- Title(参考訳): 限られた出力アクセスによるシーケンスフェアネス監査
- Authors: Ioannis Pitsiorlas, Martha V. Sourla, Marios Kountouris,
- Abstract要約: 外部評価は、AIシステムのガバナンスの中心になりつつある。
実際には、独立監査人はデプロイされたモデルへのアクセスに制限があり、クエリベースのインタラクションに頼らなければならない。
既存のフェアネス評価手法の多くは、静的データセットと固定サンプル統計検査を前提としている。
モデル出力アクセスの制限下での耐久性を考慮した逐次仮説検定問題としてフェアネス監査を定式化する。
- 参考スコア(独自算出の注目度): 6.933020649563105
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: External evaluations are becoming increasingly central to the governance of AI systems. In practice, however, independent auditors often have limited access to deployed models and must rely on query-based interactions. Most existing fairness evaluation methods assume static datasets and fixed-sample statistical tests, making them poorly suited to real-world auditing scenarios in which evidence must be collected sequentially under query constraints. In this work, we formulate fairness auditing as a tolerance-aware sequential hypothesis-testing problem under limited model output access. We develop a sequential generalized likelihood-ratio framework that allows auditors to accumulate evidence from a finite audit pool and stop once sufficient support for compliance or violation has been obtained. The framework is instantiated for decision-based Statistical Parity and Equal Opportunity audits, and extended to score- and logit-based proxy audits when richer observables are available. Our results show that both the fairness metric and the level of model access significantly affect audit efficiency, and that the benefits of richer output information are not uniform across auditing settings. In particular, richer outputs can substantially reduce the number of queries required for some fairness metrics and operating regimes, while offering limited gains in near-threshold cases. This work provides a practical statistical framework for sequential fairness auditing under realistic deployment constraints.
- Abstract(参考訳): 外部評価は、AIシステムのガバナンスの中心になりつつある。
しかし、実際には、独立監査人はデプロイされたモデルへのアクセスが限られており、クエリベースのインタラクションに依存しなければならない。
既存のフェアネス評価手法の多くは、静的データセットと固定サンプル統計検査を前提としており、クエリ制約の下で証拠を逐次収集しなければならない実世界の監査シナリオには適していない。
本研究では,限定されたモデル出力アクセス下での耐久性を考慮した逐次仮説検定問題として公正度監査を定式化する。
我々は,監査者が有限の監査プールから証拠を蓄積し,コンプライアンスや違反に対する十分な支援が得られれば停止できるような,逐次的に一般化された確率比フレームワークを開発する。
このフレームワークは、決定ベースの統計パリティと平等オポチュニティ監査のためにインスタンス化され、よりリッチなオブザーバブルが利用可能になったときにスコアベースのプロキシ監査とログベースのプロキシ監査に拡張されている。
その結果, 公平度測定値とモデルアクセスレベルの両方が監査効率に大きく影響し, よりリッチな出力情報の利点が監査設定全体にわたって均一でないことがわかった。
特に、よりリッチなアウトプットは、ある程度のフェアネスメトリックやオペレーティングレシスタンスに必要なクエリの数を大幅に削減すると同時に、ほぼ閾値のケースでは限られたゲインを提供する。
この研究は、現実的なデプロイメント制約の下での逐次公正監査のための実用的な統計フレームワークを提供する。
関連論文リスト
- Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? [61.49434544687523]
本稿では,エージェント環境におけるきめ細かい故障検出を目的としたメタ評価ベンチマークREFLECTを紹介する。
REFLECTはプロセスレベルの障害モードと結果レベルの障害モードの詳細な分類を定義し、制御および局所的な介入を実行することでインスタンス化する。
私たちの実験では、最高のパフォーマンスモデルでさえ、推論、ツール使用、レポート品質の失敗に対して、全体的なアキュラシーを55%以下に達成しています。
論文 参考訳(メタデータ) (2026-05-18T23:55:08Z) - Adaptive auditing of AI systems with anytime-valid guarantees [8.752768302067638]
2つの'重複'の観点から仮説テストフレームワークを導入します。
我々は,オーディタを「賭けによる検証」の実行として形式化し,これは重複するヌル仮説をテストするための同時eプロセスに変換する。
提案手法は, 任意の値の型I誤差制御を維持し, 事前特定試験法より優れており, 統計的に厳密な結論に到達でき, 時には20の観測しか得られない。
論文 参考訳(メタデータ) (2026-05-07T22:33:48Z) - Sequential Audit Sampling with Statistical Guarantees [6.101839518775968]
本研究は, 有限個体群を対象とした逐次的な検査問題として, 追加の逐次収集項目を用いた監査サンプリングを定式化した。
偏差率でヌル仮説と代替仮説を定義し、停止規則と決定規則を定め、有限人口誤差確率で正確な逐次境界条件を定式化する。
正確な設計は、決定エラー確率を極端に制御し、シミュレーションベースの実装は、期待される停止時間の計算を可能にしながら、その設計を近似する。
論文 参考訳(メタデータ) (2026-04-07T17:26:23Z) - IMMACULATE: A Practical LLM Auditing Framework via Verifiable Computation [49.796717294455796]
経済的なモチベーションのある逸脱を検出するための実践的な監査フレームワークIMMACULATEを提案する。
IMMACULATEは、検証可能な計算を用いて少数のリクエストを選択的に監査し、暗号オーバーヘッドを償却しながら強力な検出保証を達成する。
論文 参考訳(メタデータ) (2026-02-26T07:21:02Z) - Are You Getting What You Pay For? Auditing Model Substitution in LLM APIs [71.7892165868749]
LLM(Commercial Large Language Model) APIは基本的な信頼の問題を生み出します。
ユーザーは特定のモデルに課金するが、プロバイダが忠実に提供できることを保証することはない。
我々は,このモデル置換問題を定式化し,現実的な逆条件下での検出方法を評価する。
我々は,信頼された実行環境(TEE)を実用的で堅牢なソリューションとして使用し,評価する。
論文 参考訳(メタデータ) (2025-04-07T03:57:41Z) - Access Denied: Meaningful Data Access for Quantitative Algorithm Audits [4.182284365432724]
第三者監査はしばしばアクセス制限によって妨げられ、監査人は制限された低品質のデータに頼らざるを得ない。
本研究は,リシディズムと医療カバレッジ予測のための2つの現実的なケーススタディの監査シミュレーションを行う。
データの最小化と匿名化のプラクティスは、個々のレベルのデータのエラー率を強く向上させ、信頼性の低い評価につながることが分かっています。
論文 参考訳(メタデータ) (2025-02-01T13:33:45Z) - Under manipulations, are some AI models harder to audit? [2.699900017799093]
本研究では,モデルが大きな能力を示す現実的な環境でのロバスト監査の実現可能性について検討する。
ウェブプラットフォームが任意のデータに適合するモデルを使用している場合、監査戦略がランダムサンプリングを上回ります。
次に、Rademacher複雑性を用いて、監査の操作可能性と対象モデルのキャパシティを関連付ける。
論文 参考訳(メタデータ) (2024-02-14T09:38:09Z) - The Decisive Power of Indecision: Low-Variance Risk-Limiting Audits and Election Contestation via Marginal Mark Recording [51.82772358241505]
リスクリミット監査(リスクリミット監査、RLA)は、大規模な選挙の結果を検証する技術である。
我々は、効率を改善し、統計力の進歩を提供する監査の新たなファミリーを定めている。
新しい監査は、複数の可能なマーク解釈を宣言できるように、キャストボイトレコードの標準概念を再考することで実現される。
論文 参考訳(メタデータ) (2024-02-09T16:23:54Z) - A Brief Tutorial on Sample Size Calculations for Fairness Audits [6.66743248310448]
本チュートリアルでは、フェアネス監査に必要なサブグループサンプルサイズを決定する方法についてのガイダンスを提供する。
本研究は,2値分類モデルと混同行列の要約として導出された多重公平度指標の監査に適用できる。
論文 参考訳(メタデータ) (2023-12-07T22:59:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。