論文の概要: An Open Pipeline and Dashboard for Systemic-Risk Evidence under the EU AI Act's Code of Practice
- arxiv url: http://arxiv.org/abs/2609.28335v1
- Date: Wed, 23 Sep 2026 16:13:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 00:05:18.105866
- Title: An Open Pipeline and Dashboard for Systemic-Risk Evidence under the EU AI Act's Code of Practice
- Title(参考訳): EU AI法に基づくシステミックリスクエビデンスのためのオープンパイプラインとダッシュボード
- Abstract要約: Systemic Risk Indexはオープンな評価パイプラインとダッシュボードで、経験的エビデンスをより透明で、一般に追跡可能にする。
我々の研究は、19の公開ベンチマークを、EU GPAI Code of Practiceによって定義された4つのシステムリスクカテゴリにまとめています。
インタラクティブダッシュボードでは、平均的なアグリゲーションと最悪のアグリゲーションを切り替え、モデルの能力がアグリゲーションスコアにどのように影響するかを変更し、各リスク評価をベンチマークエビデンスにトレースすることができる。
- 参考スコア(独自算出の注目度): 9.104733371429601
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Claims about AI safety reach audiences well beyond the AI community, yet many rely on opaque evidence or static assessments, when supporting evidence is accessible at all. We present the Systemic Risk Index, an open evaluation pipeline and dashboard built to make empirical evidence more transparent and traceable to the public. Our work organizes 19 public benchmarks into four systemic-risk categories defined by the EU GPAI Code of Practice---CBRN, cyber offense, harmful manipulation, and loss of control---and evaluates models using harm-preserving perturbations and simulated deployment contexts. The interactive dashboard lets users alternate between average and worst-case aggregation, vary how model capability affects the aggregate score, and trace each risk rating to its benchmark evidence. Across 18 models, scores fall by 14 to 37 points under worst-case aggregation, highlighting information that can be hidden by an average assessment of model risk. LLM judges show agreement with human graders comparable to human--human agreement ($κ= 0.78\text{--}0.82$), and a blind audit finds that $83\%$ of sampled transformations preserve the original harm. In a survey ($N = 21$), most participants report that scores are easy to understand and that the dashboard encouraged them to view model evaluations under different settings
- Abstract(参考訳): AIの安全性に関する主張は、AIコミュニティをはるかに超越した聴衆に届くが、多くの人は、証拠を支持することが全くアクセスできないとき、不透明な証拠や静的な評価に頼っている。
実験的な証拠をより透明化し、一般に追跡できるように構築された、オープンな評価パイプラインとダッシュボードであるシステミックリスク指数を提示する。
私たちの研究は、19の公開ベンチマークを、EU GPAIのプラクティス規範(--CBRN)、サイバー犯罪、有害な操作、コントロールの喪失)で定義された4つのシステムリスクカテゴリにまとめ、ハーネス保存の摂動とシミュレートされたデプロイメントコンテキストを使用してモデルを評価する。
インタラクティブダッシュボードでは、平均的なアグリゲーションと最悪のアグリゲーションを切り替え、モデルの能力がアグリゲーションスコアにどのように影響するかを変更し、各リスク評価をベンチマークエビデンスにトレースすることができる。
18モデル全体のスコアは、最悪のケースアグリゲーションの下で14から37ポイント減少し、モデルリスクの平均評価によって隠される可能性のある情報を強調している。
LLMの審査員は、人間-人間の合意(κ= 0.78\text{-}0.82$)に匹敵する人間のグレードラーとの合意を示す。
調査(N = 21$)では、ほとんどの参加者が、スコアは理解しやすく、ダッシュボードは異なる設定下でモデル評価を見ることを奨励していると報告している。
関連論文リスト
- AgentWorld: Personality-Aware Reliability Evaluation for Agentic Information Retrieval [1.1647715835517187]
AgentWorldは、パーソナリティ駆動のユーザ人口とステートフルなツール使用環境を組み合わせたシミュレーションフレームワークである。
10のOCEANペルソナにわたる会話分析エージェント(240の評価者判断)、5つのタスクにわたるカスタマーサポートエージェント($times$4のペルソナ変種)、既存のトラジェクタの不安定さを示す5つのタスクの逆ストレステストである。
論文 参考訳(メタデータ) (2026-08-25T05:15:33Z) - HarnessEval-W: Agentifying the Evaluation of Visual Worlds [149.63310396189317]
HarnessEval-Wは、世界モデルのベンチマークのためのエージェント化された評価パイプラインである。
HarnessEval-Wは固定ルーブリックを適用するのではなく、評価問題を測定可能なサブプロブレムに分解する。
330件の評価事例に対して,HarnessEval-Wを18の代表的な世界モデルに適用した。
論文 参考訳(メタデータ) (2026-08-17T17:43:24Z) - The Eticas AI Risk Taxonomy: Open Infrastructure for Operationalizing AI Audits [2.869158116077567]
我々は、Eticasが構築した運用層を公開ベンチマークに対して単一のリスク(PIIリーク)でエンドツーエンドに示す。
GPT-4-0314では, 対向条件が増加するにつれて, 7つの外部フレームワークの制御を必要とする開示リスクが0%, 51%, 84%と測定された。
この貢献は、概念から段階的な発見への橋渡しであり、それらが表すメカニズムからリスクをきれいに分離することで支えられている。
論文 参考訳(メタデータ) (2026-07-02T14:08:34Z) - Context Over Content: Exposing Evaluation Faking in Automated Judges [8.404817247058698]
本報告では, 下流の判断モデルに対して, 判定結果が評価モデルの継続動作に系統的に悪影響を及ぼすような, 未測定の脆弱性について検討する。
LLMの安全性と品質の3つのベンチマークにまたがる1,520の応答に対して,評価内容を厳密に一定に保持する,制御された実験フレームワークを導入する。
一貫性のある$textitleniency bias$: 低いスコアがモデルの再トレーニングや廃止を引き起こすことを知らせると、判断が確実に軟化する。
論文 参考訳(メタデータ) (2026-04-16T16:55:53Z) - AI Transparency Atlas: Framework, Scoring, and Real-Time Model Card Evaluation Pipeline [2.1787849426740364]
我々は5つのフロンティアモデル(Gemini 3, Grok 4.1, Llama 4, GPT-5, Claude 4.5)と100台のHugging Faceモデルカードからドキュメントを分析した。
安全クリティカルな開示を優先する8つのセクションと23のサブセクションからなる重み付き透明性フレームワークを開発した。
論文 参考訳(メタデータ) (2025-12-13T19:48:44Z) - Better than Random: Reliable NLG Human Evaluation with Constrained Active Sampling [50.08315607506652]
信頼性の高い人的判断のための制約付きアクティブサンプリングフレームワーク(CASF)を提案する。
実験の結果、CASFは93.18%のシステム認識精度が得られた。
論文 参考訳(メタデータ) (2024-06-12T07:44:36Z) - From Adversarial Arms Race to Model-centric Evaluation: Motivating a
Unified Automatic Robustness Evaluation Framework [91.94389491920309]
テキストの敵対攻撃は、セマンティック保存されているが、入力に誤解を招く摂動を加えることでモデルの弱点を発見することができる。
既存のロバストネス評価の実践は、包括的評価、非現実的評価プロトコル、無効な対人サンプルの問題を示す可能性がある。
我々は、敵攻撃の利点を活用するために、モデル中心の評価にシフトする統合された自動ロバストネス評価フレームワークを構築した。
論文 参考訳(メタデータ) (2023-05-29T14:55:20Z) - D-BIAS: A Causality-Based Human-in-the-Loop System for Tackling
Algorithmic Bias [57.87117733071416]
D-BIASは、人間のループ内AIアプローチを具現化し、社会的バイアスを監査し軽減する視覚対話型ツールである。
ユーザは、因果ネットワークにおける不公平な因果関係を識別することにより、グループに対する偏見の存在を検出することができる。
それぞれのインタラクション、例えばバイアスのある因果縁の弱体化/削除は、新しい(偏りのある)データセットをシミュレートするために、新しい方法を用いている。
論文 参考訳(メタデータ) (2022-08-10T03:41:48Z) - Robustness Gym: Unifying the NLP Evaluation Landscape [91.80175115162218]
ディープニューラルネットワークは、現実のシステムにデプロイすると脆くなることが多い。
最近の研究は、そのようなモデルの堅牢性をテストすることに重点を置いている。
単純かつ評価可能なツールキットであるRobustness Gymの形で解を提案する。
論文 参考訳(メタデータ) (2021-01-13T02:37:54Z) - Multi-label Contrastive Predictive Coding [125.03510235962095]
差分相互情報(MI)推定器は、コントラスト予測符号化(CPC)のような教師なし表現学習法で広く利用されている。
本稿では,複数の正のサンプルを同時に同定する必要がある多ラベル分類問題に基づく新しい推定器を提案する。
同一量の負のサンプルを用いて複数ラベルのCPCが$log m$boundを超えることができる一方で、相互情報の有意な下限であることを示す。
論文 参考訳(メタデータ) (2020-07-20T02:46:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。