論文の概要: AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models
- arxiv url: http://arxiv.org/abs/2607.22671v1
- Date: Mon, 06 Jul 2026 17:26:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.016196
- Title: AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models
- Title(参考訳): AIR-BENCH Live: ファンデーションモデルのための安全ベンチマークの進化
- Authors: Rohan Naphade, Minzhou Pan, Bo Li,
- Abstract要約: 本稿では,AIR-BENCH 2024の後継であるAIR-BENCH Liveを紹介する。
自動更新パイプラインは政府の規制を監視し、現在の4段階のリスク分類に対する新しいポリシーを分類する。
多エージェントのペルソナ駆動のプロンプト生成アルゴリズムは,人間による最小限のレビューで,現実的な多言語プロンプトを生成する。
- 参考スコア(独自算出の注目度): 8.293531821026955
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Foundation-model safety benchmarks capture the AI risks of their time of publication: as models improve and governments pass new AI-safety legislation, their risk taxonomies become incomprehensive and their attack prompts become ineffective. We present AIR-BENCH Live, a self-evolving successor to AIR-BENCH 2024. An automated update pipeline monitors government regulation and classifies new policies against the current four-tier risk taxonomy, either matching them to existing categories or proposing new granular categories. Then, a multi-agent, persona-driven prompt generation algorithm generates realistic, multilingual prompts with minimal human review, leaving room for improvement with modern jail breaking techniques. This algorithm is used to overhaul legacy prompts and generate prompts for new categories. In our current version, the pipeline has expanded the benchmark from 314 to 335 granular risks, with the 21 new categories drawing from 31 truly novel policy clauses across seven jurisdictions. Evaluating 14 recent models, we find a wide safety spread (from 0.17 to 0.89 among the models judged on their own behavior), that the modernized prompts are on average 0.06 points harder than the 2024 set, with the largest drops concentrated among the most compliant models, and that most models are modestly less safe on non-English prompts. By continuously absorbing new regulation and regenerating prompts, AIR-BENCH Live is designed to evolve alongside a fast-moving field.
- Abstract(参考訳): モデルが改善され、政府が新しいAI安全法を成立させるにつれて、それらのリスク分類は理解不能になり、攻撃の促進は非効率になる。
本稿では,AIR-BENCH 2024の後継であるAIR-BENCH Liveを紹介する。
自動更新パイプラインは政府の規制を監視し、現在の4段階のリスク分類に対する新しいポリシーを分類する。
そして,マルチエージェントでペルソナ駆動のプロンプト生成アルゴリズムは,人間のレビューを最小限に抑えて,現実的で多言語的なプロンプトを生成する。
このアルゴリズムは、レガシープロンプトをオーバーホールし、新しいカテゴリのプロンプトを生成するために使用される。
現在のバージョンでは、このパイプラインはベンチマークを314から335に拡大し、21の新しいカテゴリは7つの管轄区域にまたがる31の新しいポリシー条項から引き出された。
最近の14モデルを評価すると、安全範囲が広くなり(自身の行動に基づいて判断されたモデルのうち0.17から0.89まで)、近代化されたプロンプトは2024セットよりも平均0.06ポイント硬く、最も適合したモデルでは最大のドロップが集中し、ほとんどのモデルは英語以外のプロンプトではわずかに安全でないことが分かる。
新たな規制と再生プロンプトを継続的に吸収することにより、AIR-BENCH Liveは高速移動場と共に進化するように設計されている。
関連論文リスト
- Boiling the Frog: A Multi-Turn Benchmark for Agentic Safety [2.661610409070365]
ツール使用のAIモデルがインクリメンタルアタックの影響を受けやすいかどうかを評価するベンチマークであるBoiling the Frogを紹介した。
シナリオは3段階の運用リスク分類によって編成される。
9モデルパネル全体では、総攻撃成功率(ASR)は44.4%である。
論文 参考訳(メタデータ) (2026-05-21T15:50:18Z) - Selective Safety Steering via Value-Filtered Decoding [54.87935112120107]
大型言語モデル(LLM)は人間の価値観に合わせるように訓練されているが、その世代は安全上の制約に反する可能性がある。
既存のデコード時のステアリング手法は、しばしば不要に介入し、ベースモデルの下で安全であった世代を変更する。
安全でない応答の安全性を向上しつつ、そのような不要な介入を減らすための新しいテストタイムステアリング手法を提案する。
論文 参考訳(メタデータ) (2026-05-14T12:13:08Z) - When AI Fails, What Works? A Data-Driven Taxonomy of Real-World AI Risk Mitigation Strategies [0.04736448323490553]
我々は、実世界のAIインシデント報告と緩和行動を分析し、経験的に根ざした分類を導き出す。
メディア報告された9,705件のAIインシデント記事の統合コーパスを用いて、6,893件のテキストから明示的な緩和アクションを抽出する。
分類学では,(1)矯正・規制行動,(2)法・規制強化行動,(3)金融・経済・市場管理,(4)回避・否定の4つの新たなカテゴリーを紹介している。
論文 参考訳(メタデータ) (2026-03-04T16:46:13Z) - Security Challenges in AI Agent Deployment: Insights from a Large Scale Public Competition [101.86739402748995]
44の現実的なデプロイメントシナリオを対象とした,22のフロンティアAIエージェントを対象にしています。
Agent Red Teamingベンチマークを構築し、19の最先端モデルで評価します。
私たちの発見は、今日のAIエージェントの重要かつ永続的な脆弱性を浮き彫りにしたものです。
論文 参考訳(メタデータ) (2025-07-28T05:13:04Z) - Safety Pretraining: Toward the Next Generation of Safe AI [68.99129474671282]
モデルの安全性を最初から構築する,データ中心の事前トレーニングフレームワークを提案する。
我々のフレームワークは、セーフティフィルタリング、セーフティリフレージング、Native Refusal、Harmfulness-Tag Annotated Pretrainingの4つの重要なステップで構成されています。
我々の安全事前訓練モデルでは、一般的な劣化タスクのパフォーマンスを伴わない標準LLM安全性ベンチマークにおいて、攻撃成功率を38.8%から8.4%に下げている。
論文 参考訳(メタデータ) (2025-04-23T17:58:08Z) - Auction-Based Regulation for Artificial Intelligence [28.86995747151915]
規制当局は、AIの展開が壊れた後に残された安全、偏見、法的な破片をゆっくりと拾い上げている。
本稿では,デバイスに適合したモデルをデプロイする動機付けを確実に行う,オークションベースの規制機構を提案する。
規制入札は,基準規制機構と比較して,コンプライアンス率を20%,参加率を15%向上させることを示す。
論文 参考訳(メタデータ) (2024-10-02T17:57:02Z) - AIR-Bench 2024: A Safety Benchmark Based on Risk Categories from Regulations and Policies [80.90138009539004]
AIR-Bench 2024は、新しい政府の規制や企業のポリシーに適合する最初のAI安全ベンチマークである。
8つの政府規制と16の企業政策を4階層の安全分類に分解し、最も低い階層に粒度の細かいリスクカテゴリを分類する。
AIR-Bench 2024上での言語モデルの評価を行い,その安全性に関する知見を明らかにした。
論文 参考訳(メタデータ) (2024-07-11T21:16:48Z) - AI Risk Categorization Decoded (AIR 2024): From Government Regulations to Corporate Policies [88.32153122712478]
我々は4階層の分類に分類された314のユニークなリスクカテゴリを特定した。
最高レベルでは、この分類はシステム・アンド・オペレーショナル・リスク、コンテンツ・セーフティ・リスク、社会的なリスク、法と権利のリスクを含む。
我々は、セクター間の情報共有と、生成型AIモデルとシステムのリスク軽減におけるベストプラクティスの推進を通じて、AIの安全性を向上することを目指している。
論文 参考訳(メタデータ) (2024-06-25T18:13:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。