論文の概要: SURE: Framework for Safety to Construct Trustworthy AI
- arxiv url: http://arxiv.org/abs/2609.38249v2
- Date: Thu, 01 Oct 2026 03:52:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:23.531307
- Title: SURE: Framework for Safety to Construct Trustworthy AI
- Title(参考訳): SURE: 信頼できるAIを構築するための安全フレームワーク
- Abstract要約: 人々は、AIの安全性と、大きな言語モデルが責任を持って安全に振る舞うことへの要求をますます心配している。
AIの安全性を確保する方法開発への世界的関心が高まっている。
我々は、AI安全性をカスタマイズするフレームワークとして設計されたSURE(A Safe and Unified AI Framework foR Everyone)を提案する。
- 参考スコア(独自算出の注目度): 3.079234551572028
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Warning: This paper contains harmful and offensive text. Recently, large language models such as GPT-4, and Claude have revolutionized tasks in various domains. As the use of these large language models increases, people are increasingly concerned about AI safety and demand that large language models behave responsibly and safely. As a result, there has been growing global interest in developing methods to ensure AI safety. However, the detailed criteria for AI safety may vary depending on the country, culture, and policies of the company you serve. In this study, we propose SURE (A Safe and Unified AI Framework foR Everyone), which is designed as a framework for customizing the attributes of AI safety and ensuring the defined AI safety. Within SURE, we establish taxonomies for adversarial prompts that could threaten AI safety and construct prompts based on the taxonomies. We then define templates for desirable AI responses to these prompts and design an absolute safety scoring scheme. Finally, we conduct AI alignment using the datasets to gradually ensure AI safety. The effectiveness of SURE is demonstrated through experiments with various base models.
- Abstract(参考訳): 警告: この論文は有害で不快な文章を含んでいる。
近年, GPT-4 や Claude といった大規模言語モデルは, 様々な領域におけるタスクに革命をもたらした。
これらの大きな言語モデルの使用が増加するにつれて、人々はAIの安全性と、大きな言語モデルが責任を持って安全に振る舞うことへの需要をますます懸念している。
その結果、AIの安全性を保証する方法開発への世界的な関心が高まっている。
しかし、AIの安全性に関する詳細な基準は、あなたの勤める企業の国、文化、方針によって異なります。
本研究では、AI安全性の属性をカスタマイズし、定義されたAI安全性を確保するためのフレームワークとして設計されたSURE(A Safe and Unified AI Framework foR Everyone)を提案する。
SURE内では、AIの安全性を脅かし、その分類に基づくプロンプトを構築することができる敵対的プロンプトの分類体系を構築している。
次に、これらのプロンプトに対する望ましいAI応答のためのテンプレートを定義し、絶対安全性スコアリングスキームを設計する。
最後に、データセットを使用してAIアライメントを行い、AIの安全性を徐々に確保します。
SUREの有効性は、様々な基礎モデルを用いた実験によって実証される。
関連論文リスト
- What Is AI Safety? What Do We Want It to Be? [0.0]
研究プロジェクトは、AIシステムによって引き起こされる害を防ぎ、軽減しようとする場合にのみ、AIの安全性の見地に入る。
その単純さと魅力にもかかわらず、私たちは、AI安全研究者と組織がAI安全について考え話し合う方法に関して、少なくとも2つのトレンドと緊張関係にあると主張している。
論文 参考訳(メタデータ) (2025-05-05T01:55:00Z) - Position: Mind the Gap-the Growing Disconnect Between Established Vulnerability Disclosure and AI Security [56.219994752894294]
我々は、AIセキュリティレポートに既存のプロセスを適用することは、AIシステムの特徴的な特徴に対する根本的な欠点のために失敗する運命にあると主張している。
これらの欠点に対処する私たちの提案に基づき、AIセキュリティレポートへのアプローチと、新たなAIパラダイムであるAIエージェントが、AIセキュリティインシデント報告の進展をさらに強化する方法について論じる。
論文 参考訳(メタデータ) (2024-12-19T13:50:26Z) - Trustworthy, Responsible, and Safe AI: A Comprehensive Architectural Framework for AI Safety with Challenges and Mitigations [15.946242944119385]
AI安全性は、AIシステムの安全な採用とデプロイにおいて重要な領域である。
私たちの目標は、AI安全研究の進歩を促進し、究極的には、デジタルトランスフォーメーションに対する人々の信頼を高めることです。
論文 参考訳(メタデータ) (2024-08-23T09:33:48Z) - Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress? [59.96471873997733]
我々は、より有意義な安全指標を開発するための実証的な基盤を提案し、機械学習研究の文脈でAIの安全性を定義する。
我々は、AI安全研究のためのより厳格なフレームワークを提供し、安全性評価の科学を前進させ、測定可能な進歩への道筋を明らかにすることを目指している。
論文 参考訳(メタデータ) (2024-07-31T17:59:24Z) - Towards Guaranteed Safe AI: A Framework for Ensuring Robust and Reliable AI Systems [88.80306881112313]
我々は、AI安全性に対する一連のアプローチを紹介し、定義する。
これらのアプローチの中核的な特徴は、高保証の定量的安全性保証を備えたAIシステムを作ることである。
これら3つのコアコンポーネントをそれぞれ作成するためのアプローチを概説し、主な技術的課題を説明し、それらに対する潜在的なソリューションをいくつか提案します。
論文 参考訳(メタデータ) (2024-05-10T17:38:32Z) - AI Safety: Necessary, but insufficient and possibly problematic [1.6797508081737678]
この記事では、AI安全性に関する最近の誇大広告について批判的に考察する。
AIの安全性」とは実際に何を意味するのかを考察し、AIの安全性のデジタルフットプリントが持つ支配的な概念を概説する。
私たちは、AIの安全性が、悪用され有害なAIに安全を害することで、構造的危害を助長するAIを正規化する方法に関する懸念を共有します。
論文 参考訳(メタデータ) (2024-03-26T06:18:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。