論文の概要: Epistemic Norms for AI Safety and Alignment Research
- arxiv url: http://arxiv.org/abs/2607.24243v1
- Date: Mon, 27 Jul 2026 10:22:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.383258
- Title: Epistemic Norms for AI Safety and Alignment Research
- Title(参考訳): AIの安全性とアライメント研究のための疫学ノルム
- Abstract要約: 2つの領域は2つの解析的に独立な軸に沿って異なると主張する。
sc ECAISAは、あらゆるAIシステムが安全であることを証明していない。
- 参考スコア(独自算出の注目度): 0.989901717499058
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Mainstream AI research emphasises capability growth and tolerates low failure rates when average-case performance is high. AI safety and alignment research has a different mission: to ensure that catastrophic failures never occur, under sparse evidence, adversarial dynamics, and fat-tailed risk. We argue that the two domains differ along two analytically independent axes---{\it capability profile}, demonstrating the absence of hazardous behaviours rather than the presence of positive capabilities, and {\it risk profile}, bounding worst-case outcomes under fat-tailed uncertainty rather than optimising average-case performance---and that mainstream epistemic practices are inadequate on both. Building on a structured synthesis grounded in a preregistered bibliometric baseline, we identify five cross-cutting gap dimensions in current alignment research, including the near-absence of institutionalised independent verification. To address these gaps, we propose {\sc ECAISA}, an Epistemic Code for AI Safety and Alignment comprising eight principles, a three-level scoring rubric, a four-level disclosure ladder that reconciles transparency with information-hazard and commercial-confidentiality constraints, a tiered applicability scheme, an information-hazard adjudication procedure, and seven anti-gaming mechanisms. {\sc ECAISA} does not certify that any AI system is safe; it constrains how safety-relevant research claims are documented, checked, and relied upon, with auditability rather than certification as its governance target.
- Abstract(参考訳): 主流のAI研究は、能力の成長を強調し、平均ケースのパフォーマンスが高い場合に低い失敗率を許容する。
AIの安全性とアライメントの研究には、破滅的な失敗が決して起こらないことを保証するという、異なるミッションがある。
この2つの領域は,2つの分析的に独立した軸に沿って異なる,-- 機能プロファイル,- 正の能力の有無よりも危険行動が欠如していること, および「リスクプロファイル」は, 平均ケースのパフォーマンスを最適化するよりも, 最悪のケースの結果を太さの不確実性に縛り付けること, および、メインストリームの疫学的な実践が両面において不十分であること, を論じる。
本研究は, 既登録のバイオロメトリベースライン上に構築された構造的合成に基づいて, 組織化された独立検証のほぼ一部を含む, 現行アライメント研究における5つの横断的ギャップ次元を同定する。
これらのギャップに対処するため,我々は,情報ハザードと商業秘密性制約と透明性を両立させる3段階のスコアリングルーブリック,縛り付けられた適用性スキーム,情報ハザード判断手順,および7つのアンチゲームメカニズムを含む,AI安全とアライメントのエピステミックコード {\sc ECAISA}を提案する。
安全関連研究の主張がどのように文書化され、チェックされ、信頼されているか、ガバナンスの対象として認定されるよりも監査可能性に制約される。
関連論文リスト
- The safety failures we are not instrumenting: a perspective on hidden safety-critical challenges in modern AI systems [26.594498540217568]
デプロイされたシステムでは、最も連続的な障害の多くは、目覚ましいよりも静かで、単一のアウトプットに局所化するのではなく、コンポーネントに分散し、障害として認識される前にエコシステムによって正規化される。
現代のAIシステムにおける中心的な安全性の課題は、モデルが有害な応答を放出するかどうかだけではなく、より広範な社会技術システムが、エラーが可視で、競合可能で、封じ込め可能で、回復可能な状態を維持しているかどうかである。
論文 参考訳(メタデータ) (2026-07-21T17:02:37Z) - Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security [57.35851886874902]
エージェントAIシステムは、複雑なタスクを自律的に実行するが、その多段階の軌道には、信頼性に挑戦する新たな障害モードが導入されている。
この調査では、リスクの高いデプロイメントに不可欠な2つのコアディメンションを通じて、信頼できるエージェントAIを精査する。
各次元について、重要な概念を明確にし、エージェントワークフローに沿ってリスクが発生する場所を特定し、ステージ目標の緩和戦略を要約する。
論文 参考訳(メタデータ) (2026-05-17T10:26:37Z) - Semantic Reward Collapse and the Preservation of Epistemic Integrity in Adaptive AI Systems [0.0]
近年の強化学習の進歩により、大規模言語モデルのユーザビリティ、一貫性、安全性が大幅に向上した。
実行的確実性などの繰り返しの振る舞いは、スカラー化された選好最適化システム内の未解決構造問題を示唆している。
本稿では,SRC(Semantic Reward Collapse)を提案する。
論文 参考訳(メタデータ) (2026-05-12T17:03:26Z) - Towards Trustworthy Depression Estimation via Disentangled Evidential Learning [50.22167852149165]
EviDepはうつ病の重症度を共同で定量化する明らかな学習フレームワークである。
EviDepは、堅牢な証拠合成を保証するために厳密な情報整合性を強制する。
最先端の予測精度と優れた不確実性校正を実現し、信頼できる臨床スクリーニングのための堅牢なフェールセーフメカニズムを提供する。
論文 参考訳(メタデータ) (2026-04-17T13:27:11Z) - Ethical Implications of Training Deceptive AI [0.0]
AIシステムにおける認知行動はもはや理論的ではない。
欧州連合のAI法は、詐欺的なAIシステムの配備を禁止している。
詐欺研究の実施方法を規定する確立した枠組みは存在しない。
論文 参考訳(メタデータ) (2026-03-10T20:30:27Z) - What Breaks Embodied AI Security:LLM Vulnerabilities, CPS Flaws,or Something Else? [28.12412876058788]
身体化されたAIシステムは、制御された環境から安全クリティカルな現実世界へのデプロイへと急速に移行している。
インボディードAIとは異なり、インボディードインテリジェンスにおける失敗は、不可逆的な物理的結果をもたらす。
我々は,実施によるシステムレベルのミスマッチから,重大な障害が生じることを論じる。
論文 参考訳(メタデータ) (2026-02-19T13:29:00Z) - Beyond single-channel agentic benchmarking [0.0]
本稿では,AIエージェントを分離して評価することで,人間のループ環境に配置した場合の運用上の安全性が低下すると主張している。
にもかかわらず、不完全なAIシステムでさえ、十分に文書化された人間の失敗の原因に対して冗長な監査レイヤーとして機能することで、かなりの安全性を提供することができる。
論文 参考訳(メタデータ) (2026-02-05T08:22:02Z) - Agentic Uncertainty Quantification [76.94013626702183]
本稿では,言語化された不確実性をアクティブな双方向制御信号に変換する統合されたデュアルプロセスエージェントUQ(AUQ)フレームワークを提案する。
システム1(Uncertainty-Aware Memory, UAM)とシステム2(Uncertainty-Aware Reflection, UAR)は、これらの説明を合理的な手段として利用し、必要な時にのみターゲットの推論時間解決をトリガーする。
論文 参考訳(メタデータ) (2026-01-22T07:16:26Z) - Never Compromise to Vulnerabilities: A Comprehensive Survey on AI Governance [211.5823259429128]
本研究は,本質的セキュリティ,デリバティブ・セキュリティ,社会倫理の3つの柱を中心に構築された,技術的・社会的次元を統合した包括的枠組みを提案する。
我々は,(1)防衛が進化する脅威に対して失敗する一般化ギャップ,(2)現実世界のリスクを無視する不適切な評価プロトコル,(3)矛盾する監視につながる断片的な規制,の3つの課題を特定する。
私たちのフレームワークは、研究者、エンジニア、政策立案者に対して、堅牢でセキュアなだけでなく、倫理的に整合性があり、公的な信頼に値するAIシステムを開発するための実用的なガイダンスを提供します。
論文 参考訳(メタデータ) (2025-08-12T09:42:56Z) - The Alignment Trap: Complexity Barriers [0.0]
本稿は、AIアライメントは単に難しいだけでなく、基本的な論理的矛盾に基づくものである、と論じる。
私たちは、すべての必要な安全ルールを列挙できないため、マシンラーニングを正確に使用しています。
このパラドックスは、5つの独立した数学的証明によって確認される。
論文 参考訳(メタデータ) (2025-06-12T02:30:30Z) - Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model [73.8765529028288]
我々は、モダリティ間の安全アライメントを評価するために、セーフインプットとアンセーフアウトプット(SIUO)と呼ばれる新しい安全アライメントの課題を導入する。
この問題を実証的に調査するため,我々はSIUOを作成した。SIUOは,自己修復,違法行為,プライバシー侵害など,9つの重要な安全領域を含むクロスモダリティベンチマークである。
以上の結果から, クローズドおよびオープンソース両方のLVLMの安全性上の重大な脆弱性が明らかとなり, 複雑で現実的なシナリオを確実に解釈し, 応答する上で, 現行モデルが不十分であることが示唆された。
論文 参考訳(メタデータ) (2024-06-21T16:14:15Z) - Exploring Robustness of Unsupervised Domain Adaptation in Semantic
Segmentation [74.05906222376608]
クリーンな画像とそれらの逆の例との一致を、出力空間における対照的な損失によって最大化する、逆向きの自己スーパービジョンUDA(ASSUDA)を提案する。
i) セマンティックセグメンテーションにおけるUDA手法のロバスト性は未解明のままであり, (ii) 一般的に自己スーパービジョン(回転やジグソーなど) は分類や認識などのイメージタスクに有効であるが, セグメンテーションタスクの識別的表現を学習する重要な監視信号の提供には失敗している。
論文 参考訳(メタデータ) (2021-05-23T01:50:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。