論文の概要: ERTS: Adversarial Robustness Testing of Ethical AI via Semantic Perturbation in a Bounded Consequence Space
- arxiv url: http://arxiv.org/abs/2606.13282v1
- Date: Thu, 11 Jun 2026 12:38:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-12 15:55:27.789834
- Title: ERTS: Adversarial Robustness Testing of Ethical AI via Semantic Perturbation in a Bounded Consequence Space
- Title(参考訳): ERTS: 境界空間における意味摂動による倫理的AIの逆ロバストネステスト
- Authors: Pratyush Chaudhari,
- Abstract要約: 本稿では,AIシステム評価のためのクローズドパイプフレームワークであるEthical Robustness Testing System (ERTS)を紹介する。
ERTSは倫理的ジレンマを、確立された倫理理論に基づく22次元の倫理的コンシークエンス空間にエンコードする。
我々は,8つのデプロイメントドメインにまたがる倫理的シナリオを対象とし,4つの構造化ベースラインモデルと2つの生産LLMを評価し,1500の対向テストケースを生成した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: As AI systems are deployed in high-stakes ethical contexts such as healthcare triage, autonomous vehicle control, and employment screening, formal methods for evaluating their robustness against adversarial manipulation of ethical reasoning remain underdeveloped. This paper introduces the Ethical Robustness Testing System (ERTS), a closed-pipeline framework that: (1) encodes ethical dilemmas into a 22-dimensional Ethical Consequence Space (ECS) grounded in established ethical theory; (2) applies 17 semantic perturbation functions subject to 6 validity constraint classes including a novel semantic coherence constraint; (3) measures decision deviation via a 4-component Ethical Instability Index (EII); and (4) produces domain-adaptive pre-deployment robustness assessment verdicts. We evaluate 4 structured baseline models and 2 production LLMs (Gemini 2.0 Flash and Llama 3.2) across 50 ethical scenarios spanning 8 deployment domains, generating 1,500 adversarial test cases. Results demonstrate that only 33% of models achieve assessment clearance, with the local Llama-3.2 model proving particularly vulnerable to fairness corruption and information degradation attacks (ERS = 0.737). To the best of our knowledge, no existing framework combines a bounded ethical consequence space, semantic coherence constraints, and domain-adaptive assessment in a single adversarial testing pipeline.
- Abstract(参考訳): AIシステムは、医療トリアージ、自動運転車制御、雇用スクリーニングなどの高度な倫理的文脈に展開されているため、倫理的理由付けの敵の操作に対する堅牢性を評価する公式な方法はまだ未開発のままである。
本稿では,(1)確立された倫理理論に基づく倫理的ジレンマを22次元の倫理的コンシークエンス空間(ECS)にエンコードする,(2)新しい意味的コヒーレンス制約を含む6つの妥当性制約クラスに従属する意味摂動関数を適用する,(3)4成分の倫理的不安定度指標(EII)による決定偏差を測定する,(4)ドメイン適応的事前配置性評価を行う,という,クローズド・パイプ・フレームワークであるERTSを紹介する。
我々は,8つのデプロイメントドメインにまたがる50の倫理シナリオに対して,4つの構造化ベースラインモデルと2つのLLM(Gemini 2.0 FlashとLlama 3.2)を評価し,1500の対向テストケースを生成した。
Llama-3.2モデルは、特に公正な腐敗や情報劣化攻撃(ERS = 0.737)に弱いことが証明されている。
私たちの知る限りでは、境界付けられた倫理的帰結空間、セマンティックコヒーレンス制約、単一対向テストパイプラインにおけるドメイン適応評価を組み合わせたフレームワークはありません。
関連論文リスト
- Autonomous FAIR Digital Objects: From Passive Assertions to Active Knowledge [5.118282682919236]
Web上の科学知識のキュレーションは、中央集権化と制度的な連続性に依存するが、登録が近いと、データがオンラインのままであってもアクティブなスチュワードシップは停止する。
我々は、自律デジタルオブジェクト(aFDO)の概念を抽象的なアイデアから運用モデルへと前進させる。
AFDOは、セマンティックWeb標準に固定された3つの機能、すなわち、ポータブルな条件-アクションルールのためにPROV-O、SHACL、ODRLに整合したRDF-star上のポリシー層、そして、発表毎の評価コストを制限したActivityStreams 2.0上のアナウンス層、そして、3マルチを解決した合意層である。
論文 参考訳(メタデータ) (2026-05-11T11:12:55Z) - Emergent Strategic Reasoning Risks in AI: A Taxonomy-Driven Evaluation Framework [63.74295981594549]
大規模言語モデル(LLM)は、自身の目的を達成する行動に関与している。
これには、詐欺(故意に誤解を招くユーザや評価者)、評価ゲーム(安全テスト中のパフォーマンスを戦略的に操作する)、報酬ハッキングなどが含まれる。
自動行動リスク評価のための分類駆動型エージェントフレームワークであるESRRSimを紹介する。
論文 参考訳(メタデータ) (2026-04-23T23:44:01Z) - The Cognitive Penalty: Ablating System 1 and System 2 Reasoning in Edge-Native SLMs for Decentralized Consensus [0.0]
本稿では,Qwen-3.5-9B 上で厳密なモデル内アブレーションを実行する 840-inference 実験フレームワーク Sentinel-Bench を紹介する。
システム1は、100%対逆ロバスト性、100%法線の整合性、および状態の整合性を13秒未満で達成した。
システム2の推論は破滅的な不安定を招き、基本的に26.7%の反響非収束(認知的崩壊)率によって引き起こされた。
論文 参考訳(メタデータ) (2026-04-18T08:46:37Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation [22.833977971686966]
本稿では、フロンティアAIリスク評価のための自動化フレームワークであるAutoControl Arenaを紹介する。
私たちは柔軟性を維持しながら幻覚を緩和します。
この原則は3エージェントフレームワークを通じてインスタンス化され、既存のシミュレータよりも98%以上のエンドツーエンドの成功と60%の人間の好みを達成する。
論文 参考訳(メタデータ) (2026-03-08T02:49:45Z) - A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents [4.851169906977996]
40の異なるシナリオからなる新しいベンチマークを導入する。
各シナリオはマルチステップアクションを必要とするタスクを示し、エージェントのパフォーマンスは特定のキーパフォーマンス指標(KPI)に結び付けられている。
我々は、結果駆動の制約違反を1.3%から71.4%まで観察し、12モデルのうち9モデルが30%から50%の不正調整率を示した。
論文 参考訳(メタデータ) (2025-12-23T21:52:53Z) - Making LLMs Reliable When It Matters Most: A Five-Layer Architecture for High-Stakes Decisions [51.56484100374058]
現在の大規模言語モデル(LLM)は、実行前にアウトプットをチェックできるが、不確実な結果を伴う高い戦略決定には信頼性が低い検証可能な領域で優れている。
このギャップは、人間と人工知能(AI)システムの相互認知バイアスによって引き起こされ、そのセクターにおける評価と投資の持続可能性の保証を脅かす。
本報告では、7つのフロンティアグレードLDMと3つの市場向けベンチャーヴィグネットの時間的圧力下での系統的質的評価から生まれた枠組みについて述べる。
論文 参考訳(メタデータ) (2025-11-10T22:24:21Z) - Moral Anchor System: A Predictive Framework for AI Value Alignment and Drift Prevention [0.0]
重要なリスクはバリュードリフトであり、進化するコンテキストや学習ダイナミクス、意図しない最適化によって、AIシステムが一致した値から逸脱する。
我々は,AIエージェントの値ドリフトを検出し,予測し,緩和する新しいフレームワークであるMoral Anchor System(MAS)を提案する。
論文 参考訳(メタデータ) (2025-10-05T07:24:23Z) - ASSERT: Automated Safety Scenario Red Teaming for Evaluating the
Robustness of Large Language Models [65.79770974145983]
ASSERT、Automated Safety Scenario Red Teamingは、セマンティックなアグリゲーション、ターゲットブートストラップ、敵の知識注入という3つの方法で構成されている。
このプロンプトを4つの安全領域に分割し、ドメインがモデルの性能にどのように影響するかを詳細に分析する。
統計的に有意な性能差は, 意味的関連シナリオにおける絶対分類精度が最大11%, ゼロショット逆数設定では最大19%の絶対誤差率であることがわかった。
論文 参考訳(メタデータ) (2023-10-14T17:10:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。