論文の概要: Engineering Trustworthy Agentic AI for Critical Systems
- arxiv url: http://arxiv.org/abs/2607.18548v1
- Date: Mon, 20 Jul 2026 22:28:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.258256
- Title: Engineering Trustworthy Agentic AI for Critical Systems
- Title(参考訳): クリティカルシステムのための信頼できるエージェントAI
- Abstract要約: この研究は、安全と制約満足度、堅牢性と信頼性、透明性と解釈可能性、説明責任と監査可能性、プライバシーとセキュリティの5つの横断的な側面で組織された信頼性モデルを採用している。
この基盤の上に構築されたエージェントシステムアーキテクチャ、脅威、具体的な信頼メカニズム、および定量的なメトリクスは、エージェントシステムの開発と評価において直接適用するために調査される。
これらの原則は、電力システム、自動運転車/ロボティクス/UAV、高性能コンピューティング、通信ネットワークの4つの制約のあるエンジニアリングドメインで検証される。
- 参考スコア(独自算出の注目度): 1.8015174793525714
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic artificial intelligence systems, capable of autonomous perception, planning, tool use, and multi-step action, are increasingly proposed for critical engineering domains where decisions carry physical, operational, or economic consequences. This survey addresses a gap in current literature by treating trustworthiness, whether agentic behavior can be verified, audited, and trusted under the constraints that engineering practice actually requires, as a first-class engineering property, rather than evaluating agentic AI by task capability alone. The study adopts a trustworthiness model organized around five cross-cutting dimensions: safety and constraint satisfaction; robustness and reliability; transparency and interpretability; accountability and auditability; and privacy and security. This is mapped onto an agentic assurance workflow spanning perception through audit. Building on this foundation, agentic systems architectures, threats, concrete trust mechanisms, and quantitative metrics are surveyed for direct application in agentic systems development and evaluation. These principles are then examined across four constraint-bound engineering domains: power systems, autonomous vehicles/robotics/UAVs, high-performance computing, and communication networks, identifying recurring design patterns, shared failure modes, and domain-specific gaps. Synthesizing across those domains, agentic AI trustworthiness is shown to be a single problem, with a path outlined toward a reusable, cross-domain assurance framework analogous to the graded certification regimes used by mature safety-critical engineering fields.
- Abstract(参考訳): 自律的な認識、計画、ツールの使用、多段階の行動が可能なエージェント人工知能システムは、決定が物理的、運用的、経済的な結果をもたらす重要なエンジニアリング領域に対して、ますます提案されている。
この調査は、エージェントAIをタスク能力だけで評価するのではなく、エンジニアリング実践が第一級のエンジニアリング特性として実際に要求する制約の下で、エージェント的行動を検証するか、監査し、信頼することができるか、という信頼性を扱い、現在の文献のギャップに対処する。
この研究は、安全と制約満足度、堅牢性と信頼性、透明性と解釈可能性、説明責任と監査可能性、プライバシーとセキュリティの5つの横断的な側面で組織された信頼性モデルを採用している。
これは監査を通じて知覚にまたがるエージェント保証ワークフローにマップされる。
この基盤の上に構築されたエージェントシステムアーキテクチャ、脅威、具体的な信頼メカニズム、および定量的なメトリクスは、エージェントシステムの開発と評価において直接適用するために調査される。
これらの原則は、電力システム、自動運転車/ロボティクス/UAV、高性能コンピューティング、通信ネットワーク、繰り返し発生する設計パターンの同定、共有障害モード、ドメイン固有のギャップの4つの制約のあるエンジニアリングドメインで検証される。
これらの領域を総合すると、エージェントAIの信頼性は単一の問題であることが示され、成熟した安全クリティカルなエンジニアリング分野で使用される認定制度に類似した、再利用可能なクロスドメイン保証フレームワークに向けたパスが概説されている。
関連論文リスト
- AI Deployment Accountability Engineering: A Vision for Accountable AI in Safety-Critical Socio-Technical Systems [14.280538199149634]
このビジョンペーパーはAI Deployment Accountability Engineering (ADAE)を紹介する。
ADAEは、デプロイされたAIシステムに対して測定可能で、連続的で、実行可能な説明責任を確立することを目的とした、AIエンジニアリングのサブカテゴリである。
我々は,コンテキスト依存型障害モードの構造化発見,プライバシ保護型説明責任測定,エージェントAIのシステムレベルのリスク分析,技術的障害の運用的,制度的リスクへの変換という,4つの相互接続された柱を中心に構築された研究課題を具体的に述べる。
論文 参考訳(メタデータ) (2026-09-13T15:18:41Z) - Towards Trustworthy Embodied Intelligence: A Systems Framework and Graded Trustworthiness Levels [53.63220028820581]
身体的知性は、学習した知覚と意思決定をリアルタイムの計算、制御、物理的相互作用と統合する。
我々は,信頼に値するインテリジェンスを,特定のタスクを確実に実行するための持続能力として定義する。
論文 参考訳(メタデータ) (2026-07-28T17:50:44Z) - Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security [57.35851886874902]
エージェントAIシステムは、複雑なタスクを自律的に実行するが、その多段階の軌道には、信頼性に挑戦する新たな障害モードが導入されている。
この調査では、リスクの高いデプロイメントに不可欠な2つのコアディメンションを通じて、信頼できるエージェントAIを精査する。
各次元について、重要な概念を明確にし、エージェントワークフローに沿ってリスクが発生する場所を特定し、ステージ目標の緩和戦略を要約する。
論文 参考訳(メタデータ) (2026-05-17T10:26:37Z) - Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses [168.50301366360344]
Embodied AI (Embodied AI) は、知覚、認知、計画、相互作用を、安全クリティカルな環境で機能するエージェントに統合する。
デジタルAIシステムとは異なり、エンボディエージェントは不確実な検知、不完全な知識、動的な人間とロボットの相互作用の下で行動しなければならない。
この調査は、エンボディされたAIにおける安全性研究の包括的なレビューを提供し、完全なエンボディされたパイプラインにわたる攻撃と防御を調査している。
論文 参考訳(メタデータ) (2026-03-28T13:21:44Z) - Agentic Problem Frames: A Systematic Approach to Engineering Reliable Domain Agents [0.0]
大きな言語モデル(LLM)は、自律的なエージェントへと進化していますが、現在の"フレームワークレス"な開発は、あいまいな自然言語に基づいています。
本研究では,内部モデルインテリジェンスからエージェントと環境間の構造的相互作用に焦点を移すシステム工学フレームワークであるエージェント問題フレーム(APF)を提案する。
論文 参考訳(メタデータ) (2026-02-22T06:32:32Z) - Towards Verifiably Safe Tool Use for LLM Agents [53.55621104327779]
大規模言語モデル(LLM)ベースのAIエージェントは、データソース、API、検索エンジン、コードサンドボックス、さらにはその他のエージェントなどのツールへのアクセスを可能にすることで、機能を拡張する。
LLMは意図しないツールインタラクションを起動し、機密データを漏洩したり、クリティカルレコードを上書きしたりするリスクを発生させる。
モデルベースセーフガードのようなリスクを軽減するための現在のアプローチは、エージェントの信頼性を高めるが、システムの安全性を保証することはできない。
論文 参考訳(メタデータ) (2026-01-12T21:31:38Z) - A Survey of Agentic AI and Cybersecurity: Challenges, Opportunities and Use-case Prototypes [7.02443431688472]
Agentic AIは、単一ステップ生成モデルから、長期的タスクに対する推論、計画、行動、適応が可能なシステムへの重要な転換点である。
本調査は,サイバーセキュリティにおけるエージェントAIの影響について検討する。
論文 参考訳(メタデータ) (2026-01-08T02:46:06Z) - Never Compromise to Vulnerabilities: A Comprehensive Survey on AI Governance [211.5823259429128]
本研究は,本質的セキュリティ,デリバティブ・セキュリティ,社会倫理の3つの柱を中心に構築された,技術的・社会的次元を統合した包括的枠組みを提案する。
我々は,(1)防衛が進化する脅威に対して失敗する一般化ギャップ,(2)現実世界のリスクを無視する不適切な評価プロトコル,(3)矛盾する監視につながる断片的な規制,の3つの課題を特定する。
私たちのフレームワークは、研究者、エンジニア、政策立案者に対して、堅牢でセキュアなだけでなく、倫理的に整合性があり、公的な信頼に値するAIシステムを開発するための実用的なガイダンスを提供します。
論文 参考訳(メタデータ) (2025-08-12T09:42:56Z) - TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems [8.683314804719506]
本稿では,エージェントマルチエージェントシステム(AMAS)における信頼・リスク・セキュリティマネジメント(TRiSM)の構造的分析について述べる。
まず、エージェントAIの概念的基礎を調べ、従来のAIエージェントとアーキテクチャ的区別を強調します。
次に、Textit Explainability、ModelOps、Security、Privacy、Textittheirのガバナンスガバナンスといった重要な柱を中心に構築された、エージェントAIのためのAI TRiSMフレームワークを適応して拡張します。
調整失敗から調整失敗まで、エージェントAIのユニークな脅威と脆弱性を捉えるためにリスク分類法が提案されている。
論文 参考訳(メタデータ) (2025-06-04T16:26:11Z) - Engineering Risk-Aware, Security-by-Design Frameworks for Assurance of Large-Scale Autonomous AI Models [0.0]
本稿では,大規模自律型AIシステムを対象とした企業レベルのリスク認識型セキュリティ・バイ・デザイン手法を提案する。
敵的および運用的ストレス下でのモデル動作の証明可能な保証を提供する統一パイプラインについて詳述する。
国家安全保障、オープンソースモデルガバナンス、産業自動化におけるケーススタディは、脆弱性とコンプライアンスのオーバーヘッドの計測可能な削減を実証している。
論文 参考訳(メタデータ) (2025-05-09T20:14:53Z) - Towards Trustworthy GUI Agents: A Survey [64.6445117343499]
本調査では,GUIエージェントの信頼性を5つの重要な次元で検証する。
敵攻撃に対する脆弱性、シーケンシャルな意思決定における障害モードのカスケードなど、大きな課題を特定します。
GUIエージェントが普及するにつれて、堅牢な安全基準と責任ある開発プラクティスを確立することが不可欠である。
論文 参考訳(メタデータ) (2025-03-30T13:26:00Z) - EARBench: Towards Evaluating Physical Risk Awareness for Task Planning of Foundation Model-based Embodied AI Agents [53.717918131568936]
EAI(Embodied AI)は、高度なAIモデルを現実世界のインタラクションのための物理的なエンティティに統合する。
高レベルのタスク計画のためのEAIエージェントの"脳"としてのファンデーションモデルは、有望な結果を示している。
しかし、これらのエージェントの物理的環境への展開は、重大な安全性上の課題を呈している。
本研究では,EAIシナリオにおける身体的リスクの自動評価のための新しいフレームワークEARBenchを紹介する。
論文 参考訳(メタデータ) (2024-08-08T13:19:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。