論文の概要: AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
- arxiv url: http://arxiv.org/abs/2607.28617v1
- Date: Thu, 30 Jul 2026 17:58:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.71095
- Title: AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
- Title(参考訳): AISPA: 大規模言語モデルアプリケーションのためのユーザ中心システムプロンプト
- Abstract要約: システムプロンプトは、AIアプリケーションにおける基礎モデルの振る舞いを管理するために開発者が設定した命令である。
商用AI製品全体で使用されているが、公共や規制当局に開示されることは稀である。
本稿では,AIシステムにおけるシステムプロンプトを体系的に監査する,ユーザ中心のフレームワークであるAI Prompt Assurance(AISPA)を紹介する。
- 参考スコア(独自算出の注目度): 39.37840538615966
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: System prompts are instructions configured by developers to govern the behaviors of foundation models in AI applications. They are used throughout commercial AI products, but are rarely disclosed to the public or regulators, creating a serious trust and accountability gap in the wide deployment of AI systems. In this paper, we introduce Artificial Intelligence System Prompt Assurance (AISPA), a user-centric framework for systematically auditing system prompts in AI systems. AISPA examines specific parts of a system prompt and evaluates them along eight dimensions that matter to users. We then use this framework to review 3,249 instructions from system prompts in 88 commercial AI products, classifying each instruction as either protective (of users) or problematic. Our audit surfaces four core findings. First, system prompt design varies substantially across products and developers, with some organizations averaging over 60 protective instructions per product while others average fewer than 5. Second, protective instructions are widely adopted but shallow in scope: 98.9% of products contain at least one, yet only 24% cover all eight dimensions of the AISPA taxonomy. Third, system prompts have grown steadily longer and more protective of users, suggesting that user protection is becoming a more visible concern in commercial prompt design. Fourth, despite this progress, problematic instructions remain pervasive: roughly 40% of products contain at least one instruction that works against user interests, and protective and problematic instructions frequently coexist within the same prompt. Our findings highlight the need for greater transparency, standardization, and independent oversight for system prompts in commercial AI products.
- Abstract(参考訳): システムプロンプトは、AIアプリケーションにおける基礎モデルの振る舞いを管理するために開発者が設定した命令である。
それらは商用AI製品全体で使用されているが、公あるいは規制当局に開示されることは滅多になく、AIシステムの広範な展開において、深刻な信頼と説明責任のギャップを生じさせる。
本稿では,AIシステムにおけるシステムプロンプトをシステム的に監査する,ユーザ中心のフレームワークであるAI Prompt Assurance(AISPA)を紹介する。
AISPAはシステムプロンプトの特定の部分を調べ、ユーザにとって重要な8次元に沿って評価する。
次に、このフレームワークを使用して、88の商用AI製品のシステムプロンプトから3,249の命令をレビューします。
監査の結果は4つの中核となる。
まず、システムプロンプトの設計は製品や開発者によって大きく異なり、一部の組織は1製品あたり平均60以上の保護命令を処理し、他の組織は平均5.5%以下である。
第2に、保護命令は広く採用されているが、範囲は浅い:98.9%の製品は少なくとも1つを含むが、AISPA分類の8つの次元全てをカバーするのはわずか24%である。
第3に、システムプロンプトはユーザーを着実に保護し、商業的なプロンプトデザインにおいてユーザー保護がより目に見える関心事になりつつあることを示唆している。
約40%の製品には、少なくとも1つの命令が含まれており、ユーザーの利益に対して機能し、保護的かつ問題のある命令は、しばしば同じプロンプト内で共存している。
私たちの調査結果は、商用AI製品におけるシステムプロンプトに対する透明性の向上、標準化、独立した監視の必要性を強調しています。
関連論文リスト
- FLARE-AI: Flaw Reporting for AI [51.64618567247884]
デプロイされたAIシステムの欠陥報告は、システムの障害を特定し、AIの安全性を改善するために不可欠である。
しかし、AIレポートのエコシステムは断片化されている。欠陥を特定する研究者は、報告すべきことを知らないことが多く、レポートを受け取るグループは、他の関連するステークホルダーと共有することはめったにない。
私たちは、AI開発者、サイバーセキュリティグループ、AI欠陥アグリゲータによって公表された12のレポートシステムを監査します。
我々は、既存のシステムとの相互運用性のために設計された、オープンソースのAI欠陥報告システムであるFLARE-AIを紹介する。
論文 参考訳(メタデータ) (2026-06-30T12:27:09Z) - The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents [29.98056047452529]
コンピュータ利用エージェント(CUA)は、現実の環境で複雑なタスクを自律的に完了させることができるが、誤解があれば自動化することもできる。
意図しない攻撃条件下でCUAを評価するベンチマークOSBLINDを紹介する。
ほとんどのCUAは90%の攻撃成功率(ASR)を超え、安全に配慮したClaude 4.5 Sonnetも72.7%に達している。
論文 参考訳(メタデータ) (2026-04-12T10:52:42Z) - Who Controls the Conversation? User Perspectives On Generative AI (LLM) System Prompts [7.340845393655051]
本稿では, ユーザ中心の設計に注意を喚起するシステムについて論じる。
システムプロンプトには何が含まれ、エンドユーザはそれをどのように認識し、これらの認識は設計とガバナンスの実践に何を提供するのか?
この結果から,システムプロンプトのメリットとリスク,プロンプトデザインに結びつくことを好む値,異なるタイプのプロンプトに対する快適さ,プロンプトコンテンツに関する透明性とユーザコントロールの度合い,といったユーザ視点が明らかになった。
論文 参考訳(メタデータ) (2026-02-16T17:59:30Z) - Just Ask: Curious Code Agents Reveal System Prompts in Frontier LLMs [65.6660735371212]
textbftextscJustAskは,インタラクションのみで効果的な抽出戦略を自律的に発見するフレームワークである。
これは、アッパー信頼境界に基づく戦略選択と、原子プローブと高レベルのオーケストレーションにまたがる階層的なスキル空間を用いて、オンライン探索問題として抽出を定式化する。
この結果から,現代のエージェントシステムにおいて,システムプロンプトは致命的ではあるがほぼ無防備な攻撃面であることがわかった。
論文 参考訳(メタデータ) (2026-01-29T03:53:25Z) - AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons [62.374792825813394]
本稿ではAI製品リスクと信頼性を評価するための業界標準ベンチマークとして,AIluminate v1.0を紹介する。
このベンチマークは、危険、違法、または望ましくない行動を12の危険カテゴリーで引き起こすように設計されたプロンプトに対するAIシステムの抵抗を評価する。
論文 参考訳(メタデータ) (2025-02-19T05:58:52Z) - The AI Agent Index [8.48525754659057]
エージェントAIシステムは、人間の関与が限定された複雑なタスクを計画し実行することができる。
現在、エージェントシステムの技術コンポーネント、目的の用途、安全性の特徴を文書化するための構造化されたフレームワークは存在しない。
AI Agent Indexは、現在デプロイされているエージェントAIシステムに関する情報をドキュメント化する最初の公開データベースである。
論文 参考訳(メタデータ) (2025-02-03T18:59:13Z) - Instructional Segment Embedding: Improving LLM Safety with Instruction Hierarchy [53.54777131440989]
LLM(Large Language Models)は、セキュリティや安全性の脅威を受けやすい言語である。
これらの脆弱性の大きな原因の1つは、命令階層の欠如である。
本稿では,BERTにインスパイアされた命令セグメント埋め込み(ISE)技法を,現代の大規模言語モデルに導入する。
論文 参考訳(メタデータ) (2024-10-09T12:52:41Z) - Designing Secure AI-based Systems: a Multi-Vocal Literature Review [5.799668199535053]
我々は,AIベースのシステム設計のための16のアーキテクチャセキュリティガイドラインを提示する。
このガイドラインは、AIベースのシステムのセキュアな開発について、実践者を支援することができる。
論文 参考訳(メタデータ) (2024-07-26T08:04:05Z) - Towards Guaranteed Safe AI: A Framework for Ensuring Robust and Reliable AI Systems [88.80306881112313]
我々は、AI安全性に対する一連のアプローチを紹介し、定義する。
これらのアプローチの中核的な特徴は、高保証の定量的安全性保証を備えたAIシステムを作ることである。
これら3つのコアコンポーネントをそれぞれ作成するためのアプローチを概説し、主な技術的課題を説明し、それらに対する潜在的なソリューションをいくつか提案します。
論文 参考訳(メタデータ) (2024-05-10T17:38:32Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。