論文の概要: Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity
- arxiv url: http://arxiv.org/abs/2607.01153v1
- Date: Wed, 01 Jul 2026 16:33:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.993905
- Title: Adversarial Pragmatics for AI Safety Evaluation: A Benchmark for Instruction Conflict, Embedded Commands, and Policy Ambiguity
- Title(参考訳): AI安全性評価のための逆プラグマティクス:インストラクション・コンフリクト、埋め込みコマンド、ポリシーの曖昧さのベンチマーク
- Authors: Brett Reynolds,
- Abstract要約: 本稿では,命令コンフリクト,組込みコマンド,引用,スコープあいまいさ,ディクシス,間接的音声行為,マルチターンエージェントの書き起こしに基づくモデル行動評価のベンチマークとして,逆数プラグマティクスを提案する。
この貢献は、言語的に制御された分類学、バリデーション強化されたメタデータを備えた18項目のシードベンチマーク、54行のローカルシードパイロット、タスクの成功、ポリシーコンプライアンス、安全リスク、拒絶された結果、評価者の信頼を区別する専門家評価プロトコル、そして妥当性、診断の曖昧さ、分類のドリフトを判定するためのメトリクスである。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Safety evaluations for language models increasingly depend on judgments about ambiguous natural-language behaviour: whether a model has followed an instruction, refused appropriately, complied with a policy, resisted an embedded command, or misreported progress in an agentic task. Existing benchmarks often compress these distinctions into pass/fail labels, obscuring whether failures arise from capability limits, policy ambiguity, instruction conflict, scaffold failure, or unstable evaluator judgments. This paper introduces adversarial pragmatics as a benchmark and annotation protocol for evaluating model behaviour under instruction conflict, embedded commands, quotation, scope ambiguity, deixis, indirect speech acts, and multi-turn agent transcripts. The contribution is empirical and methodological: a linguistically controlled taxonomy, an 18-item seed benchmark with validator-enforced metadata, a 54-row local seed pilot, an expert-evaluation protocol distinguishing task success, policy compliance, safety risk, refusal outcome, and evaluator confidence, and metrics for judge validity, diagnostic ambiguity, and taxonomy drift. The framework turns linguistic judgment methodology into a practical tool for validating safety evals, LLM judges, gold-set construction, prompt-injection tests, and safety documentation.
- Abstract(参考訳): 言語モデルの安全性評価は、指示に従うか、適切に拒否するか、ポリシーを遵守するか、組み込まれた命令に抵抗するか、エージェントタスクにおける誤った進捗を報告するか、あいまいな自然言語行動に関する判断にますます依存する。
既存のベンチマークは、これらの区別をパス/フェイルラベルに圧縮し、能力限界、ポリシーの曖昧さ、命令の衝突、足場故障、不安定な評価器の判断から失敗が生じるかどうかを判断する。
本稿では, 命令競合, 組込みコマンド, 引用, スコープあいまいさ, ディクシス, 間接音声行為, マルチターンエージェント書き起こしのモデル動作を評価するためのベンチマークおよびアノテーションプロトコルとして, 逆数プラグマティクスを提案する。
この貢献は、言語的に制御された分類学、バリデーション強化されたメタデータを備えた18項目のシードベンチマーク、54行のローカルシードパイロット、タスク成功、ポリシーコンプライアンス、安全リスク、拒絶された結果、評価者の信頼を区別する専門家評価プロトコル、そして妥当性、診断曖昧性、分類のドリフトを判定するためのメトリクスである。
この枠組みは、言語学的判断方法論を、安全性評価、LLM審査員、ゴールドセット構築、即時注入試験、安全文書の検証のための実践的なツールに変える。
関連論文リスト
- AgentSecBench: Measuring Prompt Injection, Privacy Leakage, and Tool-Use Integrity in LLM Agents [0.2864713389096699]
本稿では,AgentSecBenchを,この問題に対する正式なセキュリティフレームワークの実証的なインスタンス化として紹介する。
3つのゲーム・インストラクション・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス・インテリジェンス(英語版)を定めている。
これは、承認された観察と能力に対するプロジェクションとしてのアプリケーションポリシーを表し、プロジェクションの即時アノテーションとプロジェクションの強化を区別し、敵のアドバンテージと、防衛が生成前に関連するモデル可視チャネルを閉鎖するかどうかを計測する。
論文 参考訳(メタデータ) (2026-05-25T18:53:22Z) - The Evaluation Differential: When Frontier AI Models Recognise They Are Being Tested [11.663456969895462]
最近の公表された証拠は、現代のAIモデルが、評価コンテキストを認識し、最近になってそれらを表現し、それらのコンテキスト下では、デプロイメント連続的な条件下でとは異なる振る舞いをすることができることを示している。
これらの結果は、フロンティア評価から引き出された安全結論に対するクレーム正当性問題を生み出していると論じる。
本報告では, 安全クレームのタイプ (ED-stable, ED-degraded, ED-inverted, ED-undetermined) を, 文書発散に基づく保証基準を用いて開発し, TRACE (Test-Recognition Audit for Claim Evaluation) を指定する。
我々は,この枠組みを3件の公文書化された評価事件に遡って適用し,システムカードのガバナンスへの影響,適合性評価,及びガバナンスへの影響について議論する。
論文 参考訳(メタデータ) (2026-05-12T04:13:35Z) - Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges [26.595399077062638]
LLM-as-a-Judgeパイプラインは、エージェント安全性のデファクト評価器となっている。
既存のベンチマークでは、評定がエージェントの行動に依存するか、それとも単に評価方針がどう語られるかをチェックすることなく、その評定を根底からのプロキシとして扱う。
我々は、証明された等価な書き換えの下でのルーブリック・セマンティック不変性、意図的な厳密なシフトの下でのルーブリック・スレッショルド不変性、曖昧さを意識したキャリブレーションの3つの検証可能な原則として運用する。
論文 参考訳(メタデータ) (2026-05-07T12:49:09Z) - TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models [59.13964209628383]
VLA(Vision-Language-Action)ポリシーは、言語指示や視覚的な観察をロボット行動にマッピングする上で大きな進歩を見せている。
本稿では,VLA政策における乱れや外見に起因したバイアスを明示的に軽減する単純な推論時ガイダンス機構であるTAG(Target-Agnostic Guidance)を提案する。
我々は, LIBERO, LIBERO-Plus, VLABenchなどの標準操作ベンチマーク上でTAGを評価し, クラッタ下での堅牢性を一貫して改善し, ニアミスや不正なオブジェクト実行を減らす。
論文 参考訳(メタデータ) (2026-03-25T17:56:32Z) - When Contextual Inference Fails: Cancelability in Interactive Instruction Following [51.2195840589474]
私たちは、コンテキスト意味構築のためのインタラクティブなベンチマークであるBuild What I Meanを紹介します。
BWIMでは、モデルは文脈推論を行うか、小さな通信コストで明確化を要求することによって曖昧さを解決しなければならない。
我々は,不確実性の下でのパートナーブラインド過度明確化や質問逆推定などの準最適戦略を観察する。
論文 参考訳(メタデータ) (2026-03-20T14:46:59Z) - A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness [57.510025257780306]
既存の検証プロトコルは、レッドチーム固有の分散シフトを考慮できないことを示す。
我々は、より一貫して判断可能な振る舞いのベンチマークであるReliableBenchと、判断失敗を公開するために設計されたデータセットであるJiceStressTestを提案する。
論文 参考訳(メタデータ) (2026-02-04T15:13:35Z) - Drift-Bench: Diagnosing Cooperative Breakdowns in LLM Agents under Input Faults via Multi-Turn Interaction [20.610305266852638]
textbfDrift-Benchは、入力故障下でエージェントの実用性を評価する最初の診断ベンチマークである。
方法ブリッジは、安全でない実行に繋がる障害の体系的な診断を可能にする、明確化研究とエージェントの安全性評価を橋渡しする。
論文 参考訳(メタデータ) (2026-02-02T18:46:16Z) - Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation [76.5533899503582]
大規模言語モデル(LLM)は、エージェントのパフォーマンスを評価するために、ますます裁判官として使われている。
このパラダイムは、エージェントのチェーン・オブ・シークレット(CoT)推論が内部の推論と環境状態の両方を忠実に反映していることを暗黙的に仮定している。
我々は、操作された推論だけで、様々なWebタスクにまたがる800の軌跡に対して、最先端のVLM審査員の偽陽性率を最大90%向上させることができることを実証した。
論文 参考訳(メタデータ) (2026-01-21T06:07:43Z) - The Stability Trap: Evaluating the Reliability of LLM-Based Instruction Adherence Auditing [1.5954459915735735]
アプリケーション・アンダー・テスト(AUT)の指示型は、判断評価の安定性にどの程度影響しますか?
Scoped Instruction Decomposition Frameworkを導入し、AUT命令を客観型と主観型に分類し、判断の不安定性を誘導する要因を分離する。
以上の結果から,検証安定性と推論安定性の相違を特徴とする安定性トラップ'が明らかになった。
論文 参考訳(メタデータ) (2026-01-16T21:15:13Z) - Evaluating Language Model Reasoning about Confidential Information [95.64687778185703]
言語モデルが文脈的堅牢性を示すか、文脈依存型安全仕様に準拠する能力を示すかを検討する。
我々は,ユーザ要求がいつ承認されたか,言語モデルが正しく判断できるかどうかを測定するベンチマーク(PasswordEval)を開発した。
現在のオープンソースとクローズドソースのモデルでは、一見単純な作業に苦労しています。
論文 参考訳(メタデータ) (2025-08-27T15:39:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。