論文の概要: Discovering Agentic Safety Specifications from 1-Bit Danger Signals
- arxiv url: http://arxiv.org/abs/2604.23210v1
- Date: Sat, 25 Apr 2026 08:35:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-28 17:12:07.209531
- Title: Discovering Agentic Safety Specifications from 1-Bit Danger Signals
- Title(参考訳): 1ビット危険信号からのエージェント安全仕様の発見
- Abstract要約: EPO-Safeは、エージェントが反復的にアクションプランを生成し、スパースバイナリ警告を受け取り、リフレクションを通じて自然言語の振る舞い仕様を進化させるフレームワークである。
EPO-Safeは、構造化された低次元環境において、厳格に貧弱な信号から安全推論を行うことができることを示す。
標準的な報酬駆動リフレクションは安全性を積極的に低下させ、リフレクションを専用の安全チャンネルと組み合わせなければならないことを示す。
- 参考スコア(独自算出の注目度): 6.599344783327054
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Can large language model agents discover hidden safety objectives through experience alone? We introduce EPO-Safe (Experiential Prompt Optimization for Safe Agents), a framework where an LLM iteratively generates action plans, receives sparse binary danger warnings, and evolves a natural language behavioral specification through reflection. Unlike standard LLM reflection methods that rely on rich textual feedback (e.g., compiler errors or detailed environment responses), EPO-Safe demonstrates that LLMs can perform safety reasoning from a strictly impoverished signal in structured, low-dimensional environments: the agent never observes the hidden performance function $R^*$, only a single bit per timestep indicating that an action was unsafe. We evaluate on five AI Safety Gridworlds (Leike et al., 2017) and five text-based scenario analogs where visible reward $R$ may diverge from $R^*$. EPO-Safe discovers safe behavior within 1-2 rounds (5-15 episodes), producing human-readable specifications with correct explanatory hypotheses about hazards (e.g., "X cells are directionally hazardous: entering from the north is dangerous"). Critically, we show that standard reward-driven reflection actively degrades safety: agents reflecting on reward alone use the loop to justify and accelerate reward hacking, proving that reflection must be paired with a dedicated safety channel to discover hidden constraints. We further evaluate robustness to noisy oracles: even when 50% of non-dangerous steps produce spurious warnings, mean safety performance degrades by only 15% on average, though sensitivity is environment-dependent, as cross-episode reflection naturally filters inconsistent signals. Each evolved specification functions as an auditable set of grounded behavioral rules discovered autonomously through interaction, rather than authored by humans as in Constitutional AI (Bai et al., 2022).
- Abstract(参考訳): 大規模言語モデルエージェントは経験だけで隠れた安全目標を発見できるのか?
EPO-Safe(Experiential Prompt Optimization for Safe Agents)は、LLMが反復的に行動計画を生成し、疎二項警告を受信し、リフレクションを通じて自然言語の行動仕様を進化させるフレームワークである。
リッチテキストフィードバック(例えば、コンパイラエラーや詳細な環境応答)に依存する標準的なLLMリフレクションメソッドとは異なり、EPO-Safeは、LLMが構造化された低次元環境において厳格に貧弱な信号から安全推論を行うことができることを示した。
我々は5つのAI Safety Gridworlds(Leike et al , 2017)と5つのテキストベースのシナリオアナロジーで、可視報酬$R$は$R^*$から分岐する可能性がある。
EPO-Safeは1-2ラウンド(5〜15回)で安全な行動を発見し、危険についての正しい説明的仮説を持つ人間可読仕様を生成する(例えば、「X細胞は方向的に危険であり、北から入ることは危険である」)。
報酬のみを反映するエージェントは、ループを使って報酬のハッキングを正当化し、加速し、リフレクションが隠された制約を発見するために専用の安全チャンネルと組み合わせなければならないことを証明します。
非危険なステップの50%が急激な警告を発生しても、感度は環境に依存しているものの、安全性能は平均で15%低下する。
それぞれの仕様は、立憲AI(Bai et al , 2022)のように人間によって書かれたのではなく、相互作用を通じて自律的に発見された、監査可能な基礎的な行動規則のセットとして機能する。
関連論文リスト
- From Detection to Refusal: Safer LLMs via Circuit-Guided Weight Scaling [23.223636694641502]
大規模言語モデル(LLM)は、敵対的プロンプトの下で安全でないコンテンツを生成するのに脆弱である。
機械的解釈可能性の観点から安全性を研究し、多段*安全回路を特徴付ける*
我々は、上流のハーモフル検出ヘッドの抑制が下流の拒絶動作を妨害し、安全ニューロンがこの相互作用を媒介することを示した。
論文 参考訳(メタデータ) (2026-08-30T08:01:42Z) - AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming [21.12573593471532]
既存の安全アプローチは基本的なトレードオフに直面している。
本稿では,ユーザセーフ/アンセーフアノテーションから専門家が指導する安全ルールを自動生成するフレームワークであるAutoSpecを紹介する。
コード実行とエンボディエージェントドメインにまたがる291の実行トレース上でAutoSpecを評価する。
論文 参考訳(メタデータ) (2026-06-23T07:31:03Z) - AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent [53.82005364479556]
大規模言語モデル(LLM)に基づく符号化エージェントは、驚くべき自律性を示す。
既存の安全機構は主に外部ガードレールに依存している。
我々は,ランタイムの安全性検出と表現レベルの緩和を行う,ホワイトボックスの防御フレームワークであるAgentLensを提案する。
論文 参考訳(メタデータ) (2026-06-21T21:13:55Z) - SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling [12.768157540795707]
リスク推定を直接検証プロセスに統合する投機的推論フレームワークであるSafeSpecを提案する。
複数のモデルと反対ベンチマークを通じて、SafeSpecは安全性と効率のトレードオフを大幅に改善した。
Qwen3-32Bでは、SafeSpecは攻撃成功率を15%削減し、良質なワークロード上で2.06倍の推論速度を維持する。
論文 参考訳(メタデータ) (2026-06-18T03:35:32Z) - CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents [27.35968236632966]
LLMベースのコードインタプリタエージェントは、ますます重要な状況にデプロイされている。
既存のベンチマークでは、動的コード実行、ツールインタラクション、マルチターンコンテキストから生じるセキュリティリスクをキャプチャできない。
動的アタック生成、分離されたセキュアサンドボックス、状態認識評価を組み合わせた自動ベンチマークであるCIBERを紹介する。
論文 参考訳(メタデータ) (2026-02-23T06:41:41Z) - RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z) - Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models [58.17589701432514]
Think-Reflect-Revise (TRR)は、LVLM(Large Vision Language Models)の安全性向上を目的としたトレーニングフレームワークである。
まず、リフレクティブセーフティ推論(ReSafe)データセットを5000の例で構築し、シンク・リフレクティブ・リフレクティブ・プロセスに従っています。
次に、ReSafeデータセットを用いてターゲットモデルを微調整し、反射行動の初期化を行い、最後に強化学習を通じてポリシー誘導反射を強化する。
論文 参考訳(メタデータ) (2025-12-08T03:46:03Z) - ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning [64.32925552574115]
ARMORは、jailbreak戦略を分析し、コアインテントを抽出する、大規模な言語モデルである。
ARMORは最先端の安全性能を達成し、平均有害率は0.002であり、高度な最適化ベースのジェイルブレイクに対する攻撃成功率は0.06である。
論文 参考訳(メタデータ) (2025-07-14T09:05:54Z) - Fine-Tuning Lowers Safety and Disrupts Evaluation Consistency [17.57889200051214]
特定のドメインやタスクに対して汎用的な大規模言語モデル(LLM)を微調整することは,一般ユーザにとって日常的な手順となっている。
我々は、これを「攻撃」の良質な性質と相まって、微調整の広汎な取り込みによるLCMの臨界故障モードとみなす。
本実験では, 微調整装置に不連続な変化が生じても, 安全性評価の結果に驚くほどのばらつきが認められた。
論文 参考訳(メタデータ) (2025-06-20T17:57:12Z) - AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions [64.85086226439954]
本稿では,有害な指示に対するVLMエージェントの安全性を評価するためのベンチマークであるSAFEを提案する。
SAFEは、SAFE−THOR、SAFE−VERSE、SAFE−DIAGNOSEの3つの成分からなる。
我々は、ハザード認識を安全な計画と実行に翻訳する体系的な失敗を明らかにする。
論文 参考訳(メタデータ) (2025-06-17T16:37:35Z) - Shape it Up! Restoring LLM Safety during Finetuning [65.75757313781104]
大型言語モデル(LLM)の微調整は、ユーザ固有のカスタマイズを可能にするが、重大な安全性リスクをもたらす。
動的安全整形(DSS)は,不安全コンテンツを抑えつつ,応答の安全な部分からの学習を強化するための,きめ細かい安全信号を用いたフレームワークである。
STARスコアによって導かれるSTAR-DSSは、微調整リスクを堅牢に軽減し、多様な脅威、データセット、モデルファミリーにまたがる大幅な安全性の向上を提供する。
論文 参考訳(メタデータ) (2025-05-22T18:05:16Z) - SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents [58.65256663334316]
我々は,対話型シミュレーション環境におけるLLMエージェントの安全性を考慮したタスク計画のための最初のベンチマークであるSafeAgentBenchを紹介する。
SafeAgentBenchは、(1)10の潜在的な危険と3つのタスクタイプをカバーするために厳格にキュレートされた750のタスクの実行可能な多種多様な高品質データセット、(2)低レベルコントローラを備えた普遍的な実施環境、9つの最先端ベースラインに対して17のハイレベルアクションでマルチエージェント実行をサポートするSafeAgentEnv、(3)実行とセマンティックの両方の観点から信頼性の高い評価方法を含む。
論文 参考訳(メタデータ) (2024-12-17T18:55:58Z) - BEEAR: Embedding-based Adversarial Removal of Safety Backdoors in Instruction-tuned Language Models [57.5404308854535]
大型言語モデル(LLM)における安全バックドア攻撃は、正常な相互作用中の検出を回避しながら、安全でない振る舞いをステルス的に引き起こすことができる。
モデル埋め込み空間において,バックドアトリガーが比較的均一なドリフトを引き起こすという知見を活かした緩和手法であるBEEARを提案する。
両レベル最適化手法は、不要な振る舞いを誘発する普遍的な埋め込み摂動を特定し、モデルパラメータを調整し、これらの摂動に対する安全な振舞いを強化する。
論文 参考訳(メタデータ) (2024-06-24T19:29:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。