論文の概要: SafeCoEvo: Co-Evolving Safety Harnesses and Guards for LLM Agents at Test-Time
- arxiv url: http://arxiv.org/abs/2609.36580v2
- Date: Fri, 02 Oct 2026 14:10:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-06 00:14:29.945666
- Title: SafeCoEvo: Co-Evolving Safety Harnesses and Guards for LLM Agents at Test-Time
- Title(参考訳): SafeCoEvo: LLMエージェントのテスト時間における安全性のハーネスとガードの共進化
- Abstract要約: 既存の自己進化的アプローチは、固定および繰り返しアクセス可能なタスク分布よりも、複数のラウンドの最適化に依存している。
LLMエージェント安全性のためのテスト時Harness-Guard共進化フレームワークであるSafeCoEvoを提案する。
短期的迅速な適応と長期的能力強化を組み合わせることで、SafeCoEvoはエージェントの安全性を継続的に改善し、安全でない結果率を10.05%削減し、最強のベースラインに対してタスク成功率を12.15%改善する。
- 参考スコア(独自算出の注目度): 34.263634180441
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLM agents deployed in real-world environments continually encounter new tasks and safety risks, while execution feedback typically becomes available only after each task is completed. However, existing self-evolving approaches commonly rely on multiple rounds of optimization over fixed and repeatedly accessible task distributions, fundamentally differing from test-time adaptation in real-world deployment, where only experience accumulated from past tasks can be used to improve safety decisions on future unseen tasks. To address this limitation, we propose SafeCoEvo, a test-time Harness-Guard co-evolution framework for LLM agent safety that enables the external safety system to continually adapt from accumulated runtime experience. SafeCoEvo jointly improves two complementary safety capabilities at different timescales: S-Harness rapidly externalizes recent runtime experience into updatable explicit safety knowledge that can promptly influence subsequent tasks, while GuardVPO internalizes accumulated runtime safety experience over a longer timescale into parametric risk-judgment capabilities. By combining short-term rapid adaptation with long-term capability consolidation, SafeCoEvo continually improves the agent's safety capabilities, reducing the unsafe outcome rate by 10.05% while improving the task success rate by 12.15% over the strongest baseline, thereby achieving simultaneous gains in safety and task utility.
- Abstract(参考訳): 現実の環境に展開されるLLMエージェントは、新しいタスクや安全リスクに絶えず遭遇する一方、実行フィードバックは通常、各タスクが完了した後にのみ利用可能になる。
しかし、既存の自己進化的アプローチは、固定的および繰り返しアクセス可能なタスクの配布よりも、複数のラウンドの最適化に依存しており、基本的には、過去のタスクから蓄積した経験だけが、将来の目に見えないタスクの安全性決定を改善するために使用できる、実世界のデプロイメントにおけるテスト時適応と異なる。
この制限に対処するため,テストタイムのHarness-Guard共進化フレームワークであるSafeCoEvoを提案する。
SafeCoEvoは2つの補完的安全性機能を異なる時間スケールで共同で改善している。 S-Harnessは、最近の実行時の経験を迅速に外部化し、後続のタスクに迅速に影響を及ぼすことのできる、最新の明示的な安全知識へと外部化し、GuardianVPOは、より長い時間スケールで蓄積された実行時の安全性エクスペリエンスをパラメトリックリスク判断能力に内部化する。
短期的迅速な適応と長期的能力強化を組み合わせることで、SafeCoEvoはエージェントの安全性を継続的に改善し、安全でない結果率を10.05%削減し、最強のベースライン上でタスク成功率を12.15%向上させ、安全性とタスクユーティリティの同時向上を実現する。
関連論文リスト
- SafeEvolve: Harness-Policy Co-Evolution from Agent Experience for Safety Alignment [51.263370090136696]
エージェント安全アライメントのための経験駆動型フレームワークであるSafeEvolveを提案する。
我々は、完了したオン・ポリティィ・トラジェクトリから安全経験を活用して、ハーネス・ポリティ共進化の継続ループを駆動する。
Qwen3.5-4B の場合、SafeEvolve は AgentDojo の 3 倍の ASR 削減を実現し、良質なユーティリティを 59.79% から 61.86% に改善した。
論文 参考訳(メタデータ) (2026-09-02T16:19:54Z) - BeSafe-Bench: Unveiling Behavioral Safety Risks of Situated Agents in Functional Environments [22.32760987248309]
本研究では,機能的環境における位置エージェントの行動安全リスクを明らかにするベンチマークであるBeSafe-Bench(BSB)を提案する。
BSBは、Web、Mobile、Embodied VLM、Embodied VLAの4つの代表的なドメインをカバーしている。
機能的環境を用いて、安全クリティカルリスクの9つのカテゴリでタスクを増強し、多様な指導空間を構築する。
論文 参考訳(メタデータ) (2026-01-30T03:41:57Z) - AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning [78.5751183537704]
AdvEvo-MARLは、タスクエージェントに安全性を内部化する、共進化型マルチエージェント強化学習フレームワークである。
外部ガードに頼るのではなく、AdvEvo-MARLは攻撃者と防御者を共同で最適化する。
論文 参考訳(メタデータ) (2025-10-02T02:06:30Z) - Probabilistic Shielding for Safe Reinforcement Learning [51.35559820893218]
現実のシナリオでは、強化学習(RL)エージェントはトレーニング時間を含む安全な振る舞いをしなければならない。
我々は,Safe RLの厳密な保証を享受する,スケーラブルな新しい手法を提案する。
当社のアプローチは、トレーニングやテスト時にエージェントが安全であることを保証する厳格な公式な安全保証を提供する。
論文 参考訳(メタデータ) (2025-03-09T17:54:33Z) - AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection [47.83354878065321]
我々は,エージェントの安全性を高めるため,生涯のガードレールであるAGrailを提案する。
AGrailは適応型安全チェック生成、効果的な安全チェック最適化、ツールの互換性と柔軟性を備えている。
論文 参考訳(メタデータ) (2025-02-17T05:12:33Z) - Tackling Uncertainties in Multi-Agent Reinforcement Learning through Integration of Agent Termination Dynamics [9.263837897126871]
MARL(Multi-Agent Reinforcement Learning)は、複雑な現実世界のタスクを解くために大きな注目を集めている。
これらの環境における本質性と不確実性は、効率的で堅牢な政策学習に重大な課題をもたらす。
本稿では,MARLタスクの収束性を改善するために,分散学習と安全に着目した損失関数を統合した新しい手法を提案する。
論文 参考訳(メタデータ) (2025-01-21T11:31:01Z) - Agent-SafetyBench: Evaluating the Safety of LLM Agents [72.92604341646691]
我々は,大規模言語モデル(LLM)の安全性を評価するベンチマークであるAgent-SafetyBenchを紹介する。
Agent-SafetyBenchは349のインタラクション環境と2,000のテストケースを含み、安全リスクの8つのカテゴリを評価し、安全でないインタラクションで頻繁に発生する10の一般的な障害モードをカバーする。
16 名の LLM エージェントを評価した結果,いずれのエージェントも 60% 以上の安全性スコアを達成できないことがわかった。
論文 参考訳(メタデータ) (2024-12-19T02:35:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。