論文の概要: SEABench: Benchmarking Endogenous Misalignment In Self-Evolving Agents
- arxiv url: http://arxiv.org/abs/2609.35596v1
- Date: Mon, 28 Sep 2026 16:46:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:26.075763
- Title: SEABench: Benchmarking Endogenous Misalignment In Self-Evolving Agents
- Title(参考訳): SEABench: 自己進化エージェントにおける内因性障害のベンチマーク
- Abstract要約: 自己進化型LDMエージェントは、ハーネスを変更することで、デプロイ後に改善する能力で有名になった。
SEABenchは、エージェントの自己進化から生じる内因性不整合を研究するためのベンチマークである。
自己進化はタスク完了率を高めるが、安全上の失敗の犠牲になることが多い。
- 参考スコア(独自算出の注目度): 49.54988737892722
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Self-evolving LLM agents have gained prominence for their ability to improve after deployment by modifying their harness, including their controller instructions, memory management protocols, and reusable tools and skills, in response to user and environment feedback. However, locally useful updates may persist into later tasks where they produce unsafe behavior, even without direct adversarial influence. To study this risk, we introduce SEABench, a benchmark for studying endogenous misalignment arising from agent self-evolution, with 48 longitudinal task sequences that span multiple evolution surfaces, task domains, and harm types in a rich personal-assistant environment. To account for the stochasticity inherent in agentic operations, we provide an adaptive trajectory discovery pipeline that probes for failures while preserving original task intent and supports causal attribution through paired non-evolving agents and attribution scores. Our evaluation across multiple recent LLMs, evolution surfaces, and harm types reveals that self-evolution indeed increases task completion rates but often at the cost of safety failures that are absent for paired non-evolving baseline agents. We also show that qualitatively different safety behaviors emerge across evolution surfaces and harm types. Further, we show that this divergence in safety behavior is reflected in agents' chain-of-thought reasoning, which yields an effective monitoring strategy that can mitigate unsafe behavior with a low false positive rate.
- Abstract(参考訳): 自己進化型LDMエージェントは、ユーザや環境からのフィードバックに応じて、コントローラ命令、メモリ管理プロトコル、再利用可能なツールやスキルを含むハーネスを変更することで、デプロイ後に改善する能力で有名になった。
しかし、ローカルに有用な更新は、直接の敵対的影響がなくても、安全でない振る舞いを生じる、後のタスクに持続する可能性がある。
このリスクを研究するために,エージェントの自己進化から生じる内因性不整合(内因性不整合)を研究するためのベンチマークSEABenchを紹介した。
エージェント操作に固有の確率性を考慮するため,元のタスク意図を保ちながら障害を探索する適応的軌道探索パイプラインを提供し,ペア化された非進化エージェントと帰属スコアによる因果帰属を支援する。
近年の複数のLCM, 進化面, 害タイプによる評価から, 自己進化はタスク完了率を増大させるが, ペアの非進化型ベースラインエージェントに欠落する安全障害のコストがかかることが判明した。
また、進化の表面や害の種類によって、質的に異なる安全性の挙動が現れることも示している。
さらに、この安全性行動のばらつきは、エージェントのチェーン・オブ・シント推論に反映され、偽陽性率の低い安全行動を軽減する効果的な監視戦略がもたらされることを示す。
関連論文リスト
- SHE: Trajectory-driven Safety Harness Evolution for LLM Agents [63.74895225415523]
既存の安全メカニズムは、ハーネスを固定されたデプロイメントアーティファクトとして扱い、新興リスクで進化する能力を制限する。
我々は、ロールアウト軌道から安全な境界を進化させるフレームワークであるSafety Harness Evolutionを提案する。
Agent-SafetyBenchの実験では、SHEはハーネスの進化を通じて安全性を効果的に向上し、静的なSafeHarnessと比較して3.1倍のASR削減を実現している。
論文 参考訳(メタデータ) (2026-08-10T17:35:08Z) - Towards Healthy Evolution: Exploring the Role and Mechanisms of Human-Agent Interaction in Self-Evolving Systems [30.399085963137836]
自己進化エージェントは、連続的な自己再生と自己生成学習信号によって改善される。
Human-like Oversight and Review (ANCHOR)は、人間の監督をシミュレートし、自己進化のさまざまなフェーズでフィードバックを提供する。
論文 参考訳(メタデータ) (2026-06-04T13:03:16Z) - On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment [54.30690671490447]
既存の安全アライメント信号は、主に応答レベルまたは政治外である。
FATEは、検証済みの失敗を専門家のデモンストレーションなしで修復管理に変換する。
FATEは攻撃成功率を33.5%、有害なコンプライアンスを82.6%削減し、外的軌道安全診断を6.5%改善する。
論文 参考訳(メタデータ) (2026-05-12T09:56:28Z) - On Safety Risks in Experience-Driven Self-Evolving Agents [78.82066774532676]
本研究では, 自己進化型エージェントの蓄積と利用が, Web ベースおよび実施環境における安全性能に与える影響について検討する。
本研究は,現在の自己進化剤の限界を明らかにするとともに,安全で信頼性の高い適応を確実にするための,より原則化された戦略を求めるものである。
論文 参考訳(メタデータ) (2026-04-18T11:32:36Z) - NAAMSE: Framework for Evolutionary Security Evaluation of Agents [1.0131895986034316]
我々は,エージェントのセキュリティ評価をフィードバック駆動最適化問題として再編成する進化的フレームワークであるNAAMSEを提案する。
本システムでは,遺伝子プロンプト変異,階層的コーパス探索,非対称的行動スコアリングのライフサイクルを編成する単一自律エージェントを用いている。
Gemini 2.5 Flashの実験では、進化的突然変異がワンショットメソッドによって欠落した脆弱性を体系的に増幅することを示した。
論文 参考訳(メタデータ) (2026-02-07T06:13:02Z) - Your Agent May Misevolve: Emergent Risks in Self-evolving LLM Agents [58.69865074060139]
エージェントの自己進化が意図しない方法で逸脱し、望ましくない結果や有害な結果に至る場合について検討する。
我々の経験から、誤進化は広範囲にわたるリスクであり、最上位のLSM上に構築されたエージェントにも影響を及ぼすことが判明した。
我々は、より安全で信頼性の高い自己進化型エージェントを構築するためのさらなる研究を促すための潜在的な緩和戦略について議論する。
論文 参考訳(メタデータ) (2025-09-30T14:55:55Z) - Agent Alignment in Evolving Social Norms [65.45423591744434]
本稿では,エージェント進化とアライメントのための進化的フレームワークであるEvolutionaryAgentを提案する。
社会規範が継続的に進化する環境では、エージェントは現在の社会規範に適応し、生存と増殖の確率が高くなる。
進化的エージェントは、一般的なタスクにおいてその能力を維持しながら、進化する社会規範と徐々に整合できることを示す。
論文 参考訳(メタデータ) (2024-01-09T15:44:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。