論文の概要: TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling
- arxiv url: http://arxiv.org/abs/2605.27690v1
- Date: Tue, 26 May 2026 21:11:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-28 17:38:55.52419
- Title: TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling
- Title(参考訳): TRACES:軌道状態モデリングによる多軸LLMエージェントの積極的な安全監査
- Authors: Jiaqian Li, Yanshu Li, Boxuan Zhang, Ruixiang Tang, Kuan-Hao Huang,
- Abstract要約: LLMエージェントは、マルチターンツールの使用と環境相互作用によってますます運用される。
ホック後の診断は、しばしば、展開中にリスクをフラグする機会を逃す。
表現に基づくプロアクティブオーディエンスであるTRACESを提案する。
- 参考スコア(独自算出の注目度): 18.58206519209223
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: LLM agents increasingly operate through multi-turn tool use and environment interaction, where safety risks often emerge from intermediate steps long before they surface in the final outcome. Reactive auditing is therefore insufficient: post-hoc diagnosis frequently misses the chance to flag risks while they are unfolding. We propose TRACES, a representation-based proactive auditor that learns prefix-level trajectory risk states from the hidden representations of an observer LLM. TRACES induces latent mechanism features from step representations and models their temporal evolution to estimate whether a partial trajectory is drifting toward unsafe behavior. To sidestep the cost and ambiguity of step-level risk annotation, TRACES is trained with weak trajectory-level supervision while still producing dense prefix-level risk estimates. Across multiple agent safety benchmarks, TRACES improves both full-trajectory safety prediction and proactive risk discrimination. Our analyses further suggest that these risk states can help train a safer agent, highlighting the broader potential of proactive auditing for long-horizon agent safety.
- Abstract(参考訳): LLMエージェントは多ターンツールの使用や環境相互作用を通じてますます運用されるようになり、最終結果が出るずっと前に、安全リスクが中間段階から出現することが多い。
したがって、反応監査は不十分であり、ポストホック診断はしばしば、展開中にリスクを通知する機会を逃す。
LLMの隠れ表現からプレフィックスレベルの軌道危険状態を学習する表現に基づくプロアクティブ監査器TRACESを提案する。
TRACESは、ステップ表現から潜伏機構の特徴を誘導し、その時間的進化をモデル化し、部分軌道が安全でない振る舞いに向かって漂っているかどうかを推定する。
歩数レベルのリスクアノテーションのコストとあいまいさを横取りするために、TRACESは厳密なプレフィックスレベルのリスク見積を生成しながら、トラジェクトリレベルの弱い監督で訓練されている。
複数のエージェント安全性ベンチマークを通じて、TRACESは完全な軌道安全予測と積極的なリスク識別の両方を改善している。
さらに,これらのリスク状態が安全エージェントのトレーニングに役立つことを示唆し,長期エージェントの安全性に対する積極的な監査の可能性を強調した。
関連論文リスト
- Enhancing Agent Safety Judgment: Controlled Benchmark Rewriting and Analogical Reasoning for Deceptive Out-of-Distribution Scenarios [0.2578242050187029]
ROMEは、既知の安全でないトラジェクトリを偽評価インスタンスに書き換える、制御されたベンチマーク構築パイプラインである。
ARISEは、外部アナログベースからReActスタイルのアナログ安全軌道を抽出し、それらを構造化推論例として注入する検索誘導推論時間拡張である。
論文 参考訳(メタデータ) (2026-05-05T00:21:00Z) - DRAFT: Task Decoupled Latent Reasoning for Agent Safety [59.46137757545185]
DRAFT(Task Decoupled Latent Reasoning for Agent Safety)を提案する。
エクストラクターは、完全な軌跡をコンパクトな連続的な潜伏ドラフトに蒸留し、リゾナーはドラフトと元の軌跡に共同で参加して安全性を予測する。
DRAFTの精度は63.27%(LoRA)から91.18%に向上した。
論文 参考訳(メタデータ) (2026-02-11T07:45:14Z) - SafePred: A Predictive Guardrail for Computer-Using Agents via World Models [12.569157125705052]
本稿では,複雑な実環境におけるコンピュータ利用エージェント(CUA)の予測ガードレールフレームワークであるSafePredを紹介する。
このアプローチに基づいて,安全なエージェント動作を確保するためのリスク・ツー・意思決定ループを確立するSafePredを提案する。
大規模な実験の結果、SafePredはリスクの高い振る舞いを著しく減らし、97.6%以上の安全性能を達成し、リアクティブベースラインと比較してタスクユーティリティを最大21.4%改善した。
論文 参考訳(メタデータ) (2026-02-02T07:04:06Z) - ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback [53.2744585868162]
エージェントのデプロイには、ステップレベルのツールの実行動作をリアルタイムで監視することが不可欠だ。
LLMエージェントにおけるステップレベルツール起動安全検出のための新しいベンチマークであるTS-Benchを構築した。
次に,マルチタスク強化学習を用いたガードレールモデルTS-Guardを開発した。
論文 参考訳(メタデータ) (2026-01-15T07:54:32Z) - Anchoring Refusal Direction: Mitigating Safety Risks in Tuning via Projection Constraint [52.878820730054365]
インストラクションファインチューニング(IFT)は,大規模言語モデル(LLM)の能力向上のための効果的なポストトレーニング戦略として広く採用されている。
LLMの内部機構に関する最近の研究は、隠蔽状態における拒絶方向(r方向)を同定し、拒絶行動の制御において重要な役割を担っている。
このようなドリフトを緩和するため,提案手法では,各トレーニングサンプルの隠れ状態のr方向への投射の大きさを規則化する投射制約損失項を導入する。
論文 参考訳(メタデータ) (2025-09-08T15:24:33Z) - LM Agents May Fail to Act on Their Own Risk Knowledge [15.60032437959883]
言語モデル(LM)エージェントは、安全クリティカルなシナリオにおいて、様々な潜在的な、深刻なリスクをもたらす。
Sudo rm -rf /*' が危険なのか?」といった質問に対して "Yes" と答えることが多いが、インスタンス化された軌跡におけるそのようなリスクを特定できない可能性が高い。
論文 参考訳(メタデータ) (2025-08-19T02:46:08Z) - AGENTSAFE: Benchmarking the Safety of Embodied Agents on Hazardous Instructions [64.85086226439954]
本稿では,有害な指示に対するVLMエージェントの安全性を評価するためのベンチマークであるSAFEを提案する。
SAFEは、SAFE−THOR、SAFE−VERSE、SAFE−DIAGNOSEの3つの成分からなる。
我々は、ハザード認識を安全な計画と実行に翻訳する体系的な失敗を明らかにする。
論文 参考訳(メタデータ) (2025-06-17T16:37:35Z) - AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents [48.925168866726814]
AgentAuditorは、トレーニングなし、メモリ拡張推論フレームワークである。
ASSEBenchは、LLMベースの評価器が安全リスクとセキュリティ上の脅威の両方を見つけることができるかを確認するために設計された最初のベンチマークである。
論文 参考訳(メタデータ) (2025-05-31T17:10:23Z) - AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection [47.83354878065321]
我々は,エージェントの安全性を高めるため,生涯のガードレールであるAGrailを提案する。
AGrailは適応型安全チェック生成、効果的な安全チェック最適化、ツールの互換性と柔軟性を備えている。
論文 参考訳(メタデータ) (2025-02-17T05:12:33Z) - Preemptive Detection and Correction of Misaligned Actions in LLM Agents [58.39520480675366]
InferActは、実行前に不整合アクションを検出する新しいアプローチである。
タイムリーな修正をユーザーに警告し、有害な結果を防ぐ。
InferActは、ミスアライメントされたアクション検出におけるベースラインに対するMarco-F1の最大20%の改善を実現している。
論文 参考訳(メタデータ) (2024-07-16T15:24:44Z) - SMARLA: A Safety Monitoring Approach for Deep Reinforcement Learning Agents [7.33319373357049]
本稿では,Deep Reinforcement Learning (DRL)エージェント用に特別に設計されたブラックボックス安全監視手法SMARLAを紹介する。
SMARLAは機械学習を利用して、実行中のエージェントの動作を観察し、安全違反を予測する。
実験の結果、SMARLAは偽陽性率の低い安全違反を予測するのに正確であり、違反が起こる前にエージェントの実行の途中で早期に違反を予測することができることが明らかになった。
論文 参考訳(メタデータ) (2023-08-03T21:08:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。