論文の概要: SCOUT: Synergizing Reasoning and Tool-Use for Computer-Use Safety
- arxiv url: http://arxiv.org/abs/2609.36201v1
- Date: Mon, 28 Sep 2026 20:01:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:46.991432
- Title: SCOUT: Synergizing Reasoning and Tool-Use for Computer-Use Safety
- Title(参考訳): SCOUT: コンピュータ・ユース・セーフのためのシンセサイザーとツール・ユース
- Abstract要約: SCOUTは2段階のエージェント安全性検証器で、推論集約型ルーリック生成とツール集約型エビデンス収集を相乗化している。
AutoElicit-Benchでは、SCOUTは75.4の安全でないF1と74.5の補完F1を達成する。
- 参考スコア(独自算出の注目度): 15.044790213451774
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Computer-use agents (CUAs), while capable of completing computer tasks in everyday and professional workflows, can cause unintended harm even under benign instructions and environments. However, detecting such harm remains challenging. First, it requires careful, task-specific reasoning: verifiers guided only by general safety criteria often overlook many important but subtle harmful behaviors. Second, it requires active investigation: past trajectory screenshots show what the agent did but not always what actually changed in the environment, so LLM-as-a-judge verifiers that rely on screenshots alone may be unable to determine the actual consequences of actions. To address these challenges, we introduce SCOUT, a two-stage agentic safety verifier that synergizes reasoning-intensive rubric generation with tool-intensive evidence gathering. First, our SCOUT rubric generator extensively reasons over the task and the agent's trajectory to determine what successful and safe execution should entail, generating task-specific completion and safety rubrics. Then, our SCOUT probing agent follows these rubrics to interact with the post-execution environment and collect grounded evidence for final safety and completion judgments. We evaluate our framework on two computer-use safety benchmarks. On AutoElicit-Bench, SCOUT achieves 75.4 unsafe F1 and 74.5 completion F1, outperforming LLM-as-a-judge verifiers and naive tool-use verifiers. SCOUT leads on OS-Blind with 76.4% unsafe detection accuracy. Test-time reflection reduces final unsafe execution rates from 30.2% to 17.2% on AutoElicit-Bench. Ablations and analysis show that tool-free rubric generation in SCOUT elicits substantially more reasoning and is crucial for safety detection across verifier backbones, especially non-frontier ones. A preliminary extension to coding tasks shows that SCOUT can support safety verification beyond computer-use.
- Abstract(参考訳): コンピュータ利用エージェント(CUA)は、日常的および専門的なワークフローでコンピュータタスクを完了できるが、良心的な指示や環境の下でも意図しない害を引き起こす可能性がある。
しかし、そのような危害を検出することは依然として困難である。
まず、注意深いタスク固有の推論が必要である:一般的な安全基準によってのみ導かれる検証者は、多くの重要だが微妙な有害な行動を見落としていることが多い。
第2に、積極的な調査が必要である:過去の軌跡のスクリーンショットは、エージェントが何をしたかを示すが、環境の中で実際に何が変わったかは常には示さないので、スクリーンショットのみに依存するLCM-as-a-judge検証は、アクションの実際の結果を決定することができないかもしれない。
これらの課題に対処するために、ツール集約的な証拠収集と推論集約的なルーリック生成を相乗化する2段階のエージェント安全検証器SCOUTを導入する。
まず、SCOUTルーリックジェネレータは、タスクとエージェントの軌道に対して広範囲の理由から、成功と安全な実行に何が必要かを判断し、タスク固有の完了と安全ルーリックを生成する。
そして, SCOUT調査エージェントは, 作業後の環境と相互作用し, 最終安全性と完了判定の根拠となる証拠を収集する。
2つのコンピュータ使用安全性ベンチマークにおいて,本フレームワークの評価を行った。
AutoElicit-Benchでは、SCOUTは75.4の安全でないF1と74.5の補完F1を達成する。
SCOUTはOS-Blindを76.4%の安全でない検出精度でリードしている。
テスト時間リフレクションは、AutoElicit-Bench上での最終的な安全でない実行率を30.2%から17.2%に削減する。
SCOUTにおけるツールフリーのルーブリック生成は、より推論しやすく、検証されたバックボーン、特に非フロンティアの安全性検出に不可欠であることを示している。
コーディングタスクの予備的な拡張は、SCOUTがコンピュータ利用以外の安全性検証をサポートすることを示している。
関連論文リスト
- ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection [61.4148196085256]
本稿では,信頼という構造概念に根ざしたROPE(Routed Origin Policy Enforcement)について述べる。
提案手法では,(1)軌道の各段階において,攻撃可能コンテンツのみを起点とする値が,原点保護パラメータに到達しない,(2)注入のリワードがない,という2つの保証が認められている。
論文 参考訳(メタデータ) (2026-08-27T01:22:14Z) - OSGuard: A Benchmark for Safety in Computer-Use Agents [12.395093977641581]
OSGuard(OSGuard)は、コンピュータ使用エージェントの安全性を評価するベンチマークスイートである。
OSGuardには、ローカルガードレール決定のためのアクションレベルベンチマークと、エンドツーエンド評価のためのリスク強化実行スイートが含まれている。
論文 参考訳(メタデータ) (2026-06-13T00:32:24Z) - Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines [24.766671285910935]
コーディングエージェントはますますシステムオペレーションに統合されている。
これにより、セキュリティテストがシステムの問題になる。
この実行層セキュリティ境界を探索するための、実行地上のレッドチームテストフレームワークを提案する。
論文 参考訳(メタデータ) (2026-06-01T04:20:25Z) - What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants [4.032084095153604]
私たちは、22のプレミア会場から68,816の論文、安全関連の研究185のキュレーション、広くデプロイされたコーディングツールから16,586のGitHubイシューを検査しました。
両コーパスを体系的にオープンコーディングすることで、33種類の運用リスクの多次元安全分類を導出する。
以上の結果から,コーディングエージェント障害は重篤で,547件中326件が重篤であった。
論文 参考訳(メタデータ) (2026-05-29T03:09:37Z) - The Causal Impact of Tool Affordance on Safety Alignment in LLM Agents [0.3823356975862005]
本研究は,大規模言語モデル(LLM)の安全アライメントがいかに変化するかを実証的に検証する。
決定論的金融取引環境において、1500シナリオにわたる二元的安全制約を伴う実験を行う。
どちらのモデルも、テキストのみの設定では完全なコンプライアンスを維持しているが、ツールアクセスが導入されると、違反が大幅に増加する。
論文 参考訳(メタデータ) (2026-03-19T23:34:46Z) - Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety [32.40159096400358]
大規模言語モデル(LLM)エージェントは、テキスト生成のみではなく、ツールコールに安全を集中させる外部ツールを通じて、ますます機能するようになっている。
最近のベンチマークでは、さまざまな環境やリスクカテゴリにまたがるエージェントを評価しているが、根本的な疑問は解決されていない。
まず、有効なツールコールと多様なユーザシナリオを列挙して、テストケースを体系的に生成する列挙子。次に、非セマンティックで定量的な尺度であるルール耐性を導入する。
論文 参考訳(メタデータ) (2026-03-18T20:06:47Z) - DRAFT: Task Decoupled Latent Reasoning for Agent Safety [59.46137757545185]
DRAFT(Task Decoupled Latent Reasoning for Agent Safety)を提案する。
エクストラクターは、完全な軌跡をコンパクトな連続的な潜伏ドラフトに蒸留し、リゾナーはドラフトと元の軌跡に共同で参加して安全性を予測する。
DRAFTの精度は63.27%(LoRA)から91.18%に向上した。
論文 参考訳(メタデータ) (2026-02-11T07:45:14Z) - ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack [52.17935054046577]
本稿では、間接的インジェクション攻撃に対する安全性アライメントを改善するためのモデルレベルのソリューションであるReasAlignを提案する。
ReasAlignには、ユーザクエリの分析、競合する命令の検出、ユーザの意図したタスクの継続性を維持するための構造化された推論ステップが組み込まれている。
論文 参考訳(メタデータ) (2026-01-15T08:23:38Z) - RoboSafe: Safeguarding Embodied Agents via Executable Safety Logic [56.38397499463889]
視覚言語モデル(VLM)を利用するエージェントは、複雑な現実世界のタスクを実行する能力がますます高まっている。
しかし、安全でない行動を引き起こす可能性のある危険な指示に弱いままである。
提案するRoboSafeは,実行可能述語ベースの安全ロジックを通じて,エージェントを具体化するためのランタイムセーフガードである。
論文 参考訳(メタデータ) (2025-12-24T15:01:26Z) - OS-Harm: A Benchmark for Measuring Safety of Computer Use Agents [60.78202583483591]
コンピュータ使用エージェントの安全性を計測する新しいベンチマークであるOS-Harmを紹介する。
OS-HarmはOSWorld環境上に構築されており、故意のユーザ誤用、インジェクション攻撃、モデル誤動作の3つのカテゴリでモデルをテストすることを目指している。
我々は、フロンティアモデルに基づいてコンピュータ利用エージェントを評価し、その安全性に関する洞察を提供する。
論文 参考訳(メタデータ) (2025-06-17T17:59:31Z) - SafeAgentBench: A Benchmark for Safe Task Planning of Embodied LLM Agents [58.65256663334316]
我々は,対話型シミュレーション環境におけるLLMエージェントの安全性を考慮したタスク計画のための最初のベンチマークであるSafeAgentBenchを紹介する。
SafeAgentBenchは、(1)10の潜在的な危険と3つのタスクタイプをカバーするために厳格にキュレートされた750のタスクの実行可能な多種多様な高品質データセット、(2)低レベルコントローラを備えた普遍的な実施環境、9つの最先端ベースラインに対して17のハイレベルアクションでマルチエージェント実行をサポートするSafeAgentEnv、(3)実行とセマンティックの両方の観点から信頼性の高い評価方法を含む。
論文 参考訳(メタデータ) (2024-12-17T18:55:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。