論文の概要: SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills
- arxiv url: http://arxiv.org/abs/2607.09016v1
- Date: Fri, 10 Jul 2026 00:48:30 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 16:48:13.421983
- Title: SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills
- Title(参考訳): SLBench: LLMエージェントがスキルにおける論理的関係をどのように追跡するかを評価する
- Authors: Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang,
- Abstract要約: 本稿では,スキルファイルの論理的関係を解析するフレームワークであるSkillLogicを紹介する。
SkillLogicを使うことで、5000以上の公開スキルをスキャンし、70%が少なくとも1つの論理的関係を持つことがわかった。
次に、高信頼、高インパクト、局所的なテスト可能な関係から86ケースのベンチマークであるSLBenchを構築する。
- 参考スコア(独自算出の注目度): 15.716453891551057
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent skills extend LLM agents with reusable procedures, tools, and domain-specific workflows, but their safety depends on resolving dependencies among interacting instructions. We introduce SkillLogic, a framework for analyzing logical relations in skill files and constructing executable tests from them. Our taxonomy covers eight relation types, including preconditions that gate valid actions, constraints that limit how allowed actions may be performed, and fallbacks that specify recovery behavior after failure. Using SkillLogic, we scan over 5000 public skills and find that 70% contain at least one logical relation. We then construct SLBench, an 86-case executable benchmark from high-confidence, high-impact, and locally testable relations. Evaluating Codex and Claude Code across six LLM backbones shows unsafe rates up to 70%, with violations leading to privacy leaks, unsafe configuration changes, and incomplete cleanup. The human audit attributes failures to both agent capability gaps and low-salience skill text. We further show that SLGuard, a lightweight inference-time scaffold, reduces violations by 63% on targeted cases. Our results establish logical-relation following as a distinct reliability challenge for skill-guided agents.
- Abstract(参考訳): エージェントスキルは、再利用可能なプロシージャ、ツール、ドメイン固有のワークフローを備えたLLMエージェントを拡張するが、その安全性は相互作用する命令間の依存関係の解決に依存する。
SkillLogicは、スキルファイルの論理的関係を分析し、それらから実行可能なテストを構築するためのフレームワークである。
私たちの分類学は、有効なアクションをゲートする前提条件、許容されたアクションの実行方法を制限する制約、障害後のリカバリ動作を指定するフォールバックを含む8つの関係タイプをカバーしています。
SkillLogicを使うことで、5000以上の公開スキルをスキャンし、70%が少なくとも1つの論理的関係を持つことがわかった。
次に、高信頼、高インパクト、局所的なテスト可能な関係から86ケースのベンチマークであるSLBenchを構築する。
CodexとClaude Codeを6つのLLMバックボーンで評価すると、安全でないレートが最大70%まで向上し、違反によってプライバシリーク、安全でない設定変更、不完全なクリーンアップにつながっている。
人間の監査はエージェント能力ギャップと低可用性のスキルテキストの両方に障害がある。
さらに,軽量な推論時間スキャフォールドであるSLGuardは,対象症例の違反を63%低減することを示した。
以上の結果から, スキルガイドエージェントの信頼性への挑戦として, 論理的関連性を確立した。
関連論文リスト
- SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills [0.0]
我々は、LLM-as-Judgeを使ってエージェントスキルを拒否するHugging Faceのライブ公開リーダーボードであるSKILLVETBENCHを紹介する。
SSARS(スキルエージェントリスクスコア、Skill Agentic Risk Score)は、5次元のエージェントリスク計量であり、命令追従システムに対する原則付き重み付け式である。
論文 参考訳(メタデータ) (2026-06-14T16:30:33Z) - SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing [81.51044612408793]
SkillAuditは、地味なフィードバックなしにエージェントスキルを進化させるフレームワークである。
行動の違いを編集指導に変換するために、SkillAuditはProcess-Aligned Contrastive Evaluationを使用する。
Refineはノイズや無関係なガイダンスを広く有用なスキルから取り除き、修復はタスクと競合するパスを置き換える。
論文 参考訳(メタデータ) (2026-06-12T08:20:09Z) - Behavioral Integrity Verification for AI Agent Skills [9.127363793428119]
我々はこれを行動整合性検証(BIV)問題として定式化する。
OpenClawレジストリの49,943のスキルでは、逸脱分類が広範な記述と実装のギャップを明らかにしている。
906スキルの悪質なスキル検出ベンチマークでは、BIVは0.946のF1に達し、最先端のルールベースとシングルパスのLCMベースラインを上回っている。
論文 参考訳(メタデータ) (2026-05-12T08:41:09Z) - ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback [53.2744585868162]
エージェントのデプロイには、ステップレベルのツールの実行動作をリアルタイムで監視することが不可欠だ。
LLMエージェントにおけるステップレベルツール起動安全検出のための新しいベンチマークであるTS-Benchを構築した。
次に,マルチタスク強化学習を用いたガードレールモデルTS-Guardを開発した。
論文 参考訳(メタデータ) (2026-01-15T07:54:32Z) - Towards Verifiably Safe Tool Use for LLM Agents [53.55621104327779]
大規模言語モデル(LLM)ベースのAIエージェントは、データソース、API、検索エンジン、コードサンドボックス、さらにはその他のエージェントなどのツールへのアクセスを可能にすることで、機能を拡張する。
LLMは意図しないツールインタラクションを起動し、機密データを漏洩したり、クリティカルレコードを上書きしたりするリスクを発生させる。
モデルベースセーフガードのようなリスクを軽減するための現在のアプローチは、エージェントの信頼性を高めるが、システムの安全性を保証することはできない。
論文 参考訳(メタデータ) (2026-01-12T21:31:38Z) - Self-Abstraction from Grounded Experience for Plan-Guided Policy Refinement [61.35824395228412]
大規模言語モデル(LLM)ベースのエージェントは、ソフトウェア工学のタスクに取り組むためにますます使われています。
エージェントが自身のタスク実行から学習することを可能にするフレームワークであるSAGE(Self-Abstraction from Grounded Experience)を提案する。
論文 参考訳(メタデータ) (2025-11-08T08:49:38Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z) - Benchmarking LLMs and LLM-based Agents in Practical Vulnerability Detection for Code Repositories [8.583591493627276]
JitVulは、各関数をその脆弱性導入とコミットの修正にリンクする脆弱性検出ベンチマークである。
思考・行動・観察と相互言語的文脈を活用するReAct Agentsは,良性のあるコードと区別する上で,LLMよりも優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2025-03-05T15:22:24Z) - Defining and Detecting the Defects of the Large Language Model-based Autonomous Agents [31.126001253902416]
本研究は,LLMエージェントの欠陥の同定と検出に焦点を当てた最初の研究である。
StackOverflowから6,854件の関連記事を収集し分析し、8種類のエージェント欠陥を定義しました。
以上の結果から,Agentableの総合精度は88.79%,リコール率は91.03%であった。
論文 参考訳(メタデータ) (2024-12-24T11:54:14Z) - AgentBench: Evaluating LLMs as Agents [99.12825098528212]
エージェントとしてのLarge Language Model (LLM)は近年広く認知されている。
我々は,LLM-as-Agentの推論と意思決定能力を評価するために,8つの異なる環境からなるベンチマークであるAgentBenchを提案する。
論文 参考訳(メタデータ) (2023-08-07T16:08:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。