論文の概要: Progressive Skill Discovery as Access Control for Tool-Using LLM Agents: Structural Governance through Role-Scoped Capability Delivery
- arxiv url: http://arxiv.org/abs/2609.28693v1
- Date: Wed, 23 Sep 2026 18:31:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.489655
- Title: Progressive Skill Discovery as Access Control for Tool-Using LLM Agents: Structural Governance through Role-Scoped Capability Delivery
- Title(参考訳): ツール利用LLMエージェントのアクセス制御としてのプログレッシブスキル発見:ロールスコープ機能提供による構造的ガバナンス
- Abstract要約: 大きな言語モデル(LLM)エージェントは、巨大なエンタープライズツールセットに晒されると、安全にスケールするのに苦労する。
マルチエージェントドメインデリゲートのような既存の緩和策は監査ログを分散化し、ポリシーコンプライアンスの保証に失敗する。
スキル、ツール、インストラクションのバンドルとそれらを束縛する制限という、機能を役割にパッケージするフレームワークであるSillderを紹介します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Large Language Model (LLM) agents struggle to scale safely when exposed to vast enterprise toolsets. Providing an agent with access to every internal tool leads to oversized context windows, degraded tool selection, and severe governance vulnerabilities - as system policies defined purely in prompts remain probabilistic advice rather than hard constraints. Existing mitigations, such as multi-agent domain delegation, decentralize audit logs and fail to guarantee policy compliance across sessions. We introduce skilder, a framework that packages capabilities into roles: bundles of skills, tools, and instructions, together with the limits that bound them. An agent begins with a minimal role catalog, learns the roles a task requires, and receives each role's skills, instructions, and tools through a single MCP server. Because tools reach the agent only inside learned skills, the same server enforces the scope of what was learned deterministically. We evaluate skilder against flat-context tool selection and multi-agent orchestration across 13 tasks using six models (10 runs each). Our results show that, when models completed discovery and issued a governed call, the skilder simulated authorization layer enforced governance boundaries: no unauthorized tool call or parameter violation (e.g., a spending-limit breach) executed. Aggregate task pass rates also reflect whether each model followed the discovery protocol and satisfied response-quality checks; those misses are not authorization failures. Furthermore, by allowing agents to dynamically acquire cross-role capabilities mid-task, skilder preserves problem-solving flexibility while providing hard system-level enforcement.
- Abstract(参考訳): 大きな言語モデル(LLM)エージェントは、巨大なエンタープライズツールセットに晒されると、安全にスケールするのに苦労する。
すべての内部ツールにアクセス可能なエージェントを提供することは、過大なコンテキストウィンドウ、劣化したツールの選択、厳しいガバナンス上の脆弱性につながる。
マルチエージェントドメインデリゲートのような既存の緩和策は、監査ログを分散化し、セッション間のポリシーコンプライアンスを保証するのに失敗する。
スキル、ツール、インストラクションのバンドルとそれらを束縛する制限という、機能を役割にパッケージするフレームワークであるSillderを紹介します。
エージェントは最小限の役割カタログから始まり、タスクが必要とする役割を学習し、各ロールのスキル、指示、ツールを単一のMPPサーバを通じて受信する。
ツールが学習スキル内でのみエージェントに到達するため、同じサーバが学習対象の範囲を決定論的に強制する。
我々は,6つのモデル(それぞれ10回実行)を用いて,フラットコンテキストツールの選択と13タスク間のマルチエージェントオーケストレーションに対するスラダーの評価を行った。
我々の結果は、モデルが発見を完了し、統制された呼び出しを発行すると、スラダーシミュレートされた認可層がガバナンス境界を強制したことを示している。
集約されたタスクパスレートはまた、各モデルがディスカバリプロトコルと満足度の高い応答品質チェックに従うかどうかを反映している。
さらに、エージェントが中間タスク中にクロスロール機能を動的に取得できるようにすることで、ハードシステムレベルの強制力を提供しながら問題解決の柔軟性を保ちます。
関連論文リスト
- Symbolic Temporal Supervision of LLM Agents Using Contracts [1.7188280334580195]
本稿では,大規模言語モデル(LLM)エージェントのシンボリック時間監視のための契約ベースのフレームワークであるContrAgentを紹介する。
ContrAgentは、エージェントの振舞いを一連のツールコールとして捉え、それを固定されたチェック可能な述語セット上のトレースとしてフォーマル化する。
その後、有限トレース上の線形時間論理における仮定保証契約(sum-guarantee contract)を用いて必要な振る舞いを特定する。
論文 参考訳(メタデータ) (2026-09-16T05:05:35Z) - ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents [61.184954205350984]
ClawArena-Teamは、41のマルチターン、マルチモーダル、マルチエージェントシナリオのベンチマークである。
全体的なスコア -- Subagent-Management Score (SMS) -- は、タスクの正しさを最小限のプライマリとモダリティのルーティング因子によって乗算する。
論文 参考訳(メタデータ) (2026-06-30T06:06:08Z) - Prompts Don't Protect: Architectural Enforcement via MCP Proxy for LLM Tool Access Control [0.0]
大規模な言語モデルは、大規模なレジストリからツールを選択して呼び出す自律的なエージェントとしてますます機能する。
本稿では,属性ベースのアクセス制御(ABAC)をツール発見とツール実行の2点で実施するMPPプロキシを提案する。
我々のプロキシは、50msの中央値レイテンシを追加しながら、不正呼び出し率(UIR)を0%に削減します。
論文 参考訳(メタデータ) (2026-05-18T13:52:24Z) - ALARA for Agents: Least-Privilege Context Engineering Through Portable Composable Multi-Agent Teams [0.0]
宣言型コンテキストエージェント・ツール(CAT)データ層を関連ファイルを通じて表現し,各エージェントのツールアクセスとコンテキストを,その役割に必要な最小限に制限する。
システムがこれらのファイルを構造的に解析し強制するため、エージェントのツールリストを変更することで、モデルが従うかもしれない、あるいは従わないかもしれないという提案よりも、保証された振る舞いの変更が生成される。
我々は,ファイル操作,Web検索,マルチステップスクリプティング,ツールチェーン,マルチエージェントデリゲートにまたがる115の実用的なタスクに対して,0.6Bから35Bパラメータのローカルホストモデル22を評価した。
論文 参考訳(メタデータ) (2026-03-20T18:00:09Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - Multi-Agent Tool-Integrated Policy Optimization [67.12841355267678]
大規模言語モデル(LLM)は、知識集約的かつ複雑な推論タスクに対して、多ターンツール統合計画にますます依存している。
既存の実装は通常、単一のエージェントに依存するが、コンテキスト長とノイズの多いツールレスポンスに悩まされる。
ツール統合マルチエージェントフレームワークの効果的な強化学習をサポートする方法はない。
論文 参考訳(メタデータ) (2025-10-06T10:44:04Z) - Which Agent Causes Task Failures and When? On Automated Failure Attribution of LLM Multi-Agent Systems [50.29939179830491]
LLMマルチエージェントシステムにおける障害帰属は、まだ調査が過小評価されており、労働集約的である。
本稿では,3つの自動故障帰属手法の開発と評価を行い,その欠点と欠点を要約する。
最良の方法は、障害に応答するエージェントを特定する際に53.5%の精度を達成するが、故障の特定には14.2%しか役に立たない。
論文 参考訳(メタデータ) (2025-04-30T23:09:44Z) - Progent: Programmable Privilege Control for LLM Agents [46.31581986508561]
本稿では,大規模言語モデルエージェントをセキュアにするための最初の特権制御フレームワークであるProgentを紹介する。
Progentは、潜在的に悪意のあるものをブロックしながら、ユーザタスクに必要なツールコールの実行をエージェントに制限することで、ツールレベルでのセキュリティを強化する。
モジュール設計のおかげで、Progentの統合はエージェント内部を変更せず、既存のエージェントの実装に最小限の変更しか必要としません。
論文 参考訳(メタデータ) (2025-04-16T01:58:40Z) - SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints [59.645885492637845]
SOPBenchは、各サービス固有のSOPコードプログラムを実行可能な関数の有向グラフに変換する評価パイプラインである。
提案手法では,各サービス固有のSOPコードプログラムを実行可能関数の有向グラフに変換し,自然言語SOP記述に基づいてこれらの関数を呼び出しなければならない。
我々は18の先行モデルを評価し、上位モデルでさえタスクが困難であることを示す。
論文 参考訳(メタデータ) (2025-03-11T17:53:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。