論文の概要: SkCC: Portable and Secure Skill Compilation for Cross-Framework LLM Agents
- arxiv url: http://arxiv.org/abs/2605.03353v2
- Date: Sat, 09 May 2026 15:12:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 16:21:29.351733
- Title: SkCC: Portable and Secure Skill Compilation for Cross-Framework LLM Agents
- Title(参考訳): SkCC: クロスフレームLDMエージェントのためのポータブルでセキュアなスキルコンパイル
- Authors: Yipeng Ouyang, Yi Xiao, Yuhao Gu, Xianwei Zhang,
- Abstract要約: SkCCはLLMエージェント用のコンパイラで、エージェントスキル開発に古典的なコンパイルを導入する。
この設計では、サブ10msのコンパイルレイテンシ、94.8%のプロアクティブなセキュリティトリガーレート、フレームワーク間で10-46%のトークンセーブを実現している。
- 参考スコア(独自算出の注目度): 2.421205361034078
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: LLM agents increasingly rely on reusable skills (e.g., `SKILL.md`) to execute complex tasks, yet these artifacts lack portability: agent frameworks are highly sensitive to prompt formatting, leading to a large performance variation for the same skill. Nevertheless, most skills are authored once as format-agnostic Markdown, necessitating costly per-framework rewrites and also leaving security largely unaddressed, with widespread vulnerabilities in practice. To address this, we present SkCC, a compiler for LLM agents that introduces classical compilation design into agent skill development. SkCC centers on SkIR, a strongly-typed intermediate representation that decouples skill semantics from framework-specific formatting, thus enabling portable deployment across agent frameworks. Atop of this IR, a static Optimizer enforces security constraints, blocking vulnerabilities before deployment. Implemented as a four-phase pipeline, SkCC effectively reduces adaptation complexity from $O(m \times n)$ to $O(m + n)$ across $m$ skills and $n$ frameworks. Experiments on SkillsBench demonstrate that SkCC delivers consistent and substantial gains over original counterparts, with pass rate increases from 21.1% to 33.3% on Claude Code and from 35.1% to 48.7% on Kimi CLI. Further, the design achieves sub-10ms compilation latency, 94.8% proactive security trigger rate, and 10-46% runtime token savings across frameworks.
- Abstract(参考訳): LLMエージェントは、複雑なタスクを実行するために再利用可能なスキル(例えば `SKILL.md`)にますます依存しているが、これらのアーティファクトには移植性がない。
それにもかかわらず、ほとんどのスキルは一度フォーマットに依存しないMarkdownとして書かれており、フレーム単位の書き直しにコストがかかり、セキュリティはほとんど修正されていない。
そこで本研究では,従来のコンパイル設計をエージェントスキル開発に導入したLLMエージェントのコンパイラであるSkCCを紹介する。
SkCCは、フレームワーク固有のフォーマットからスキルセマンティクスを分離する、強く型付けされた中間表現であるSkIRを中心としている。
このIRに加えて、静的オプティマイザはセキュリティ制約を強制し、デプロイ前に脆弱性をブロックする。
4相パイプラインとして実装されたSkCCは、適応の複雑さを$O(m \times n)$から$O(m + n)$へ効果的に低減する。
SkillsBenchの実験では、SkCCはオリジナルのものと比べ一貫性があり、パスレートが21.1%から33.3%に上昇し、Kimi CLIでは35.1%から48.7%に上昇した。
さらに、この設計では、サブ10msのコンパイルレイテンシ、94.8%のプロアクティブなセキュリティトリガーレート、フレームワーク間の10-46%のランタイムトークンセーブを実現している。
関連論文リスト
- CADMAS-CTX: Contextual Capability Calibration for Multi-Agent Delegation [0.0]
CADMAS-CTXはコンテキストキャリブレーションのためのフレームワークである。
階層的なコンテキスト能力プロファイルは、静的なスキルレベルの信頼性をコンテキスト条件の後方に置き換える。
GAIAとSWE-benchベンチマークを用いて,本手法の有効性を実証的に検証した。
論文 参考訳(メタデータ) (2026-04-20T08:30:28Z) - Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems [35.65937852381774]
Document-Driven Implicit Payload Execution (DDIPE)は、コード例や設定テンプレートに悪意のあるロジックを埋め込む。
我々は15のMITRE ATTACKカテゴリで81種から1,070の対逆スキルを生成した。
DDIPEは11.6%から33.5%のバイパス率を獲得し、明示的な命令攻撃は強い防御下で0%を達成する。
論文 参考訳(メタデータ) (2026-04-03T14:58:58Z) - SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistants [10.897758061443989]
SafeClaw-Rは、実行グラフ上のシステムレベルの不変量として安全を強制するフレームワークである。
生産性プラットフォーム、サードパーティのスキルエコシステム、コード実行環境の3つの領域でSafeClaw-Rを評価します。
論文 参考訳(メタデータ) (2026-03-28T05:03:54Z) - MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild [74.7263562191605]
大規模言語モデル(LLM)エージェントは、複雑なタスクにますます使われている。
既存の方法は、知識を蒸留せずに生の軌跡を保存するか、静的なスキルライブラリを維持するか、または再訓練のために破壊的なダウンタイムを必要とする。
本稿では,基本的なLCMポリシと再利用可能な行動スキルのライブラリを共同で進化させるメタ学習フレームワークであるMetaClawを紹介する。
論文 参考訳(メタデータ) (2026-03-17T22:30:30Z) - CVE-Factory: Scaling Expert-Level Agentic Tasks for Code Security Vulnerability [50.57373283154859]
CVE-Factoryは、脆弱性タスクを自動変換するエキスパートレベルの品質を実現するための、最初のマルチエージェントフレームワークである。
最新の現実的な脆弱性についても評価され、66.2%の成功が証明されている。
コードセキュリティにおけるエージェントタスクの大規模スケーリングとして,1000以上の実行可能なトレーニング環境を合成する。
論文 参考訳(メタデータ) (2026-02-03T02:27:16Z) - RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories [58.32028251925354]
LLM(Large Language Models)は、コード生成において顕著な能力を示しているが、セキュアなコードを生成する能力は依然として重要で、未調査の領域である。
我々はRealSec-benchを紹介します。RealSec-benchは、現実世界の高リスクなJavaリポジトリから慎重に構築されたセキュアなコード生成のための新しいベンチマークです。
論文 参考訳(メタデータ) (2026-01-30T08:29:01Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents [38.755035623707656]
本稿では,エージェントツールの利用を生かした新しいマルチターンアタックフレームワークSTACについて紹介する。
我々は,483のSTACケースを自動生成し,評価するために,1,352セットのユーザエージェント環境相互作用を特徴とするフレームワークを適用した。
GPT-4.1を含む最先端のLSMエージェントはSTACに対して極めて脆弱であり,攻撃成功率(ASR)は90%以上である。
論文 参考訳(メタデータ) (2025-09-30T00:31:44Z) - SafeSieve: From Heuristics to Experience in Progressive Pruning for LLM-based Multi-Agent Communication [19.633176635669397]
プログレッシブで適応的なマルチエージェント・プルーニングアルゴリズムであるSafeSieveを提案する。
SafeSieveの平均精度は94.01%であり、トークン使用率を12.4%から27.8%削減している。
これらの結果はSafeSieveを実用マルチエージェントシステムのための堅牢で効率的でスケーラブルなフレームワークとして確立している。
論文 参考訳(メタデータ) (2025-08-15T13:44:50Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。