論文の概要: SkillTrace: Multi-Trace Provenance Auditing for LLM-Agent Skill Reuse
- arxiv url: http://arxiv.org/abs/2608.05204v2
- Date: Fri, 07 Aug 2026 09:43:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 14:11:31.069715
- Title: SkillTrace: Multi-Trace Provenance Auditing for LLM-Agent Skill Reuse
- Title(参考訳): SkillTrace: LLM-Agent Skill Reuseのためのマルチトレース調査
- Authors: Jialuo Chen, Minghe Wang, Lingqi Jiang, Jianan Ma, Xinhao Deng, Xiaohu Du, Ruixiao Lin, Yunhao Feng, Linkang Du, Jingyi Wang,
- Abstract要約: LLMエージェントエコシステムは、再利用可能なスキルを中心に急速に成長している。
スキルがマーケットプレースアーティファクトになるにつれて、再利用の監査は、通常のコードクローン検出ともはや同じ問題ではない。
LLM-agentスキル再利用のためのマルチトレース実証監査フレームワークであるSKILLTRACEを提案する。
- 参考スコア(独自算出の注目度): 8.14783644256836
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM-agent ecosystems are rapidly growing around reusable skills: mixed-modality packages of metadata, natural-language instructions, code, tools, references, and operational workflows. As skills become marketplace artifacts, auditing their reuse is no longer the same problem as ordinary code clone detection. Existing detectors target single-modality source code or whole-package similarity, yet skill reuse evidence is distributed across authored text, implementation fragments, and operational structure. As a result, they can miss reuse that preserves only one part of a skill. We present SKILLTRACE, a multi-trace provenance auditing framework for LLM-agent skill reuse. SKILLTRACE extracts three provenance traces: Expression, Implementation, and Operational. It represents the Operational Trace as a Skill Operational Graph (SOG) that captures activation, procedure, and resource-flow structure. An LLM assists only the Operational-trace extraction, once at ingestion; at audit time SKILLTRACE compares cached traces deterministically, calibrates each trace against same-function strict negatives, and reports which trace supports a reuse decision. On SKILLTRACE-BENCH, with 820 transformed reuse positives over 100 marketplace anchors and 751 negative controls, SKILLTRACE achieves AUROC 0.938 and F1 0.898. A 36,446-skill wild audit further shows that trace-attributed evidence surfaces actionable reuse review queues beyond repository-level baselines.
- Abstract(参考訳): LLMエージェントエコシステムは、メタデータの混合モダリティパッケージ、自然言語命令、コード、ツール、参照、運用ワークフローなど、再利用可能なスキルを中心に急速に成長している。
スキルがマーケットプレースアーティファクトになるにつれて、再利用の監査は、通常のコードクローン検出ともはや同じ問題ではない。
既存の検出器は、単一モジュールのソースコードやパッケージ全体の類似性をターゲットにしているが、スキル再利用の証拠は、認可されたテキスト、実装のフラグメント、運用構造に分散している。
結果として、スキルの1つしか保存しない再利用を見逃すことができます。
LLM-agentスキル再利用のためのマルチトレース実証監査フレームワークであるSKILLTRACEを提案する。
SKILLTRACEは、式、実装、操作の3つの証明トレースを抽出する。
操作トレースは、アクティベーション、プロシージャ、リソースフロー構造をキャプチャするスキル操作グラフ(SOG)として表される。
監査時、SKILLTRACEはキャッシュされたトレースを決定論的に比較し、各トレースを同じ機能の厳密な負に対して校正し、トレースが再利用決定をサポートするレポートを作成する。
SKILLTRACE-BENCHでは、100個のマーケットプレースアンカーと751個の負のコントロールで820個の再利用陽性が変換され、AUROC 0.938とF1 0.898を達成している。
36,446スキルのワイルド監査では、トレース報告されたエビデンスにより、リポジトリレベルのベースラインを超えて、実行可能な再利用レビューキューが表面化している。
関連論文リスト
- Cross-Layer Misalignment Detection in Agent Skills: A Progressive Loading-Aware Contrastive Learning Approach [12.79484512803839]
大規模言語モデル(LLM)エージェントはエージェントスキルによってますます拡張される。
オープンソースのスキルマーケットプレースが拡大するにつれて、ユーザやエージェントは、簡単なメタデータをサードパーティのスキルに頼っている。
階層間ミスアライメントを検出するためのPL-HCL(Progressive Loading-Aware Hierarchical Contrastive Learning)を提案する。
論文 参考訳(メタデータ) (2026-07-12T02:07:37Z) - TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents [62.969415789328025]
LLMエージェントは、個々の良性行動のシーケンスを通じて、隠れた悪意のある目的を追求することができる。
既存のアプローチでは、1つのパスで完全な軌跡を評価するか、独立して評価されたウィンドウに分割する。
本研究では,長期LLMエージェントトラジェクトリのモニタリングフレームワークであるTRACEを提案する。
論文 参考訳(メタデータ) (2026-06-05T08:54:38Z) - TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents [19.156453695628013]
マルチモーダル・ツール・ユース・エージェントにおけるジェネレーティブ・プロビデンスを検証するためのフレームワークであるTRACERを紹介する。
TraCERは、サポートツールターン、エビデンスユニット、セマンティックサポート関係を識別する構造化された証明レコードとともに、各回答文を生成する。
Qwen3-VL-8Bでは、TRACERは78.23%の回答精度と95.72%の要約精度に達し、最強のクローズドソースツール強化ベースラインを23.80ポイント上回った。
論文 参考訳(メタデータ) (2026-05-11T03:32:55Z) - Towards Multi-Agent Autonomous Reasoning in Hydrodynamics [0.06999740786886537]
本稿では,多エージェントをレイヤ実行グラフ(LEG)を介して協調させる,流体力学のためのマルチエージェントシステム(MAS)のプロトタイプを提案する。
プランナーエージェントは、ドメイン知識を厳密な制御ロジックとしてハードコーディングすることなく、自然言語ルーティングからクエリ固有の実行トポロジを構築する。
レポーターエージェントが最終応答を合成し、ランタイムが監査性をサポートするためのツール呼び出し毎に証明をログする。
論文 参考訳(メタデータ) (2026-05-01T21:17:55Z) - LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources [0.7734726150561088]
行方不明者や子どもの安全に関する調査は、構造化フォーム、掲示板スタイルのポスター、物語ウェブプロファイルなど、異種ケース文書に依存している。
レイアウト、用語、データ品質の変化は、急激なトリアージ、大規模分析、探索計画を妨げる。
本稿では、AIによる解析および正規化パイプラインであるGuardian Packを紹介し、マルチソース調査文書を統一されたスキーマ準拠の表現に変換する。
論文 参考訳(メタデータ) (2026-04-08T01:35:56Z) - RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents [0.9821874476902969]
LLMエージェントは、単一のスカラーテストメトリクスで成功を判断するエンドツーエンドのMLエンジニアリングタスクをますます実行します。
エージェントは、モデルを改善するのではなく、評価パイプラインを妥協することで、報告されたスコアを増やすことができる。
ワークスペースベースのベンチマークであるRewardHackingAgentsを導入する。
論文 参考訳(メタデータ) (2026-03-11T22:06:44Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Get my drift? Catching LLM Task Drift with Activation Deltas [55.75645403965326]
タスクドリフトは攻撃者がデータを流出させたり、LLMの出力に影響を与えたりすることを可能にする。
そこで, 簡易線形分類器は, 分布外テストセット上で, ほぼ完全なLOC AUCでドリフトを検出することができることを示す。
このアプローチは、プロンプトインジェクション、ジェイルブレイク、悪意のある指示など、目に見えないタスクドメインに対して驚くほどうまく一般化する。
論文 参考訳(メタデータ) (2024-06-02T16:53:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。