論文の概要: Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents
- arxiv url: http://arxiv.org/abs/2607.12340v1
- Date: Tue, 14 Jul 2026 04:40:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.036681
- Title: Skills That Don't Exist: A Large-Scale Study of Hallucinated Skill Recommendation in LLM Agents
- Title(参考訳): 存在しないスキル: LLMエージェントにおけるハロシン化スキル勧告の大規模研究
- Abstract要約: LLMエージェントは、オープンレジストリからスキルをダウンロードすることで、新しい機能を取得する。
これらのカタログを手動で閲覧する代わりに、開発者は通常、エージェントにスキルを推薦してインストールするよう依頼する。
この利便性はリスクを隠蔽する。エージェントはレジストリに存在しないスキルの名前を頻繁に発明する。
偽名は無害に見えるかもしれないが、サプライチェーン攻撃への扉を開く。
- 参考スコア(独自算出の注目度): 10.269934572328022
- License: http://creativecommons.org/publicdomain/zero/1.0/
- Abstract: LLM agents acquire new capabilities by downloading skills from open registries. Instead of browsing these catalogs manually, developers typically ask the agent to recommend and install a skill. This convenience hides a risk: agents frequently invent names for skills that exist in no registry. We term this flaw skill name hallucination. A fake name may seem harmless, but it opens the door to supply-chain attacks. Because registries rarely verify publishers, an adversary can prompt the agent, collect the fake names it returns, pre-register malicious skills under them, and wait for a victim to install the payload. We conducted the first large-scale measurement of skill name hallucination, evaluating 15,000 prompts across 12 configurations (4 standalone LLMs and 8 agents). We conservatively counted a name as hallucinated only if it was missing from all live registries and GitHub. The results reveal a systemic vulnerability: every configuration hallucinates. Rates average 36.0% for standalone LLMs and 36.9% for agents, rising to 43.1% on real-world developer questions. In total, the systems generated 5,669 distinct hallucinated names. Crucially, these names are not random noise. Agents repeat the same fake names across prompts and models, giving attackers highly reliable targets to hijack. Finally, we tested four model-level defenses and found a severe conflict between security and usability. The strongest, retrieval grounding, cut the hallucination rate from 40.8% to 3.2% but crippled usefulness: even the best-defended system recommended the correct skill only about one in six times. Skill name hallucination is thus a highly exploitable vulnerability requiring minimal attacker effort. Fixing it cannot rely on prompt engineering or model tuning alone. It demands ecosystem-wide structural changes: registry-level name reservations and verified recommendation pipelines.
- Abstract(参考訳): LLMエージェントは、オープンレジストリからスキルをダウンロードすることで、新しい機能を取得する。
これらのカタログを手動で閲覧する代わりに、開発者は通常、エージェントにスキルを推薦してインストールするよう依頼する。
この利便性はリスクを隠蔽する。エージェントはレジストリに存在しないスキルの名前を頻繁に発明する。
私たちはこの欠陥スキルを幻覚と呼ぶ。
偽名は無害に見えるかもしれないが、サプライチェーン攻撃への扉を開く。
登録者は出版社を滅多に検証しないため、敵はエージェントを誘導し、返却した偽名を集め、その下に悪意あるスキルを登録し、被害者がペイロードをインストールするのを待つことができる。
本研究は,12項目に15,000のプロンプト(4つの独立したLCMと8つのエージェント)をそれぞれ評価し,スキルネームの幻覚を初めて大規模に測定した。
私たちは、すべてのライブレジストリとGitHubから欠落している場合にのみ、その名前を幻覚的なものとして保守的にカウントしました。
その結果、すべての構成が幻覚する、システム的な脆弱性が明らかになった。
スタンドアロンのLCMは平均36.0%、エージェントは36.9%であり、実際の開発者の質問では43.1%まで上昇した。
合計で5,669の幻覚名を生み出した。
重要なことに、これらの名前はランダムノイズではない。
エージェントはプロンプトとモデルにまたがって同じ偽名を繰り返し、攻撃者が非常に信頼できるターゲットをハイジャックする。
最後に、我々は4つのモデルレベルの防御実験を行い、セキュリティとユーザビリティの深刻な衝突を発見した。
最強の検索基盤は幻覚率を40.8%から3.2%に下げたが、有用性は損なわれ、最良の防御システムでさえ6回に1回程度しか正しいスキルを推奨しなかった。
したがって、スキル名の幻覚は、最小限の攻撃力を必要とする非常に悪用可能な脆弱性である。
迅速なエンジニアリングやモデルチューニングのみを頼りにすることはできない。
レジストリレベルの名前予約と検証されたレコメンデーションパイプラインという、エコシステム全体の構造変更が必要です。
関連論文リスト
- SkillAtlas: An Attack Trace Library for Agent Skills [67.18648151130607]
我々は、プライベートエージェントスキルセキュリティレポートバンドルをレビュー、修正、検索可能なパブリックケースに変換する、ホストされた攻撃トレースライブラリであるSkillAtlasを紹介する。
図書館には3,014のケース、6,589のトレース、151,131のステップ、233の影響を受けたスキル、8のリスクカテゴリが含まれている。
論文 参考訳(メタデータ) (2026-09-11T16:44:39Z) - EVOMAL: Self-Poisoning in Self-Evolving Coding Agents [21.932129032072893]
自己進化型コーディングエージェントは、共有スキルライブラリから取得したスキルを模倣して、独自のツールを記述する。
エージェントの作者は、悪意のあるスキルを保存し、実行します。
EvoMalは、バナーに交換可能なペイロードをラップすることで、自己攻撃を増幅する攻撃です。
論文 参考訳(メタデータ) (2026-08-26T13:19:12Z) - Demystifying Agent Skills: Why They Work-Until They Don't [58.92875630998418]
既存の評価は、スキルが集約されたタスクの成功を改善するかどうかを主に測定する。
我々は、表現、結果アノテーション、検索難易度、スキルのクロスフレームワークの影響を分離する。
我々はこれらの観察を3つの高レベルカテゴリと12のスキルユースモードの分類に集約する。
論文 参考訳(メタデータ) (2026-08-14T07:26:38Z) - SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills [0.0]
我々は、LLM-as-Judgeを使ってエージェントスキルを拒否するHugging Faceのライブ公開リーダーボードであるSKILLVETBENCHを紹介する。
SSARS(スキルエージェントリスクスコア、Skill Agentic Risk Score)は、5次元のエージェントリスク計量であり、命令追従システムに対する原則付き重み付け式である。
論文 参考訳(メタデータ) (2026-06-14T16:30:33Z) - MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills [24.371534406647978]
MalSkillBenchは、悪質なエージェントスキルの最初のランタイム検証ベンチマークである。
コードインジェクションは94.5%に達するが、迅速なインジェクションは75.8%に過ぎない。
データセット、パイプライン、ベースライン、結果をリリースしています。
論文 参考訳(メタデータ) (2026-06-05T10:43:19Z) - Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry [49.83108591873481]
SKILL.md - エージェントスキルライフサイクルの3つのステージを対象とするアタックのみを調査する。
SKILL.mdは受動的ドキュメントではなく、サードパーティのエージェントが発見し、信頼し、使用する機能を形成する運用テキストであることを示す。
論文 参考訳(メタデータ) (2026-05-12T02:11:54Z) - HarmfulSkillBench: How Do Harmful Skills Weaponize Your Agents? [20.305306682682083]
エージェント生態系における有害なスキルの大規模測定を初めて行った。
スキルの4.93%(4,858)が有害であり、ClawHubは8.84%、Skills.Restは3.49%である。
そして、現実的なエージェントコンテキストにおける有害なスキルに対するエージェント安全性を評価するための最初のベンチマークであるHarmfulSkillBenchを構築します。
論文 参考訳(メタデータ) (2026-04-16T17:31:52Z) - Credential Leakage in LLM Agent Skills: A Large-Scale Empirical Study [51.717224133855886]
サードパーティのスキルはLLMエージェントを強力な能力で拡張するが、特権のある環境では機密情報を扱うことが多い。
静的解析,サンドボックステスト,手動検査を用いて17,022のスキル(SkillsMPで170,226からサンプリング)を分析した。
我々は,1,708の課題で520の脆弱なスキルを識別し,10の漏洩パターン(事故4件,反対6件)の分類を導出する。
論文 参考訳(メタデータ) (2026-04-03T14:50:16Z) - SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks [61.89812116484928]
エージェントスキルは、LLMエージェントを推論時に増強する手続き的知識の構造化パッケージである。
SkillsBenchは、11のドメインにわたる86のタスクのベンチマークであり、キュレートされたスキルと決定論的検証との組み合わせを示す。
キュレートされたスキルは平均パスレートを16.2ポイント(pp)上昇させるが、効果は領域によって大きく異なる。
自己生成スキルは平均的に何の利益も与えず、モデルが消費から得られる手続き的な知識を確実に説明できないことを示している。
論文 参考訳(メタデータ) (2026-02-13T07:06:06Z) - Malicious Agent Skills in the Wild: A Large-Scale Security Empirical Study [47.60135753021306]
サードパーティのエージェントスキルは、LLMベースのエージェントを拡張して、命令ファイルとユーザのマシン上で動作する実行可能なコードを生成する。
結果として生じる脅威を特徴づけるために、地中真実のデータセットは存在しない。
我々は,98,380のスキルを行動検証することで,悪質なエージェントスキルのラベル付きデータセットを構築した。
論文 参考訳(メタデータ) (2026-02-06T09:52:27Z) - Library Hallucinations in LLMs: Risk Analysis Grounded in Developer Queries [14.887647336580544]
大規模言語モデル(LLM)は、コードを生成するためにますます使われていますが、幻覚を継続し、しばしば存在しないライブラリを発明します。
LLM生成コードのライブラリ幻覚にユーザレベルのプロンプト変動がどう影響するかについて,最初の系統的研究を行った。
ライブラリ名の1文字のミススペルは、最大26%のタスクで幻覚を引き起こし、偽のライブラリ名は最大99%のタスクで受け入れられ、時間関連のプロンプトは最大84%のタスクで幻覚を引き起こす。
論文 参考訳(メタデータ) (2025-09-26T11:14:38Z) - Can Large Language Models Really Recognize Your Name? [23.4365383606717]
現代大規模言語モデル(LLM)は、曖昧な文脈のため、短いテキストスニペットでも定期的に人名を見落としている。
AMBENCHは、明らかに不明瞭な人物名のベンチマークデータセットである。
論文 参考訳(メタデータ) (2025-05-20T16:05:05Z) - DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers [74.7446827091938]
我々はjailbreak textbfAttack (DrAttack) のための自動プロンプト textbfDecomposition と textbfReconstruction フレームワークを導入する。
DrAttack には3つの重要な要素が含まれている: (a) プロンプトをサブプロンプトに分解する; (b) セマンティックに類似しているが無害な再組み立てデモで暗黙的にこれらのサブプロンプトを再構築する; (c) サブプロンプトのシンノニム検索する; サブプロンプトのシノニムを見つけることを目的としたサブプロンプトのシノニムを見つけること。
論文 参考訳(メタデータ) (2024-02-25T17:43:29Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。