論文の概要: A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use
- arxiv url: http://arxiv.org/abs/2608.00218v1
- Date: Fri, 31 Jul 2026 19:03:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:24.550875
- Title: A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use
- Title(参考訳): LLMの誤用ツール:信頼性ツール用スパース検出と選択ステアリング
- Authors: Yutong Ke, Ming Yin, Chongwen Zhao, Kaizhu Huang,
- Abstract要約: PRISMS(Probing Representations In Support of Monitoring and Steering)は,スパース検出とアクティベーションの間に障害特異的ニューロンベースを共有するクローズループフレームワークである。
6つのモデル全体で、PRISMSはプールされたオーバーコール率を80%削減し、ツール要求の精度を14.2%向上させた。
- 参考スコア(独自算出の注目度): 28.57781785937644
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Agentic LLMs exhibit three consequential tool-use failures: invalid arguments (validity), unnecessary calls (over-calling), and omitted calls when tools are needed (missing). We find that a small, failure-specific set of MLP neurons could distinguish such failures with linearly separable decision boundaries. Building on this observation, we introduce PRISMS (Probing Representations In Support of Monitoring and Steering), a closed-loop framework that shares a failure-specific neuron basis between sparse detection and activation steering. PRISMS selects contribution-critical MLP neurons and fits an L1-regularized detector on their activations. Across six models from the Qwen3, Llama, and Gemma families, over-calling and missing are detected at the pre-generation prompt boundary with ROC-AUC 0.90-1.00, while validity is detected from the generated tool-call span with ROC-AUC 0.86-0.90. These results are achieved with highly sparse readouts: only 1-2 MLP neurons for missing, 2-16 for over-calling, and approximately 128 for validity. These sparse detectors match or outperform dense residual-stream baselines using 23-627 times fewer features. The shared neuron basis also supports bidirectional control over tool-calling behavior, suppressing unnecessary calls and eliciting omitted ones. PRISMS therefore gates intervention on predicted failure risk to mitigate the collateral effects of unconditional steering. Across all six models, PRISMS reduces pooled over-calling rate by 80% (from 0.131 to 0.026) while increasing tool-required accuracy by 14.2 percentage points (from 0.689 to 0.831). PRISMS thus provides lightweight failure detection and selective intervention across model families.
- Abstract(参考訳): エージェントLDMは、無効な引数(無効性)、不要な呼び出し(オーバーコール)、ツールが必要なときに省略された呼び出し(欠落)の3つの連続的なツール使用障害を示す。
MLPニューロンの小さな障害特異的な集合は、そのような障害を線形に分離可能な決定境界で区別することができる。
PRISMS(Probing Representations In Support of Monitoring and Steering)は,スパース検出とアクティベーションステアリングの間に障害特異的ニューロン基盤を共有するクローズループフレームワークである。
PRISMSはコントリビューションクリティカルなMLPニューロンを選択し、その活性化にL1正規化検出器を適合させる。
Qwen3、Llama、Gemmaファミリーの6つのモデルのうち、ROC-AUC 0.90-1.00と前世代のプロンプト境界でオーバーコールと欠落を検出し、ROC-AUC 0.86-0.90で生成されたツールコールスパンから妥当性を検出する。
これらの結果は、欠如する1-2 MLPニューロン、オーバーコールする2-16ニューロン、有効性は約128ニューロンという、非常に希薄な読み出しによって達成される。
これらのスパース検出器は23~627倍の性能で高密度の残留流ベースラインと一致または性能を向上する。
共有ニューロン基盤はまた、ツールコール動作の双方向制御をサポートし、不要な呼び出しを抑え、省略された呼び出しを誘発する。
したがって、PRISMSは非条件のステアリングによる副作用を軽減するために、予測された失敗リスクへの介入をゲートする。
6つのモデル全体で、PRISMSはプールされたオーバーコールレートを80%(0.131から0.026まで)削減し、ツール要求の精度を14.2ポイント(0.689から0.831まで)向上させた。
PRISMSは、モデルファミリ間の軽量な障害検出と選択的介入を提供する。
関連論文リスト
- Harnessing Disagreement: Detecting Correlated Agreement Blindness in Multi-Agent Triage [3.164789424470588]
分散トリガー付きエスカレーションは、マルチエージェント仲裁において構造的な盲点を生み出すことができる。
本稿では,誘導性ランダムフォレスト (RF) エージェントと類似のケースベースk-アネレスト (k-NN) エージェントを組み合わせた指向性星系ARATを提案する。
論文 参考訳(メタデータ) (2026-07-22T08:35:00Z) - Calibration Without Comprehension: Diagnosing the Limits of Fine-Tuning LLMs for Vulnerability Detection in Systems Software [1.0026496861838445]
CWE-Traceは、手動でキュレートされたLinuxカーネルサンプルから構築された脆弱性検出フレームワークである。
対象でない検出,ターゲット検出,CWE分類において,8つのバニラLLMと15のLORA微調整変異体を評価した。
論文 参考訳(メタデータ) (2026-06-18T17:19:26Z) - Output Vector Editing for Memorization Mitigation in Large Language Models [68.30351930772788]
大規模な言語モデルは、トレーニングデータからシーケンスを記憶し、再現し、プライバシ、著作権、セキュリティリスクを生み出す。
既存のニューロンレベルの緩和方法は、ニューロンの活性化をゼロにすることで編集を等しくするが、活性化はニューロンが関与するかどうかのみを制御する。
記憶継続に責任を負うニューロンの小さな集合を探索する制約最適化編集である出力ベクトル編集を提案する。
論文 参考訳(メタデータ) (2026-06-17T07:29:18Z) - Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation [6.129872931808218]
キー値(KV)キャッシュの量子化は、Large Language Model(LLM)推論メモリの削減に広く利用されている。
本研究では,KVキャッシュ量子化下でのアライメント保存について検討する。
低ビット量子化は安全アライメントを静かに破壊することができる。
論文 参考訳(メタデータ) (2026-06-01T02:02:20Z) - HunterAgent: Neuro-Symbolic Attack Trace Reconstruction under Anti-Forensics [4.5096964986324]
脅威狩りは、不均一な丸太を越えて因果攻撃鎖を再構築する必要がある。
我々は,コストバウンドグラフ検索としてトレース再構成を再構成するニューロシンボリックなフレームワークであるHunterAgentを提案する。
HunterAgentは86.1%の平均F1を達成し、トップエージェントベースラインを26.7F1、KAIROSを17.1F1で上回っている。
論文 参考訳(メタデータ) (2026-05-28T02:38:12Z) - Tracing Uncertainty in Language Model "Reasoning" [46.61902399979181]
言語モデル(LM)は、一般的にChain-of-Thoughtまたはテストタイムスケーリングと呼ばれ、しばしばベンチマークのパフォーマンスを改善する。
本研究では,LMが生成する中間トークン列である「推論」トレースを進化的モデル状態として扱うことにより,これらのダイナミクスを考察する。
論文 参考訳(メタデータ) (2026-05-08T14:16:37Z) - HalluScan: A Systematic Benchmark for Detecting and Mitigating Hallucinations in Instruction-Following LLMs [0.0]
大規模言語モデル(LLM)は、様々な自然言語処理タスクにまたがる顕著な機能を示している。
しかし、それらは幻覚に影響を受けやすい - 事実的に不正確で、提供されたコンテキストに反するコンテンツを生成したり、ユーザ指示に反する。
本稿では,72構成の幻覚検出と緩和を体系的に評価する総合ベンチマークフレームワークであるHaluScanを紹介する。
論文 参考訳(メタデータ) (2026-05-04T10:43:27Z) - Hierarchy-Guided Topology Latent Flow for Molecular Graph Generation [44.50339042016925]
本稿では,グローバルコンテキストに対する潜在的マルチスケールプランを用いた3次元座標を用いた結合グラフを生成するプランナー・エグゼクタモデルを提案する。
HLTFは98.8%の原子安定性と92.9%の有効・均一性を達成し、PoseBustersの妥当性は94.0%(+0.9)に向上した。
GEOM-DRUGSでは、HLTFは後処理なしで85.5%/85.0%の妥当性/バリッド・ユニク・ノーベル、標準化された緩和後の92.2%/91.2%を達成している。
論文 参考訳(メタデータ) (2026-03-28T03:48:13Z) - BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning [73.46118996284888]
マルチモーダル・コントラスト学習モデルに対するバックドア攻撃の研究は、ステルスネスと永続性という2つの大きな課題に直面している。
両課題に対処する統合フレームワークであるBadCLIP++を提案する。
ステルスネスのために,タスク関連領域付近に知覚不可能なパターンを埋め込むセマンティックフュージョンQRマイクロトリガーを導入する。
持続性については、半径縮小とセントロイドアライメントによるトリガ埋め込みを安定化する。
論文 参考訳(メタデータ) (2026-02-19T08:31:16Z) - Information Fidelity in Tool-Using LLM Agents: A Martingale Analysis of the Model Context Protocol [69.11739400975445]
モデルコンテキストプロトコル(MCP)エージェントにおけるエラー蓄積を解析するための最初の理論的枠組みを紹介する。
累積歪みが線形成長と高確率偏差を$O(sqrtT)$で表すことを示す。
主な発見は、意味重み付けは歪みを80%減らし、周期的再接地は、エラー制御の約9ステップごとに十分である。
論文 参考訳(メタデータ) (2026-02-10T21:08:53Z) - On GRPO Collapse in Search-R1: The Lazy Likelihood-Displacement Death Spiral [59.14787085809595]
この障害を引き起こす中核的なメカニズムとしてLazy Likelihood Displacement(LLD)を同定する。
LDDは早期に出現し、自己強化性LDDデススパイラル(LDD Death Spiral)を引き起こす。
本稿では,GRPO のための軽量な確率保存正則化 LLDS を提案する。
論文 参考訳(メタデータ) (2025-12-03T19:41:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。