論文の概要: Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools
- arxiv url: http://arxiv.org/abs/2608.04719v1
- Date: Wed, 05 Aug 2026 11:38:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.854818
- Title: Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools
- Title(参考訳): カナリアツールを用いたLDMエージェントの診断ツール選択推論
- Authors: Atul Anand, Sourav Chattaraj,
- Abstract要約: エージェントのModel Context Protocolツールセットにインストールされた診断プローブツール。
6種類の分類法は、単一の"間違ったツール"の結果を、モデルがどのようにツールに理由を持つかを多次元のプロファイルに変換する。
8つのモデル – 6つのホストと2つの8Bオープンウェイト – を3つの機能レベルに分散して評価しています。
- 参考スコア(独自算出の注目度): 0.42481744176244507
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Agent evaluations tell us that a model picked the wrong tool, but rarely why. We introduce canary tools: diagnostic probe tools planted in an agent's Model Context Protocol (MCP) tool set, each engineered to probe one specific tool-selection weakness. A six-type taxonomy (semantic decoys, parameter traps, capability mirages, prerequisite blindness, temporal decoys, and granularity traps) turns a single "wrong tool" outcome into a multi-dimensional profile of how a model reasons about tools. We evaluate eight models -- six hosted and two 8B open-weight -- spanning three capability tiers, on 120 tasks across three canary-density conditions and three seeds (8,640 runs), plus a 2,880-run subtlety ablation. Task success is graded by a provider-independent judge, corroborated by a second independent judge (Cohen's kappa = 0.75). We report three findings. First, susceptibility drops sharply as models get more capable: the per-task canary susceptibility rate (CSR) ranges about 36x across models, lowest for Claude Opus 4.8 and highest for Llama 3.1 8B. Second, capability tier alone does not predict safety: the most susceptible hosted model is mid-tier, and within a provider the cheaper model can be the safer one. Third, the taxonomy is capability-stratified: capability mirages most reliably trap frontier models, while the other types are largely inert on strong models but fire on small open models, so they discriminate by capability rather than being weak. Softening each canary's give-away phrase leaves frontier CSR essentially unchanged, evidence that the probes measure reasoning, not phrase-spotting. Susceptibility also predicts task failure (Spearman rho = -0.34), while the most robust models are not significantly degraded by canary pressure. We release the framework, canary schemas, tasks, and logs.
- Abstract(参考訳): エージェント評価は、モデルが間違ったツールを選択したことを示しているが、なぜかはめったにない。
エージェントのモデルコンテキストプロトコル(MCP)ツールセットに組み込まれた診断プローブツール。
6種類の分類法(セマンティック・デコイ、パラメータ・トラップ、能力・ミラージュ、必要視力、時間的デコイ、粒度・トラップ)は、単一の「強力なツール」の結果を、モデルがどのようにツールに理由を持つかの多次元プロファイルに変換する。
8つのモデル – 6つのホストと2つのオープンウェイト – が3つの機能レベルにまたがって,3つのカナリア密度条件と3つの種子(8,640ラン),2,880ランの微妙なアブレーションで評価した。
タスクの成功はプロバイダ非依存の裁判官によって評価され、第二独立の裁判官によって調整される(コーエンのカッパ = 0.75)。
我々は3つの発見を報告した。
タスクあたりのカナリア・サセプティビリティ・レート(CSR)は、モデル全体で約36倍、クロード・オプス4.8では最低、ラマ3.1では最高である。
第2に、機能層だけでは安全性を予測できない — 最も感受性の高いホストモデルが中間層であり、プロバイダ内ではより安価なモデルがより安全である可能性がある。
能力ミラージュはフロンティアモデルを最も確実に罠にかけるのに対して、他のタイプは強力なモデルでは不活性であるが、小さなオープンモデルでは不活性であるので、弱いというより能力によって区別される。
それぞれのカナリアの与えられたフレーズを軟化すると、フロンティアCSRは基本的に変化せず、プローブがフレーズスポッティングではなく推論を測る証拠となる。
サセプティビビリティはタスクの失敗を予測する(Spearman rho = -0.34)が、最も頑健なモデルはカナリア圧力によって著しく劣化しない。
フレームワーク、カナリアスキーマ、タスク、ログをリリースしています。
関連論文リスト
- Determinants and Limits of LLM Security-Tool Orchestration: A Study with HexStrike-AI [2.2616066835313253]
7つのカテゴリと3つの難易度で86のPicoCTF課題を実行し、3つのツールアクセスレジームと3つのモデル/クライアント構成で実行します。
既存のツール,エージェント・ビヘイビアの変更,11の新たな機能ツールに修正を適用し,これまで未経験だったトライアルを再実行します。
全体の解決率は55.4%から72.0%に上昇し、全ての構成が大幅に改善される。
論文 参考訳(メタデータ) (2026-07-03T02:20:04Z) - Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning [51.88950852117154]
Chunk-Level Guided Generationは、既製の大規模言語モデルをプロセススコアラとして使用する、トレーニング不要の代替手段である。
本研究では,系統的な長さバイアスのため,大モデル確率の可変長推論ステップが信頼できないことを示す。
Chunk-Level Guided Generation は PRM guided search よりもかなり短い推論トレースを生成する。
論文 参考訳(メタデータ) (2026-06-01T04:43:36Z) - It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers [0.0]
LLMエージェントのデプロイメントにおける一般的な仮定は、より構造化されたハーネスは信頼性を普遍的に改善する、というものである。
我々はこの仮説を,4つの能力層にまたがる6つのモデルにまたがる制御された432回の実験により検証した。
我々は6ラベルの障害分類を導入し、form_violationが有能なモデル障害を、 wrong_fileが低能力な障害を、それぞれ支配していることを示す。
論文 参考訳(メタデータ) (2026-05-26T09:08:41Z) - AgentAtlas: Beyond Outcome Leaderboards for LLM Agents [0.025718125188898048]
AgentAtlasは、診断語彙および監査プロトコルとしてのエージェント評価を再設定する。
i)6状態制御-決定分類(Act / Ask / Refuse / Stop / Confirm / Recover)、(ii)一次誤差源と下流衝撃を持つ軌道障害語彙、(iv)8つのモデルで評価された合成1,342-itemに関する実証的プロトコル研究。
論文 参考訳(メタデータ) (2026-05-19T22:05:12Z) - AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators [0.0]
AgentCollabBenchは、ソフトウェアエンジニアリング、DevOps、データエンジニアリングにまたがる900の人為的なタスクの診断ベンチマークです。
各タスクは、4つの行動リスクのうちの1つを分離する。
GPT 4.1 mini, Gemini 2.5 Flash Lite, Qwen-3.5-35B-A3B, Llama 3.1 8B の4つの近代LCMの評価を行った。
通信トポロジは、マルチホップ情報サバイバルにおけるばらつきの7-40%を説明する主要なリスクファクターとして現れる。
論文 参考訳(メタデータ) (2026-05-09T03:35:09Z) - Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning [59.74608632210439]
そこで本研究では,ツール使用の自然な動作を,ツールなし推論能力を犠牲にすることなく,強力な思考モデルに注入する方法を示す。
提案手法は,オープンソースモデル間のベンチマークにおいて,最先端のパフォーマンスを実現するモデルを生成する。
論文 参考訳(メタデータ) (2026-05-07T14:23:21Z) - Claw-Eval: Toward Trustworthy Evaluation of Autonomous Agents [66.97968363332465]
エージェントベンチマークの3つのギャップに対処するエンドツーエンド評価スイートであるClaw-Evalを紹介した。
Claw-Evalは3つのグループにまたがる9つのカテゴリにまたがる300の人間検証タスクで構成されている。
すべてのエージェントアクションは、3つの独立したエビデンスチャネルを通じて記録される。
論文 参考訳(メタデータ) (2026-04-07T17:43:18Z) - AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents [75.67445299298949]
AgentCPM-Exploreは、知識密度と強力な探索能力を備えたコンパクトな4Bエージェントモデルである。
本稿では,パラメータ空間モデルの融合,報酬信号の復調,文脈情報の改良を特徴とする総合的なトレーニングフレームワークを提案する。
AgentCPM-Exploreは4つのベンチマークで8BクラスのSOTAモデルにマッチまたは超え、また5つのベンチマークでClaude-4.5-SonnetやDeepSeek-v3.2のような大規模モデルよりも優れている。
論文 参考訳(メタデータ) (2026-02-06T08:24:59Z) - One Model to Critique Them All: Rewarding Agentic Tool-Use via Efficient Reasoning [54.580646706013965]
リワードモデル(RM)は、大きな言語モデルと人間の嗜好の整合において重要な役割を果たす。
一般的なツール使用シナリオに適した軽量な生成型RMのファミリーであるToolRMを紹介する。
これらのモデルを構築するために,ルールベースのスコアリングと多次元サンプリングを用いたペアワイズ選好データを構築するパイプラインを提案する。
論文 参考訳(メタデータ) (2025-10-30T06:08:27Z) - MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools [54.63478102768333]
十分に校正されたモデル信頼度は、潜在的な行動の報酬に対するリスクを測るために使用することができる。
本稿では,ツール呼び出し時の信頼度を評価するために,モデル内信頼度推定器(MICE)の新たなクラスを提案する。
論文 参考訳(メタデータ) (2025-04-28T18:06:38Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。