論文の概要: Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures
- arxiv url: http://arxiv.org/abs/2608.02645v1
- Date: Fri, 31 Jul 2026 16:16:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:22.87389
- Title: Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures
- Title(参考訳): 非原子障害時のLDMエージェント信頼性向上のための検証ツールコール
- Authors: Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip Rana,
- Abstract要約: 現実世界のシステムは、ディスパッチ後のタイムアウト、遅延可視性、部分的な状態更新など、非原子的な振る舞いを示す。
これらのミスマッチは、重複アクション、タスク成功、不要なツール実行などの信頼性の問題を引き起こす。
ライトウェイトで検証対応のツールラッパーが導入されており、ツールコールをポストコンディション検証、バリデーション前ロジック、イデオロケーションキーで拡張する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Model (LLM) agents rely on external tools to perform multistage tasks. Existing agent frameworks typically assume that tool calls are atomic and return binary success or failure signals. However, real-world systems exhibit non-atomic behaviors such as timeouts after dispatch, delayed visibility, and partial state updates. These mismatches lead to reliability issues including duplicate actions, task success, and unnecessary tool executions. A lightweight, verification-aware tool wrapper is introduced that augments tool calls with postcondition verification, verify-before-retry logic, and idempotency keys. The approach is evaluated in a controlled simulated environment with injected non-atomic failures across multiple task templates. The results demonstrate that the proposed method significantly reduces duplicate actions, while maintaining comparable task success rates. Overall, the findings suggest that strengthening tool interaction semantics is a promising direction for improving LLM agent reliability without requiring modifications to the underlying language model.
- Abstract(参考訳): 大規模言語モデル(LLM)エージェントは、マルチステージタスクを実行するために外部ツールに依存している。
既存のエージェントフレームワークは通常、ツールコールがアトミックであると仮定し、バイナリの成功または失敗のシグナルを返す。
しかし、現実世界のシステムはディスパッチ後のタイムアウト、遅延可視性、部分的な状態更新など、非原子的な振る舞いを示す。
これらのミスマッチは、重複アクション、タスク成功、不要なツール実行などの信頼性の問題を引き起こす。
ライトウェイトで検証対応のツールラッパーが導入されており、ツールコールをポストコンディション検証、バリデーション前ロジック、イデオロケーションキーで拡張する。
このアプローチは、複数のタスクテンプレートにまたがる非原子的障害を注入した、制御されたシミュレーション環境で評価される。
提案手法は,タスク成功率を同等に保ちながら,重複動作を著しく低減することを示した。
全体として、ツール間の相互作用のセマンティクスの強化は、基礎となる言語モデルの変更を必要とせず、LLMエージェントの信頼性を向上させる上で有望な方向であることを示唆している。
関連論文リスト
- ScrambleToolBench: Agents Search Exhaustively Even When Their Own Map Points to the Next Step [74.83535434786145]
ScrambleToolBenchは,行動推論の分離を目的とした対話型端末ベンチマークである。
このベンチマークでは、エージェントがテストとエラーのインタラクションを通じて、隠されたツールの振る舞いを明らかにする必要がある。
現状の言語モデルに対する我々の評価は、初期発見が成功しても頑健な適応にはならないことを示している。
論文 参考訳(メタデータ) (2026-08-03T15:07:46Z) - Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints [37.92327096151557]
本稿では,生産エージェントシステムで観測された再現可能な現象について報告する。
複数のオープンウェイトモデルでは、高いスキーマ準拠を維持しながら、ツールの起動を中止している。
本稿では,スキーマ制約された応答生成からツールの実行を分離する推論時間戦略であるTransparent Two-Executionを提案する。
論文 参考訳(メタデータ) (2026-06-24T09:14:18Z) - Beyond the Black Box: Interpretability of Agentic AI Tool Use [0.0]
本稿では,スパースオートエンコーダと線形プローブ上に構築された機械論的・解釈可能性ツールキットを提案する。
フレームワークは各アクションの前にモデル状態を読み出し、ツールが必要かどうか、そして次のツールアクションがいかに適切かの両方を推測する。
我々は、NVIDIA Nemotron関数呼び出しデータセットから多段階の軌道上のプローブをトレーニングし、GPT-OSS 20BとGemma 3 27Bモデルに同じワークフローを適用する。
論文 参考訳(メタデータ) (2026-05-07T19:47:30Z) - AgentProcessBench: Diagnosing Step-Level Process Quality in Tool-Using Agents [50.481033105867205]
我々はAgentProcessBenchを紹介した。AgentProcessBenchは、現実的なツール拡張トラジェクトリにおけるステップレベルの有効性を評価するための最初のベンチマークである。
ベンチマークは、1,000の多様な軌跡と8,509の人間ラベル付きステップアノテーションと89.1%のアノテーション間合意で構成されている。
探索をキャプチャする3つのラベリングスキームと、ラベルのあいまいさを減らすためのエラー伝搬ルールを備えている。
論文 参考訳(メタデータ) (2026-03-15T16:13:58Z) - Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning [58.432996881401415]
最近の作業では、エージェント推論を可能にするために、外部ツールで大きな言語モデル(LLM)を拡張している。
本稿では,入力プロンプトを書き換えることのみでエージェント推論を妨害するスポンジツールアタック(STA)を提案する。
STAは、意味的忠実度の高い原文からの良心的な即興的な書き直しを生成する。
論文 参考訳(メタデータ) (2026-01-24T19:36:51Z) - Internal Representations as Indicators of Hallucinations in Agent Tool Selection [5.2107604548805915]
大規模言語モデル(LLM)は、ツール呼び出しとツールの使用において顕著な能力を示している。
LLMは、誤ったツールを選択し、不正なパラメータを提供し、"ツールバイパス"の振る舞いを示す幻覚に悩まされる。
LLMの内部表現を利用して,ツールコールの幻覚をリアルタイムに検出する,計算効率のよいフレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-08T18:38:45Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions [10.598440138966028]
現在の自己回帰のプラクティスは、プロンプトや一方的な推論に依存しています。
提案する構造的リフレクションは, エラーから修復までの経路を明示的で制御可能な, 訓練可能な動作に変換する。
BFCL v3とTool-Reflection-Benchの実験では、マルチターンツールコールの成功とエラー回復、冗長呼び出しの削減が大幅に向上した。
論文 参考訳(メタデータ) (2025-09-23T09:35:49Z) - Reinforcement Learning for Machine Learning Engineering Agents [52.03168614623642]
強化学習によって改善される弱いモデルによって支援されるエージェントは、はるかに大きいが静的モデルによって支援されるエージェントよりも優れていることを示す。
分散非同期RLフレームワークにおいて,高コストかつ高利回りな動作を増幅するための時間依存性の勾配更新を提案する。
また,早期に失敗するプログラムとほぼ正しくないプログラムを区別し,部分クレジットを提供する環境機器を提案する。
論文 参考訳(メタデータ) (2025-09-01T18:04:10Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。