論文の概要: Invocation-Level Reliability of Tool-Using Agents
- arxiv url: http://arxiv.org/abs/2608.26189v1
- Date: Sun, 23 Aug 2026 09:04:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-28 16:30:58.1123
- Title: Invocation-Level Reliability of Tool-Using Agents
- Title(参考訳): ツール・ユース・エージェントの起動レベル信頼性
- Authors: Afiya Noorain, Subhranshu Mohanty, Amritesh Banerjee, Abhijit Dasgupta,
- Abstract要約: クリーンな教師強化コンテキストと,モデル独自のフリーランニングコンテキストの両方の下で,その2つを分離する,正しい起動率を測定する。
深さ6では、モデル自身のクリーンコンテキスト能力の約70%が、以前の失敗に失われる。
- 参考スコア(独自算出の注目度): 0.7874708385247353
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Tool-using agents fail two ways: choosing the wrong tool, or forming wrong arguments, and an early failure of either kind can silently corrupt everything downstream. We measure a correct-invocation rate that separates the two, under both a clean teacher-forced context and the model's own free-running context, on five open-weight models over contamination-free multi-step tasks (depths 1-8). By depth 6, roughly 70% of a model's own clean-context capability is lost to its own earlier mistakes (L6 = 0.686, 0.684). Our central finding concerns the measurement itself. Under exact-match scoring against a fixed gold trajectory, a propagation model's severity and recovery parameters are not merely hard to estimate - they are fixed by the scoring rule. Severity is forced to its boundary (0 of 869 poisoned steps correct); recovery is structurally unobservable (0 of 580 poisoned steps returned on-track, against an expected 0.0058 by chance). Both follow from one mechanism: post-divergence, the gold value is generated by tool constants the model never sees, so it is information the model cannot derive. A fit run anyway returns 0.92 and 0.73 for a quantity that is exactly 1.000 - confident numbers for a parameter the scoring rule already determined. We give the mechanism and a remedy, conditional-on-state scoring, applied retrospectively to cached completions at zero additional cost, which un-pins severity to interior estimates excluding zero (+0.149, +0.316).
- Abstract(参考訳): ツールを使用するエージェントは、間違ったツールを選択するか、間違った引数を作るかの2つの方法で失敗する。
汚染のないマルチステップタスク(deepths 1-8)上の5つのオープンウェイトモデルに基づいて、クリーンな教師強化コンテキストとモデル独自のフリーランニングコンテキストの両方の下で、両者を分離する正しい起動率を測定する。
深さ6では、モデル自身のクリーンコンテキスト能力の約70%が、それ以前の誤り(L6 = 0.686, 0.684)に失われる。
私たちの中心的な発見は測定そのものに関するものです。
固定された金軌道に対する正確なマッチスコアでは、伝播モデルの重大度と回復パラメータは単に推定が難しいだけでなく、スコアリングルールによって固定される。
重症度は境界線に強制され(869段のうち0段は正しい)、回復は構造的に観察不可能(0段目のうち580段目は偶然に0.0058段が返却される)である。
どちらも1つのメカニズムから従う: 分割後、金の値はモデルが決して見ることのないツール定数によって生成されるので、モデルが導出できない情報である。
いずれにせよ、フィッティングランは、スコアリングルールがすでに決定しているパラメータに対して、正確に1.000の自信のある数値に対して0.92と0.73を返す。
キャッシュされた完了に対して、ゼロ (+0.149, +0.316) を除く内部推定に重大性を弱めるため、キャッシュされた完了をゼロのコストで遡及的に適用する機構と条件付き状態スコアを与える。
関連論文リスト
- Where Cognition Lives: Dissecting Emergent from Computed Function in a Minimal Complete Cognitive Architecture [0.0]
適応停止, ホメオスタティック制御フィールド, 値モジュールを備えたリカレント推論器を構築する。
停止も出現し、前もって決定できるものよりも価値が高いように見えるが、その外観は計り知れない。
PonderNetスタイルの停止は、隠された状態の停止重み付き混合を返し、強制深度ベースラインは1を返す。
論文 参考訳(メタデータ) (2026-08-23T10:27:13Z) - RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance [84.26294415726723]
汎用報酬モデルが、ロボット学習のスケーリングのボトルネックになりつつある。
ロボット操作のためのオープンソースのバリューファンデーションモデルであるRynnValueを紹介した。
RynnValueは7000時間以上、好みやプログレッシブアノテーションなしで約3Mの命令条件付きクリップにスケールする。
論文 参考訳(メタデータ) (2026-08-10T17:09:37Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary [0.0]
言語モデルは、進行中の計算の質を読み取ることができるか?
外部介入は、その読み出しをより良い結果に変えることができるか?
凍結した2.6Bループ変換器,Ouro-RLTTで両質問を検証した。
論文 参考訳(メタデータ) (2026-07-20T22:40:36Z) - Self-Compacting Language Model Agents [44.3231488987671]
SelfCompactは、モデル自体がいつ、どのようにコンパクトになるかを決定できる足場である。
微調整や外部の監督なしに、効果的な適応圧縮を付与する。
以上の結果から,SelfCompactはトークンコストのごく一部で,固定区間の要約と一致するか,あるいは超えていることがわかった。
論文 参考訳(メタデータ) (2026-06-22T16:08:34Z) - CRANE: Knowledge Editing for Reasoning MLLMs [37.084419383244814]
マルチモーダルな大言語モデル(MLLM)は、回答を生成する前に明示的なチェーン・オブ・シークレット(CoT)推論を生成する。
MLLMの推論では、(FT, LoRA)を一般化する手法はフォーマットの崩壊を引き起こすが、深い修正のない手法は一般化できない。
本稿では,CRANEを提案する。
論文 参考訳(メタデータ) (2026-06-08T05:01:11Z) - Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures [0.0]
Causal Agent Replay (CAR) は、エージェントが構造的因果モデルとして実行されることをモデル化する。
ステップにダブルオペレーションを適用し、同じポリシーの下で軌道を再実行します。
CARはオープンソースで、ホストまたはフリーのローカルモデルで動作する。
論文 参考訳(メタデータ) (2026-06-06T17:44:23Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - Tracing Uncertainty in Language Model "Reasoning" [46.61902399979181]
言語モデル(LM)は、一般的にChain-of-Thoughtまたはテストタイムスケーリングと呼ばれ、しばしばベンチマークのパフォーマンスを改善する。
本研究では,LMが生成する中間トークン列である「推論」トレースを進化的モデル状態として扱うことにより,これらのダイナミクスを考察する。
論文 参考訳(メタデータ) (2026-05-08T14:16:37Z) - Evaluating Tool-Using Language Agents: Judge Reliability, Propagation Cascades, and Runtime Mitigation in AgentProp-Bench [0.0]
AgentProp-Benchは4つのドメインに2300のトレースを持つ2,000タスクのベンチマークである。
我々は、判断信頼性を定量化し、エラーの伝播を特徴づけ、実行時の緩和を評価する。
すべてのコード、データ、トレース、および人間のラベルはhttps://github.com/bhaskargurram-ai/agenthallu-bench.orgで公開されている。
論文 参考訳(メタデータ) (2026-04-17T21:15:35Z) - Probing for Knowledge Attribution in Large Language Models [45.47366023067617]
大規模言語モデル(LLM)は、しばしば流動的だが根拠のないクレームや幻覚を生成する。
適切な緩和は、モデルの答えがプロンプトまたは内部の重みに基づいているかどうかを知ることに依存する。
モデル隠れ表現に基づいて訓練された単純な線形分類器であるプローブは、帰納的帰属を確実に予測できることを示す。
論文 参考訳(メタデータ) (2026-02-26T09:21:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。