論文の概要: Measuring the Serving Stack Instead of the Model: Hidden Confounds in Local Tool-Use Evaluation
- arxiv url: http://arxiv.org/abs/2609.26693v1
- Date: Tue, 22 Sep 2026 16:48:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-24 01:05:39.750351
- Title: Measuring the Serving Stack Instead of the Model: Hidden Confounds in Local Tool-Use Evaluation
- Title(参考訳): モデルの代わりにサービングスタックを計測する: ローカルツール利用評価における隠れた欠点
- Abstract要約: 測定結果は, モデル行動のみでなく, サービス層に依存していることを示す。
評価プロトコルの一部としてサービス提供行動を扱うためのチェックリストで締めくくった。
- 参考スコア(独自算出の注目度): 0.49109372384514843
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A coding agent must emit a valid tool call--a parseable invocation of a tool in the provided schema--before the harness can execute its chosen action. We study how local serving stacks affect this protocol step and show that measured outcomes can depend on the serving layer rather than model behavior alone. In Ollama, the default tools= request is gated per model by a static template flag: some models are accepted and return calls as text, some return native tool_calls, while Phi-3 and Gemma-3 are rejected before inference. In our harness, rejection and retry exhaustion are not preserved as structured failure metadata, so downstream analysis can misclassify them as model non-calls and naively report 0% fidelity. Adding a text tool list while retaining the native channel recovers much of the measured fidelity for accepted models, whereas a uniform text protocol reduces fidelity for Llama-3.2, which has native tool-call support. Cross-stack probes on Ollama, llama.cpp, vLLM, and SGLang show different handling of the same request. Constrained decoding removes parse failures but can induce non-termination, and turn-pooled versus per-instance estimates differ by up to about 55 points. We conclude with a checklist for treating serving behavior as part of the evaluation protocol.
- Abstract(参考訳): コーディングエージェントは、与えられたスキーマでツールを解析可能な呼び出しとして、有効なツールコールを発行する必要がある。
ローカルなサービススタックがこのプロトコルのステップにどのように影響するかを調べ、測定結果がモデル動作のみでなくサービス層に依存していることを示す。
Ollamaでは、デフォルトのツール=リクエストは静的テンプレートフラグによってモデルごとにゲートされる。いくつかのモデルは受け入れられ、テキストとして返される。
我々のハーネスでは、リトライとリトライの疲労は構造化された障害メタデータとして保存されないため、下流分析はそれらをモデルノンコールとして誤分類し、0%の忠実度を否定的に報告することができる。
ネイティブチャネルを維持しながらテキストツールリストを追加すると、許容されたモデルに対する測定された忠実度が回復する一方、統一されたテキストプロトコルは、ネイティブツールコールをサポートするLlama-3.2の忠実度を減少させる。
Ollama、llama.cpp、vLLM、SGLangのクロススタックプローブは、同じリクエストの異なるハンドリングを示している。
制限された復号化はパース障害を除去するが、非終端を誘導し、ターンプールとインスタンス毎の推定値は55ポイントまで異なる。
評価プロトコルの一部としてサービス提供行動を扱うためのチェックリストで締めくくった。
関連論文リスト
- Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - AgentProv: Auditing Agentic LLM API Providers via Tool-use Policy Probes [38.37599802008238]
商用LLM APIは特定の基盤モデルを宣伝するが、提供されたバックボーンは静かに代用され、定量化され、あるいはラップされることがある。
既存の監査はすべて、テキスト出力チャネルからバックボーンアイデンティティを決定する。
本稿では,AgentProv(AgentProv)について紹介する。
論文 参考訳(メタデータ) (2026-08-30T08:22:12Z) - Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling [11.1017602726296]
大規模言語モデルは、ますます自律的なエージェントとして機能している。
現在のベンチマークには3つの制限がある。
Evalは、2段階のフレームワークで構築されたベンチマークである。
論文 参考訳(メタデータ) (2026-08-09T13:25:54Z) - Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers [0.0]
実行状態を維持して、実行を中断し、クラッシュを生き残るためのフレームワークは、すでに発生した影響に対して、再開が何を意味するのかを判断し続けなければなりません。
5つの広くデプロイされたエージェントワークフローフレームワークがそれぞれ異なる答えを出し、マシンチェック可能なコントラクトを公開することはない。
LangGraph 1.2.9は2度目の履歴書値を記録し、それを参照せず、無意味な状態を静かに持続し、実際のSIGKILLの後、永続的に記録された作業を再実行する。
論文 参考訳(メタデータ) (2026-08-04T15:45:31Z) - TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference [47.62941623025392]
本稿では,非侵入的でログ対応なLLM推論フレームワークであるTELLERについて紹介する。
TELLERはモデルバイナリを変更することなく、NVTX/CUPTIトレースとサービスログを収集する。
リクエスト毎のコールチェーンツリーを再構築し、ログ行と対応する実行ステップをアライメントする。
これらの表現に加えて、TELLERは数値的候補のローカライゼーションとマルチモーダルな根起因モデルを組み合わせる。
論文 参考訳(メタデータ) (2026-08-03T09:39:11Z) - Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints [37.92327096151557]
本稿では,生産エージェントシステムで観測された再現可能な現象について報告する。
複数のオープンウェイトモデルでは、高いスキーマ準拠を維持しながら、ツールの起動を中止している。
本稿では,スキーマ制約された応答生成からツールの実行を分離する推論時間戦略であるTransparent Two-Executionを提案する。
論文 参考訳(メタデータ) (2026-06-24T09:14:18Z) - Tool-Call Dependency Structure is Linearly Decodable in LLM Agent Residual Streams [1.0971997884861282]
LLMエージェントは、呼び出しが有向依存グラフを形成するトラジェクトリを生成する。
以前の構造プローブは、エージェントのランタイムコールグラフではなく、静的コードやチェーン・オブ・シンクテキストをターゲットにしていた。
Qwen3-32Bの残ストリーム上の低容量エッジプローブは、ツールコール依存性グラフをデコードする。
論文 参考訳(メタデータ) (2026-05-25T00:16:32Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - MICE for CATs: Model-Internal Confidence Estimation for Calibrating Agents with Tools [54.63478102768333]
十分に校正されたモデル信頼度は、潜在的な行動の報酬に対するリスクを測るために使用することができる。
本稿では,ツール呼び出し時の信頼度を評価するために,モデル内信頼度推定器(MICE)の新たなクラスを提案する。
論文 参考訳(メタデータ) (2025-04-28T18:06:38Z) - Probing Model Signal-Awareness via Prediction-Preserving Input
Minimization [67.62847721118142]
モデルが正しい脆弱性信号を捕捉して予測する能力を評価する。
SAR(Signal-Aware Recall)と呼ばれる新しい指標を用いて,モデルの信号認識を計測する。
その結果,90年代以降のリコールから60年代以降のリコールは,新たな指標で大幅に減少した。
論文 参考訳(メタデータ) (2020-11-25T20:05:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。