論文の概要: Action-Space Shaping for LLM Agents: Measuring and Mitigating Tool-Schema Bias
- arxiv url: http://arxiv.org/abs/2609.34971v1
- Date: Mon, 28 Sep 2026 11:52:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:25:11.011252
- Title: Action-Space Shaping for LLM Agents: Measuring and Mitigating Tool-Schema Bias
- Title(参考訳): LLM剤のアクション・スペース・シェイピング:ツール・スキーマ・バイアスの測定と緩和
- Abstract要約: 大きな言語モデル(LLM)は、固定されたツールスキーマが与えられたとき、ツール使用エージェントタスクに強いパフォーマンスを示しています。
しかし、ツールスキーマはエージェントのアクション空間ではない。
現在のエージェントはそうではないことがよく示され、それはスキーマバイアスと呼ばれる現象である。
- 参考スコア(独自算出の注目度): 21.179051569465578
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have shown strong performance on tool-use agentic tasks when given a fixed tool schema. Yet a tool schema is not the action space of an agent; it is merely one interface representation of it. The same executable action can be exposed through many different, functionally equivalent tool definitions, and an agent that has truly learned a task should behave consistently across them. We show that current agents often do not, a phenomenon we term schema bias. To study this systematically, we introduce an executable transformation framework that rewrites a native tool schema using nine operators, including merging and splitting tools, altering how a single tool is expressed, and distributing one action across several dependent calls. The tasks, executable actions, and reachable states remain fixed, so any change in success is attributable to the interface alone. Evaluating eleven LLMs, including two closed models, on up to 32 schema variants, we ask how large schema bias is, how it manifests, whether the difficulty of a schema variant can be predicted without a full evaluation, and whether training removes it. We find that schema bias is substantial even for the newest models: success rates range from complete failure to 97% depending solely on the schema. To reliably estimate schema difficulty, it requires running a small sample of the target queries. Training repairs a schema variant only when that variant appears in the training data.
- Abstract(参考訳): 大きな言語モデル(LLM)は、固定されたツールスキーマが与えられたとき、ツール使用エージェントタスクに強いパフォーマンスを示しています。
しかし、ツールスキーマはエージェントのアクション空間ではない。
同じ実行可能なアクションは、さまざまな機能的に等価なツール定義を通じて公開することができる。
現在のエージェントはそうではないことがよく示され、それはスキーマバイアスと呼ばれる現象である。
これを体系的に研究するために、私たちは、マージと分割ツール、単一のツールの表現方法の変更、複数の依存する呼び出しにまたがる1つのアクションの分散を含む9つのオペレータを使って、ネイティブツールスキーマを書き換える実行可能な変換フレームワークを導入しました。
タスク、実行可能なアクション、到達可能な状態は依然として固定されているため、成功のあらゆる変化はインターフェイスのみに起因する。
2つのクローズドモデルを含む11のLCMを最大32のスキーマ変種で評価し、スキーマ偏差がどの程度大きいか、スキーマ変種の難易度を十分に評価せずに予測できるかどうか、トレーニングがそれを除去するかどうかを問う。
成功率は、スキーマのみに依存して、完全な失敗から97%まで、さまざまです。
スキーマの難しさを確実に見積もるためには、ターゲットクエリの小さなサンプルを実行する必要がある。
トレーニングは、トレーニングデータにその変種が現れる場合にのみスキーマの変種を修復する。
関連論文リスト
- Calibration is the Bottleneck: An Action-Class Diagnostic of Multi-Turn Tool-Calling [65.03665015319457]
本稿では,マルチターン障害を2つのモードに分解するアクションクラス指向診断フレームワークを提案する。
複数のマルチターンベンチマークにまたがるツールコールモデルのパネル上で検証を行う。
論文 参考訳(メタデータ) (2026-09-01T09:08:15Z) - Joint Optimization of Tool Creation and Use for Large Language Model Agents [69.07066297088187]
SMITH (-grounded Multi-task Iterative Tool Honing) は、単一のポリシー内でツールの作成とツールの使用を訓練する。
SMITHで訓練された4B Qwen3は、正確に検証された13の手続き的推論タスクで、保持されたタスクで平均79.8のマクロ平均精度に達する。
また、TabMWP-Hardでは40.4、ドメイン外のGQAでは42.6に到達している。
論文 参考訳(メタデータ) (2026-08-25T13:59:34Z) - MM-ToolSandBox: A Unified Framework for Evaluating Visual Tool-Calling Agents [50.27505102982638]
本稿では,ツールコールエージェントのベンチマークおよび評価フレームワークであるMM-ToolSandBoxを紹介する。
このフレームワークは16のアプリケーションドメインで500以上のツールにまたがるステートフルな実行環境を提供する。
マルチイメージのマルチターンタスクをサポートしており、エージェントは実行可能ツールコールに徐々に視覚的な入力を入力しなければならない。
論文 参考訳(メタデータ) (2026-07-13T17:13:09Z) - Constraint Tax in Open-Weight LLMs: An Empirical Study of Tool Calling Suppression Under Structured Output Constraints [37.92327096151557]
本稿では,生産エージェントシステムで観測された再現可能な現象について報告する。
複数のオープンウェイトモデルでは、高いスキーマ準拠を維持しながら、ツールの起動を中止している。
本稿では,スキーマ制約された応答生成からツールの実行を分離する推論時間戦略であるTransparent Two-Executionを提案する。
論文 参考訳(メタデータ) (2026-06-24T09:14:18Z) - Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents [41.53691975342536]
私たちは、小さなプランナがツールの解決、パラメータの検証、依存性の追跡、実行で失敗する、妥当なワークフローグラフを生成すると論じています。
数百のトレースがワークフロー形式を教えることができるが、ツールカタログの変更による障害計画の修正に必要なリカバリ動作をカバーすることはめったにない。
本稿では,ツールグラフの修復作業として,コンパクトツールの使用を取り扱う推論時進化探索手法であるEvofluxを紹介する。
論文 参考訳(メタデータ) (2026-06-10T21:01:06Z) - When Tools Fail: Benchmarking Dynamic Replanning and Anomaly Recovery in LLM Agents [48.32450507410869]
既存のベンチマークでは、LLMにおけるツール統合推論を理想化された'ハッピーパス'に基づいて評価している。
我々はTIRエージェントの動的経路探索とエラー回復のためのベンチマークであるToolMazeを紹介する。
論文 参考訳(メタデータ) (2026-06-04T07:38:46Z) - Don't Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models [13.697586490157299]
小型言語モデル(SLM)は、ツール強化されたAIシステムに対して大きな計算上のアドバンテージを提供する。
ツールの使用タスク、特に適切なツールの選択と正確なパラメータの特定に苦労する。
モデルの事前訓練された知識に合わせてスキーマを適用することを提案する。
MetaToolとRoTBenchの実験では、最大17%の改善があり、スキーマのミスアライメントエラーが80%削減された。
論文 参考訳(メタデータ) (2025-10-08T17:16:07Z) - ReMatch: Retrieval Enhanced Schema Matching with LLMs [0.874967598360817]
本稿では,検索強化大言語モデル(LLM)を用いたスキーママッチングのためのReMatchという新しい手法を提案する。
大規模な実世界のスキーマに対する実験結果から,ReMatchが効果的なマーカであることが示された。
論文 参考訳(メタデータ) (2024-03-03T17:14:40Z) - AdaMerging: Adaptive Model Merging for Multi-Task Learning [68.75885518081357]
本稿では,Adaptive Model Merging (AdaMerging)と呼ばれる革新的な手法を紹介する。
本来のトレーニングデータに頼ることなく、タスクレベルでも階層的にも、モデルマージの係数を自律的に学習することを目指している。
AdaMergingは、現在の最先端のタスク演算のマージ方式と比較すると、パフォーマンスが11%向上している。
論文 参考訳(メタデータ) (2023-10-04T04:26:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。