論文の概要: Attributing Structured-Output Gains in Function Calling: Interface Alignment versus Procedural Transfer
- arxiv url: http://arxiv.org/abs/2607.02595v1
- Date: Wed, 01 Jul 2026 08:32:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-09 13:39:56.296072
- Title: Attributing Structured-Output Gains in Function Calling: Interface Alignment versus Procedural Transfer
- Title(参考訳): 関数呼び出しにおける構造的出力利得の寄与:インターフェイスアライメントと手続き的転送
- Authors: Wanyi Chen, Daoyuan Chen, Fang Kong,
- Abstract要約: 本稿では,4層ゲイントリビューションプロトコルを提案する。
いくつかの明らかな利得は、手続き的転送よりもインタフェースの整合性に起因していることが示される。
我々は、BFCL-CANONICALをリリースし、標準化メトリクス、バランスの取れたインジェクション、スキルゲイン帰属のためのフォーマットのみのベースラインを推奨する。
- 参考スコア(独自算出の注目度): 17.463712346845803
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Structured-output benchmarks reward both task decisions and interface compliance, so prompt-induced function-calling gains require attribution before they can be interpreted as transferable skill. We introduce a four-layer gain-attribution protocol for prompt-prepended skill injection, combining canonicalized rescoring, format-only controls, repaired/balanced induction, and portability checks. Applied to the Berkeley Function Calling Leaderboard (BFCL) and scoped with API-Bank, MATH-500, and MultiHop-RAG, the protocol shows that several apparent gains are better attributed to interface alignment than to procedural transfer: format-only prompts match or exceed full skills in key BFCL cells, repaired/balanced induction removes the largest sub-frontier gains, and API-Bank target-native gains are matched within 0.5 percentage points (pp) by length-matched generic procedural prompts. These findings treat format compliance as a useful engineering capability while clarifying what a structured-output score certifies. We release BFCL-CANONICAL and recommend canonicalized metrics, balanced induction, and format-only baselines for function-calling skill-gain attribution. Code and data are available at https://github.com/couragec/skill-injection-attribution.
- Abstract(参考訳): 構造化出力ベンチマークは、タスク決定とインターフェースコンプライアンスの両方に報いるため、プロンプトによる関数呼び出しのゲインは、転送可能なスキルとして解釈する前に属性を必要とする。
本稿では,4層ゲイントリビューションプロトコルを導入し,正規化再コーディング,フォーマットのみの制御,修復/均衡誘導,ポータビリティチェックを併用する。
このプロトコルは、Berkeley Function Calling Leaderboard (BFCL)に適用され、API-Bank、MATH-500、MultiHop-RAGでスコープされている。このプロトコルは、プロシージャ転送よりも、インターフェースアライメントによる明らかな利得が優れていることを示している。
これらの知見は、構造化出力スコアの証明を明確化しつつ、フォーマットコンプライアンスを有用なエンジニアリング能力として扱う。
我々は、BFCL-CANONICALをリリースし、標準化メトリクス、バランスの取れた誘導、および関数呼び出しスキルゲイン属性のためのフォーマットのみのベースラインを推奨する。
コードとデータはhttps://github.com/couragec/skill-injection-attribution.comで公開されている。
関連論文リスト
- TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition [62.56752617853322]
アウトカムベースの報酬はスパースフィードバックのみを提供するが、トラジェクトリによる報酬は注釈付き参照ソリューションに依存している。
本稿では,関数スキーマと実行時実行を直接管理する報奨フレームワークであるtrajectory-Invariant Execution Rewardsを提案する。
論文 参考訳(メタデータ) (2026-05-16T03:47:26Z) - Parallel Prefix Verification for Speculative Generation [10.689879928713564]
PARSE (Parallel pRefix Speculative Engine) は、大規模言語モデル(LLM)推論を高速化する投機生成フレームワークである。
本稿では,大言語モデル(LLM)推論を,意味レベルでプレフィックス検証を並列化することによって高速化する投機的生成フレームワークであるPARSEを紹介する。
論文 参考訳(メタデータ) (2026-05-05T19:56:37Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - UniRec: Bridging the Expressive Gap between Generative and Discriminative Recommendation via Chain-of-Attribute [12.89120699793625]
Generative Recommendation (GR) reframes search and ranking as autoregressive decoding over Semantic IDs (SIDs)
p(y|f,u) によるランクは p(f|y,u) によるランクと同値であり、アイテムの特徴を自己回帰的に分解する。
提案するUniRecとChain-of-Attribute(CoA)は、その中核となるメカニズムである。CoAは、SIDを復号する前に構造化属性トークン:カテゴリ、販売者、ブランドを含む各SIDシーケンスをプレフィックスし、識別モデルが活用するアイテム側の特徴交差を復元する。
論文 参考訳(メタデータ) (2026-04-14T03:13:50Z) - Learning from Emptiness: De-biasing Listwise Rerankers with Content-Agnostic Probability Calibration [76.08899010904652]
CapCalは、ランキング決定から位置バイアスを機械的に分離する、トレーニング不要のフレームワークである。
シングルパス効率を保ちながら、トレーニング不要の手法で優れた性能を発揮する。
論文 参考訳(メタデータ) (2026-04-11T10:47:22Z) - ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning [9.137158235106941]
ExecVerifyは、実行トレースから得られた検証済みのホワイトボックス報酬を組み込むことで、テキストの模倣を越えている。
ExecVerifyでトレーニングされた7Bモデルは、コード推論ベンチマークで32Bモデルに匹敵するパフォーマンスを実現している。
論文 参考訳(メタデータ) (2026-03-11T18:49:45Z) - BRIDGE: Building Representations In Domain Guided Program Verification [67.36686119518441]
BRIDGEは、検証をコード、仕様、証明の3つの相互接続ドメインに分解する。
提案手法は, 標準誤差フィードバック法よりも精度と効率を著しく向上することを示す。
論文 参考訳(メタデータ) (2025-11-26T06:39:19Z) - TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework [62.66056331998838]
TeaRAGは、検索内容と推論ステップの両方を圧縮できるトークン効率のエージェントRAGフレームワークである。
報奨関数は,過剰な推論ステップをペナルティ化しながら,知識マッチング機構によって知識満足度を評価する。
論文 参考訳(メタデータ) (2025-11-07T16:08:34Z) - GRAPE: Let GPRO Supervise Query Rewriting by Ranking for Retrieval [19.73916326078242]
CLIPモデルは,テキストと画像データを統合埋め込み空間に整列させることにより,大規模検索システムの基盤となっている。
コストのかかるリトレーニングを避けるため、既存のメソッドは主に大規模言語モデル(LLM)によるクエリ書き換え戦略を採用している。
GRAPEは,検索誘導型クエリ書き換えにランキング信号を組み込むプラグイン・アンド・プレイ拡張手法である。
論文 参考訳(メタデータ) (2025-09-27T15:36:59Z) - Instruction-Following Evaluation in Function Calling for Large Language Models [0.0]
IFEval にインスパイアされたベンチマーク IFEval-FC (arXiv:2311.079) を紹介する。
IFEval-FCは、関数呼び出しによる正確な命令を評価する。
GPT-5やClaude 4.1 Opusといった最先端のプロプライエタリモデルでさえ、基本的なフォーマットルールに従わなかったことがよく示されている。
論文 参考訳(メタデータ) (2025-09-22T21:04:39Z) - GLiClass: Generalist Lightweight Model for Sequence Classification Tasks [49.2639069781367]
本稿では,シーケンス分類タスクにGLiNERアーキテクチャを適用する新しい手法であるGLiClassを提案する。
提案手法は,ゼロショットおよび少数ショット学習シナリオに必要な柔軟性を維持しつつ,埋め込み方式に匹敵する高い精度と効率を実現する。
論文 参考訳(メタデータ) (2025-08-11T06:22:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。