論文の概要: CRAFT: Learn the Schema, Execute the Plan
- arxiv url: http://arxiv.org/abs/2607.22642v1
- Date: Wed, 24 Jun 2026 00:12:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-02 22:55:39.002004
- Title: CRAFT: Learn the Schema, Execute the Plan
- Title(参考訳): CRAFT: スキーマを学び、計画を実行する
- Abstract要約: CRAFTは、スキーマ基底符号化エージェントのための2段階の訓練後レシピである。
まず、スキーマストラップ付きPLAN教師付き微調整により、検証された軌道からドメイン構造化計画と実行可能な振る舞いを学習する。
第二に、実行形式の強化学習は、ツールの選択、コード品質、計画コードの一貫性、失敗した実行からのリカバリのポリシーを整合させる。
- 参考スコア(独自算出の注目度): 1.4711904351495848
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Enterprise coding agents translate natural-language analytical requests into executable code over proprietary APIs, schemas, and metric definitions. Yet the prevailing deployment pattern injecting exhaustive schema and tool documentation into each prompt increases inference overhead, complicates schema evolution, and undermines reliability in multi-turn analysis. We investigate whether stable schema knowledge and tool-use behavior can instead be acquired through post-training while preserving the consistency required for production-facing analytics. We present CRAFT, a two-stage post-training recipe for schema-grounded coding agents. First, schema-stripped PLAN supervised fine-tuning learns domain-structured plans and executable behaviors from validated trajectories without exhaustive prompt-time schema injection. Second, execution-shaped reinforcement learning aligns the policy for tool selection, code quality, plan-code consistency, and recovery from failed executions. Training trajectories are curated through a Tri-Gate filter combining execution validation, data-integrity checks, and LLM-judge reasoning audit. We evaluate CRAFT for planned rollout in advertising analytics, covering campaign performance analysis, metric drill-downs, entity-level performance analysis, and multi-turn analytical refinement. The enterprise evaluation environment incorporates beta APIs as the agent-facing tool surface and spans 25 schema-linked core entities and 30 agentic workflows. Relative to a schema-stuffed baseline, CRAFT improves composite Agent Score by +9.6 pp, consistency by +4.1 pp, and multi-turn coherence by +4.2 pp, while reducing input-token burden by approximately 9x and schema-discovery loops by up to 5x. We further report deployment tradeoffs, reward-shaping limitations, and training-infrastructure extensions required for multi-turn tool-use reinforcement learning in enterprise settings.
- Abstract(参考訳): エンタープライズコーディングエージェントは、自然言語分析要求をプロプライエタリなAPI、スキーマ、メトリック定義上で実行可能なコードに変換する。
しかし、徹底的なスキーマとツールドキュメントを各プロンプトに注入する一般的なデプロイメントパターンは、推論オーバーヘッドを増大させ、スキーマの進化を複雑化し、マルチターン分析の信頼性を損なう。
そこで本研究では,本番環境におけるデータ分析に必要な一貫性を保ちながら,トレーニング後から安定したスキーマ知識とツール使用行動を取得することができるかどうかを考察する。
CRAFTは、スキーマ基底符号化エージェントのための2段階の訓練後レシピである。
まず、スキーマストラップ付きPLAN教師による微調整により、網羅的な即時スキーマインジェクションなしで、検証された軌道からドメイン構造化計画と実行可能な振る舞いを学習する。
第二に、実行形式の強化学習は、ツールの選択、コード品質、計画コードの一貫性、失敗した実行からのリカバリのポリシーを整合させる。
トレーニングトラジェクトリは、実行検証、データ統合性チェック、LCM-judge推論監査を組み合わせたTri-Gateフィルタを通じてキュレートされる。
我々はCRAFTを広告分析の計画展開、キャンペーンパフォーマンス分析、メートル法ドリルダウン、エンティティレベルパフォーマンス分析、マルチターン分析精細化などについて評価した。
企業評価環境には、エージェント対応ツールサーフェスとしてベータAPIが組み込まれており、25のスキーマリンクコアエンティティと30のエージェントワークフローにまたがっている。
CRAFTは、スキーマスタッフベースラインに対して、複合エージェントスコアを+9.6pp、一貫性を+4.1pp、マルチターンコヒーレンスを+4.2ppで改善し、入力の負荷を約9倍、スキーマ発見ループを最大5倍削減する。
さらに、企業環境でのマルチターンツール利用強化学習に必要なデプロイメントトレードオフ、報酬形成制限、トレーニングインフラストラクチャ拡張についても報告する。
関連論文リスト
- Graph-Based Agentic AI with LangGraph: Workflow Pathways for Long-Running Stateful Business Processes [0.0]
タイプされた状態、条件付きルーティング、決定論的ツール、再試行、割り込み、チェックポイント、トレースがどのように適合するかを示すために、実行可能なレシピを3つ提示する。
LangGraphはワークフローの複雑さに適合する位置にあり、普遍的なデフォルトではない。
論文 参考訳(メタデータ) (2026-07-21T17:07:13Z) - TIER: Trajectory-Invariant Execution Rewards for Multi-Step Tool Composition [62.56752617853322]
アウトカムベースの報酬はスパースフィードバックのみを提供するが、トラジェクトリによる報酬は注釈付き参照ソリューションに依存している。
本稿では,関数スキーマと実行時実行を直接管理する報奨フレームワークであるtrajectory-Invariant Execution Rewardsを提案する。
論文 参考訳(メタデータ) (2026-05-16T03:47:26Z) - Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning [79.88942231770629]
強化学習(RL)は、大規模言語モデル(LLM)の推論能力を向上させるための訓練後の中心的なツールとなっている。
統一表記によるロールアウトパイプラインの形式化とGenerate-Filter-Control-Replay(GFCR)の導入
検証可能な報酬、プロセスの監督、判断に基づくゲーティング、ガイドとツリー/セグメントのロールアウト、アダプティブな計算割り当て、早期終了と部分的なロールアウト、スループット最適化、自己改善のための再生/再配置でRLにまたがる手法を合成する。
論文 参考訳(メタデータ) (2026-04-08T00:53:29Z) - Understanding by Reconstruction: Reversing the Software Development Process for LLM Pretraining [66.89012795621349]
大規模言語モデル(LLM)は、複雑なソフトウェア工学に必要な、深く、長期にわたる推論に苦しむことが多い。
本稿では,再構築による理解という,新しいパラダイムを提案する。
マルチエージェントシミュレーションを用いて潜在エージェント軌道を合成するフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-11T09:23:20Z) - Agentic Planning with Reasoning for Image Styling via Offline RL [66.10749901925941]
直接的なプロンプトベースの編集は複雑な変換では失敗するが、なぜなら曖昧で主観的なプロンプトは、画像に何を変更するべきかを微妙に理解する必要がしばしばあるからである。
ツールベースのエージェントRLポストトレーニングフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-07T11:14:37Z) - Tool-Aware Planning in Contact Center AI: Evaluating LLMs through Lineage-Guided Query Decomposition [2.8180871881371456]
コンタクトセンターにおけるツール・アウェア・プラン生成のためのドメイン・グラウンド・フレームワークとベンチマークを提案する。
i) 基準ベースの計画評価フレームワークを2つのモードで動作させる: (i) 計量的評価器とワンショット評価器、および (ii) 評価器>最適化器ループを介して計画を反復的に洗練するデータ方法論である。
論文 参考訳(メタデータ) (2026-02-16T17:36:05Z) - GAP: Graph-Based Agent Planning with Parallel Tool Use and Reinforcement Learning [20.75113227786218]
グラフベースのエージェント計画(GAP)は、グラフベースの計画を通じてタスク間の依存関係を明示的にモデル化する新しいフレームワークである。
我々のアプローチは、複雑なタスクを依存性を意識したサブタスクグラフに分解する基礎モデルを訓練する。
この依存性を意識したオーケストレーションは、実行効率とタスクの正確性の両方で大幅に改善される。
論文 参考訳(メタデータ) (2025-10-29T09:35:55Z) - CoT Referring: Improving Referring Expression Tasks with Grounded Reasoning [67.18702329644526]
CoT Referringは、構造化されたチェーン・オブ・シークレット・トレーニングデータ構造を通じて、モデル推論をモダリティにわたって強化する。
トレーニングデータを再構築して、新たな出力フォームを実行し、既存のデータセットに新たなアノテーションを提供します。
また、検出とセグメント化機能を統合MLLMフレームワークに統合し、新しい適応重み付き損失で学習して性能を最適化する。
論文 参考訳(メタデータ) (2025-10-03T08:50:21Z) - Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks [3.3705400036304205]
セマンティックドリフト(Semantic drift)は、データとガバナンスを妥協し、テキストからRAGまでのサービスの有用性を損なう。
本稿では,多言語エンタープライズパイプラインスクリプトから細粒度スキーマを自動抽出するフレームワークを提案する。
結果:単一推論トレースを使用した32Bオープンソースモデルは、標準プロンプトの下でGPTシリーズに匹敵するパフォーマンスを達成することができる。
論文 参考訳(メタデータ) (2025-08-10T05:04:32Z) - SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling [58.05959902776133]
私たちはSingle-Passを紹介します。
Reference-Guided Evaluation (SPARE)は、効率的なステップごとのアノテーションを可能にする新しい構造化フレームワークである。
数学的推論(GSM8K, MATH)、マルチホップ質問応答(MuSiQue-Ans)、空間推論(SpaRP)にまたがる4つの多様なデータセットにおけるSPAREの有効性を実証する。
ProcessBenchでは、SPAREがデータ効率のよいアウト・オブ・ディストリビューションの一般化を実証し、トレーニングサンプルの$sim$16%しか使用していない。
論文 参考訳(メタデータ) (2025-06-18T14:37:59Z) - Benchmarking Agentic Workflow Generation [80.74757493266057]
複数面シナリオと複雑なグラフワークフロー構造を備えた統合ワークフロー生成ベンチマークであるWorfBenchを紹介する。
また,サブシーケンスとサブグラフマッチングアルゴリズムを利用したシステム評価プロトコルWorfEvalを提案する。
我々は、生成されたタスクが下流のタスクを強化し、推論中により少ない時間で優れたパフォーマンスを達成することを観察する。
論文 参考訳(メタデータ) (2024-10-10T12:41:19Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。