論文の概要: CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training
- arxiv url: http://arxiv.org/abs/2607.01846v1
- Date: Thu, 02 Jul 2026 08:07:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.739349
- Title: CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training
- Title(参考訳): CLAP: ドメインエージェントポストトレーニングのためのクローズドループトレーニング、評価、リリース制御
- Authors: Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo,
- Abstract要約: CLAPはビジネスデータを構造化されたSFTサンプル、意思決定基準サンプル、ホールドアウトセット、リスク診断、リリースゲートレコードに変換する。
匿名化された5つの製造・scenarioバッチでは、QLoRAスタイルのLoRA-SFTが平均利得を抑える。
- 参考スコア(独自算出の注目度): 14.51193578486111
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Domain agents often face noisy business data, uncertain post-training gains, offline/application mismatch, and adapter-release risk. This paper presents CLAP (Closed-Loop Agent Post-training), a closed-loop method that converts business data into structured SFT samples, decision-preference samples, holdout sets, risk diagnostics, and release-gate records. CLAP combines data validation, target/evidence normalization, reward/KL diagnosis, offline gates, and application-chain replay to decide whether an adapter is suitable for the target application chain. On five anonymized manufacturing-scenario batches, QLoRA-style LoRA-SFT yields modest average gains: overall score increases by 0.0098, pass rate by 0.0240, and evidence accuracy by 0.0280, while hallucination and wrong facts decrease. Yet only 3 of 5 batches improve, some batches regress, and GRPO exposes high KL risks. Application-chain replay further shows that RAG is necessary for factual extraction; under the same 3B backbone and 100 replay cases, an application-RAG-oriented LoRA-SFT adapter improves value, core fields, and answer-evidence doc/page matching over base+RAG, but increases latency. These results support managing domain-agent post-training through an integrated data-training-evaluation-release loop rather than relying on training completion or a single offline score.
- Abstract(参考訳): ドメインエージェントは、しばしばノイズの多いビジネスデータ、トレーニング後の不確実なゲイン、オフライン/アプリケーションミスマッチ、アダプタリリースリスクに直面します。
本稿では,CLAP(Closed-Loop Agent Post-training)を提案する。CLAP(Closed-Loop Agent Post-training)は,ビジネスデータを構造化されたSFTサンプル,意思決定基準サンプル,ホールドアウトセット,リスク診断,リリースゲートレコードに変換するクローズドループ手法である。
CLAPは、データ検証、ターゲット/エビデンス正規化、報酬/KL診断、オフラインゲート、アプリケーションチェーンのリプレイを組み合わせて、アダプタがターゲットのアプリケーションチェーンに適しているかどうかを判断する。
匿名化された5つの製造・scenarioバッチでは、QLoRAスタイルのLoRA-SFTは、スコアが0.0098、パスレートが0.0240、証拠精度が0.0280、幻覚と誤った事実が減少する。
しかし、5つのバッチのうち3つだけが改善され、いくつかのバッチが後退し、GRPOは高いKLリスクを露呈する。
3Bバックボーンと100のリプレイケースの下では、アプリケーションRAG指向のLoRA-SFTアダプタは、値、コアフィールド、および応答エビデンスドキュメント/ページマッチングをbase+RAG上で改善するが、レイテンシは向上する。
これらの結果は、トレーニング完了や単一のオフラインスコアに頼るのではなく、統合されたデータトレーニング-評価-リリースループによるドメインエージェントのポストトレーニングの管理をサポートする。
関連論文リスト
- VeriEvol: Scaling Multimodal Mathematical Reasoning via Verifiable Evol-Instruct [71.22358682581215]
ビジュアルな数学的推論のための強化学習のスケーリングは、難しい質問を生成すること以上のものを必要とします。
これは2つのコンポーネントからなる反復的なフレームワークであるVeriEvolとしてインスタンス化します。
5ベンチマークのビジュアル・マス・スイートでは、10Kから250KサンプルまでのSFTデータのスケーリングが平均精度を35.42から54.73に引き上げている。
論文 参考訳(メタデータ) (2026-06-22T16:17:30Z) - Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning [60.83841532299041]
本稿では、強化学習後学習を行うための2レベルデータスケジューリングフレームワークであるAdaptive Data Scheduling (ADS)を提案する。
ADSは、セマンティックパターンに従ってサンプルを整理し、適応的なクラスタ間分布を維持して、現在のトレーニングの進捗を固める。
3つのLCMと7つの推論ベンチマークによる実験結果から、ADSはグループ相対ポリシー最適化よりも平均精度を5.2%向上することが示された。
論文 参考訳(メタデータ) (2026-06-21T02:19:17Z) - DecomposeRL: Learning to Ask Useful, Informative, and Diverse Questions for Semi-Supervised, Traceable Claim Verification [7.917135080399156]
検査可能なトレースを生成する正確なクレーム検証器としてDecomposeRLを提案する。
DecomposeRLはGRPOで訓練されたRLポリシーとして分解を行う。
分割RL-7Bは5Kキュレートされたクレームのみを全面的に監督し、86.3のドメイン内と69.8のドメイン外バランスの正確性を達成している。
論文 参考訳(メタデータ) (2026-05-27T02:19:52Z) - Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture [0.0]
本稿では、RLコーディングエージェントのためのローカルファーストのモデルコンテキストプロトコル(MCP)ネイティブな開発者メモリアーキテクチャであるRL Developer Memoryについて述べる。
メモリ選択をログ化されたコンテキスト決定プロセスとして扱う。
システムは、RLアルゴリズムのバグ、ハードネガ、レビューゲートされたRL/コントロールケース、低リスク障害を含む決定論的200ケースのベンチマークで評価される。
論文 参考訳(メタデータ) (2026-05-02T18:37:36Z) - Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization [74.91418266859297]
インプシットプロセス報酬モデル(PRM)は、推論プロセスに沿ってきめ細かな報酬信号を提供する。
トレーニングはシーケンスレベルの集約のみを制限しますが、推論はローカルステップの品質を反映するためにトークンレベルのスコアが必要です。
本稿では,予測精度を推定するプレフィックス条件付き値関数を直接学習する新しいインプリシット・プレフィックス・バリュー・リワード・モデル(IPVRM)を提案する。
また,サンプルトークンと高確率候補トークンの両方に対してTDの利点を演算する分散レベルRL(DistRL)を提案する。
論文 参考訳(メタデータ) (2026-04-14T18:19:54Z) - LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications [51.56484100374058]
評価をデプロイメント決定ワークフローに変換するLLMおよびRAGアプリケーションのための準備性ハーネスを提案する。
このシステムは、最小限のAPI契約の下で、自動ベンチマーク、OpenTelemetryオブザーバビリティ、CI品質ゲートを組み合わせる。
チケットルーティングとBEIRタスクのハーネスを、完全なAzureマトリックスカバレッジで評価する。
論文 参考訳(メタデータ) (2026-03-28T18:03:32Z) - Improving Search Agent with One Line of Code [68.58667107354253]
ツールベースのエージェント強化学習(TARL)は,検索エージェントが外部ツールと対話できるようにトレーニングするための,有望なパラダイムとして登場した。
textbfSearch textbfAgent textbfPolicy textbfOptimization (textbfSAPO)を提案する。
論文 参考訳(メタデータ) (2026-03-10T04:07:39Z) - Double Check My Desired Return: Transformer with Target Alignment for Offline Reinforcement Learning [64.6334337560557]
教師付き学習(RvS)による強化学習は、シーケンスモデリングタスクとしてオフラインRLをフレーム化する。
決定変換器(DT)は、実際の完了したリターンを特定のターゲットリターンと確実に整合させるのに苦労する。
そこで我々は,Offline RLの目標アライメントによる変換器の二重チェックを行う新しいアプローチであるDoctorを提案する。
論文 参考訳(メタデータ) (2025-08-22T14:30:53Z) - A Vision-Language Pre-training Model-Guided Approach for Mitigating Backdoor Attacks in Federated Learning [43.847168319564844]
視覚言語事前学習モデルのゼロショット学習機能を利用したFLバックドアディフェンスフレームワークCLIP-Fedを提案する。
本計画では, 防衛効果に課される非IIDの限界を克服し, 事前集約・後防衛戦略を統合する。
論文 参考訳(メタデータ) (2025-08-14T03:39:54Z) - DeRAG: Black-box Adversarial Attacks on Multiple Retrieval-Augmented Generation Applications via Prompt Injection [0.9499594220629591]
アドリシャル・プロンプト・アタックは、レトリーバル・アフュージョンド・ジェネレーション(RAG)システムの信頼性を大きく変える可能性がある。
本稿では, RAGに基づく質問応答に対して, 対角的プロンプト接尾辞を最適化するために, 微分進化(DE)を適用した新しい手法を提案する。
論文 参考訳(メタデータ) (2025-07-20T16:48:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。