論文の概要: Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
- arxiv url: http://arxiv.org/abs/2608.15763v2
- Date: Sat, 22 Aug 2026 04:28:03 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-25 18:24:36.873613
- Title: Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report
- Title(参考訳): タオライブデジタルアバターエージェント技術報告
- Authors: TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao, Zulong Chen,
- Abstract要約: ハーネス・アウェア・トレーニング (Harness-Aware Training, HAT) は、ハーネスの変化に対応するためにコンパクトなモデルを訓練する。
あるNVIDIA H20 GPUでは、最適化されたシステムはP50とP95の3.4sと8.1sのレイテンシを提供する。
- 参考スコア(独自算出の注目度): 11.208193267995986
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI-powered digital avatar streamers must answer product questions, engage viewers, and execute marketing strategies in real time, demanding low latency, frequent strategy updates, and accurate yet effective responses. Evolvable Harnesses, whose Skills, Hooks, prompts, and tools can be updated independently of model weights, enable rapid iteration but expose a trade-off: large models adapt zero-shot yet are too slow, whereas compact models meet latency targets but overfit to fixed Harness configurations. We propose Harness-Aware Training (HAT), which trains compact models to adapt to changing Harnesses. Its key component, Harness-State Augmentation (HSA), applies task-preserving transformations to Skill identifiers and content, tool schemas, prompt structures, and Hook functions. Training proceeds in three stages: HSA-SFT learns reasoning and tool use from strong-model trajectories across diverse environments; General On-Policy Distillation restores generalization lost during SFT; and HSA-RL improves robustness to changing Harnesses through reinforcement learning in augmented environments. Across four evaluation sets, HAT achieves 94.8 on Live-Stream QA (base: 80.3; strongest general LLM: 93.0) and 94.6 on Harness-Variant QA (base: 75.4). Unlike Fixed-Harness SFT, which lowers IFEval by 7.7 points from the base model, HAT avoids this regression and reaches 83.5. On one NVIDIA H20 GPU, the optimized system delivers P50 and P95 latencies of 3.4 s and 8.1 s. Deployed in Taobao Live's digital-avatar service, it also yields positive online A/B test results for GMV and item-page views.
- Abstract(参考訳): AIで動くデジタルアバターストリーマーは、製品の質問に答え、視聴者をエンゲージし、リアルタイムでマーケティング戦略を実行し、低レイテンシ、頻繁な戦略更新、正確で効果的なレスポンスを要求する必要がある。
Skills、Hooks、プロンプト、ツールをモデルウェイトとは独立して更新できるEvolvable Harnessesは、迅速なイテレーションを可能にするが、トレードオフを公開する。
本研究では,変化するハーネスに対応するためにコンパクトなモデルを訓練するハーネス・アウェア・トレーニング(HAT)を提案する。
その主要なコンポーネントであるHarness-State Augmentation(HSA)は、スキル識別子とコンテンツ、ツールスキーマ、プロンプト構造、Hook関数にタスク保存変換を適用する。
HSA-SFTは様々な環境における強力なモデル軌道からの推論とツールの使用を学習し、General On-Policy DistillationはSFTで失われた一般化を回復し、HSA-RLは強化された環境における強化学習を通じてハーネスの変化に対する堅牢性を改善する。
4つの評価セットで、HATはライブストリームQAで94.8(ベース: 80.3、最強の一般LLM: 93.0)、Harness-Variant QAで94.6(ベース: 75.4)を達成した。
IFEvalをベースモデルから7.7ポイント下げるFixed-Harness SFTとは異なり、HATはこの回帰を避けて83.5に達する。
あるNVIDIA H20 GPUでは、最適化されたシステムはP50とP95の3.4sと8.1sのレイテンシを提供する。
Taobao Liveのデジタル・アバターサービスでデプロイされ、GMVとアイテムページビューのオンラインA/Bテスト結果も肯定的に得られる。
関連論文リスト
- Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories [41.919231699460944]
Harness-R1は、既存の実行ランタイムのエラー条件付きライフサイクルワイドな編集を学習機能を提供する最初の方法です。
オンラインの強化学習を専門とするハーネスエンジニアをポストトレーニングし、その編集は、彼らが実現したタスク成功のために最適化される。
WebShop、ALFWorld、DBBenchの他、Harness-R1はバニラQwen3.5-9Bを44.3%から53.6%に引き上げている。
論文 参考訳(メタデータ) (2026-08-03T14:12:18Z) - HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry [35.87794858139959]
HarnessXは、構成可能、適応可能、進化可能なエージェントハーネス用のファウンダリーである。
型付きハーネスプリミティブを置換代数学で組み立て、AIGISを介して適応する。
軌道をハーネス更新とモデルトレーニング信号の両方に変換することでハーネスモデルループを閉じる。
論文 参考訳(メタデータ) (2026-06-12T08:27:11Z) - Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents [82.27610290890475]
i) ハーネス更新、(i) 実行証拠から有用な永続的ハーネス更新を生成する能力、(ii) ハーネスベネフィット、タスク解決時に更新されたハーネスの恩恵を受ける能力の2つのハーネス自己進化能力を分析した。
まず、ハーネス更新は基本能力において平坦である:異なる能力階層のモデルがハーネス更新を生成し、驚くほど類似したゲインをもたらす。
第二に、ハーネスベネフィットは基本能力において単調ではない:弱い層モデルは更新されたハーネスからほとんど恩恵を受けず、中層モデルは最も恩恵を受け、強い層モデルは中層より利益が低い。
論文 参考訳(メタデータ) (2026-05-28T22:16:14Z) - Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic LLM Agents [4.765206163164323]
モデル重みや評価環境を変化させることなく冷凍LDMエージェントを改善するライフサイクル対応ランタイムハーネスであるLife-Harnessを提案する。
ライフ・ハーネスは、繰り返し発生する相互作用の失敗を、環境契約、手続きスキル、行動実現、軌道規制にまたがる再利用可能な介入に変換することによって、訓練軌道から進化する。
ライフハーネスはモデル116のうち116で改善され、環境設定は18モデルバックボーンで改善され、平均的な相対的改善は88.5%である。
論文 参考訳(メタデータ) (2026-05-21T08:36:49Z) - TEMPO: Scaling Test-time Training for Large Reasoning Models [87.61789183311856]
テストタイムトレーニング(TTT)は、推論時間中にラベルのないテストインスタンスにモデルパラメータを適用する。
TTTフレームワークであるTEMPOを提案する。これは、ラベル付きデータセット上で定期的な批評家の再検討を行い、ラベル付き質問に対するポリシー修正をインターリーブする。
論文 参考訳(メタデータ) (2026-04-21T10:01:04Z) - Adaptive Data Flywheel: Applying MAPE Control Loops to AI Agent Improvement [8.230420096371407]
我々は、NVIDIAのMixture-of-Experts (MoE) Knowledge AssistantであるNVInfo AIにおけるデータフライホイールの実践的な実装について述べる。
我々は、検索強化世代(RAG)パイプラインの障害に対処し、継続的な学習を可能にするクローズドループシステムを構築した。
ルーティングでは、Llama 3.1Bモデルを微調整8Bモデルに置き換え、96%の精度、モデルサイズ10倍の削減、70%のレイテンシ改善を実現した。
論文 参考訳(メタデータ) (2025-10-30T23:41:06Z) - Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR [110.90317717368264]
RLVRトレーニングのためのオンライン変分問題合成(SvS)戦略を提案する。
この戦略は、トレーニング中のポリシーのエントロピーを効果的に維持し、標準のRLVRと比較してPass@kを大幅に改善する。
論文 参考訳(メタデータ) (2025-08-19T17:42:45Z) - AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security [74.22452069013289]
AegisLLMは、敵の攻撃や情報漏洩に対する協調的なマルチエージェント防御である。
テスト時のエージェント推論システムのスケーリングは,モデルの有用性を損なうことなく,ロバスト性を大幅に向上させることを示す。
アンラーニングやジェイルブレイクを含む主要な脅威シナリオに対する総合的な評価は、AegisLLMの有効性を示している。
論文 参考訳(メタデータ) (2025-04-29T17:36:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。