論文の概要: A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing
- arxiv url: http://arxiv.org/abs/2608.04625v1
- Date: Wed, 05 Aug 2026 09:28:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.802979
- Title: A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing
- Title(参考訳): A/Bエージェント:産業用A/Bテストにおける戦略イテレーションのための自己進化エージェント
- Authors: Zhuohang Jiang, Yuxin Chen, Yongsen Pan, Zheng Hu, Wenqi Fan, Qing Li, Hongyang Wang, Jun Wang, Wenwu Ou,
- Abstract要約: 産業レコメンデーション戦略は大規模A/B実験に大きく依存している。
従来のチューニングでは、専門家は戦略を繰り返し設計し、実験を設定し、結果を分析し、パラメータを調整する必要がある。
産業推薦戦略最適化のための閉ループA/BエージェントであるA/Bエージェントを提案する。
- 参考スコア(独自算出の注目度): 28.455537827793744
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Industrial recommendation strategy iteration heavily relies on large-scale A/B experimentation. Traditional tuning requires experts to repeatedly design strategies, configure experiments, analyze results, and adjust parameters, making the process labor-intensive and time-consuming. Meanwhile, valuable knowledge from historical experiments is often fragmented, making systematic reuse difficult through manual expert effort alone. Existing RAG agents partially alleviate this burden by retrieving prior strategies, but typically organize experience in a flat manner, overlooking the hierarchical relationships among business scenarios, recommendation stages, optimization objectives, and experimental contexts. This often results in mismatched retrieval and limited cross-scenario transfer, while preventing agents from continuously refining strategies and parameters through sequential A/B feedback. % To address these limitations, we propose A/B Agent, a closed-loop A/B agent for industrial recommendation strategy optimization. The framework comprises three tightly coupled core components: Historical Strategy Knowledge Organization, Autonomous Target-Aware Strategy Generation, and Experiment-Guided Strategy Self-Evolution. It organizes historical strategies into a hierarchical experience tree, retrieves transferable evidence through multi-path Tree-RAG to generate executable strategies, and continuously analyzes online A/B feedback to guide autonomous tuning and update the experience tree for self-evolution. Extensive offline and online evaluations demonstrate its effectiveness, including a 4.829% improvement in GMV in a real-world short-video e-commerce recommendation system while maintaining positive gains across all guardrail metrics.
- Abstract(参考訳): 産業レコメンデーション戦略の反復は大規模なA/B実験に大きく依存している。
従来のチューニングでは、専門家が戦略を繰り返し設計し、実験を設定し、結果を分析し、パラメータを調整し、プロセスが労働集約的で時間を要するようにする必要がある。
一方、歴史的実験から得られる貴重な知識は断片化され、手作業による専門家の努力だけで体系的な再利用が困難になる。
既存のRAGエージェントは、事前戦略を取得することで、この負担を部分的に軽減しますが、通常、ビジネスシナリオ、レコメンデーションステージ、最適化目標、実験的なコンテキストの間の階層的な関係を見越して、フラットな方法で経験を整理します。
この結果、しばしばミスマッチした検索やクロスシナリオ転送が制限され、エージェントが連続的なA/Bフィードバックを通じて戦略やパラメータを継続的に洗練することを防ぐ。
%) この制限に対処するため, 産業推薦戦略最適化のための閉ループA/BエージェントであるA/Bエージェントを提案する。
このフレームワークは、3つの密結合されたコアコンポーネントで構成されている。
歴史的戦略を階層的なエクスペリエンスツリーに整理し、マルチパスツリーRAGを介して転送可能なエビデンスを取得して実行可能な戦略を生成し、オンラインA/Bフィードバックを継続的に分析して、自律的なチューニングをガイドし、自己進化のためのエクスペリエンスツリーを更新する。
大規模なオフラインおよびオンライン評価は、現実のショートビデオeコマースレコメンデーションシステムにおいて、GMVが4.829%改善され、ガードレールの指標全体で肯定的な利得を維持しながら、その効果を実証している。
関連論文リスト
- SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategy Refinement in E-Commerce Recommendation [17.227149633495586]
SRAgentは産業用電子商取引レコメンデーションシステム(RS)におけるポストグレード戦略を洗練するための最初のエージェントフレームワークである。
SR-Agentは、3つのコンポーネントを統合している: (i) ユーザ認識の悪いケースを検査するUserSimエージェント、 (ii) 繰り返し発生する悪いケースを構造化された再利用可能な診断に集約する分析エージェント、 (iii) 型付きおよび有界なアクションにマップする制約付き戦略リファインメントハーネス。
論文 参考訳(メタデータ) (2026-07-20T09:12:46Z) - Retrieval-Augmented LLM Agents: Learning to Learn from Experience [16.248836438253814]
本研究では,検索対象のLLMエージェントを学習し,検索したトラジェクトリをコンテキスト内で活用する方法について検討する。
最先端のエージェントトレーニングパイプラインよりも優れたロラを用いた,堅牢な教師付き微調整(SFT)レシピを確立した。
その結果,この組み合わせによるタスクの一般化が著しく向上することが示唆された。
論文 参考訳(メタデータ) (2026-03-18T20:45:04Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - TreePS-RAG: Tree-based Process Supervision for Reinforcement Learning in Agentic RAG [71.06073770344732]
エージェント検索強化生成(RAG)は、推論と情報検索の多段階的な相互作用として質問応答を定式化する。
エージェントRAGのためのオンラインツリーベースRLフレームワークであるTreePS-RAGについて述べる。
論文 参考訳(メタデータ) (2026-01-11T14:07:30Z) - Experience-Guided Adaptation of Inference-Time Reasoning Strategies [49.954515048847874]
Experience-Guided Reasoner (EGuR) は蓄積された経験に基づいて推論時に調整された戦略を生成する。
EGuRは最強のベースラインに対して最大14%の精度向上を実現し、計算コストを最大111倍に削減する。
論文 参考訳(メタデータ) (2025-11-14T17:45:28Z) - Reinforced Strategy Optimization for Conversational Recommender Systems via Network-of-Experts [63.412646471177645]
会話レコメンダシステム(CRS)のための新しい強化戦略最適化(RSO)手法を提案する。
RSOは、戦略駆動型応答決定をマクロレベルの戦略計画とマイクロレベルの戦略適応に分解する。
実験の結果, RSOは最先端のベースラインと比較して, インタラクション性能を著しく向上することがわかった。
論文 参考訳(メタデータ) (2025-09-30T11:12:01Z) - SAGE: Strategy-Adaptive Generation Engine for Query Rewriting [8.941793732446856]
本稿では,SAGE(Strategy-Adaptive Generation Engine)について紹介する。
SAGEは、最先端のNDCG@10の結果を新たに達成すると同時に、魅力的な創発的行動も明らかにする。
この結果から, 戦略誘導型RLは, よりスケーラブルで, 効率的で, 解釈可能なパラダイムを, 次世代の堅牢な情報検索システム開発に役立てることが示唆された。
論文 参考訳(メタデータ) (2025-06-24T16:50:51Z) - From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning [62.54484062185869]
本稿では,エージェントの強化学習プロセスの最適化にステップワイド報酬を利用するStepAgentを紹介する。
エージェント反射とポリシー調整を容易にする暗黙の逆・逆の強化学習手法を提案する。
論文 参考訳(メタデータ) (2024-11-06T10:35:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。