論文の概要: PILOT Technical Report
- arxiv url: http://arxiv.org/abs/2608.18637v2
- Date: Thu, 20 Aug 2026 02:56:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-21 14:00:35.579105
- Title: PILOT Technical Report
- Title(参考訳): PILOT技術報告
- Abstract要約: PILOT(Proactive Insight Learner for Online Tree-Experiments)は、制約のある制御ループ内で3つの役割を編成する。
マネージャはエージェントを積極的にし、プランナーはグローバルチューニングを超えて人口レベルのパーソナライズを可能にし、キュレーターはすべての完了したタスクを次の学習機会に変える。
5つの実験的なバケットでTaobaoのプラットフォーム上にデプロイされたPILOTは、ライフサイクルガバナンスや構造化仮説テストのないフリー探索エージェントであるROAM(Reactive Optimization with Agent-driven Moves)と比較される。
- 参考スコア(独自算出の注目度): 12.594036897595993
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Existing agentic approaches for recommendation system optimization remain fundamentally reactive: they adjust parameters in response to observed metric changes but lack the ability to proactively design controlled experiments, personalize strategies at the user-segment level, or accumulate reusable experimental methodology across tasks. We present PILOT (Proactive Insight Learner for Online Tree-Experiments), an LLM-agent framework that organizes three roles within a constrained control loop where deterministic services enforce all safety, statistical, and permission boundaries: (1) an Experiment Manager that drives the full experiment lifecycle -- task intake, observation governance, anomaly recovery, and postmortem -- by selecting only from a rule-generated legal-command envelope; (2) a Search Planner that proposes candidate decision trees for user-segment-level personalization, invoked only when the Manager requests planning; and (3) a Memory Curator that asynchronously distills experiment outcomes into strategy-level domain knowledge and provenance-tracked methodology, failure-isolated from the main loop. The Manager makes the agent proactive, the Planner enables population-level personalization beyond global tuning, and the Curator turns every completed task into a learning opportunity for the next. Deployed on Taobao's platform with 5 experimental buckets, PILOT is compared against ROAM(Reactive Optimization with Agent-driven Moves), a free-exploration agent without lifecycle governance or structured hypothesis testing. PILOT achieves up to +1.40% IPV, +1.60% Core IPV, +0.96% transaction count, and +1.50% transaction amount, improving over ROAM's best results (+1.00% IPV, +0.90% Core IPV, +0.60% transaction count, +1.13% transaction amount) while raising search efficiency from 53.3% to 93.3% (+40 pp), with no human intervention throughout the experimental cycle.
- Abstract(参考訳): 既存のエージェント的手法は、観測されたメートル法の変化に応じてパラメータを調整するが、制御された実験を積極的に設計したり、ユーザーセグメントレベルで戦略をパーソナライズしたり、タスク全体にわたって再利用可能な実験方法論を蓄積する能力は欠如している。
PILOT(Proactive Insight Learner for Online Tree-Experiments)は,(1)タスクの取り出し,監視ガバナンス,異常回復,そしてポストモーテムという,すべての実験ライフサイクルを駆動する実験マネージャ,(2)ルール生成された法的コマンドエンベロープからのみ選択する探索プランナ,(2)管理者の要求によってのみ実行されるユーザレベルのパーソナライズのための候補決定ツリーを提案する検索プランナ,(3)戦略レベルのドメイン知識と実績追跡手法に実験結果を非同期に抽出するメモリキュレータ。
マネージャーはエージェントを積極的にし、プランナーはグローバルチューニング以上の人口レベルのパーソナライズを可能にし、キュレーターはすべての完了したタスクを次の学習機会に変える。
5つの実験的なバケットを備えたTaobaoプラットフォーム上にデプロイされたPILOTは、ライフサイクルガバナンスや構造化仮説テストのないフリー探索エージェントであるROAM(Reactive Optimization with Agent-driven Moves)と比較される。
PILOTは最大で+1.40%のIPV、+1.60%のCore IPV、+0.96%のトランザクション数、+1.50%のトランザクション量を実現し、ROAMの最良の結果(+1.00%のIPV、+0.90%のCore IPV、+0.60%のトランザクション数、+1.13%のトランザクション量)よりも改善され、検索効率は53.3%から93.3%(+40pp)に向上する。
関連論文リスト
- SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategy Refinement in E-Commerce Recommendation [17.227149633495586]
SRAgentは産業用電子商取引レコメンデーションシステム(RS)におけるポストグレード戦略を洗練するための最初のエージェントフレームワークである。
SR-Agentは、3つのコンポーネントを統合している: (i) ユーザ認識の悪いケースを検査するUserSimエージェント、 (ii) 繰り返し発生する悪いケースを構造化された再利用可能な診断に集約する分析エージェント、 (iii) 型付きおよび有界なアクションにマップする制約付き戦略リファインメントハーネス。
論文 参考訳(メタデータ) (2026-07-20T09:12:46Z) - From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents [90.3279207163486]
EvoSOPは、エージェントが実行軌跡からSOPを抽出し、反復的にツールセットを最適化することを可能にするフレームワークである。
EvoSOPはタスク成功率を大幅に向上し,インタラクションラウンドの回数を大幅に削減することを示す。
論文 参考訳(メタデータ) (2026-07-08T12:09:49Z) - LLM-Guided ANN Index Optimization for Human-Object Interaction Retrieval [10.896685094390136]
ビジュアル検索、レコメンデーションエンジン、マルチモーダル質問応答など、現代のAIアプリケーションを支えるマルチステージ検索システム。
本稿では,この制限を相認識型大規模言語モデル (LLM) エージェントを用いて解決する。
論文 参考訳(メタデータ) (2026-06-03T22:28:34Z) - Agentick: A Unified Benchmark for General Sequential Decision-Making Agents [30.028388632526745]
Agentickはシーケンシャルな意思決定エージェントのベンチマークである。
プロシージャで生成されたタスクは6つの機能カテゴリ、難易度レベル4、観察モード5で37になる。
27のコンフィグレーションと90,000以上のエピソードにまたがる評価では、単一のアプローチが支配的でないことが示されている。
論文 参考訳(メタデータ) (2026-05-07T19:12:03Z) - RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedback [54.39884046754265]
RetroAgentは、エージェントが複雑なインタラクティブ環境をマスターできるオンラインRLフレームワークである。
実験の結果,RetroAgentはSOTA(State-of-the-art)の性能を達成できた。
論文 参考訳(メタデータ) (2026-03-09T16:23:33Z) - AgentAssay: Token-Efficient Regression Testing for Non-Deterministic AI Agent Workflows [0.0]
AgentAssayは、非決定論的AIエージェントを回帰テストするための最初のトークン効率のよいフレームワークである。
厳密な統計保証を維持しながら78-100%のコスト削減を実現している。
論文 参考訳(メタデータ) (2026-03-03T04:59:25Z) - Towards a Science of Scaling Agent Systems [79.64446272302287]
エージェント評価の定義を定式化し,エージェント量,コーディネーション構造,モデル,タスク特性の相互作用として,スケーリング法則を特徴付ける。
協調指標を用いて予測モデルを導出し,R2=0をクロスバリデーションし,未知のタスク領域の予測を可能にする。
ツールコーディネーショントレードオフ: 固定的な計算予算の下では, ツールヘビータスクはマルチエージェントのオーバーヘッドから不均衡に悩まされ, 2) 能力飽和: 調整が減少または負のリターンを, 単一エージェントのベースラインが45%を超えると達成できる。
論文 参考訳(メタデータ) (2025-12-09T06:52:21Z) - AgentPRM: Process Reward Models for LLM Agents via Step-Wise Promise and Progress [71.02263260394261]
大規模言語モデル(LLM)は、マルチターン意思決定タスクにおいて依然として課題に直面している。
プロセス報酬モデル(PRM)を構築し、各意思決定を評価し、エージェントの意思決定プロセスを導く。
AgentPRMは、シーケンシャルな決定と最終的な目標への貢献の間の相互依存の両方をキャプチャする。
論文 参考訳(メタデータ) (2025-11-11T14:57:54Z) - In-the-Flow Agentic System Optimization for Effective Planning and Tool Use [73.72524040856052]
AgentFlowはトレーニング可能なインザフローエージェントフレームワークで、進化するメモリを通じて4つのモジュール(プランナ、実行子、検証子、ジェネレータ)をコーディネートする。
Flow-GRPOは、マルチターン最適化をトラクタブルな単一ターンポリシー更新のシーケンスに変換することで、長い水平、スパース・リワードのクレジット割り当てに取り組む。
エージェントフローは7Bスケールのバックボーンで、平均的精度が14.9%、エージェントが14.0%、数学が14.5%、科学的タスクが4.1%でトップパフォーマンスのベースラインを上回っている。
論文 参考訳(メタデータ) (2025-10-07T05:32:44Z) - Proactive Agent: Shifting LLM Agents from Reactive Responses to Active Assistance [95.03771007780976]
我々は、人間の指示なしにタスクを予測および開始できるプロアクティブエージェントを開発するという課題に取り組む。
まず,実世界の人的活動を収集し,前向きなタスク予測を生成する。
これらの予測は、ヒトのアノテータによって受け入れられるか拒否されるかのどちらかとしてラベル付けされる。
ラベル付きデータは、人間の判断をシミュレートする報酬モデルをトレーニングするために使用される。
論文 参考訳(メタデータ) (2024-10-16T08:24:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。