論文の概要: SiriusDeliver: Automating Data Warehouse Delivery at Tencent
- arxiv url: http://arxiv.org/abs/2608.09185v1
- Date: Mon, 10 Aug 2026 06:54:40 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:37.108873
- Title: SiriusDeliver: Automating Data Warehouse Delivery at Tencent
- Title(参考訳): SiriusDeliver: Tencentにおけるデータウェアハウスデリバリの自動化
- Abstract要約: SiriusDeliverは、プロダクションウェアハウスタスクのエンドツーエンドデリバリ自動化エージェントです。
当社は,Tencent Cloud WeData上でのオフラインデータセットと大規模運用デプロイメントを通じて,SiriusDeliverを評価した。
- 参考スコア(独自算出の注目度): 45.75783602568372
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Enterprise data warehouses (DWs) support business-critical analytics, but warehouse task delivery remains a complicated production process involving context retrieval, workflow configuration, code generation, platform submission, and failure diagnosis. Although large language models (LLMs) and coding agents have improved software development, they are insufficient for production DW delivery, which requires dependency-aware orchestration, lifecycle-aware artifact control, and continuous adaptation to evolving platform practices. We present SiriusDeliver, an end-to-end delivery automation agent for production warehouse task submission. SiriusDeliver integrates three components: a hierarchical delivery agent that orchestrates warehouse skills, an artifact lifecycle control module that verifies and revises artifacts before and after platform execution, and a trace-driven skill evolution mechanism that maintains reusable skills from delivery trajectories. We evaluate SiriusDeliver through offline datasets and large-scale production deployment on Tencent Cloud WeData. Offline experiments on real-world warehouse delivery cases show that SiriusDeliver improves delivery success and automation efficiency over representative baselines. During a two-month deployment across 6 business teams and 4 warehouse task types, SiriusDeliver served 3,600 monthly active users and supported 18,240 delivery sessions, achieving an 87.2% end-to-end success rate and a 73.5% autonomous submission rate. A one-month A/B test shows that SiriusDeliver reduces median delivery time from 228 to 23 minutes and engineer effort from 95 to 11 minutes, while maintaining comparable final delivery success.
- Abstract(参考訳): エンタープライズデータウェアハウス(DW)はビジネスクリティカルな分析をサポートするが、ウェアハウスタスクデリバリは、コンテキスト検索、ワークフロー構成、コード生成、プラットフォーム提出、障害診断を含む複雑な生産プロセスのままである。
大規模言語モデル(LLM)とコーディングエージェントはソフトウェア開発を改善しているが、依存性を意識したオーケストレーション、ライフサイクルを意識したアーティファクトコントロール、進化するプラットフォームプラクティスへの継続的適応を必要とする、本番DWデリバリには不十分である。
SiriusDeliverは、プロダクションウェアハウスタスクのエンドツーエンドデリバリ自動化エージェントです。
SiriusDeliverは、ウェアハウススキルをオーケストレーションする階層的デリバリエージェント、プラットフォーム実行前後のアーティファクトの検証と修正を行うアーティファクトライフサイクルコントロールモジュール、デリバリトラジェクトリから再利用可能なスキルを維持するトレース駆動スキル進化メカニズムの3つのコンポーネントを統合する。
当社は,Tencent Cloud WeData上でのオフラインデータセットと大規模運用デプロイメントを通じて,SiriusDeliverを評価した。
SiriusDeliverは、現実の倉庫配送ケースのオフライン実験によって、代表的なベースラインよりもデリバリの成功と自動化の効率を改善している。
6つのビジネスチームと4つの倉庫タスクタイプにまたがる2ヶ月のデプロイメントで、SiriusDeliverは3600人の月間アクティブユーザに仕え、18,240回のデリバリセッションをサポートし、87.2%のエンドツーエンドの成功率と73.5%の自律的な応募率を達成した。
1ヶ月のA/Bテストでは、SiriusDeliverが中央値のデリバリ時間を228分から23分に短縮し、エンジニアの労力を95分から11分に短縮し、最終的なデリバリ成功を維持することが示されている。
関連論文リスト
- Integrated Order Dispatching and Routing for Last-Mile Pickup via Deep Reinforcement Learning [3.9921873121588103]
本稿では,学習したルーティングとリアルタイムの分散オーラクルを結合した統合最適化フレームワークを提案する。
Cainiao Logisticsによる実世界のデータセットの実験は、我々のアプローチのパフォーマンスをテストするのに使われている。
論文 参考訳(メタデータ) (2026-07-24T14:37:02Z) - DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch [89.87798465720181]
リポジトリ全体生成のための大規模データセットである textbfDeNovoSWE を紹介する。
DeNovoSWEは4,818の高品質なインスタンスで構成されており、各インスタンスはドキュメントから完全なリポジトリを生成する必要がある。
DeNovoSWE上の微調整Qwen3-30B-A3Bは、長期SWEのパフォーマンスを大幅に改善し、挑戦的なBeyondSWE-Doc2Repoベンチマークのスコアを5.8%から47.2%に引き上げた。
論文 参考訳(メタデータ) (2026-06-09T11:37:15Z) - GTA: Generating Long-Horizon Tasks for Web Agents at Scale [82.43869456830664]
我々は、クローリング、検索ベースのシード、コンテキスト内生成、自動品質管理を統合したスケーラブルなフレームワーク、GTAを導入する。
eコマース、政府、フォーラム、ニュースをカバーする50以上のウェブサイトでパイプラインをインスタンス化し、マルチリンガルとマルチホップをカバーしています。
i) マルチホップWebエージェントタスク生成の形式化、(ii) 自動データ生成のための効率的で検証されたパイプラインの提案、(iii) 再現可能な評価を伴う動的ベンチマークのリリースである。
論文 参考訳(メタデータ) (2026-05-28T01:05:50Z) - Orchard: An Open-Source Agentic Modeling Framework [124.68499958175111]
スケーラブルなエージェントモデリングのためのオープンソースのフレームワークOrchardを紹介します。
Orchard Envは、サンドボックスライフサイクル管理のための再利用可能なプリミティブを提供する軽量環境サービスである。
Orchard Envの上に、3つのエージェントモデリングレシピを構築します。
論文 参考訳(メタデータ) (2026-05-14T16:35:12Z) - Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows [67.92316850084575]
ワークフローエージェントのライブベンチマークであるClaw-Eval-Liveを紹介する。
各リリースは、公開ワークフロー要求信号から構築される。
Claw-Eval-Liveは実行トレース、監査ログ、サービス状態、実行後のワークスペースアーティファクトを記録する。
論文 参考訳(メタデータ) (2026-04-30T17:23:19Z) - Orchestrating Human-AI Software Delivery: A Retrospective Longitudinal Field Study of Three Software Modernization Programs [0.0]
我々は,4段階にわたる人間とAIエージェントを協調する産業用プラットフォームであるChironについて,縦断調査を行った。
この研究は、3つの実際のソフトウェアモダナイゼーションプログラムをカバーしている。バンキングマイグレーション(30k LOC)、大規模な会計モダナイゼーション(400k LOC)、.NET/Angular住宅ローンのモダナイゼーション(30k LOC)である。
このベンチマークは、観察された結果(ステージ期間、タスクボリューム、検証ステージの問題、最初のリリースカバレッジ)をモデル化された結果から分離する。
論文 参考訳(メタデータ) (2026-03-20T15:14:36Z) - Immersion in the GitHub Universe: Scaling Coding Agents to Mastery [60.359983359258955]
ScaleSWEは、高品質なSWEデータを大規模に構築するために設計された、自動化されたサンドボックス化されたマルチエージェントワークフローである。
このシステムは、環境設定、テスト生成、問題記述合成のための3つの特別なエージェントをコーディネートし、5200リポジトリにわたる600万のプルリクエストを処理する。
論文 参考訳(メタデータ) (2026-02-10T15:30:19Z) - Towards Reliable ML Feature Engineering via Planning in Constrained-Topology of LLM Agents [1.991571265620589]
コード生成モデルの最近の進歩は、機能エンジニアリングを自動化する前例のない機会を解き放ちました。
現実のMLチームにおける彼らの採用は、依然として重要な課題に制約されている。
我々はこれらの課題に,プランナーによる制約付きトポロジーマルチエージェントフレームワークで対処する。
論文 参考訳(メタデータ) (2026-01-15T19:33:42Z) - Reinforcement Learning for Autonomous Warehouse Orchestration in SAP Logistics Execution: Redefining Supply Chain Agility [0.0]
本研究では,SAP Logistics Executionにおける倉庫作業の自律的オーケストレーションに強化学習を活用した先駆的フレームワークを提案する。
300,000 LEトランザクションの合成データセットは、マルチリンガルデータや運用上の障害を含む現実の倉庫シナリオをシミュレートする。
この分析は95%のタスク最適化精度を実現し、従来の手法に比べて処理時間を60%削減する。
論文 参考訳(メタデータ) (2025-06-06T20:34:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。