論文の概要: ALIGN-HOLD: Experience Alignment for Real-Time Hold Control in Large-Scale Ride-Hailing Matching at DiDi
- arxiv url: http://arxiv.org/abs/2609.09685v1
- Date: Wed, 09 Sep 2026 03:59:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-10 19:44:08.893932
- Title: ALIGN-HOLD: Experience Alignment for Real-Time Hold Control in Large-Scale Ride-Hailing Matching at DiDi
- Title(参考訳): ALIGN-HOLD:DiDiにおける大規模ライディングマッチングにおけるリアルタイムホールド制御のためのエクスペリエンスアライメント
- Abstract要約: 我々は,暗黙のマーケットプレース嗜好から保持ポリシーを学習する実運用規模のエクスペリエンスアライメントフレームワークであるALIGN-HOLDを提案する。
我々はDiDiの配車プラットフォームにALIGN-HOLDをデプロイし,28日間のランダム化A/B実験で評価した。
ALIGN-HOLDは、配備された生産方針と比較して、旅行完了率と運転者収入の統計的に有意な改善を実現している。
- 参考スコア(独自算出の注目度): 20.21575759739407
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Real-time hold control is a high-leverage mechanism in large-scale ride-hailing systems: by selectively deferring driver-order pairs, the platform can wait for better matching opportunities and improve end-to-end passenger-driver experience. Existing production systems such as EXHOLD learn bandit-based hold policies from handcrafted combinations of trip completion, cancellations, waiting time, and driver effort. However, designing such rewards becomes increasingly difficult as marketplace preferences are heterogeneous and observed passenger-driver behavior can be sparse, noisy, and affected by dynamic supply-demand conditions. We present ALIGN-HOLD, a production-scale experience alignment framework that learns hold policy from implicit marketplace preferences. ALIGN-HOLD constructs complementary preference pairs from order trajectories, driver trajectories, and contemporaneous local matching graphs, and trains an experience Reward Model (RM) using balanced multi-view sampling and model-adaptive hard preference sampling. During simulator-based policy learning, the frozen RM provides a dense, context-dependent reward and supports label-free filtering of low-identifiability interactions whose behavioral feedback is difficult to attribute to matching quality. We deploy ALIGN-HOLD on DiDi's ride-hailing platform and evaluate it in a 28-day randomized A/B experiment, covering approximately 100,000 passenger requests per day. Compared with the deployed production policy, ALIGN-HOLD achieves statistically significant improvements in trip completion rate and driver income, while significantly reducing passenger cancellations before and after driver acceptance. Complementary ablations, RM diagnostics, and behavioral analyses validate the contributions of the proposed components. ALIGN-HOLD has been fully ramped up and is currently serving DiDi's Brazil marketplace.
- Abstract(参考訳): ドライバーとドライバーのペアを選択的に遅延させることで、プラットフォームはより良いマッチング機会を待ち、エンド・ツー・エンドのドライバー体験を改善することができる。
EXHOLDのような既存のプロダクションシステムは、手作りの旅行完了、キャンセル、待ち時間、ドライバーの努力からバンディットベースのホールドポリシーを学ぶ。
しかし、マーケットプレースの嗜好が不均一であり、乗客・ドライバーの振る舞いが疎く、騒々しく、動的供給需要条件の影響を受けやすいため、このような報酬の設計はますます困難になってきている。
我々は,暗黙のマーケットプレース嗜好から保持ポリシーを学習する実運用規模のエクスペリエンスアライメントフレームワークであるALIGN-HOLDを提案する。
ALIGN-HOLDは、順序軌跡、ドライバ軌跡、同時局所マッチンググラフから相補的な選好ペアを構築し、バランスの取れたマルチビューサンプリングとモデル適応型ハードプライオリティサンプリングを用いて、経験的リワードモデル(RM)を訓練する。
シミュレータベースのポリシー学習の間、凍結されたRMは、密集したコンテキスト依存の報酬を提供し、振る舞いフィードバックが整合性に起因しにくい低識別性相互作用のラベルなしフィルタリングをサポートする。
我々はDiDiの配車プラットフォームにALIGN-HOLDをデプロイし、28日間のランダム化されたA/B実験で評価した。
ALIGN-HOLDは、配備された生産方針と比較して、走行完了率と運転者所得の統計的に有意な改善を実現し、運転者の受け入れ前後の乗客のキャンセルを著しく減少させる。
補完的改善, RM診断, 行動分析により, 提案した成分の寄与を検証した。
ALIGN-HOLDは完全に強化され、現在DiDiのブラジルのマーケットプレースを提供している。
関連論文リスト
- EXHOLD: Experience-Aware Real-Time Hold Control for Large-Scale Ride-Hailing Matching at DiDi [15.809083286679462]
大規模なライドシェアリングでは、ホールドコントロールは乗客とドライバーの体験を改善するための重要なメカニズムである。
ホールドタイム実行から経験と認識のペアアセスメントを分離するためのデプロイ可能なフレームワーク EXHOLD を提案する。
EXHOLDは旅行の完了とドライバーの収入を増大させ、乗客のキャンセルを著しく減らし、ファネル効率を向上する。
論文 参考訳(メタデータ) (2026-07-10T04:19:12Z) - TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning [52.67756371231985]
検証可能な報酬を伴う強化学習(RLVR)は、大規模言語モデルにおける推論とエージェント的行動を強化するための有望なアプローチである。
本稿では,Tree Rollout Allocation for Contrastive Exploration (TRACE)について紹介する。
技術的には、TRACEはロールアウト予算をルートと中間プレフィックスの両方に割り当てている。
論文 参考訳(メタデータ) (2026-06-09T17:16:03Z) - CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving [19.474428775260034]
超高速な生成計画と深い意味的推論を組み合わせたフレームワークであるCLEARを提案する。
CLEARはDrive-JEPAをビジュアルエンコーダとして採用し、VAEラテント空間におけるマルチステップデノイングチェーンを単一ステップ条件ドリフトに置き換える。
NAVSIM v1ベンチマークでは、CLEARは93.7の最先端のPDMSを達成した。
論文 参考訳(メタデータ) (2026-06-04T14:32:10Z) - MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving [62.43744546817599]
視覚言語-アクション(VLA)モデルは、エンドツーエンドのモーションプランナーとして有効であるが、クローズドループ設定で評価すると不安定である。
本稿では, VLAモデルの潜在空間における動的駆動シナリオの, リアクティブでマルチエージェントなロールアウトのための新しいフレームワークMAPLEを提案する。
MAPLEはBench2Driveで最先端の駆動性能を実現し、堅牢なE2E自動運転システムのためのスケーラブルでクローズループなマルチエージェントプレイを実演する。
論文 参考訳(メタデータ) (2026-05-13T23:35:14Z) - Beyond Self-Play and Scale: A Behavior Benchmark for Generalization in Autonomous Driving [8.06426702612716]
最近の自律運転(AD)研究は、政策推進のための訓練戦略として強化学習(RL)を大規模に解き放たれた。
しかし、これらのポリシーは確立されたベンチマークから切り離されたままであり、標準化された評価を駆動するための大規模RLの性能は未知のままである。
評価、複雑さ、振る舞いの多様性という3つの軸に沿って、このギャップを埋める包括的なテストスイートであるBehaviorBenchを紹介します。
論文 参考訳(メタデータ) (2026-05-11T05:59:49Z) - CoReVLA: A Dual-Stage End-to-End Autonomous Driving Framework for Long-Tail Scenarios via Collect-and-Refine [73.74077186298523]
CoReVLAは、自動運転のための継続的学習フレームワークである。
データコレクションとビヘイビアリファインメントの2段階プロセスを通じて、ロングテールシナリオのパフォーマンスを改善する。
CoReVLAは72.18のドライビングスコア(DS)と50%の成功率(SR)を達成し、7.96DSの最先端手法と15%SRの長期的安全クリティカルシナリオで性能を向上する。
論文 参考訳(メタデータ) (2025-09-19T13:25:56Z) - Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment [51.10604883057508]
DR-IRL(逆強化学習によるリワードの動的調整)を提案する。
まず、IRLを介して7つの有害なカテゴリをカバーするバランスの取れた安全データセットを用いて、カテゴリ固有の報酬モデルを訓練する。
次に,テキストエンコーダのコサイン類似性によるデータレベルの硬さ,報酬ギャップによるモデルレベルの応答性など,タスク難易度による報酬を導入することにより,グループ相対政策最適化(GRPO)を強化する。
論文 参考訳(メタデータ) (2025-03-23T16:40:29Z) - Timing the Match: A Deep Reinforcement Learning Approach for Ride-Hailing and Ride-Pooling Services [17.143444035884386]
本稿では、リアルタイムシステム条件に基づいていつマッチングを行うかを決定するために、深層強化学習(RL)を用いた適応型ライドマッチング戦略を提案する。
本手法は,システム状態の評価を継続的に行い,全乗客待ち時間を最小化するタイミングでマッチングを実行する。
論文 参考訳(メタデータ) (2025-03-17T14:07:58Z) - MetaFollower: Adaptable Personalized Autonomous Car Following [63.90050686330677]
適応型パーソナライズされた自動車追従フレームワークであるMetaFollowerを提案する。
まず,モデルに依存しないメタラーニング(MAML)を用いて,様々なCFイベントから共通運転知識を抽出する。
さらに、Long Short-Term Memory (LSTM) と Intelligent Driver Model (IDM) を組み合わせて、時間的不均一性を高い解釈性で反映する。
論文 参考訳(メタデータ) (2024-06-23T15:30:40Z) - Conditional Expectation based Value Decomposition for Scalable On-Demand
Ride Pooling [11.988825533369683]
従来のライドプーリングアプローチは、現在のマッチが車/ドライバーの将来的な価値に与える影響を考慮していない。
我々は,新たなアプローチである条件付き期待値分解(CEVD)がNeurADPを最大9.76%上回っていることを示す。
論文 参考訳(メタデータ) (2021-12-01T15:53:16Z) - Value Function is All You Need: A Unified Learning Framework for Ride
Hailing Platforms [57.21078336887961]
DiDi、Uber、Lyftなどの大型配車プラットフォームは、都市内の数万台の車両を1日中数百万の乗車要求に接続している。
両課題に対処するための統合価値に基づく動的学習フレームワーク(V1D3)を提案する。
論文 参考訳(メタデータ) (2021-05-18T19:22:24Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。