論文の概要: Multi-Robot Multi-Queue Control via Exhaustive Assignment Actor-Critic Learning
- arxiv url: http://arxiv.org/abs/2604.03605v1
- Date: Sat, 04 Apr 2026 06:32:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-07 15:49:18.665759
- Title: Multi-Robot Multi-Queue Control via Exhaustive Assignment Actor-Critic Learning
- Title(参考訳): 排他的アサインメント・アクター・クリティカル・ラーニングによるマルチロボットマルチキュー制御
- Authors: Mohammad Merati, H. M. Sabbir Ahmad, Wenchao Li, David Castañón,
- Abstract要約: 非対称な到着と切替遅延を持つマルチロボット,マルチキューシステムに対するオンラインタスク割り当てについて検討する。
サーバ位置比,負荷,非対称到着プロファイルの異なるポリシでは,ESLベースラインよりも低い割引保持コストと平均キュー長が一貫して達成される。
これらの結果から, 実時間マルチロボットスケジューリングにおいて, 構造認識型アクター批判手法が有効であることが示された。
- 参考スコア(独自算出の注目度): 3.376602231014461
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study online task allocation for multi-robot, multi-queue systems with asymmetric stochastic arrivals and switching delays. We formulate the problem in discrete time: each location can host at most one robot per slot, servicing a task consumes one slot, switching between locations incurs a one-slot travel delay, and arrivals at locations are independent Bernoulli processes with heterogeneous rates. Building on our previous structural result that optimal policies are of exhaustive type, we formulate a discounted-cost Markov decision process and develop an exhaustive-assignment actor-critic policy architecture that enforces exhaustive service by construction and learns only the next-queue allocation for idle robots. Unlike the exhaustive-serve-longest (ESL) queue rule, whose optimality is known only under symmetry, the proposed policy adapts to asymmetry in arrival rates. Across different server-location ratios, loads, and asymmetric arrival profiles, the proposed policy consistently achieves lower discounted holding cost and smaller mean queue length than the ESL baseline, while remaining near-optimal on instances where an optimal benchmark is available. These results show that structure-aware actor-critic methods provide an effective approach for real-time multi-robot scheduling.
- Abstract(参考訳): 非対称な確率到着と切替遅延を持つマルチロボット,マルチキューシステムに対するオンラインタスク割り当てについて検討する。
それぞれの場所が1つのスロットに1つのロボットをホストし、タスクが1つのスロットを消費し、各場所を切り替えると1スロットの移動遅延が発生し、各場所での到着は不均一な速度でBernoulliプロセスとなる。
これまでの構造的結果から,最適政策は総括型であり,コストの削減されたマルコフ決定プロセスを定式化し,建設による総括業務を強制する総括型アクタ批判型政策アーキテクチャを開発し,アイドルロボットの次のキューアロケーションのみを学習する。
最適性は対称性の下でのみ知られている排他的サービス最長(ESL)キュールールとは異なり、提案されたポリシーは到着率の非対称性に適応する。
サーバ位置比,負荷,非対称の到着プロファイルの異なるポリシでは,最適なベンチマークが利用可能なインスタンスに対してほぼ最適に留まる一方で,提案手法は,ESLベースラインよりも低割引の保持コストと平均キュー長を一貫して達成している。
これらの結果から, 実時間マルチロボットスケジューリングにおいて, 構造認識型アクター批判手法が有効であることが示された。
関連論文リスト
- Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - Queueing-Aware Optimization of Reasoning Tokens for Accuracy-Latency Trade-offs in LLM Servers [4.3400407844814985]
我々は,1つの大規模言語モデル (LLM) サーバを,$N$の異なるタスクタイプに属するクエリの異種ストリームを提供する。
各タスクタイプに対して、サーバは一定の数の内部思考トークンを割り当て、クエリに費やされる計算労力を決定する。
平均系時間で計算された重み付き平均精度目標を最大化する制約付き最適化問題を定式化する。
論文 参考訳(メタデータ) (2026-01-15T10:47:11Z) - A Real-Time Rescheduling Algorithm for Multi-robot Plan Execution [9.839983977902671]
Switchable-Edge Search (SES) は最適通過順序を見つけるために設計されたA*スタイルのアルゴリズムである。
本研究では,SESの最適性を証明し,シミュレーションによる効率評価を行う。
論文 参考訳(メタデータ) (2024-03-26T23:10:41Z) - DASA: Delay-Adaptive Multi-Agent Stochastic Approximation [64.32538247395627]
我々は,N$エージェントが並列に動作し,中央サーバと通信することで,一般的な近似問題を高速化することを目的とした設定を考える。
遅延とストラグラーの効果を軽減するために,マルチエージェント近似のための遅延適応アルゴリズムである textttDASA を提案する。
論文 参考訳(メタデータ) (2024-03-25T22:49:56Z) - Efficient Reinforcement Learning for Routing Jobs in Heterogeneous Queueing Systems [21.944723061337267]
我々は、中央キューに到着するジョブをヘテロジニアスサーバのシステムに効率的にルーティングする問題を考察する。
均質なシステムとは異なり、キュー長が一定のしきい値を超えた場合、ジョブを遅いサーバにルーティングするしきい値ポリシーは、ワンファストワンスローの2サーバシステムに最適であることが知られている。
本稿では,低次元ソフトしきい値パラメータ化を用いた効率的なポリシー勾配に基づくアルゴリズムであるACHQを提案する。
論文 参考訳(メタデータ) (2024-02-02T05:22:41Z) - Learning to Schedule in Parallel-Server Queues with Stochastic Bilinear Rewards [7.519872646378837]
本稿では,ジョブサーバの割り当てが不確実なマルチクラス並列サーバシステムにおけるスケジューリングの問題について考察する。
我々の目標は、時間軸上でのジョブサーバ割り当ての累積報酬を最大化することで、後悔を最小限に抑えることです。
提案アルゴリズムは,サブリニア・リセット・バウンドとサブリニア平均保持コストを実現する。
論文 参考訳(メタデータ) (2021-12-13T00:37:20Z) - Better than the Best: Gradient-based Improper Reinforcement Learning for
Network Scheduling [60.48359567964899]
パケット遅延を最小限に抑えるため,制約付き待ち行列ネットワークにおけるスケジューリングの問題を考える。
我々は、利用可能な原子ポリシーよりも優れたスケジューラを生成するポリシー勾配に基づく強化学習アルゴリズムを使用する。
論文 参考訳(メタデータ) (2021-05-01T10:18:34Z) - Dynamic Multi-Robot Task Allocation under Uncertainty and Temporal
Constraints [52.58352707495122]
本稿では,不確実性およびマルチエージェント協調の下での逐次意思決定における重要な計算課題を分離するマルチロボット割当アルゴリズムを提案する。
都市におけるマルチアームコンベヤベルトピック・アンド・プレイスとマルチドローン配送ディスパッチの2つの異なる領域における広範囲なシミュレーション結果について検証を行った。
論文 参考訳(メタデータ) (2020-05-27T01:10:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。