論文の概要: Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution
- arxiv url: http://arxiv.org/abs/2607.08960v1
- Date: Thu, 09 Jul 2026 21:51:39 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-13 14:47:12.746479
- Title: Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution
- Title(参考訳): Eluna:ReasoningとTask Executionによる倉庫作業自動化のためのエージェントLLMシステム
- Authors: Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi,
- Abstract要約: 信頼性の高いSOP実行のための実運用型エージェントシステムであるElunaを提案する。
Elunaは、プログレッシブな開示を伴う非循環グラフとしてSOPをエンコードし、独立したタスクを並列サブエージェントに委譲する。
13タスクのベンチマークと2つのプロダクションアプリケーションでは、微調整されたモデルが教師と一致しているか、あるいは超えるかのどちらかで、オフ・ザ・シェルフのベースラインを全て破り、チケット処理アプリケーションに関して94%のエキスパート合意に達した。
- 参考スコア(独自算出の注目度): 32.27116355787843
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Warehouse operations are governed by Standard Operating Procedures (SOPs) that encode complex, multi-system decision logic, which must be executed reliably under strict time constraints, yet LLM agents lack mechanisms to enforce procedural compliance and degrade under the context overload full SOP specifications introduce. We present Eluna, a production-deployed agentic system for reliable SOP execution. Eluna is a graph-guided, multi-agent framework that encodes SOPs as directed acyclic graphs with progressive disclosure and delegates independent tasks to parallel sub-agents, each with persistent code execution and live data access. To meet production latency and accuracy needs, we use asymmetric episodic distillation where a strong teacher is improved through episodic error memories, then a smaller student is fine-tuned on the corrected trajectories with memory stripped, internalizing corrections without inference-time overhead. On a 13-task benchmark and two production applications, our fine-tuned models match or exceed their teacher, beat all larger off-the-shelf baselines, and reach 94% expert agreement on the ticket processing application.
- Abstract(参考訳): ウェアハウス操作は、複雑なマルチシステム決定ロジックをエンコードする標準オペレーティング手順(SOP)によって管理され、厳密な時間制約の下で確実に実行されなければならない。
信頼性の高いSOP実行のための実運用型エージェントシステムであるElunaを提案する。
Elunaはグラフ誘導型マルチエージェントフレームワークで、SOPをプログレッシブな開示を伴う非循環グラフとしてエンコードし、独立したタスクを並列サブエージェントに委譲する。
生産遅延と精度の要求を満たすため,非対称なエピソード蒸留を用いて,エピソード的誤り記憶により強い教師が改善され,より小さな学生が推論時間オーバーヘッドを伴わずに修正されたトラジェクトリに微調整される。
13タスクのベンチマークと2つのプロダクションアプリケーションでは、微調整されたモデルが教師と一致しているか、あるいは超えるかのどちらかで、オフ・ザ・シェルフのベースラインを全て破り、チケット処理アプリケーションに関して94%のエキスパート合意に達した。
関連論文リスト
- OSDAG: Online Scheduling for Efficient Multi-Robot Collaboration [2.2726869886741383]
本稿では, LLMに基づくタスク推論と, Directed Acyclic Graph表現と制約対応オンラインスケジューリングを統合した新しいフレームワークOSDAGを提案する。
5つのベンチマークシナリオの実験では、OSDAGは対話ベースの手法に比べて5~15倍高速な推論時間を実現し、シーケンシャルベースラインよりも最大38%のペースパンを削減し、競争的な成功率を維持している。
論文 参考訳(メタデータ) (2026-06-13T11:22:34Z) - Multi-Agent Computer Use [72.79887808312706]
我々はマルチエージェント・コンピュータ・ユース(MACU)システムの評価・構築に向けて進むべきであると論じる。
本稿では、マネージャモデルがコンピュータ使用タスクを有向非巡回グラフ(DAG)として分解する汎用マルチエージェント構成を提案する。
各イテレーションで、マネージャは並列CUAサブエージェントをディスパッチし、DAGの準備ができているフロンティアでノードを実行する。
論文 参考訳(メタデータ) (2026-06-01T01:29:36Z) - Towards Multi-Agent Autonomous Reasoning in Hydrodynamics [0.06999740786886537]
本稿では,多エージェントをレイヤ実行グラフ(LEG)を介して協調させる,流体力学のためのマルチエージェントシステム(MAS)のプロトタイプを提案する。
プランナーエージェントは、ドメイン知識を厳密な制御ロジックとしてハードコーディングすることなく、自然言語ルーティングからクエリ固有の実行トポロジを構築する。
レポーターエージェントが最終応答を合成し、ランタイムが監査性をサポートするためのツール呼び出し毎に証明をログする。
論文 参考訳(メタデータ) (2026-05-01T21:17:55Z) - Small Model as Master Orchestrator: Learning Unified Agent-Tool Orchestration with Parallel Subtask Decomposition [61.291733522717415]
Agent-as-Toolは並列オーケストレーションのパラダイムであり、エージェントとツールの両方を標準化された学習可能なアクション空間に緩和する。
ParaManagerは、サブタスク解決から計画決定を分離し、ステート対応の並列サブタスク分解、デリゲート、非同期実行を可能にする。
実験により、ParaManagerは複数のベンチマークで高い性能を示し、目に見えないモデルプールの下で堅牢な一般化を示す。
論文 参考訳(メタデータ) (2026-04-18T14:41:27Z) - Chimera: Latency- and Performance-Aware Multi-agent Serving for Heterogeneous LLMs [62.17306142810532]
ヘテロジニアスLSMクラスタ上で動作するマルチエージェントワークフローの予測スケジューリングシステムであるChimeraを提案する。
Chimeは最高のレイテンシをトレースし、エンドツーエンドのレイテンシを1.2-2.4$times$で削減し、タスクパフォーマンスを平均8.0-9.5ポイント改善する。
論文 参考訳(メタデータ) (2026-03-23T17:01:42Z) - SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding [41.98672557723593]
SWEQA-Proは,多種多様な長期リポジトリと実行可能な環境から構築されたベンチマークである。
さらに,2段階のトレーニングレシピであるSupervised Fine-Tuning(SFT)とReinforcement Learning from AI Feedback(RLAIF)という,スケーラブルな合成データパイプラインを提案する。
SWE-QA-ProのGPT-4oを2.3ポイント超え、最先端モデルとのギャップを大幅に狭める。
論文 参考訳(メタデータ) (2026-03-17T05:12:48Z) - DLLM Agent: See Farther, Run Faster [94.74432470237817]
拡散大言語モデル(DLLM)は、自己回帰(AR)デコーディングの代替として、魅力的な効率とモデリング特性を持つ。
我々は、DLLMとARのバックボーンを同一のエージェントワークフロー内でインスタンス化することで、制御された環境でこれを研究する。
DLLMエージェントはARエージェントよりも平均30%以上速く、場合によっては8倍のスピードアップを達成している。
論文 参考訳(メタデータ) (2026-02-07T09:01:18Z) - AgentAsk: Multi-Agent Systems Need to Ask [26.13279490836716]
大規模言語モデル(LLM)上に構築されたマルチエージェントシステムは、協調的な分業による問題解決能力の向上を約束する。
我々はAgentAskを提案する。AgentAskは軽量でプラグ・アンド・プレイの明確化モジュールで、すべてのエージェント間メッセージを潜在的な障害点として扱い、エラーの伝播を抑えるのに必要最小限の質問を挿入する。
AgentAskは、公開マルチエージェント実装の精度と堅牢性を継続的に改善し、オーバーヘッドを最小限に抑え、レイテンシと余分なコストを5%以下に抑える。
論文 参考訳(メタデータ) (2025-10-08T22:36:05Z) - Performant LLM Agentic Framework for Conversational AI [1.6114012813668932]
複雑なグラフをトラバースする際に,適切なノードを選択し,順に処理を実行する際に,LLM(Large Language Models)を支援する新しいシステムであるPerformant Agentic Framework(PAF)を紹介する。
PAFはLLMベースの推論と数学的に基底化されたベクトルスコアリング機構を組み合わせることで、高い精度とレイテンシの低減を実現している。
PAFは、複雑なビジネス環境において、スケーラブルでリアルタイムな会話型AIシステムを実現する方法として、ベースラインメソッドを著しく上回ることを示した。
論文 参考訳(メタデータ) (2025-03-09T02:58:34Z) - Procedures as Programs: Hierarchical Control of Situated Agents through
Natural Language [81.73820295186727]
エージェント命令と制御のための階層的な手続き的知識を表現する強力な手法である,プログラムとしての手続きの形式化を提案する。
NL命令に対するIQAおよびALFREDデータセット上で、このフレームワークをインスタンス化する。
論文 参考訳(メタデータ) (2021-09-16T20:36:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。