論文の概要: Architectural Implications of Agentic AI Workflows
- arxiv url: http://arxiv.org/abs/2608.04458v1
- Date: Wed, 05 Aug 2026 05:31:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.729491
- Title: Architectural Implications of Agentic AI Workflows
- Title(参考訳): エージェントAIワークフローのアーキテクチャ的意味
- Authors: Jirong Yang, Peizhe Liu, Chaojie Zhang, Jovan Stojkovic,
- Abstract要約: エージェント実行は断片化され、不均一であることを示す。
私たちの分類学は、この断片化が資源需要にどのように変わるかを説明している。
私たちは、Microsoft Azureの製品研究とオープンソースフレームワークの制御された研究で、最初のアーキテクチャ特性を提示します。
- 参考スコア(独自算出の注目度): 3.5622270586216858
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Agentic AI is emerging in datacenters, but its architectural implications remain unexplored. We organize agentic workflows in a taxonomy and present its first architectural characterization with a production study at Microsoft Azure and a controlled study of open-source frameworks. We show that agentic execution is fragmented and heterogeneous. Requests expand into a workflow of LLM inferences, tool invocations, and orchestration decisions that repeatedly cross the CPU-GPU boundary. Our taxonomy explains how this fragmentation turns into resource demand. As orchestration and tools run on the host, the CPU sits on the critical path. Execution structure sets the load over time, which stays low with sudden spikes. Model composition sets how evenly the workflow uses the GPUs. Diversity in tasks and tools widens this range even further. These characteristics expose architectural mismatches of conventional uniform servers. Fragmented execution strands CPU and GPU capacity despite bursty demand. Different software roles make homogeneous CPU provisioning inefficient. Finally, multiplexing many agents onto shared cores degrades microarchitectural locality. Guided by our findings, we derive implications for agentic servers and examine them through Agora, our prototype for commodity servers. Agora dynamically harvests idle CPU cores for co-located throughput work, while protecting agentic tail latency against tool spikes. It oversubscribes GPU memory by placing more agents on each GPU, prefetching the next agent's state to hide swap latency. To match the machine to the heterogeneous roles, Agora pools cores by role and applies affinity-aware scheduling to restore locality. It automatically tunes mechanisms to the workload. Agora improves utilization and server throughput while preserving agent tail latency. Our insights also identify key directions for future server architectures for agentic AI.
- Abstract(参考訳): Agentic AIはデータセンターに登場しているが、そのアーキテクチャ的意味はいまだ解明されていない。
分類学でエージェントワークフローを編成し、Microsoft Azureのプロダクション研究とオープンソースフレームワークの制御された研究により、その最初のアーキテクチャ特性を提示する。
エージェント実行は断片化され、不均一であることを示す。
リクエストはLLM推論、ツール呼び出し、CPU-GPUバウンダリを何度も横断するオーケストレーション決定のワークフローに拡張される。
私たちの分類学は、この断片化が資源需要にどのように変わるかを説明している。
オーケストレーションとツールがホスト上で実行されると、CPUはクリティカルパスに配置されます。
実行構造は、負荷を時間とともに設定します。
モデル構成はワークフローがGPUをいかに均一に使用するかを設定する。
タスクやツールの多様性は、この範囲をさらに広げます。
これらの特徴は、従来の統一サーバのアーキテクチャミスマッチを明らかにする。
フラグメンテッドな実行は、バースト的な需要にもかかわらず、CPUとGPUのキャパシティを損なう。
異なるソフトウェアの役割は、同質のCPUプロビジョニングを非効率にする。
最後に、多くのエージェントを共有コアに多重化すると、マイクロアーキテクチャーの局所性が低下する。
この結果からエージェントサーバへの影響を導き,コモディティサーバのプロトタイプであるAgoraを通じてそれらを検証した。
AgoraはアイドルCPUコアを動的に回収してスループットの同時ロケーションを実現し、ツールスパイクに対してエージェント的なテールレイテンシを保護する。
各GPUにより多くのエージェントを配置することで、GPUメモリをオーバーサブスクライブし、次のエージェントの状態をプレフェッチしてスワップレイテンシを隠蔽する。
マシンを異種の役割に合わせるため、Agoraはコアをロールごとにプールし、アフィニティ対応のスケジューリングを適用してローカリティを復元する。
自動的に機構をワークロードにチューニングする。
Agoraは、エージェントのテールレイテンシを保ちながら、使用率とサーバスループットを改善している。
私たちの洞察は、エージェントAIのための将来のサーバーアーキテクチャの鍵となる方向も特定します。
関連論文リスト
- Multi-Agent Computer Use [72.79887808312706]
我々はマルチエージェント・コンピュータ・ユース(MACU)システムの評価・構築に向けて進むべきであると論じる。
本稿では、マネージャモデルがコンピュータ使用タスクを有向非巡回グラフ(DAG)として分解する汎用マルチエージェント構成を提案する。
各イテレーションで、マネージャは並列CUAサブエージェントをディスパッチし、DAGの準備ができているフロンティアでノードを実行する。
論文 参考訳(メタデータ) (2026-06-01T01:29:36Z) - ArchAgent: Agentic AI-driven Computer Architecture Discovery [37.90375160345664]
ArchAgentはAlphaEvolve上に開発されたコンピュータアーキテクチャの自動発見システムである。
本稿では,ArchAgentのキャッシュ置換ポリシーを自動設計・実装する機能を示す。
またエージェントAIの時代におけるコンピュータアーキテクチャ研究への幅広い影響についても概説する。
論文 参考訳(メタデータ) (2026-02-25T21:36:16Z) - AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent [57.10083973844841]
AgentArkは、マルチエージェントダイナミクスを単一のモデルの重みに蒸留する新しいフレームワークである。
各種モデル,タスク,スケーリング,シナリオの3つの階層的蒸留戦略について検討する。
シミュレーションからトレーニングへ計算の負担をシフトさせることで、蒸留されたモデルは、複数のエージェントの強い推論と自己補正性能を示しながら、一つのエージェントの効率を保ちます。
論文 参考訳(メタデータ) (2026-02-03T19:18:28Z) - CUA-Skill: Develop Skills for Computer Using Agent [48.87870942314034]
コンピュータを利用したエージェントスキルベースであるCUA-Skillを導入し,人間のコンピュータ利用知識をスキルとして符号化する。
我々は、動的スキル検索、引数のインスタンス化、メモリ認識障害回復をサポートする、エンドツーエンドのコンピュータ利用エージェントであるCUA-Skill Agentを構築した。
その結果、CUA-Skillは、エンドツーエンドのベンチマークで実行の成功率と堅牢性を大幅に向上することを示した。
論文 参考訳(メタデータ) (2026-01-28T23:38:25Z) - A CPU-Centric Perspective on Agentic AI [8.417523196411574]
Agentic AIフレームワークは、Web検索、Pythonインタプリタ、コンテキストデータベースなど、外部ツールに埋め込まれた意思決定オーケストレータを追加する。
本稿では,エージェントAIワークロードが導入するシステムのボトルネックをCPU中心の観点から特徴づけ,理解することを目的とする。
論文 参考訳(メタデータ) (2025-11-01T23:46:44Z) - DeepAgent: A General Reasoning Agent with Scalable Toolsets [111.6384541877723]
DeepAgentは、自律的な思考、ツール発見、アクション実行を実行するエンドツーエンドのディープ推論エージェントである。
長期にわたる相互作用の課題に対処するために,過去の相互作用を構造化エピソード,動作,ツール記憶に圧縮する自律的メモリ折り畳み機構を導入する。
LLMシミュレートされたAPIを活用し、ツール呼び出しトークンにきめ細かいクレジットを割り当てるツールコールアドバンテージ属性を適用した、エンドツーエンドの強化学習戦略であるToolPOを開発した。
論文 参考訳(メタデータ) (2025-10-24T16:24:01Z) - PC-Agent: A Hierarchical Multi-Agent Collaboration Framework for Complex Task Automation on PC [98.82146219495792]
本稿では,PC-Agentという階層型エージェントフレームワークを提案する。
認識の観点からは,現在のMLLMのスクリーンショットコンテンツに対する認識能力の不十分さを克服するために,アクティブ知覚モジュール(APM)を考案する。
意思決定の観点から、複雑なユーザ命令や相互依存サブタスクをより効果的に扱うために、階層的なマルチエージェント協調アーキテクチャを提案する。
論文 参考訳(メタデータ) (2025-02-20T05:41:55Z) - Compass: A Decentralized Scheduler for Latency-Sensitive ML Workflows [0.792324422300924]
我々は、GPU対応のワーカが協調して複雑なクエリを実行する分散システムにおけるMLクエリ処理について検討する。
このようなシステムでは、GPUメモリ管理とタスク配置の共スケジューリングが有望な機会である。
資源を効率的に利用しながら、仕事の遅延を軽減するためにこれらの機能を統一する新しいフレームワークであるCompassを提案する。
論文 参考訳(メタデータ) (2024-02-27T16:21:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。