論文の概要: Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution
- arxiv url: http://arxiv.org/abs/2509.09560v1
- Date: Thu, 11 Sep 2025 15:51:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-09-12 16:52:24.456882
- Title: Boosting Embodied AI Agents through Perception-Generation Disaggregation and Asynchronous Pipeline Execution
- Title(参考訳): 知覚生成分解と非同期パイプライン実行による身体的AIエージェントの増強
- Authors: Shulai Zhang, Ao Xu, Quan Chen, Han Zhao, Weihao Cui, Ningxin Zheng, Haibin Lin, Xin Liu, Minyi Guo,
- Abstract要約: 身体化されたAIシステムは動的環境で動作し、知覚と生成モジュールのシームレスな統合を必要とする。
本稿では,AIエージェントの推論周波数を最適化するアルゴリズム設計の推論フレームワークであるAurasを紹介する。
- 参考スコア(独自算出の注目度): 26.709777786029225
- License: http://creativecommons.org/licenses/by-sa/4.0/
- Abstract: Embodied AI systems operate in dynamic environments, requiring seamless integration of perception and generation modules to process high-frequency input and output demands. Traditional sequential computation patterns, while effective in ensuring accuracy, face significant limitations in achieving the necessary "thinking" frequency for real-world applications. In this work, we present Auras, an algorithm-system co-designed inference framework to optimize the inference frequency of embodied AI agents. Auras disaggregates the perception and generation and provides controlled pipeline parallelism for them to achieve high and stable throughput. Faced with the data staleness problem that appears when the parallelism is increased, Auras establishes a public context for perception and generation to share, thereby promising the accuracy of embodied agents. Experimental results show that Auras improves throughput by 2.54x on average while achieving 102.7% of the original accuracy, demonstrating its efficacy in overcoming the constraints of sequential computation and providing high throughput.
- Abstract(参考訳): Embodied AIシステムは動的環境で動作し、高周波入力および出力要求を処理するために知覚と生成モジュールのシームレスな統合を必要とする。
従来の逐次計算パターンは精度を確保するのに効果的だが、現実世界のアプリケーションに必要な「考える」頻度を達成する上で、重大な制限に直面している。
本研究では,AIエージェントの推論周波数を最適化するアルゴリズム設計型推論フレームワークであるAurasを紹介する。
Aurasは知覚と生成を分離し、制御されたパイプライン並列性を提供し、高い安定したスループットを実現する。
並列性の増加に伴って発生するデータ不安定性の問題に直面して、Aurasは認識と生成を共有するための公開コンテキストを確立し、エンボディエージェントの精度を約束する。
実験結果から、Aurasはスループットを平均2.54倍改善し、元の精度の102.7%を達成し、シーケンシャルな計算の制約を克服し、高いスループットを提供する効果を示した。
関連論文リスト
- Jano: Adaptive Diffusion Generation with Early-stage Convergence Awareness [7.596181361033662]
DiT(Diffusion Transformer)は、集中的なフルアテンション計算を必要とする。
私たちは、この洞察を効率的な地域認識生成に活用する、トレーニング不要のフレームワークであるJanoを紹介します。
Janoは、生成品質を維持しながら、相当な加速(平均2.0倍のスピードアップ、2.4倍)を達成する。
論文 参考訳(メタデータ) (2026-02-28T07:35:01Z) - Scaling Agentic Verifier for Competitive Coding [66.11758166379092]
大規模言語モデル(LLM)は強力なコーディング能力を示しているが、1回の試行で競合するプログラミング問題を正しく解くのに苦戦している。
実行ベースの再ランク付けは、有望なテスト時間スケーリング戦略を提供するが、既存のメソッドは、難しいテストケースの生成または非効率的なランダム入力サンプリングによって制約される。
本稿では,プログラムの動作を積極的に推論し,高い差別性のあるテスト入力を検索するエージェント検証手法を提案する。
論文 参考訳(メタデータ) (2026-02-04T06:30:40Z) - FASTer: Toward Efficient Autoregressive Vision Language Action Modeling via Neural Action Tokenization [61.10456021136654]
本稿では,効率的で汎用的なロボット学習のための統合フレームワークであるFASTerを紹介する。
FASTerVQは、アクションチャンクをシングルチャネルイメージとしてエンコードし、高い圧縮比を維持しながら、グローバルな時間的依存関係をキャプチャする。
FASTerVLAはブロックワイドの自動回帰デコーディングと軽量アクションエキスパートを備えたトークンライザ上に構築されており、推論の高速化とタスクパフォーマンスの向上を実現している。
論文 参考訳(メタデータ) (2025-12-04T16:21:38Z) - Adaptive Residual-Update Steering for Low-Overhead Hallucination Mitigation in Large Vision Language Models [13.32858759983739]
LVLM(Large Vision-Language Models)は、しばしばオブジェクト幻覚に悩まされ、視覚入力と矛盾するテキストを生成する。
この問題を緩和するための既存の推論時間の介入は、難しいトレードオフをもたらします。
本稿では,LVLMを視覚的に生成するフレームワークであるResidual-Update Directed Decoding Regulation(RUDDER)を提案する。
論文 参考訳(メタデータ) (2025-11-13T13:29:38Z) - Improving Deepfake Detection with Reinforcement Learning-Based Adaptive Data Augmentation [60.04281435591454]
CRDA(Curriculum Reinforcement-Learning Data Augmentation)は、マルチドメインの偽造機能を段階的にマスターするための検出器を導く新しいフレームワークである。
私たちのアプローチの中心は、強化学習と因果推論を統合することです。
提案手法は検出器の一般化性を大幅に向上し,複数のクロスドメインデータセット間でSOTA法より優れている。
論文 参考訳(メタデータ) (2025-11-10T12:45:52Z) - Lightweight Task-Oriented Semantic Communication Empowered by Large-Scale AI Models [66.57755931421285]
大規模人工知能(LAI)モデルは、リアルタイム通信シナリオにおいて重大な課題を提起する。
本稿では,LAIモデルから知識を抽出・凝縮するために知識蒸留(KD)技術を活用することを提案する。
本稿では,反復推論の必要性を排除したプレストア圧縮機構を備えた高速蒸留法を提案する。
論文 参考訳(メタデータ) (2025-06-16T08:42:16Z) - Task-Oriented Feature Compression for Multimodal Understanding via Device-Edge Co-Inference [49.77734021302196]
本稿では,マルチモーダル理解のためのタスク指向特徴圧縮(TOFC)手法を提案する。
圧縮効率を向上させるために、視覚特徴の特性に基づいて複数のエントロピーモデルを適応的に選択する。
その結果,TOFCはデータ転送オーバーヘッドを最大52%削減し,システム遅延を最大63%削減できることがわかった。
論文 参考訳(メタデータ) (2025-03-17T08:37:22Z) - DriveTransformer: Unified Transformer for Scalable End-to-End Autonomous Driving [62.62464518137153]
DriveTransformerは、スケールアップを簡単にするためのシンプルなE2E-ADフレームワークである。
タスク・セルフ・アテンション、センサー・クロス・アテンション、時間的クロス・アテンションという3つの統合された操作で構成されている。
シミュレーションされたクローズドループベンチマークBench2Driveと、FPSの高い実世界のオープンループベンチマークnuScenesの両方で、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-03-07T11:41:18Z) - Monitoring Decoding: Mitigating Hallucination via Evaluating the Factuality of Partial Response during Generation [9.137042895376343]
大規模な言語モデルは幻覚に影響を受けやすいため、真に正しくない内容を生成する。
このようなリスクを軽減する既存の方法は、しばしば複数の全世代をサンプリングすることに依存する。
生成プロセスを動的に監視する新しいフレームワークであるモニタリングデコーディングを導入する。
論文 参考訳(メタデータ) (2025-03-05T01:51:03Z) - Enhancing 5G O-RAN Communication Efficiency Through AI-Based Latency Forecasting [2.3784320672898227]
本稿では,関数型O-RANプロトタイプに統合された人工知能駆動の遅延予測システムを提案する。
このシステムは、双方向の長期記憶モデルを使用して、FlexRICで構築されたスケーラブルでオープンソースのフレームワーク内で、リアルタイムで遅延を予測する。
実験の結果、モデルの有効性が示され、0.04未満の損失測定値が得られ、ダイナミックな5G環境に適用可能であることが証明された。
論文 参考訳(メタデータ) (2025-02-25T10:11:48Z) - AI-in-the-Loop Sensing and Communication Joint Design for Edge Intelligence [65.29835430845893]
本稿では,AI-in-the-loopジョイントセンシングと通信によるエッジインテリジェンス向上のためのフレームワークを提案する。
私たちの研究の重要な貢献は、バリデーション損失とシステムのチューニング可能なパラメータとの間に明確な関係を確立することです。
提案手法は, 通信エネルギー消費を最大77%削減し, 試料数で測定した検知コストを最大52%削減する。
論文 参考訳(メタデータ) (2025-02-14T14:56:58Z) - Faster Diffusion Action Segmentation [9.868244939496678]
時間的行動分類(TAS)はビデオ解析において不可欠な課題であり、連続したフレームを別のアクションセグメントに分割し分類することを目的としている。
拡散モデルの最近の進歩は、安定したトレーニングプロセスと高品質な生成能力により、TASタスクにおいて大きな成功を収めている。
本稿では,効率的かつ高性能なTASアルゴリズムであるEffiDiffActを提案する。
論文 参考訳(メタデータ) (2024-08-04T13:23:18Z) - AdaDiff: Accelerating Diffusion Models through Step-Wise Adaptive Computation [32.74923906921339]
拡散モデルは多彩で高忠実な画像を生成する上で大きな成功を収めるが、それらの応用は本質的に遅い生成速度によって妨げられる。
本稿では,拡散モデルの生成効率を向上させるために,各サンプリングステップで動的に計算資源を割り当てる適応フレームワークであるAdaDiffを提案する。
論文 参考訳(メタデータ) (2023-09-29T09:10:04Z) - Conditional Denoising Diffusion for Sequential Recommendation [62.127862728308045]
GAN(Generative Adversarial Networks)とVAE(VAE)の2つの顕著な生成モデル
GANは不安定な最適化に苦しむ一方、VAEは後続の崩壊と過度に平らな世代である。
本稿では,シーケンスエンコーダ,クロスアテンティブデノナイジングデコーダ,ステップワイズディフューザを含む条件付きデノナイジング拡散モデルを提案する。
論文 参考訳(メタデータ) (2023-04-22T15:32:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。