論文の概要: Automating the Design of Embodied Agent Architectures
- arxiv url: http://arxiv.org/abs/2606.30111v2
- Date: Fri, 03 Jul 2026 09:48:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 13:04:58.257591
- Title: Automating the Design of Embodied Agent Architectures
- Title(参考訳): エージェント・アーキテクチャの自動化
- Authors: Jian Zhou, Sihao Lin, Jin Li, Shuai Fu, Gengze Zhou, Qi Wu,
- Abstract要約: エージェントは一般的に、知覚、記憶、計画、行動モジュールのハンドデザインされた構成として構築される。
本研究では,エミュレータを編集可能なノード・アンド・ワイヤプログラムとしてホストし,シミュレータを意識した実行とエピソードレベルのログを生成する型グラフランタイムを提案する。
視覚言語ナビゲーション,具体的質問応答,言語条件の操作にまたがる4つの実施者を対象に,AASの3つの変種を評価した。
- 参考スコア(独自算出の注目度): 17.294577626616917
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Embodied agents are typically built as hand-designed compositions of perception, memory, planning, and action modules. This modularity exposes a large architectural design space, but current systems still rely on researcher intuition to choose where information is stored, how observations are processed, and how model calls are connected. Agent Architecture Search (AAS) automates such design for text-domain agents, but has not been systematically evaluated on perceptual embodied agents through simulator rollouts. We study this transfer. We introduce AgentCanvas, a typed-graph runtime that hosts embodied executors as editable node-and-wire programs with simulator-aware execution and episode-level logs, and KDLoop, a coding-agent search procedure that cycles through proposal, critique, experiment, and distillation, with triggered reflection after stalls. We evaluate three AAS variants across four embodied executors spanning vision-language navigation, embodied question answering, and language-conditioned manipulation. The resulting 3x4 matrix shows that architecture-level search can produce deployable and directional success-rate gains on embodied tasks, while one apparent high-scoring candidate is rejected as leak-bearing. At the same time, the experiments expose constraints that are muted in text-domain AAS: optimization signals can be masked by rollout noise, search can become trapped in local edit basins, and episode-level credit assignment only partially emerges even when detailed logs are available. These results characterize both the promise and the current limits of automated architecture search for embodied agents.
- Abstract(参考訳): エージェントは一般的に、知覚、記憶、計画、行動モジュールのハンドデザインされた構成として構築される。
このモジュラリティは、大規模なアーキテクチャ設計空間を公開するが、現在のシステムは、情報の保管場所、観察の処理方法、モデル呼び出しの接続方法など、研究者の直観に依存している。
Agent Architecture Search (AAS)は、テキストドメインエージェントのこのような設計を自動化するが、シミュレータロールアウトを通じて知覚的エンボディエージェントに対して体系的に評価されていない。
私たちはこの転校について研究する。
我々は,エミュレートされた実行プログラムを編集可能なノード・アンド・ワイヤプログラムとしてホストするタイプ付きグラフランタイムであるAgentCanvasと,提案,批判,実験,蒸留を循環するコーディングエージェント検索プロシージャであるKDLoopを紹介した。
視覚言語ナビゲーション,具体的質問応答,言語条件の操作にまたがる4つの実施者を対象に,AASの3つの変種を評価した。
結果として得られた3x4行列は、アーキテクチャレベルのサーチにより、エンボディされたタスクに対してデプロイ可能で方向性のある成功率のゲインが得られ、一方、明らかなハイスコア候補の1つがリークベイリングとして拒否されることを示している。
最適化信号はロールアウトノイズによって隠蔽され、検索はローカル編集池に閉じ込められ、エピソードレベルのクレジット代入は詳細なログが利用可能である場合でも部分的にしか発生しない。
これらの結果は,組込みエージェントの自動検索の約束と現在の限界の両方を特徴付ける。
関連論文リスト
- PRIMA: Operational Patterns for Resilient Multi-Agent Research with Verifiable Identity and Convergent Feedback [0.0]
PRIMAは、複数時間にわたる協調型マルチエージェント研究システムとして運用されている。
主なコントリビューションは、生存可能な障害モードのための3つの運用パターンである。
グラフ同型ケーススタディは、生成されたアーティファクトのアーキテクチャ的クレームを根拠にしている。
論文 参考訳(メタデータ) (2026-05-23T23:27:46Z) - SAGE: A Service Agent Graph-guided Evaluation Benchmark [27.342044311161654]
本稿では,SAGE(Service Agent Graph-Guided Evaluation)を提案する。
SAGEは構造化されていないSOPを動的ダイアロググラフに形式化し、論理的コンプライアンスの正確な検証を可能にする。
また、モデルが論理的失敗にもかかわらず丁寧な会話ファサードを維持する現象である「共感回復」も観察する。
論文 参考訳(メタデータ) (2026-04-10T12:55:23Z) - Improving Coherence and Persistence in Agentic AI for System Optimization [9.443037059325086]
Engramは、反復的にメカニズムを設計、テスト、分析する一連のエージェントを探索する。
本研究では,マルチクラウドマルチキャスト推論,LLM要求ルーティング,自然言語クエリを用いたデータベースにおけるKVキャッシュ再利用の最適化など,さまざまな領域において優れた性能を示すことを示す。
論文 参考訳(メタデータ) (2026-03-22T17:04:50Z) - ESAA: Event Sourcing for Autonomous Agents in LLM-Based Software Engineering [0.0]
本稿では,ESAA(Event Sourcing for Autonomous Agents)アーキテクチャについて述べる。
アーキテクチャは、イベントソーシングパターンにインスパイアされた、認知意図とプロジェクトの状態突然変異を分離する。
2つのケーススタディは、アーキテクチャを検証し、単一エージェントのシナリオを超えたアーキテクチャのスケーラビリティの実証的な証拠を提供する。
論文 参考訳(メタデータ) (2026-02-26T16:45:59Z) - TriCEGAR: A Trace-Driven Abstraction Mechanism for Agentic AI [5.1181001367075]
TriCEGARはトレース駆動の抽象化メカニズムで、実行ログから状態構築を自動化する。
タイプされたエージェントライフサイクルイベントをキャプチャし、トレースから抽象化を構築するフレームワークネイティブ実装について説明する。
また, 走行確率が異常検出をガードレール信号として有効にする方法も示す。
論文 参考訳(メタデータ) (2026-01-30T14:01:47Z) - AgentSwift: Efficient LLM Agent Design via Value-guided Hierarchical Search [58.98450205734779]
大規模言語モデル(LLM)エージェントは、多様なドメインにまたがる強力な機能を示している。
既存のエージェントサーチ手法には3つの大きな制限がある。
これらの課題に対処するための包括的なフレームワークを導入します。
論文 参考訳(メタデータ) (2025-06-06T12:07:23Z) - Spatial-Temporal Graph Enhanced DETR Towards Multi-Frame 3D Object Detection [54.041049052843604]
STEMDは,多フレーム3Dオブジェクト検出のためのDETRのようなパラダイムを改良した,新しいエンドツーエンドフレームワークである。
まず、オブジェクト間の空間的相互作用と複雑な時間的依存をモデル化するために、空間的時間的グラフアテンションネットワークを導入する。
最後に、ネットワークが正のクエリと、ベストマッチしない他の非常に類似したクエリを区別することが課題となる。
論文 参考訳(メタデータ) (2023-07-01T13:53:14Z) - Autoregressive Search Engines: Generating Substrings as Document
Identifiers [53.0729058170278]
自動回帰言語モデルは、回答を生成するデファクト標準として現れています。
これまでの研究は、探索空間を階層構造に分割する方法を探究してきた。
本研究では,検索空間の任意の構造を強制しない代替として,経路内のすべてのngramを識別子として使用することを提案する。
論文 参考訳(メタデータ) (2022-04-22T10:45:01Z) - AutoSTR: Efficient Backbone Search for Scene Text Recognition [80.7290173000068]
テキストインスタンスの多様性とシーンの複雑さのため、シーンテキスト認識(STR)は非常に難しい。
テキスト認識性能を向上させるために,データ依存のバックボーンを検索するための自動STR(AutoSTR)を提案する。
実験によると、データ依存のバックボーンを検索することで、AutoSTRは標準ベンチマークにおける最先端のアプローチより優れている。
論文 参考訳(メタデータ) (2020-03-14T06:51:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。