論文の概要: ASENA: Self-evolving Agents for Embodied Navigation
- arxiv url: http://arxiv.org/abs/2609.39207v1
- Date: Wed, 30 Sep 2026 07:53:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-01 18:57:27.407413
- Title: ASENA: Self-evolving Agents for Embodied Navigation
- Title(参考訳): ASENA: 身体的ナビゲーションのための自己進化型エージェント
- Abstract要約: ASENAは汎用コーディングエージェントをロボットセンシング、計算、教師付き実行、永続的な体験に接続する。
独立政策としてASENA-VLNはR2Rで68.7%、RxRで70.2%という最先端の成功率を達成した。
- 参考スコア(独自算出の注目度): 84.64998230277466
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present ASENA, an embodied agent system that connects general-purpose coding agents to robot sensing, computation, supervised execution, and persistent experience. Agents can write and execute programs, inspect recorded outcomes, repair failures, and reuse notes and executable skills while keeping their model weights fixed. We further introduce ASENA-VLN, a 4B monocular navigation policy that serves as an optional tool within this programmable system. ASENA-VLN predicts body-frame trajectories for both extended routes and short-horizon behaviors using a shared vision-language decoder trained on route instructions, visual question answering, and a newly curated dataset of geometry-derived atomic navigation tasks. As a standalone policy, ASENA-VLN achieves state-of-the-art success rates of 68.7% on R2R and 70.2% on RxR. When integrated with a coding agent, learned navigation improves ASENA's success rate by 11 percentage points on both agentic benchmarks while reducing execution time. Through persistent workspace evolution and simulator feedback, ten passes over recurring 100-task subsets further improve success from 72% to 98% on R2R and from 65% to 89% on RxR. On embodied question answering, ASENA achieves state-of-the-art accuracy with fewer interaction steps. Finally, real-world demonstrations on a Unitree G1 combine search, visual inspection, spatial reasoning, and synthesized gestures without a pre-built map, illustrating how online programming extends robot behavior beyond route following and predefined skills.
- Abstract(参考訳): 本稿では,汎用コーディングエージェントをロボットセンシング,計算,教師付き実行,永続的な体験に接続する組込みエージェントであるASENAを提案する。
エージェントはプログラムを書いて実行したり、記録された結果を調べたり、失敗を修復したり、ノートや実行可能なスキルを再利用したりできる。
さらに,このプログラム可能なシステムにおいて,オプションツールとして機能する4B単分子ナビゲーションポリシーであるASENA-VLNを紹介する。
ASENA-VLNは、経路指示、視覚的質問応答、およびジオメトリ由来の原子ナビゲーションタスクの新たなデータセットに基づいて訓練された共有視覚言語デコーダを用いて、拡張経路と短水平動作の両方のフレーム軌道を予測する。
独立政策としてASENA-VLNはR2Rで68.7%、RxRで70.2%という最先端の成功率を達成した。
コーディングエージェントと統合すると、学習ナビゲーションはASENAの成功率を2つのエージェントベンチマークで11パーセント改善し、実行時間を短縮する。
永続的なワークスペースの進化とシミュレーターフィードバックを通じて、繰り返し発生する100タスクサブセットを超える10回のパスにより、R2Rは72%から98%、RxRは65%から89%に改善された。
具体的質問応答では、ASENAはより少ないインタラクションステップで最先端の精度を達成する。
最後に、Unitree G1上の実世界のデモでは、事前に構築されたマップを使わずに検索、視覚検査、空間推論、合成ジェスチャーを組み合わせることで、オンラインプログラミングが経路追従や事前定義されたスキルを超えてロボットの動作をどのように拡張するかを説明した。
関連論文リスト
- ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks [60.600151982455195]
ProgramDistillは、完全に機能する参照アプリケーションとのインタラクションによって発見された機能について、コーディングエージェントを評価するベンチマークである。
私たちのパイプラインであるマイニングクラフトパッチは、26のアプリケーションにまたがる1,975のリプレイ検証された振る舞いを発見し、人間の介入なしに4,063のタスクを構築します。
論文 参考訳(メタデータ) (2026-09-16T15:19:05Z) - HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness [30.61739879302674]
身体的ナビゲーションでは、エージェントは空間観測において指示や目標を下ろす必要がある。
本稿では,ゼロショットでトレーニング不要なフレームワークであるHarnessVLNを紹介した。
論文 参考訳(メタデータ) (2026-09-14T08:15:56Z) - NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness [76.6324710887112]
NeoHorse-1は、エージェントのポストトレーニングを通じてこの経路を探索するために開発されたエージェントネイティブモデルのファミリーである。
本システムでは,異種モデルプールとインテリジェントなルーティング,予測能力要求,選択されたサービス層,およびその後のユーザ毎のインタラクションを結合する。
論文 参考訳(メタデータ) (2026-09-08T03:14:54Z) - HODAgent: Towards On-Demand, Responsive Humanoids for Physical World Human Interaction [18.76628104467029]
HODAgent(ホダジェント)は、ヒューマノイドロボットのためのシステム2エージェントである。
共有インターフェースはシミュレーションと物理ロボットを接続する。
その結果,システム2エージェントはシミュレーションと現実をまたいだ適応型ヒューマノイドサービスを実現することができた。
論文 参考訳(メタデータ) (2026-08-18T09:49:16Z) - AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation [2.0325612651874305]
本稿では,ナビゲーションタスクのためのエージェントガイド型強化学習フレームワークであるAgenticRLを提案する。
AgenticRLは、タスク情報と視覚シーンの観察を解釈するために、マルチモーダル・ジェネレーティブ・プレトレーニング・トランスフォーマー(GPT)エージェントを使用する。
タスク固有の報酬関数を生成し、PPOアルゴリズムを用いてポリシーを訓練し、訓練されたポリシーを評価することで批判的な役割を果たす。
このフィードバックに基づいて、エージェントは障害モードを特定し、クローズドループ自己改善プロセスにおける報酬関数を洗練する。
論文 参考訳(メタデータ) (2026-06-02T17:50:15Z) - Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments [96.23886784364997]
身体的な知性は、操作やナビゲーションといった個々のタスクのための特別なモデルを通してしばしば研究される。
本稿では,Qwenの視覚言語モデリングスタックを連続的な動作と軌道生成に拡張した統一的な基礎モデルであるQwen-VLAを提案する。
論文 参考訳(メタデータ) (2026-05-28T17:36:31Z) - ProcTHOR: Large-Scale Embodied AI Using Procedural Generation [55.485985317538194]
ProcTHORは、Embodied AI環境の手続き的生成のためのフレームワークである。
ナビゲーション、アレンジメント、アーム操作のための6つの具体化されたAIベンチマークに対して、最先端の結果を実証する。
論文 参考訳(メタデータ) (2022-06-14T17:09:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。