論文の概要: ASH: Agents that Self-Hone via Embodied Learning
- arxiv url: http://arxiv.org/abs/2605.14211v1
- Date: Thu, 14 May 2026 00:10:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-15 21:45:34.54695
- Title: ASH: Agents that Self-Hone via Embodied Learning
- Title(参考訳): ASH: 自力で学習するエージェント
- Authors: Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun,
- Abstract要約: ASHは、未ラベルでノイズの多いインターネットビデオから具体的ポリシーを学ぶエージェントシステムである。
ASHは教師なし学習を使用して、大規模なインターネットビデオから重要な瞬間を識別し、長期記憶として保持する。
ターンベースのRPGであるPokemon Emeraldと、リアルタイムアクションアドベンチャーゲームであるThe Legend of Zelda: The Minish Capである。
- 参考スコア(独自算出の注目度): 8.529044800084554
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Long-horizon embodied tasks remain a fundamental challenge in AI, as current methods rely on hand-engineered rewards or action-labeled demonstrations, neither of which scales. We introduce ASH, an agentic system that learns an embodied policy from unlabeled, noisy internet video, without reward shaping or expert annotation. ASH follows a self-improvement loop; when it gets stuck, ASH learns an Inverse Dynamics Model (IDM) from its own trajectories, and uses its IDM to extract supervision from relevant internet video. ASH uses unsupervised learning to identify key moments from large-scale internet video and retains them as long-term memory -- allowing it to tackle long-horizon problems. We evaluate ASH on two complementary environments demanding multi-hour planning: Pokemon Emerald, a turn-based RPG, and The Legend of Zelda: The Minish Cap, a real-time action-adventure game. In both games, behavioral cloning, retrieval-augmented and zero-shot foundation-model baselines plateau, while ASH sustains progression across our 8-hour evaluation. ASH reaches an average of $11.2/12$ milestones in Pokemon Emerald and $9.9/12$ in Legend of Zelda, while the strongest baseline gets stuck in both environments at an average of $6.5/12$ and $6.0/12$ milestones, respectively. We demonstrate that self-improving agents are a scalable recipe for long-horizon embodied learning.
- Abstract(参考訳): ロングホライゾンの具体化タスクは、現在の方法では手作業による報酬やアクションラベルによるデモンストレーションに頼っているため、AIの基本的な課題である。
我々は,未ラベルでノイズの多いインターネットビデオから具体的ポリシーを学習するエージェントシステムであるASHを紹介し,報酬形成や専門家のアノテーションを使わずに導入する。
ASHは自己改善ループに従い、立ち往生すると、自身の軌道から逆ダイナミクスモデル(IDM)を学び、そのIDMを使用して関連するインターネットビデオから監視を抽出する。
ASHは教師なし学習を使用して、大規模なインターネットビデオから重要な瞬間を識別し、それらを長期記憶として保持する。
ターンベースのRPGであるPokemon Emeraldと、リアルタイムアクションアドベンチャーゲームであるThe Legend of Zelda: The Minish Capである。
両ゲームとも,行動クローニング,検索強化,ゼロショットベースラインベースライン,ASHは8時間にわたる評価を継続する。
ASHはポケモン・エメラルドのマイルストーン平均1.2/12ドル、ゼルダ伝説の9.9/12ドルに達するが、最強のベースラインはそれぞれ6.5/12ドルと6.0/12ドルである。
我々は,自己改善剤が長期学習のスケーラブルなレシピであることを実証した。
関連論文リスト
- Continual Harness: Online Adaptation for Self-Improving Foundation Agents [21.599574507129365]
連続ハーネス(Continuous Harness)は、エンボディエージェントのためのリセットのない自己改善ハーネスである。
Pokemon Redでは、トレーニングイテレーション間の環境をリセットすることなく、ゲーム内でのマイルストーンを達成している。
論文 参考訳(メタデータ) (2026-05-11T05:21:33Z) - SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning [53.67654657011112]
SAGEは、1ターンでより単純な問題を処理しながら、長いビデオのマルチターン推論を行うエージェントシステムである。
さらに,SAGE-MMにおける任意の水平推論能力を注入するための効果的なRLポストトレーニングレシピを提案する。
提案手法の有効性を実証的に検証し,オープンエンドビデオ推論タスクにおいて最大6.1%の顕著な改善が見られた。
論文 参考訳(メタデータ) (2025-12-15T20:14:19Z) - Game-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game Agents [56.25101378553328]
本稿では,汎用ゲームエージェントであるGame-TARSについて紹介する。
Game-TARSは500B以上のトークンで事前トレーニングされており、様々な軌跡とマルチモーダルデータがある。
実験により、Game-TARSは、オープンワールドMinecraftタスクにおける以前のソータモデルの約2倍の成功率を達成することが示された。
論文 参考訳(メタデータ) (2025-10-27T17:43:51Z) - TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance [36.22149703563646]
TimeRewarderは、受動的ビデオから進捗推定信号を導出する、シンプルで効果的な報酬学習手法である。
TimeRewarderはスパース・リワードタスクのRLを大幅に改善し、タスク1タスク当たり20,000のインタラクションしか持たない9/10タスクでほぼ完璧に成功することを示す。
論文 参考訳(メタデータ) (2025-09-30T17:58:20Z) - FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games [56.81554611870848]
我々はFlashAdventureを紹介した。これは、フルストーリーのアーク補完をテストするために設計された、34のFlashベースのアドベンチャーゲームのベンチマークである。
また,ゲームプレイの自動評価装置であるCUA-as-a-Judgeと,長期記憶を利用したエージェントフレームワークであるCOASTを提案する。
実験では、現在のGUIエージェントがフルストーリーのアークに苦しむのに対して、COASTは観察と振る舞いのギャップを埋めることでマイルストーンの完了を改善する。
論文 参考訳(メタデータ) (2025-09-01T01:33:16Z) - Pokemon Red via Reinforcement Learning [3.548348926427221]
古典的なゲームボーイJRPGであるPok'emon Redは、エージェントのテストベッドとして重要な課題を提示している。
本稿では,Cerrulean Cityの完成までのゲームの初期セグメントを完了させるベースラインエージェントを実証する,単純化された環境と深層強化学習の方法論を紹介する。
我々の実験には、報酬形成の脆弱性を明らかにする様々な改善が含まれており、エージェントは特定の報酬信号を利用する。
論文 参考訳(メタデータ) (2025-02-27T09:42:23Z) - Adversarial Online Learning with Variable Plays in the Pursuit-Evasion
Game: Theoretical Foundations and Application in Connected and Automated
Vehicle Cybersecurity [5.9774834479750805]
対戦型・非確率型マルチアームバンディット(MPMAB)は,演奏するアームの数が変動している場合に拡張する。
この作業は、相互接続された輸送システムにおいて、異なる重要な場所をスキャンするために割り当てられたリソースが、時間とともに、環境によって動的に変化するという事実によって動機付けられている。
論文 参考訳(メタデータ) (2021-10-26T23:09:42Z) - Semi-supervised reward learning for offline reinforcement learning [71.6909757718301]
トレーニングエージェントは通常、報酬機能が必要ですが、報酬は実際にはほとんど利用できず、エンジニアリングは困難で手間がかかります。
限定されたアノテーションから学習し,ラベルなしデータを含む半教師付き学習アルゴリズムを提案する。
シミュレーションロボットアームを用いた実験では,動作のクローン化が大幅に向上し,真理の報奨によって達成される性能に近づいた。
論文 参考訳(メタデータ) (2020-12-12T20:06:15Z) - Neural MMO v1.3: A Massively Multiagent Game Environment for Training
and Evaluating Neural Networks [48.5733173329785]
本稿では,MMOにインスパイアされたマルチエージェントゲーム環境であるNeural MMOを紹介する。
分散インフラストラクチャとゲームIOという,AI研究のためのマルチエージェントシステムエンジニアリングにおける,より一般的な2つの課題について論じる。
論文 参考訳(メタデータ) (2020-01-31T18:50:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。