論文の概要: AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents
- arxiv url: http://arxiv.org/abs/2606.24893v1
- Date: Fri, 29 May 2026 22:40:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-28 23:46:52.322114
- Title: AgentOdyssey: Open-Ended Long-Horizon Text Game Generation for Test-Time Continual Learning Agents
- Title(参考訳): AgentOdyssey: テスト時間連続学習エージェントのためのオープンエンディング長軸テキストゲーム生成
- Authors: Zheyuan Zhang, Zehao Wen, Alvin Zhang, Andrew Wang, Jianwen Xie, Daniel Khashabi, Tianmin Shu,
- Abstract要約: 我々はAgentOdysseyを紹介した。AgentOdysseyは、リッチエンティティ、ワールドダイナミクス、ロングホライゾンタスクを備えたオープンエンドテキストゲームを手続き的に生成する新しい評価フレームワークである。
ゲーム進行だけでなく、世界知識獲得、エピソード記憶、オブジェクトとアクションの探索、アクションの多様性、モデルコストの診断テストも提供する多面的評価手法を提案する。
実験の結果、エージェントのキー能力の限界と、その意味のある地平線に影響を与える要因が明らかになった。
- 参考スコア(独自算出の注目度): 50.667928258781934
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: For agents to learn continuously from interaction with the world at test time, they must be able to explore effectively, acquire new world knowledge and skills, retain relevant episodic experiences, and plan over long horizons. To evaluate these key abilities of test-time continual learning agents, we introduce AgentOdyssey, a novel evaluation framework that procedurally generates open-ended text games with rich entities, world dynamics, and long-horizon tasks. Critically, AgentOdyssey goes beyond the conventional machine learning assumption that learning does not occur at test time by placing agents in a continuous, long-horizon setting that interleaves learning and inference throughout deployment. We further propose a multifaceted evaluation methodology that measures not only game progress but also offers diagnostic tests on world knowledge acquisition, episodic memory, object and action exploration, action diversity, and model cost. We evaluate diverse agent paradigms in the generated games. Our experimental results reveal critical limits in agents' key abilities, as well as factors that influence their meaningful horizon. Although performance scales with stronger base models, even the top agent remains far below human performance, leaving substantial headroom for improvement. Among agent mechanisms, we find that short-term memory benefits multiple agent paradigms and is an important component of agent test-time training.
- Abstract(参考訳): エージェントがテスト時に世界との対話から継続的に学ぶためには、効果的に探索し、新しい世界の知識とスキルを習得し、関連するエピソード体験を保持し、長い地平線を計画しなければなりません。
テスト時間連続学習エージェントのこれらの重要な能力を評価するために,リッチなエンティティ,ワールドダイナミクス,長期的タスクを備えたオープンエンドテキストゲームを手続き的に生成する新しい評価フレームワークであるAgentOdysseyを紹介した。
批判的に言えば、AgentOdyssey氏は、エージェントをデプロイ全体を通して学習と推論をインターリーブする長期的設定に配置することで、テスト時に学習が起こらないという従来の機械学習の仮定を越えている。
さらに,ゲーム進行だけでなく,世界知識獲得,エピソード記憶,オブジェクトとアクションの探索,行動多様性,モデルコストの診断テストも提供する多面的評価手法を提案する。
生成されたゲームにおいて,エージェントのパラダイムを多様に評価する。
実験の結果、エージェントのキー能力の限界と、その意味のある地平線に影響を与える要因が明らかになった。
より強力なベースモデルでパフォーマンスはスケールするが、トップエージェントでさえ人間のパフォーマンスをはるかに下回っており、改善のための実質的なヘッドルームを残している。
エージェント機構の中で、短期記憶は複数のエージェントパラダイムに有効であり、エージェントテストタイムトレーニングの重要な構成要素であることがわかった。
関連論文リスト
- Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents [32.49699221723716]
大規模言語モデル(LLM)エージェントが動的にインタラクティブな環境で動作するためには、生涯学習が不可欠である。
オンライン生涯学習エージェントのための2段階強化学習フレームワークであるSkill-enhanced Test-Time Co-Evolution(textttLifeSkill)を提案する。
論文 参考訳(メタデータ) (2026-06-03T12:38:57Z) - Look Before You Leap: Autonomous Exploration for LLM Agents [46.001025916022066]
大規模言語モデルに基づくエージェントは、未熟な環境において、未熟な利用のために失敗することが多い。
我々は,自律探査を適応エージェント構築の重要かつ未探索の能力とみなす。
論文 参考訳(メタデータ) (2026-05-15T16:24:16Z) - Agent Learning via Early Experience [93.83579011718858]
言語エージェントの長期的な目標は、彼ら自身の経験から学び、改善することであり、最終的には複雑な現実世界のタスクにおいて人間より優れています。
現在のエージェントのほとんどは、専門家データによる教師付き微調整に依存しており、スケールと一般化が不十分である。
本研究では,(1)環境力学における政策の基盤として収集された状態を利用するインプリシット・ワールド・モデリング,(2)エージェントが最適な行動から学習し,推論と意思決定を改善するための自己回帰という2つの手法について検討する。
論文 参考訳(メタデータ) (2025-10-09T17:59:17Z) - Building Self-Evolving Agents via Experience-Driven Lifelong Learning: A Framework and Benchmark [57.59000694149105]
本稿では、自己進化エージェントを構築するためのフレームワークである、経験駆動型生涯学習(ELL)を紹介する。
ELLは、Experience Exploration、Long-term Memory、Skill Learning、Knowledge Internalizationの4つのコア原則に基づいて構築されている。
また、学生の総合的な大学旅行をシミュレートするELLのベンチマークデータセットであるStuLifeを紹介した。
論文 参考訳(メタデータ) (2025-08-26T13:04:28Z) - Deep Reinforcement Learning Agents are not even close to Human Intelligence [25.836584192349907]
深部強化学習(RL)エージェントは、様々なタスクにおいて印象的な結果を得るが、ゼロショット適応能力は欠如している。
我々は、アーケード学習環境のタスクバリエーションのセットであるHackAtariを紹介する。
人間とは対照的に、RLエージェントは、トレーニングタスクのより単純なバージョンに対して、体系的に大きなパフォーマンス低下を示します。
論文 参考訳(メタデータ) (2025-05-27T20:21:46Z) - Assessing Human Interaction in Virtual Reality With Continually Learning
Prediction Agents Based on Reinforcement Learning Algorithms: A Pilot Study [6.076137037890219]
本研究では,人間と学習の継続する予測エージェントの相互作用が,エージェントの能力の発達とともにどのように発達するかを検討する。
我々は、強化学習(RL)アルゴリズムから学習した予測が人間の予測を増大させる仮想現実環境と時間ベースの予測タスクを開発する。
以上の結果から,人的信頼はエージェントとの早期の相互作用に影響され,信頼が戦略的行動に影響を及ぼす可能性が示唆された。
論文 参考訳(メタデータ) (2021-12-14T22:46:44Z) - Open-Ended Learning Leads to Generally Capable Agents [12.079718607356178]
環境領域内のタスクの宇宙を定義し、この広大な空間をまたいだエージェントを訓練する能力を示す。
結果として生じる空間は、エージェントがもたらす課題に関して非常に多様であり、エージェントの学習の進捗を測定することさえも、オープンな研究課題である。
オープンエンド学習プロセスの構築により,エージェントが学習を止めないようなトレーニングタスク分布や訓練目標を動的に変化させることで,新しい行動の一貫性のある学習が可能になることを示す。
論文 参考訳(メタデータ) (2021-07-27T13:30:07Z) - Learning to Incentivize Other Learning Agents [73.03133692589532]
我々は、学習インセンティブ関数を用いて、RLエージェントに他のエージェントに直接報酬を与える能力を持たせる方法を示す。
このようなエージェントは、一般的なマルコフゲームにおいて、標準のRLと対戦型エージェントを著しく上回っている。
私たちの仕事は、マルチエージェントの未来において共通の善を確実にする道のりに沿って、より多くの機会と課題を指しています。
論文 参考訳(メタデータ) (2020-06-10T20:12:38Z) - Planning to Explore via Self-Supervised World Models [120.31359262226758]
Plan2Exploreは自己監督型強化学習エージェントである。
我々は、自己監督型探索と、新しいタスクへの迅速な適応に対する新しいアプローチを提案する。
Plan2Exploreは、訓練の監督やタスク固有の相互作用がなければ、自己監督型の探査方法よりも優れている。
論文 参考訳(メタデータ) (2020-05-12T17:59:45Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。