論文の概要: Coachable agents for interactive gameplay
- arxiv url: http://arxiv.org/abs/2607.00642v1
- Date: Wed, 01 Jul 2026 08:57:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-02 19:56:07.818181
- Title: Coachable agents for interactive gameplay
- Title(参考訳): インタラクティブゲームプレイのためのコーチング可能なエージェント
- Authors: Roberto Capobianco, Harm van Seijen, Nolan D. Bard, Neil Burch, Fatima Davelouis, Josh Davidson, Alisa Devlic, Yunshu Du, Ishan Durugkar, Siddhant Gangapurwala, Daniel Hernandez, G. Zacharias Holland, Sahil Jain, Kenta Kawamoto, Raksha Kumaraswamy, Patrick MacAlpine, Dustin R. Morrill, Declan Oller, Francesco Riccio, Akanksha Saran, Craig Sherstan, Kaushik Subramanian, Thomas J. Walsh, Samuel Barrett, Kizza N. Frisbee, Mady Govil, Johannes Günther, Varun R. Kompella, James A. MacGlashan, Maxwell Svetlik, Michael D. Thomure, Jaden B. Travnik, Kevin Waugh, Elahe Aghapour, Florian Fuchs, Andreanne Lemay, Shruti Mishra, Takuma Seno, Peter Stone, Michael Spranger, Peter R. Wurman,
- Abstract要約: 強化学習は、高度なAIとロボットシステムを作成する上で価値のあるツールであることが証明されている。
複雑なドメインのスタイルを示すエージェントをコーチングするためのフレームワークを作成します。
AAAのゲーム『Horizon Forbidden West』と『Gran Turismo』でフレームワークの応用を実演する。
- 参考スコア(独自算出の注目度): 22.530832644886658
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reinforcement learning has proven to be a valuable tool in the creation of advanced AI and robotic systems, contributing to everything from game playing to robotics to foundation models. Through trial-and-error, these AI systems typically learn one, near-optimal behavior to solve their tasks. However, there are many use cases in which one would like to assert some level of control, preferably in real time, over how the task is solved. We refer to these modifications of a core task as styles. We combine universal value function approximators (UVFAs) with carefully selected training scenarios, learning algorithms, and data augmentation to create a framework for coaching agents that exhibit styles in complex domains. We demonstrate the framework's application in the AAA video games Horizon Forbidden West and Gran Turismo, and in an open-source humanoid test domain. Despite the different nature of the domains -- car racing, stylized game combat, and humanoid walking -- each agent shows strong coherence to the style requests while still satisfying the main task in its domain. Importantly, the techniques outlined in this paper allow an end user to choose the final behavior at run time, giving them flexible control over the final executed performance.
- Abstract(参考訳): 強化学習は、高度なAIとロボットシステムの開発において貴重なツールであることが証明されており、ゲームプレイからロボティクス、基礎モデルに至るまで、あらゆることに貢献している。
試行錯誤によって、これらのAIシステムは、通常、タスクを解決するために、ほぼ最適な行動を学ぶ。
しかし、タスクの解決方法に関して、ある程度の制御レベル、好ましくはリアルタイムに主張したいユースケースが数多く存在する。
コアタスクのこれらの変更をスタイルとして参照する。
ユビキタスバリュー関数近似器(UVFA)と、慎重に選択されたトレーニングシナリオ、学習アルゴリズム、データ拡張を組み合わせて、複雑なドメインのスタイルを示すエージェントをコーチングするためのフレームワークを作成します。
我々は、このフレームワークの応用を、AAAのゲーム『Horizon Forbidden West』と『Gran Turismo』、およびオープンソースのヒューマノイドテストドメインで実証する。
ドメインの性質が異なる — カーレース、スタイリングされたゲーム戦闘、ヒューマノイドウォーキング — にもかかわらず、各エージェントは、そのドメインの主要なタスクを満足しながら、スタイル要求に強い一貫性を示す。
本論文で概説した手法により,エンドユーザーは実行時に最終動作を選択することができ,最終的な実行性能を柔軟に制御することができる。
関連論文リスト
- DexterityGen: Foundation Controller for Unprecedented Dexterity [67.15251368211361]
ツール使用など,ロボットの巧妙な操作スキルを教えることは,大きな課題となる。
現在のアプローチは、人間の遠隔操作(模倣学習)とシミュレート・トゥ・リアル強化学習(sim-to-real reinforcement learning)の2つの戦略に大別できる。
本稿では,手動回転や翻訳などの大規模動きプリミティブをRLで事前学習するDexterityGenを紹介する。
現実の世界では、人間の遠隔操作をコントローラーのプロンプトとして利用し、厳密な振る舞いを生み出す。
論文 参考訳(メタデータ) (2025-02-06T18:49:35Z) - Offline Imitation Learning Through Graph Search and Retrieval [57.57306578140857]
模倣学習は、ロボットが操作スキルを取得するための強力な機械学習アルゴリズムである。
本稿では,グラフ検索と検索により,最適下実験から学習する,シンプルで効果的なアルゴリズムGSRを提案する。
GSRは、ベースラインに比べて10%から30%高い成功率、30%以上の熟練を達成できる。
論文 参考訳(メタデータ) (2024-07-22T06:12:21Z) - End-To-End Training and Testing Gamification Framework to Learn Human Highway Driving [3.234017706225293]
本稿では,自律走行自動車のためのゲームベースのエンドツーエンド学習およびテストフレームワークを提案する。
人気ゲーム「グランドセフト・オートV」を使って高速道路の運転データを収集する。
エンド・ツー・エンドのアーキテクチャは、ゲーム画面の画像により車両を制御する操舵およびスロットル値を予測する。
論文 参考訳(メタデータ) (2024-04-16T18:51:58Z) - An Interactive Agent Foundation Model [49.77861810045509]
本稿では,AIエージェントを訓練するための新しいマルチタスクエージェントトレーニングパラダイムを用いた対話型エージェント基礎モデルを提案する。
トレーニングパラダイムは、視覚マスク付きオートエンコーダ、言語モデリング、次世代の予測など、多様な事前学習戦略を統一する。
私たちは、ロボティクス、ゲームAI、ヘルスケアという3つの異なる領域でフレームワークのパフォーマンスを実演します。
論文 参考訳(メタデータ) (2024-02-08T18:58:02Z) - Toward Human-AI Alignment in Large-Scale Multi-Player Games [24.784173202415687]
我々はXboxのBleeding Edge(100K+ゲーム)から広範囲にわたる人間のゲームプレイデータを解析する。
人間のプレイヤーは、戦闘飛行や探索飛行行動において多様性を示す一方で、AIプレイヤーは均一性に向かう傾向にある。
これらの大きな違いは、ヒューマンアラインアプリケーションにおけるAIの解釈可能な評価、設計、統合の必要性を浮き彫りにしている。
論文 参考訳(メタデータ) (2024-02-05T22:55:33Z) - Pangu-Agent: A Fine-Tunable Generalist Agent with Structured Reasoning [50.47568731994238]
人工知能(AI)エージェント作成の鍵となる方法は強化学習(RL)である
本稿では,構造化推論をAIエージェントのポリシーに統合し,学習するための一般的なフレームワークモデルを提案する。
論文 参考訳(メタデータ) (2023-12-22T17:57:57Z) - Promptable Game Models: Text-Guided Game Simulation via Masked Diffusion
Models [68.85478477006178]
ニューラルビデオゲームシミュレータのためのPGM(Promptable Game Model)を提案する。
ユーザーは高レベルのアクションシーケンスと低レベルのアクションシーケンスでゲームを実行することができる。
私たちのPGMは、エージェントの目標をプロンプトの形で指定することで、ディレクターのモードをアンロックします。
提案手法は,既存のニューラルビデオゲームシミュレータのレンダリング品質を著しく上回り,現在の最先端の能力を超えたアプリケーションをアンロックする。
論文 参考訳(メタデータ) (2023-03-23T17:43:17Z) - Towards General and Autonomous Learning of Core Skills: A Case Study in
Locomotion [19.285099263193622]
我々は,足の広いロボットに対して,洗練された移動動作を学習できる学習フレームワークを開発した。
我々の学習フレームワークは、データ効率のよいマルチタスクRLアルゴリズムと、ロボット間で意味論的に同一の報酬関数のセットに依存している。
現実世界の四足ロボットを含む9種類のロボットに対して、同じアルゴリズムが、多種多様な再利用可能な運動スキルを迅速に学習できることを実証する。
論文 参考訳(メタデータ) (2020-08-06T08:23:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。