論文の概要: Faynt: Scaling and Optimizing Policies for Competitive Melee
- arxiv url: http://arxiv.org/abs/2610.02144v1
- Date: Thu, 01 Oct 2026 17:48:38 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.352885
- Title: Faynt: Scaling and Optimizing Policies for Competitive Melee
- Title(参考訳): Faynt: 競争力のあるミーリーのためのスケーリングと最適化
- Abstract要約: スーパースマッシュブラザーズ・メリーのための10Mパラメータと75Mパラメータのトランスフォーマーポリシーであるファイントを紹介する。
強化学習の後、M10Mは244試合中240勝(98.4%)を、支援されたロースターの14人のスペシャリストとマルチキャラクタリリースに対して獲得した。
プライベートに供給されたゼロ遅延Slippi-AIモデルに対する別の評価では、10Mは2つの条件設定で68ゲームすべてに勝利する。
- 参考スコア(独自算出の注目度): 0.6299766708197883
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We introduce Faynt, a family of 10M- and 75M-parameter Transformer policies for Super Smash Bros. Melee, each controlling all 26 characters with a single checkpoint. After reinforcement learning (RL), the 10M wins 240 of 244 same-character games (98.4%) against fourteen specialist and multi-character releases on their supported rosters, with a winning record against every release. These opponents retain 21- or 24-frame action delays; Faynt uses no added delay, and we have not isolated the effect of this difference. In a separate evaluation against a privately supplied zero-delay Slippi-AI model, the 10M wins all 68 games across two conditioning settings. We study architecture, optimization, scaling, and hyperparameter transfer to guide pretraining on approximately 840,000 human replays. Post-training combines rank- and outcome-based curricula, 75M-to-10M distillation, and RL restricted to Fox mirror matches. On the initial 152-game benchmark, the supervised 10M wins 69.7% of games, compared with 45.4% for the pretrained 75M, despite higher overall held-out controller-prediction loss. The weighted validation loss used for supervised checkpoint selection agrees with the win-rate ordering of all four pretrained and supervised policies. After supervised post-training, both models take less damage per minute, build larger early leads, and win more often after losing the first life. Optimized inference on recorded game states averages 5.2 ms per decision for the 10M and 8.7 ms for the 75M on an NVIDIA T4, excluding emulator execution and communication. We open-source the weights, both benchmark suites, and a platform for automated model tournaments.
- Abstract(参考訳): スーパースマッシュブラザーズのための10Mおよび75MパラメータトランスフォーマーポリシーであるFayntを紹介する。
ミーリー、各文字は26文字全てを1つのチェックポイントで制御する。
強化学習(RL)の後、10Mは244試合中240勝(98.4%)を、支援されたロースターの14人のスペシャリストとマルチキャラクタリリースに対して獲得し、各リリースに対して勝利記録を更新した。
これらの対戦相手は21フレームまたは24フレームの動作遅延を保持しており、ファイントは追加の遅延を使用せず、この差の影響を孤立させていない。
プライベートに供給されたゼロ遅延Slippi-AIモデルに対する別の評価では、10Mは2つの条件設定で68ゲームすべてに勝利する。
アーキテクチャ,最適化,スケーリング,ハイパーパラメータ転送について検討し,約840,000人のリプレイの事前学習を指導した。
ポストトレーニングでは、ランクと結果に基づくカリキュラム、75Mから10Mの蒸留とRLがFoxミラーマッチに制限されている。
最初の152ゲームベンチマークでは、監督された10Mが69.7%のゲームで勝利し、事前訓練された75Mは45.4%だった。
教師付きチェックポイント選択に使用される重み付きバリデーション損失は、事前訓練された4つの教師付きポリシーのすべての勝利率順序に一致する。
監督後トレーニングの後、両モデルとも1分あたりのダメージを減らし、より大きな早期リードを構築し、最初の人生を失った後、より頻繁に勝利する。
記録されたゲーム状態の最適化推論は、エミュレータの実行と通信を除いたNVIDIA T4上の75Mの10Mに対して平均5.2msと8.7msである。
ウェイト、ベンチマークスイート、および自動モデルトーナメントのためのプラットフォームをオープンソースとして公開しています。
関連論文リスト
- The Inference Engineering Pareto Atlas: Which Optimizations Dominate the Cost, Quality, and Latency Frontier? [0.0]
我々は、L4、A100、H100 GPUにわたるvLLM 0.12上で動作するQwen2.5-7B-Instructの54構成を測定し、これらのアンカーを用いてシミュレータを校正する。
異なる品質評価テスト FP16, AWQ 4bit, FP8 重み, FP8 KV キャッシュは 200 GSM8K の質問に対して,プロンプト毎に 5 つの例がある。
論文 参考訳(メタデータ) (2026-09-15T21:44:58Z) - MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs [54.81359054218573]
大規模言語モデル(LLM)のためのマルチゲームアリーナと評価プラットフォームであるMindgamesを紹介する。
Mindgamesは、統合されたインタラクションインターフェース、TrueSkillベースの評価、および4つのゲーム環境にわたる完全な軌跡ログを提供する。
我々は,決定論的オフライントーナメントプロトコルMG-Refとともに,ターンレベルの観察,アクション,報酬を含む29,571個のマルチエージェントゲームを分析した。
論文 参考訳(メタデータ) (2026-05-28T07:33:47Z) - Sim2Win: A Team-Agnostic, Event-Based Pre-Match Outcome Prediction and Tactical Profiling System for Football [0.5156484100374058]
Sim2Winは、チームに依存しない、イベントベースの戦術的レコメンデーションフレームワークである。
システムはチーム名やアイデンティティ機能なしで動作し、トレーニング中に見たことのないチームに一般化を可能にする。
Sim2Win は平均 ROC-AUC が 0.704 であり、完全に見えないチームでは 55.4% の精度である。
論文 参考訳(メタデータ) (2026-05-26T01:46:46Z) - Tracking vs. Deciding: The Dual-Capability Bottleneck in Searchless Chess Transformers [3.692740024498697]
人間のようなチェスエンジンは、遊びの強さを最大化するのではなく、強い人間のプレーヤーのスタイル、エラー、一貫性を真似るべきである。
移動順序のみからのトレーニングは、ボードを移動履歴から再構築する状態トラッキングと、その再構築された状態から良い動きを選択する決定品質という2つの能力の学習をモデルに強いることを示す。
このテンションを二重能力ボトルネック P = min(T,Q) として定式化し、全体的な性能はより弱い能力によって制限される。
論文 参考訳(メタデータ) (2026-03-31T14:01:39Z) - MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games [79.72300527041534]
マルチエージェントゲームの評価は、しばしば実質的なラン・ツー・ランのばらつきを示す。
回転する小さな偏差は、多エージェントカップリングによって増幅される。
自己再生フレームワークであるMEMO(Memory-augmented MOdel context optimization)を用いて,不安定性とアンダーパフォーマンスの両面に対処する。
論文 参考訳(メタデータ) (2026-03-09T23:36:32Z) - CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning [55.425576693143285]
CPMbius(CPMobius)は推論モデルのデータフリー強化学習のためのCoach-Playerパラダイムである。
従来の対戦型自己プレーとは異なり、CPMbiusはコーチとプレーヤを独立しているが協力的な役割として扱う。
CPMbiusは、外部のトレーニングデータに頼ることなく、大幅に改善され、既存の教師なしアプローチよりも優れています。
論文 参考訳(メタデータ) (2026-02-03T01:38:53Z) - Sparks of Cooperative Reasoning: LLMs as Strategic Hanabi Agents [1.7764325874934432]
2-5プレーヤゲームにおいて17の最先端LDMエージェントをベンチマークする。
エージェントは状態追跡のための内部動作メモリを維持可能であることを示す。
注釈付きトラジェクトリを備えた最初の公開データセットをリリースし、ユーティリティを移動します。
論文 参考訳(メタデータ) (2026-01-26T02:23:47Z) - Game-TARS: Pretrained Foundation Models for Scalable Generalist Multimodal Game Agents [56.25101378553328]
本稿では,汎用ゲームエージェントであるGame-TARSについて紹介する。
Game-TARSは500B以上のトークンで事前トレーニングされており、様々な軌跡とマルチモーダルデータがある。
実験により、Game-TARSは、オープンワールドMinecraftタスクにおける以前のソータモデルの約2倍の成功率を達成することが示された。
論文 参考訳(メタデータ) (2025-10-27T17:43:51Z) - LM Fight Arena: Benchmarking Large Multimodal Models via Game Competition [104.81487689011341]
本稿では,Mortal Kombat IIにおける大規模マルチモーダルモデルを評価する新しいフレームワークであるLM Fight Arenaを紹介する。
静的評価とは異なり、LM Fight Arenaは完全に自動化され、再現可能で、LMMの戦略的推論能力の客観的評価を提供する。
論文 参考訳(メタデータ) (2025-10-10T02:19:21Z) - WARM: On the Benefits of Weight Averaged Reward Models [63.08179139233774]
Weight Averaged Reward Models (WARM) を提案する。
最良N法とRL法を用いた要約タスクの実験は、WARMがLLM予測の全体的な品質とアライメントを改善することを示す。
論文 参考訳(メタデータ) (2024-01-22T18:27:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。