論文の概要: Playing DOOM with 1.3M Parameters: Specialized Small Models vs Large Language Models for Real-Time Game Control
- arxiv url: http://arxiv.org/abs/2604.07385v1
- Date: Wed, 08 Apr 2026 03:33:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-10 18:34:05.434915
- Title: Playing DOOM with 1.3M Parameters: Specialized Small Models vs Large Language Models for Real-Time Game Control
- Title(参考訳): 1.3Mパラメータを用いたDOOMの演奏:リアルタイムゲーム制御のための小型モデルと大規模言語モデル
- Authors: David Golchinfar, Daryoush Vaziri, Alexander Marquardt,
- Abstract要約: SauerkrautLM-MultiVecは13万のパラメータモデルで、古典的なファーストパーソンシューターをリアルタイムで演奏する。
わずか31,000人の人間のゲームプレイのデモでトレーニングされ、dedef_the_centerシナリオで10エピソードで178のフラグを達成している。
この結果から,ドメイン固有データに対する小さなタスク特化モデルは,リアルタイム制御タスクにおいて汎用LLMよりも格段に優れていることが示された。
- 参考スコア(独自算出の注目度): 42.18443783365649
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present SauerkrautLM-Doom-MultiVec, a 1.3 million parameter model that plays the classic first-person shooter DOOM in real time, outperforming large language models up to 92,000x its size, including Nemotron-120B, Qwen3.5-27B, and GPT-4o-mini. Our model combines a ModernBERT encoder with hash embeddings, depth-aware token representations, and an attention pooling classification head to select game actions from ASCII frame representations at 31ms per decision. Trained on just 31,000 human gameplay demonstrations, it achieves 178 frags in 10 episodes (17.8 per episode) in the defend_the_center scenario, more than all tested LLMs combined (13 frags total). All agents receive equivalent input: ASCII frames and depth maps. Despite having 92,000x fewer parameters than Nemotron-120B, our model is the only agent that actively engages enemies rather than purely evading them. These results demonstrate that small, task-specific models trained on domain-appropriate data can decisively outperform general-purpose LLMs at real-time control tasks, at a fraction of the inference cost, with deployment capability on consumer hardware.
- Abstract(参考訳): SauerkrautLM-Doom-MultiVecは1300万のパラメータモデルで、古典的なファーストパーソンシューティングゲームDOOMをリアルタイムで演奏し、Nemotron-120B, Qwen3.5-27B, GPT-4o-miniなど、最大92,000倍の大きさの大規模言語モデルより優れている。
本モデルでは, ハッシュ埋め込み, 奥行き認識トークン表現, およびアテンションプーリング分類ヘッドを組み合わせ, 決定毎に31msのASCIIフレーム表現からゲームアクションを選択する。
わずか31,000人の人間のゲームプレイのデモで訓練され、ディフェント_the_centerシナリオで10エピソード(17.8回)で178個のフラッグ(合計13個のフラッグ)を達成している。
全てのエージェントは、ASCIIフレームと深さマップという等価な入力を受け取る。
ネモトロン120Bよりもパラメータが92,000倍少ないにもかかわらず、我々のモデルは純粋に回避するのではなく、敵に積極的に関与する唯一のエージェントである。
これらの結果は、ドメインに適したデータに基づいて訓練された小さなタスク固有モデルが、消費者ハードウェアへの展開能力とともに、推論コストのごく一部で、リアルタイム制御タスクにおいて汎用LLMを決定的に上回ることを示した。
関連論文リスト
- NitroGen: An Open Foundation Model for Generalist Gaming Agents [101.41866522979548]
NitroGenは、ジェネラリストゲームエージェントのためのビジョンアクション基盤モデルである。
1000以上のゲームで4万時間のゲームプレイビデオでトレーニングされている。
論文 参考訳(メタデータ) (2026-01-04T16:24:50Z) - Pixels to Play: A Foundation Model for 3D Gameplay [4.380638021267298]
そこで,Pixels2Play-0.1(P2P0.1)を紹介した。
論文 参考訳(メタデータ) (2025-08-19T22:24:50Z) - MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention [90.68287470551311]
MiniMax-M1は、オープンウェイトで大規模なハイブリッドアテンション推論モデルである。
コンテクストの長さは100万トークンで、DeepSeek R1のコンテクストサイズは8倍だ。
MiniMax-M1は大規模強化学習を用いて訓練されている。
論文 参考訳(メタデータ) (2025-06-16T15:08:02Z) - Puzzle: Distillation-Based NAS for Inference-Optimized LLMs [17.72841008597783]
大きな言語モデル(LLM)は優れた能力を提供するが、高い推論コストは広く採用を制限する。
本稿では,LLMの推論を高速化するハードウェア対応フレームワークであるPuzzleについて述べる。
我々は、Llama-3.1-Nemotron-51B-Instruct (Nemotron-51B)とLlama-3.3-Nemotron-49Bという2つの公開モデルを通して、我々のフレームワークの影響を実証する。
論文 参考訳(メタデータ) (2024-11-28T13:45:42Z) - WebLINX: Real-World Website Navigation with Multi-Turn Dialogue [23.71601972991744]
WEBLINXは,対話型Webナビゲーションの2300人の専門家による実演における100Kインタラクションのベンチマークである。
私たちのベンチマークでは、150以上の現実世界のWebサイト上の幅広いパターンをカバーし、さまざまなシナリオにおけるエージェントのトレーニングと評価に使用しています。
選択した要素とスクリーンショットとアクション履歴を使用して、Webをナビゲートする際の人間の振る舞いを再現するさまざまなモデルを評価します。
論文 参考訳(メタデータ) (2024-02-08T18:58:02Z) - LRM: Large Reconstruction Model for Single Image to 3D [61.47357798633123]
本稿では,1つの入力画像からオブジェクトの3次元モデルを5秒以内で予測する最初のLarge Restruction Model (LRM)を提案する。
LRMは5億の学習可能なパラメータを持つ高度にスケーラブルなトランスフォーマーベースのアーキテクチャを採用し、入力画像からニューラル放射場(NeRF)を直接予測する。
約100万のオブジェクトを含む巨大なマルチビューデータに基づいて、エンド・ツー・エンドでモデルをトレーニングする。
論文 参考訳(メタデータ) (2023-11-08T00:03:52Z) - MobileNMT: Enabling Translation in 15MB and 30ms [53.75988363281843]
デバイス上で15MBと30msで翻訳できるMobileNMTを提案する。
モデルとエンジンの共設計により、既存のシステムと比較して47.0xのスピードを上げ、メモリの99.5%を節約し、BLEUの損失は11.6%に留まった。
論文 参考訳(メタデータ) (2023-06-07T08:25:51Z) - What Language Model Architecture and Pretraining Objective Work Best for
Zero-Shot Generalization? [50.84738303888189]
本稿では,モデル選択の大規模評価とそのゼロショット一般化への影響について述べる。
私たちは、70億以上のトークンに対して、50億以上のパラメータを持つモデルをトレーニングします。
事前学習した因果デコーダモデルを非因果デコーダモデルに効率的に適用できることが判明した。
論文 参考訳(メタデータ) (2022-04-12T14:19:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。