論文の概要: MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft
- arxiv url: http://arxiv.org/abs/2607.29218v1
- Date: Fri, 31 Jul 2026 09:43:54 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.677592
- Title: MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft
- Title(参考訳): MirrorCraft:Minecraftの隠されたルール変更下での評価
- Authors: Jianxin Gao, Beini Hu, Runze Li, Wanli Peng, Ruohan Lei, Jinyuan Zhang, Linna Deng, Tianyi Yu, Zining Wang,
- Abstract要約: MirrorCraftは、Minecraftの隠されたルール変更の下でエージェントを評価するためのベンチマークである。
MirrorCraftには、コントロールされた5つのバイオム、6つのルールスイート、3つのプログレクション目標、2つのモデルファミリー、6つのエージェント構成が含まれている。
- 参考スコア(独自算出の注目度): 17.025304951829003
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: With the prosperity of the large language models (LLMs), it has become an interesting topic: how do LLM-based agents work in Minecraft? Unfortunately, most existing benchmarks evaluate them under fixed game mechanics. High performance in these settings does not show whether an agent can continue making progress when familiar recipes, drops, and other rules change. In this paper, we introduce MirrorCraft, a paired benchmark for evaluating agents under hidden rule changes in Minecraft. Each Mirror world is a copy of its paired Vanilla world, with selected server-side rules modified by the corresponding datapack. Terrain, spawn, resource placement, objective, interface, and action budget remain matched within every Vanilla-Mirror pair. MirrorCraft includes five controlled biomes, six rule suites, three progression objectives, two model families, and six agent configurations under a shared Mineflayer interface. We evaluate task progress with deterministic advancement milestones and success rate and use the Rule Intervention Effect (RIE) to measure the performance change between matched Vanilla and Mirror worlds. The experiments show that hidden rule changes have strongly different effects across suites. Among the configurations evaluated without rule descriptions, ReAct achieves the highest pooled Mirror score. Providing the exact rules yields modest gains in average progress and completion across all three objectives. MirrorCraft extends Minecraft evaluation beyond fixed mechanics and provides a controlled setting for studying how agents use gameplay outcomes when the rules of the current world differ from familiar ones.
- Abstract(参考訳): LLMベースのエージェントはMinecraftでどのように動作するのか?
残念ながら、既存のベンチマークのほとんどは、固定されたゲーム力学の下で評価している。
これらの設定でのハイパフォーマンスは、慣れ親しんだレシピやドロップ、その他のルールが変更されても、エージェントが進行し続けるかどうかを示すものではない。
本稿では,Minecraftに隠されたルール変更の下でエージェントを評価するためのベンチマークであるMirrorCraftを紹介する。
各ミラーワールドは、そのペア化されたVanillaワールドのコピーであり、対応するデータパックによって修正されたサーバサイドルールが選択されている。
テライン、産卵、資源配置、客観的、インターフェース、アクション予算は、バニラとミラーのペアごとに一致している。
MirrorCraftには、コントロールされた5つのバイオム、6つのルールスイート、3つのプログレッシション目標、2つのモデルファミリ、6つのエージェント構成がある。
決定論的進歩のマイルストーンと成功率を用いてタスク進捗を評価し,ルール介入効果(RIE)を用いて一致したバニラとミラー世界のパフォーマンス変化を測定する。
実験により、隠れた規則の変更はスイート間で強く異なる効果を持つことが示された。
ルール記述なしで評価される構成の中で、ReActは最もプールされたミラースコアを達成している。
正確なルールを提供することで、平均的な進歩と完成度が3つの目標すべてに対してわずかに向上する。
MirrorCraftはMinecraftの評価を固定力学を超えて拡張し、現在の世界のルールが馴染みのあるものと異なる場合、エージェントがゲームプレイ結果をどのように利用するかを研究するための制御された設定を提供する。
関連論文リスト
- GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine? [65.42976417627254]
ゲーム生成はゲームエンジン内で行われ、スクリプト、シーン、アセット、レンダリング、実行時インタラクションは共同でコヒーレントなゲームプレイを生成する必要がある。
我々は、完全なゲームアーティファクトを生成する問題として、エンド・ツー・エンドのゲーム生成を形式化する。
我々は、このフレームワークを15のゲームファミリーで140のGodotタスクからなるベンチマークであるGameCraft-Benchとしてインスタンス化する。
論文 参考訳(メタデータ) (2026-06-16T12:34:39Z) - GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents [76.60994803070436]
GameWorldは、ブラウザ環境におけるマルチモーダル大言語モデル(MLLM)ゲームエージェントの評価のためのベンチマークである。
2つのゲームエージェントインタフェースが研究され、 (i) キーボードとマウスのコントロールを直接出力するコンピュータ利用エージェント、 (ii) セマンティックアクション空間で作用する汎用マルチモーダルエージェントが研究されている。
18組のモデルとインタフェースのペアによる結果は、最高のパフォーマンスエージェントでさえ、ビデオゲームで人間の能力を達成するには程遠いことを示唆している。
論文 参考訳(メタデータ) (2026-04-08T17:49:03Z) - LieCraft: A Multi-Agent Framework for Evaluating Deceptive Capabilities in Language Models [22.928188725128138]
大きな言語モデル(LLM)は、優れた汎用能力を示すと同時に、深刻な安全性のリスクももたらします。
LLM偽造を計測するための新しい評価フレームワークであるLieCraftとサンドボックスについて紹介する。
論文 参考訳(メタデータ) (2026-03-06T20:49:48Z) - Optimus-3: Towards Generalist Multimodal Minecraft Agents with Scalable Task Experts [54.21319853862452]
Minecraftの汎用エージェントOptimus-3を提案する。
エージェント開発のためのスケーラブルで高品質なトレーニングデータを提供するための知識強化型データ生成パイプラインを提案する。
視覚的多様性に対するエージェントの推論能力を高めるために,マルチモーダル推論強化学習手法を開発した。
論文 参考訳(メタデータ) (2025-06-12T05:29:40Z) - TeamCraft: A Benchmark for Multi-Modal Multi-Agent Systems in Minecraft [40.419794780178044]
オープンソースのビデオゲームMinecraft上に構築されたマルチモーダルなマルチエージェントベンチマークであるTeamCraftを紹介します。
このベンチマークでは、マルチモーダルプロンプトによって指定された55,000のタスク変種、模倣学習のための手続き的に生成された専門家のデモンストレーション、モデル一般化機能を評価するための慎重に設計されたプロトコルが特徴である。
以上の結果から,既存のモデルでは,新たな目標,シーン,不明なエージェントの数を一般化する上で,大きな課題が続いていることが示唆された。
論文 参考訳(メタデータ) (2024-12-06T18:41:16Z) - Odyssey: Empowering Minecraft Agents with Open-World Skills [26.537984734738764]
Odysseyは、LLM(Large Language Model)ベースのエージェントにオープンワールドスキルを付与し、Minecraftの世界を探索する新しいフレームワークである。
Odysseyは,(1)40のプリミティブスキルと183の作曲スキルからなるオープンワールドスキルライブラリを備えた対話型エージェント,(2)Minecraft Wikiから派生した390k以上のインストラクションインストラクションを持つ大規模質問応答データセット上で訓練された微調整LLaMA-3モデル,(3)新しいエージェント能力ベンチマークの3つの重要な部分から構成される。
論文 参考訳(メタデータ) (2024-07-22T02:06:59Z) - SmartPlay: A Benchmark for LLMs as Intelligent Agents [45.76707302899935]
SmartPlayはRock-Paper-Scissors, Tower of Hanoi, Minecraftなど,6つの異なるゲームで構成されている。
各ゲームは知的LLMエージェントの9つの重要な能力のサブセットに挑戦する。
テストには、オブジェクト依存による推論、事前計画、空間的推論、履歴からの学習、ランダムさの理解が含まれる。
論文 参考訳(メタデータ) (2023-10-02T18:52:11Z) - Automated Isovist Computation for Minecraft [0.0]
アーキテクチャのアイデア,すなわちアイソビストと空間構文をモチベーションとした,新しい自動メトリクスセットを開発する。
これらのメトリクスは、プレイヤーの観点から特定のゲーム状態に対して計算され、ゲームの世界における彼らの体格を考慮に入れられる。
私たちはこれらのメトリクスをMinecraftの3Dブロックワールドに適用する方法を示します。
論文 参考訳(メタデータ) (2022-04-07T21:41:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。