論文の概要: VLMs for Videogame Data Annotation
- arxiv url: http://arxiv.org/abs/2608.05949v1
- Date: Thu, 06 Aug 2026 12:20:53 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-07 17:43:06.751597
- Title: VLMs for Videogame Data Annotation
- Title(参考訳): ビデオゲームデータアノテーションのためのVLM
- Authors: Katrin Schmid, Iuri Frosio,
- Abstract要約: VLM(Vision Language Models)とAI(Artificial Intelligence)エージェントは、エンジニアが現実世界のアプリケーションで複雑な問題にどのようにアプローチするかに革命をもたらしたことを示す。
ビデオゲームにおける彼らの採用は、合成シナリオの極端な多様性と現実世界の物理へのコンプライアンスの欠如によって制限されている。
- 参考スコア(独自算出の注目度): 3.102704962960118
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Vision Language Models (VLMs) and Artificial Intelligence (AI) agents have revolutionized how engineers approach complex problems in real-world applications. Their adoption in video games is on the other hand limited by the extreme variability of the synthetic scenarios and their poor compliance with real-world physics. Here we investigate the use of VLMs for annotating video game frame sequences with reward signals, a task with several potential applications including, among others, conditioned training and offline reinforcement learning. We show that VLMs often struggle to answer basic questions on racing video games (although we observed a similar behavior on other game genres) and discuss countermeasures such as VLM output mixing and prompt optimization. We also show how input sequence length, resolution, and question batching affect the annotation quality and its token consumption.
- Abstract(参考訳): ビジョン言語モデル(VLM)と人工知能(AI)エージェントは、エンジニアが現実世界のアプリケーションで複雑な問題にどのようにアプローチするかに革命をもたらした。
一方、ビデオゲームにおける彼らの採用は、合成シナリオの極端な多様性と現実世界の物理学へのコンプライアンスの欠如によって制限されている。
本稿では,VLMを用いたゲームフレームのアノテート,報酬信号,条件付きトレーニング,オフライン強化学習など,いくつかの潜在的な応用課題について検討する。
VLMは(他のゲームジャンルでも同様の動作を観察するが)、VLM出力の混合や迅速な最適化といった対策を議論する。
また,入力シーケンスの長さ,解像度,問合せのバッチ化がアノテーションの品質とトークン消費に与える影響についても示す。
関連論文リスト
- GameVerse: Can Vision-Language Models Learn from Video-based Reflection? [15.723982947450189]
我々は、反射的な視覚的相互作用ループを可能にする総合的なビデオゲームベンチマークであるGameVerseを紹介する。
従来のファイア・アンド・フォーゲット・アセスメントを超えて、ビジョン・ランゲージ・モデルがどのように視覚体験を内部化し、ポリシーを改善するかを評価するために、新しいリフレクション・アンド・リトライ・パラダイムを使用している。
論文 参考訳(メタデータ) (2026-03-01T14:29:39Z) - SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models [60.80050275581661]
VLM(Vision-Language Models)は、目覚しい常識と意味論的推論能力を示す。
物理力学に関する基礎的な理解は欠如している。
テストタイムでシミュレーション可能な ACTion Planning フレームワークである S を提案する。
本手法は,5つの難易度,実世界の剛体および変形可能な操作課題に対して,最先端の性能を示す。
論文 参考訳(メタデータ) (2025-12-05T18:51:03Z) - SIRI-Bench: Challenging VLMs' Spatial Intelligence through Complex Reasoning Tasks [51.774165536666864]
SIRI-Benchは視覚言語モデルの構造的空間知性を評価するためのベンチマークである。
Benchは9000の動画検索用三脚で構成されており、各問題はリアルな3Dシーンに埋め込まれている。
実験結果から,最先端のVLMはSIRI-Benchでかなり苦労し,構造的空間推論の課題を浮き彫りにした。
論文 参考訳(メタデータ) (2025-06-17T13:40:00Z) - Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning [89.93384726755106]
視覚言語強化学習(RL)は主に狭い領域に焦点を当てている。
ビデオゲームは本質的に、検証が容易なリッチなビジュアル要素とメカニクスを提供します。
ビデオゲームにおけるマルチモーダルかつ検証可能な報酬を完全に活用するために,Game-RLを提案する。
論文 参考訳(メタデータ) (2025-05-20T03:47:44Z) - Reflective Planning: Vision-Language Models for Multi-Stage Long-Horizon Robotic Manipulation [90.00687889213991]
複雑な長距離ロボット操作問題を解決するには、高度な高レベルの計画能力が必要である。
インターネット上で事前訓練された視覚言語モデル(VLM)は、原則としてそのような問題に対処するためのフレームワークを提供する。
本稿では,多段階操作タスクにおけるVLMの物理推論能力を高める新しいテストタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2025-02-23T20:42:15Z) - Can VLMs Play Action Role-Playing Games? Take Black Myth Wukong as a Study Case [20.14197375326218]
本研究の目的は,複雑なアクションゲーム環境にマルチモーダルエージェントを適用するための新たな洞察と方向性を提供することである。
我々は、既存の視覚言語モデルの能力境界を探求する研究プラットフォームとして、ARPG、Black Myth: Wukong'を選択した。
記録されたゲームプレイビデオとマウスとキーボードアクションを含む操作ログを含む人間の操作データセットをリリースする。
論文 参考訳(メタデータ) (2024-09-19T16:30:25Z) - ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models [27.5219975853389]
事前学習された視覚・言語モデル (VLM) と大規模言語モデル (LLM) は,様々な視覚コモンセンス推論問題に長けている。
画像内容以外の結論を推測することが目的である場合、VLMは困難に直面し、LLMは十分な視覚的証拠を与えられた場合、その答えをよく推測するために常識を使用することができる。
論文 参考訳(メタデータ) (2023-10-09T17:10:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。