論文の概要: Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs
- arxiv url: http://arxiv.org/abs/2607.08193v1
- Date: Thu, 09 Jul 2026 07:48:36 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 14:45:27.45024
- Title: Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs
- Title(参考訳): マルチモーダルLCMを用いた視覚検査によるオープンエンドマルチエージェントオートキュラ
- Abstract要約: 強化学習(Reinforcement Learning, RL)のオープンエンドカリキュラムは、ますます複雑なスキルの学習を容易にするタスクを識別することによって、一般的な能力を持つエージェントを訓練することを目的としている。
これまでの研究は、エージェントの振る舞いのスカラータスクスコアやテキスト要約を用いて検討されてきた。
ここでは、記録されたエピソードビデオを通して、政策行動を直接検査する、別のアプローチについて研究する。
- 参考スコア(独自算出の注目度): 2.5234156040689233
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Open-ended curricula in Reinforcement Learning (RL) aim to train generally-capable agents by identifying tasks that facilitate learning increasingly complex skills. A major challenge when designing such curricula is assessing task difficulty relative to the agent's current learning progress. While previous work has explored using scalar task scores or textual summaries of the agent's behavior, here we study a different approach: directly inspecting policy behavior via recorded episode videos. We introduce a simple yet effective instantiation of this approach which leverages a Video Language Model (VLM) to both process these videos and provide curriculum recommendations, which we call Visual Inspection of Policies (VIP). Since videos can naturally contain any number of controllable agents, we empirically study VIP on the StarCraft Multi-Agent Challenge (SMAC). We show that even with a lightweight and openly accessible VLM (VideoLLaMa2-7B), VIP can use policy videos to generate more effective curricula than both its text-only ablation and methods that rely on scalar task scores.
- Abstract(参考訳): 強化学習(Reinforcement Learning, RL)のオープンエンドカリキュラムは、ますます複雑なスキルの学習を容易にするタスクを識別することによって、一般的な能力を持つエージェントを訓練することを目的としている。
このようなカリキュラムを設計する際の大きな課題は、エージェントの現在の学習進捗に対するタスクの難しさを評価することである。
過去の研究は、エージェントの行動のスカラー・タスクスコアやテキスト・サマリーを用いて検討されてきたが、ここでは、記録されたエピソードビデオを通して、ポリシー行動を直接検査する別のアプローチについて検討する。
本稿では、ビデオ言語モデル(VLM)を利用して、これらのビデオの処理とカリキュラムの推薦を行う。
ビデオには自然に制御可能なエージェントがたくさん含まれているので、私たちはStarCraft Multi-Agent Challenge (SMAC)でVIPを経験的に研究します。
軽量でオープンなVLM(VideoLLaMa2-7B)でも、VIPはポリシービデオを使ってテキストのみのアブレーションやスカラータスクスコアに依存する手法よりも効果的なカリキュラムを生成することができる。
関連論文リスト
- Single-agent vs. Multi-agents for Automated Video Analysis of On-Screen Collaborative Learning Behaviors [0.0]
スクリーン上の学習行動は、学生が学習中にどのように情報を求め、利用し、生成するかについての貴重な洞察を提供する。
近年の視覚言語モデル(VLM)は、労働集約型手動コーディングを自動化する新しい機会を提供する。
本研究では,ビデオ解析におけるVLMベースのマルチエージェントシステムの有効性を実証し,マルチモーダルデータ解析のためのスケーラブルなフレームワークを提供する。
論文 参考訳(メタデータ) (2026-04-04T08:01:02Z) - Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations [22.561305437484975]
本稿では,ビデオからの模倣学習を実現するために,遅延表現(BCV-LR)を用いた動画からの行動クローニングを提案する。
BCV-LRは、自己監督タスクを通じて高次元映像入力から行動関連潜伏特徴を抽出する。
我々は、離散制御と連続制御の両方を含む、難易度の高い視覚的タスクのセットについて広範な実験を行う。
論文 参考訳(メタデータ) (2025-12-25T09:11:14Z) - Training Multi-Image Vision Agents via End2End Reinforcement Learning [51.81337984526068]
我々は、エンドツーエンドの強化学習によって訓練されたオープンソースの視覚エージェントであるIMAgentを提案する。
マルチエージェントシステムを利用することで、困難かつ視覚的にリッチなマルチイメージQAペアを生成する。
我々は、視覚的反射と確認のための2つの特別なツールを開発し、モデルが積極的に画像コンテンツに注意を向けることを可能にする。
論文 参考訳(メタデータ) (2025-12-05T10:02:38Z) - VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning [30.278740496355507]
本稿では,ビデオ理解のための新しいマルチエージェントシステムであるVideoChat-M1を提案する。
単一のポリシーや固定されたポリシーを使う代わりに、VideoChat-M1は複数のポリシーエージェントを持つCPP(Collaborative Policy Planning)パラダイムを採用する。
我々は,ビデオチャット-M1が4つのタスクにまたがる8つのベンチマークでSOTA性能を達成することを示す。
論文 参考訳(メタデータ) (2025-11-24T07:04:51Z) - Sample-efficient Unsupervised Policy Cloning from Ensemble Self-supervised Labeled Videos [7.827978803804189]
Unsupervised Policy from Ensemble Self-supervised labeled Videos (SV) は、報酬なしにアクションフリーのビデオからポリシーを効率的に学習する新しいフレームワークである。
SVはビデオラベリングモデルをトレーニングし、専門家のビデオで専門家の行動を推測する。
サンプル効率、教師なし、反復的なトレーニングプロセスの後、SVはロバストなビデオラベリングモデルに基づく高度なポリシーを得る。
論文 参考訳(メタデータ) (2024-12-14T10:12:22Z) - TANGO: Training-free Embodied AI Agents for Open-world Tasks [11.029387480118652]
本稿では,すでに観測されているLCMを用いてプログラム構成を拡張するTANGOを提案する。
追加のトレーニングを必要とせずに、単一のモデルが多様なタスクにどのように対処できるかを示す。
我々は,オープンセットオブジェクトゴールナビゲーション,マルチモーダルライフロングナビゲーション,オープンエンボディード質問回答という3つの重要なAIタスクに対するアプローチを評価した。
論文 参考訳(メタデータ) (2024-12-05T21:52:20Z) - VURF: A General-purpose Reasoning and Self-refinement Framework for Video Understanding [65.12464615430036]
本稿では,Large Language Models (LLM) の推論能力に基づくビデオ理解・推論フレームワーク (VURF) を提案する。
ビデオタスクのコンテキストにおいてLLMの実用性を拡張し,最小限のインプットとアウトプットのデモをコンテキストフレームワーク内で一般化する,新たなアプローチを提案する。
論文 参考訳(メタデータ) (2024-03-21T18:00:00Z) - Agent-Pro: Learning to Evolve via Policy-Level Reflection and Optimization [53.510942601223626]
大規模言語モデル(LLM)は多様なタスクに対して堅牢な問題解決能力を示す。
これらのタスクソルバは、タスクルールを通知し、行動を調整するために手作業によるプロンプトを必要とする。
本稿では,ポリシーレベルのリフレクションと最適化を備えた LLM ベースのエージェントである Agent-Pro を提案する。
論文 参考訳(メタデータ) (2024-02-27T15:09:20Z) - Vision-Language Models Provide Promptable Representations for Reinforcement Learning [67.40524195671479]
視覚言語モデル(VLM)に符号化された多量の一般知識と索引可能な世界知識をインターネット規模で事前学習して具体的強化学習(RL)を行う新しい手法を提案する。
提案手法では,共通意味的推論の表現にチェーン・オブ・シントを用いることで,新規シーンのポリシー性能を1.5倍向上できることを示す。
論文 参考訳(メタデータ) (2024-02-05T00:48:56Z) - DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent) [73.10899129264375]
本稿では,LLMによる動的シーン理解のための包括的かつ概念的にエレガントなシステムであるドラモンGPTについて検討する。
質問/タスクのあるビデオが与えられた場合、DoraemonGPTは入力されたビデオをタスク関連の属性を格納するシンボリックメモリに変換することから始める。
我々は,DoraemonGPTの有効性を,3つのベンチマークといくつかのアプリ内シナリオで広範囲に評価した。
論文 参考訳(メタデータ) (2024-01-16T14:33:09Z) - Adapting Pre-trained Language Models to Vision-Language Tasks via
Dynamic Visual Prompting [83.21164539349273]
事前学習型言語モデル (PLM) はマルチメディア研究においてその役割を担っている。
本稿では,視覚言語推論タスクのスタンドアロンモデルとしてのPLMの探索に焦点をあてる。
ダイナミックビジュアル・プロンプティング(DVP)と呼ばれるPLMのための新しいトランスファー学習手法を提案する。
論文 参考訳(メタデータ) (2023-06-01T07:19:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。