論文の概要: Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing
- arxiv url: http://arxiv.org/abs/2605.04733v1
- Date: Wed, 06 May 2026 10:32:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-07 18:41:07.773304
- Title: Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing
- Title(参考訳): 没入型ビデオロールプレイングのための逆分解強化学習
- Authors: Miao Wang, Yuling Shi, Yijiang Li, Yeheng Chen, Xiaodong Gu, Bin Li, Bo Gao, Yaduan Ruan,
- Abstract要約: 我々は,ビデオ・グラウンドド・ロールプレイング・ダイアログを研究し,分離されたGRPOベースのフレームワークであるEMM-RL(Eye-Brain-Mouth Reinforcement Learning)を導入する。
EBM-RLは、環境と感情を改善するためのCLIPベースのシーンテキストアライメント、(ii)参照応答の可能性を増大させる知覚認知報酬、(iii)忠実性を保証するための答えの正確性、(iv)要求される構造化された出力を強制する密度の高いフォーマット報酬の4つの補完的な報酬を統合する。
- 参考スコア(独自算出の注目度): 22.931532401011182
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Text-based role-playing models can imitate character styles, yet they often fail to reflect a scene's atmosphere and evolving tension, both essential for immersive applications such as Virtual Reality (VR) games and interactive narratives. We study video-grounded role-playing dialogue and introduce EBM-RL (Eye-Brain-Mouth Reinforcement Learning), a decoupled GRPO-based framework that explicitly separates observation ([perception]), reasoning ([think]), and utterance ([answer]). This structure promotes human-like sensory grounding by compelling the model to first attend to visual cues, then form internal interpretations, and finally generate context-appropriate dialogue. EBM-RL integrates four complementary rewards: (i) CLIP-based scene-text alignment to improve ambiance and emotion; (ii) a Perceptual-Cognitive reward that encourages [perception] and [think] processes that increase the likelihood of the reference response; (iii) answer accuracy to ensure faithfulness; and (iv) a dense format reward to enforce the desired structured output. Extensive experiments demonstrate that EBM-RL substantially outperforms text-only role-playing baselines and larger-scale vision-language models on our immersive role-playing benchmark, delivering simultaneous gains in visual-atmosphere consistency and character authenticity. Beyond the role-playing domain, EBM-RL also exhibits strong zero-shot generalization: without any additional fine-tuning, it consistently improves performance on out-of-domain VideoQA benchmarks. We additionally release an open-source dataset for video-grounded role-playing dialogue.
- Abstract(参考訳): テキストベースのロールプレイングモデルはキャラクタースタイルを模倣することができるが、仮想リアリティ(VR)ゲームやインタラクティブな物語のような没入型アプリケーションに不可欠なシーンの雰囲気や緊張の進化を反映しないことが多い。
本研究では,映像によるロールプレイング・ダイアログを学習し,EMM-RL(Eye-Brain-Mouth Reinforcement Learning)を導入し,観察(知覚),推論(思考),発話(回答)を明確に分離する分離されたGRPOベースのフレームワークを提案する。
この構造は、まず視覚的手がかりに出席し、次に内部解釈を形成し、最後にコンテキストに適した対話を生成することによって、人間のような感覚の接地を促進する。
EBM-RLは4つの相補的な報酬を統合する。
(i)環境と感情を改善するCLIPベースのシーンテキストアライメント
(二)参照応答の可能性を増大させる知覚認知報酬及びプロセスの促進
三 誠実さを確保するために正確性に答えること
(iv) 所望の構造化出力を強制するための高密度なフォーマット報酬。
EBM-RLは、我々の没入型ロールプレイングベンチマークにおいて、テキストのみのロールプレイングベースラインと大規模ビジョンランゲージモデルを大幅に上回り、視覚的雰囲気の整合性と文字の信頼性を同時に向上することを示した。
EBM-RLはロールプレイングドメイン以外にも、強力なゼロショットの一般化も示している。
また,ロールプレイング対話のためのオープンソースデータセットもリリースしている。
関連論文リスト
- ES4R: Speech Encoding Based on Prepositive Affective Modeling for Empathetic Response Generation [30.006550552714938]
共感的音声対話は、言語内容だけでなく、豊富なパラ言語情報も理解する必要がある。
既存の音声から音声への大きな言語モデルは、ASRの転写に依存するか、エンコーダを使用して潜在表現を抽出する。
音声に基づく共感応答生成のためのフレームワークである textbfES4R を提案する。
論文 参考訳(メタデータ) (2026-01-16T10:26:50Z) - ViSS-R1: Self-Supervised Reinforcement Video Reasoning [84.1180294023835]
本稿では,新しい自己教師付き強化学習GRPOアルゴリズム(Pretext-GRPO)を標準R1パイプライン内に導入する。
また、プリテキストタスクに基づく自己教師型学習をMLLMのR1ポストトレーニングパラダイムに直接統合するViSS-R1フレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-17T07:00:42Z) - REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding [23.684146245231457]
ロングフォームビデオ理解には、よりリッチでダイナミックな視覚入力が含まれる。
純粋にテキストベースのリフレクションメカニズムは、クロスモーダルなインタラクション機能を欠いている。
ツール拡張マルチモーダルリフレクションのための新しいフレームワークであるREVISORを提案する。
論文 参考訳(メタデータ) (2025-11-17T06:25:12Z) - SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents [72.79816494079833]
ロールプレイングエージェントは、パーソナライズされた相互作用と感情共鳴を達成するための有望なパラダイムとして登場した。
既存の研究は主にテキストのモダリティに焦点を当て、現実的な対話的なシナリオにおける音声の重要な次元を無視している。
我々は,98の多様な役割と112kの音声ベースの1ターン・マルチターン会話からなる大規模かつ高品質なデータセットであるSpeechRole-Dataを構築した。
論文 参考訳(メタデータ) (2025-08-04T03:18:36Z) - CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards [53.36917093757101]
ロールプレイング言語エージェント (RPLA) は,Large Language Models (LLM) に対する重要な適用方向として登場した。
テキスト認識対応推論パラダイムを採用した新しいRPLAであるtextbfCogDualを紹介する。
外部状況認識と内部自己認識を共同でモデル化することにより、CagDualは文字整合性と文脈整合性を改善した応答を生成する。
論文 参考訳(メタデータ) (2025-07-23T02:26:33Z) - Playpen: An Environment for Exploring Learning Through Conversational Interaction [84.0413820245725]
本研究は,対話ゲームが学習のフィードバック信号の源として機能するかどうかを考察する。
本稿では,対話ゲームによるオフラインおよびオンライン学習環境であるPlaypenを紹介する。
SFTによる模倣学習は、目に見えないインスタンスのパフォーマンスを向上させるが、他のスキルに悪影響を及ぼす。
論文 参考訳(メタデータ) (2025-04-11T14:49:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。