論文の概要: Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents
- arxiv url: http://arxiv.org/abs/2609.28609v1
- Date: Wed, 23 Sep 2026 16:58:08 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.447299
- Title: Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents
- Title(参考訳): ロールプレイングエージェントの進化のための対向的閉ループカリキュラム
- Abstract要約: 最近のRLメソッドは通常、学習が始まる前に収集された固定シナリオプールでトレーニングする。
本稿では,ロールプレイングRLを閉ループカリキュラムに変換する逆コンテキスト書き換えフレームワークであるAdvRoleを提案する。
英語と中国語をカバーする3つのロールプレイングベンチマークの実験と、我々がリリースした新しい多言語ベンチマークは、AdvRoleが一貫してベースラインを上回っていることを示している。
- 参考スコア(独自算出の注目度): 46.71303645473725
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Role-playing agents based on large language models have been widely applied in areas such as personalized assistance and social simulation. Recent RL methods typically train on a fixed scenario pool collected before learning begins. This creates a distributional bottleneck: as the agent improves, the scenarios where it performs poorly also change, while the training distribution remains static. Therefore, we propose AdvRole, an adversarial context rewriting framework that turns role-playing RL into a closed-loop curriculum. AdvRole alternates between an Actor that learns to role-play and a Rewriter that edits character profiles and dialogue contexts into actor-specific hard scenarios. The Rewriter is trained with a performance-gap reward, which favors rewrites that reduce the current Actor's score relative to the original scenario. As a result, the scenario pool evolves with the Actor and continuously targets under-mastered regions of the character-context space. Experiments on three role-playing benchmarks covering English and Chinese, as well as a new multilingual benchmark we release, show that AdvRole consistently outperforms baselines.
- Abstract(参考訳): 大規模言語モデルに基づくロールプレイングエージェントは、パーソナライズされた援助や社会シミュレーションといった分野に広く応用されている。
最近のRLメソッドは通常、学習が始まる前に収集された固定シナリオプールでトレーニングする。
エージェントが改善するにつれて、パフォーマンスの悪いシナリオも変化し、トレーニングディストリビューションは静的のままになります。
そこで本稿では,ロールプレイングRLを閉ループカリキュラムに変換する逆コンテキスト書き換えフレームワークであるAdvRoleを提案する。
AdvRoleはロールプレイを学ぶアクターと、キャラクタープロファイルと対話コンテキストをアクター固有のハードシナリオに編集するリライターを交互に使用する。
リライターはパフォーマンスギャップの報酬で訓練され、元のシナリオと比較して現在のアクターのスコアを下げる書き直しが好まれる。
その結果、シナリオプールはアクターとともに進化し、文字コンテキスト空間のアンダーマスターされた領域を継続的にターゲットします。
英語と中国語をカバーする3つのロールプレイングベンチマークの実験と、我々がリリースした新しい多言語ベンチマークは、AdvRoleが一貫してベースラインを上回っていることを示している。
関連論文リスト
- Adaptive Turn-Taking for Real-time Multi-Party Voice Agents [4.515705397557082]
マルチパーティ設定において、明示的に割り当てられたロールにターンテイク動作を条件付けるロールプレイング音声エージェントであるModerratorLMを提案する。
RolePlayConvは,多様なアシスタント機能を備えた音声多人数会話の大規模合成データセットである。
論文 参考訳(メタデータ) (2026-06-11T16:27:45Z) - AdaMARP: An Adaptive Multi-Agent Interaction Framework for General Immersive Role-Playing [71.66362858228418]
LLMロールプレイングは、対話的な物語において任意のキャラクターを描写することを目的としているが、既存のシステムは没入性や適応性に制限されることが多い。
本稿では,[Thought], (Action), Environment>, and Speechをインターリーブする没入型メッセージ形式を特徴とする,適応型マルチエージェントロールプレイングフレームワークAdaMARPを提案する。
論文 参考訳(メタデータ) (2026-01-16T05:41:45Z) - ERABAL: Enhancing Role-Playing Agents through Boundary-Aware Learning [17.5855800570993]
ヒューマン・コンピュータ・インタラクション(HCI)分野におけるロールプレイング
大幅な進歩にもかかわらず、ロールプレイングエージェント(RPLA)は、会話間のロール一貫性を維持するのに依然として苦労している。
境界認識学習によるロールプレイング能力向上を目的としたフレームワークであるERABALを提案する。
論文 参考訳(メタデータ) (2024-09-23T05:12:13Z) - Enhancing Role-playing Systems through Aggressive Queries: Evaluation and Improvement [17.5855800570993]
大言語モデル(LLM)は、特にロールプレイングシステム(RPS)分野において、対話生成を新しい領域に推進している。
既存のLLMベースのRSSは、境界シナリオで複雑なクエリと閉じ込められたクエリを扱う場合、役割と整合するのに依然として苦労している。
本研究は,MORTISE (Modular Orchestrated Trap-setting Interaction SystEm) を設計し,ロールプレイングLLMの性能向上を図る。
論文 参考訳(メタデータ) (2024-02-16T12:12:05Z) - Large Language Models are Superpositions of All Characters: Attaining
Arbitrary Role-play via Self-Alignment [62.898963074989766]
本稿では,ロールプレイのための自己アライメント手法であるDittoを紹介する。
この方法は4000文字からなるロールプレイトレーニングセットを生成し、現在利用可能なデータセットのスケールを10倍に超える。
本稿では,ロールプレイ領域におけるクロススーパービジョンアライメント実験について紹介する。
論文 参考訳(メタデータ) (2024-01-23T03:56:22Z) - RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models [107.00832724504752]
大規模言語モデル(LLM)におけるロールプレイング能力をベンチマークし、評価し、拡張するフレームワークであるRoleLLMを紹介する。
Context-InstructとRoleGPTによって、168,093サンプルでロールプレイする最初の体系的できめ細かい文字レベルのベンチマークデータセットであるRoleBenchを作成します。
論文 参考訳(メタデータ) (2023-10-01T17:52:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。