論文の概要: DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents
- arxiv url: http://arxiv.org/abs/2605.29256v1
- Date: Thu, 28 May 2026 02:20:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-30 02:45:55.593885
- Title: DynSess: Dynamic Session-Level Evaluation and Optimization Framework for Role-Playing Agents
- Title(参考訳): DynSess:ロールプレイングエージェントのための動的セッションレベル評価と最適化フレームワーク
- Authors: Rongsheng Zhang, Jiji Tang, Junnan Ren, Zuyi Bao, Weijie Chen, Ruofan Hu, Zhou Zhao, Tangjie Lv, Yan Zhang,
- Abstract要約: ロールプレイングエージェントのための統合セッションレベルフレームワークであるDynSessを提案する。
DynSess-Evalは、ロングホライゾンな振る舞いをターゲットとしたルーリックを通じて、完全な対話セッションをスコアする。
私たちのデータセットとコードは、将来の研究を促進するためにリリースされます。
- 参考スコア(独自算出の注目度): 48.320673807521096
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Role-playing with large language models is fundamentally a session-level task, requiring agents to sustain character identity and interaction quality across extended multi-turn conversations. Yet existing evaluation and optimization methods remain largely turn-level, failing to capture long-horizon quality. We propose DynSess, a unified session-level framework for role-playing agents. DynSess-Eval scores complete dialogue sessions via rubrics targeting long-horizon behaviors. Leveraging its session-level rewards, we construct high-quality training trajectories through multi-turn lookahead search and train DynSess-Character with two complementary variants: DSPO (off-policy) and GSRPO (on-policy). Experiments show that DynSess-Eval aligns with human judgments substantially better than prior evaluators, and blind human evaluation further shows that DynSess-Character matches the strongest character model despite using substantially fewer parameters, while maintaining strong role consistency and interactive ability. Our dataset and code will be released to facilitate future research.
- Abstract(参考訳): 大規模言語モデルによるロールプレイングは、基本的にセッションレベルのタスクであり、エージェントは、拡張されたマルチターン会話におけるキャラクタアイデンティティとインタラクション品質を維持する必要がある。
しかし、既存の評価と最適化手法はターンレベルのままであり、長い水平品質の取得に失敗した。
ロールプレイングエージェントのための統合セッションレベルフレームワークであるDynSessを提案する。
DynSess-Evalは、ロングホライゾンな振る舞いをターゲットとしたルーリックを通じて、完全な対話セッションをスコアする。
セッションレベルの報酬を利用して、マルチターンルックアヘッドサーチにより高品質なトレーニングトラジェクトリを構築し、DSPO(オフ・ポリシー)とGSRPO(オン・ポリシー)の2つの相補的なバリエーションでDynSess-Characterを訓練する。
実験の結果、DynSess-Evalは以前の評価値よりも人間による判断とほぼ一致しており、視覚的評価により、DynSess-Characterは極めて少ないパラメータを使用しながら、強い役割一貫性と対話性を維持しながら、最強のキャラクタモデルと一致していることが示された。
私たちのデータセットとコードは、将来の研究を促進するためにリリースされます。
関連論文リスト
- Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning [57.22705949022221]
RoleJudgeは、音声大言語モデルを利用して、音声と文字のアライメントを評価する評価フレームワークである。
連鎖推論アノテーションを付加した最初の音声ロールプレイング評価データセットであるRoleChatを紹介する。
論文 参考訳(メタデータ) (2026-04-15T12:39:03Z) - Dialogue Model Optimization via Agent Game and Adaptive Tree-based GRPO [19.784541601653128]
オープンエンド対話エージェントは、ユーザの特性に適応して、エンゲージメントでパーソナライズされた対話を提供することを目的としている。
本稿では,オンラインパーソナライズと適応木に基づくグループ相対的ポリシー最適化を統合した新しい長軸フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-09T11:32:02Z) - Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback [82.70507055599093]
本稿では,マルチターン・チェーン・オブ・ソートモデルとブロックワイド・デュプレックスモデルの両方において,SDSの品質向上のための選好学習に関する最初の体系的研究を行う。
実験により, 単一回帰RLAIFは目標距離を選択的に改善し, 連立多重回帰学習は意味的品質と音声の自然性において一貫した利得が得られることが示された。
論文 参考訳(メタデータ) (2026-01-27T00:55:14Z) - SpeechRole: A Large-Scale Dataset and Benchmark for Evaluating Speech Role-Playing Agents [72.79816494079833]
ロールプレイングエージェントは、パーソナライズされた相互作用と感情共鳴を達成するための有望なパラダイムとして登場した。
既存の研究は主にテキストのモダリティに焦点を当て、現実的な対話的なシナリオにおける音声の重要な次元を無視している。
我々は,98の多様な役割と112kの音声ベースの1ターン・マルチターン会話からなる大規模かつ高品質なデータセットであるSpeechRole-Dataを構築した。
論文 参考訳(メタデータ) (2025-08-04T03:18:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。