論文の概要: PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue
- arxiv url: http://arxiv.org/abs/2608.06975v1
- Date: Fri, 07 Aug 2026 08:50:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.42393
- Title: PHASE-Tree: Modeling Character-State Evolution in Long-Horizon Role-Playing Dialogue
- Title(参考訳): PHASE-Tree:長期ロールプレイング対話におけるキャラクタ-状態進化のモデル化
- Abstract要約: PHASE-Treeは、不変IDルートと変更可能なペルソナ、セッション、モーメント層を備えたマルチタイムの文字状態ツリーである。
明示的なテキストプロビジョニングや暗黙的なパラメトリック適応を通じて生成する。
ロングダイアログコアでは、PHASE-Treeは12のデータセット測定細胞のうち11の1位にランクインし、内部変異細胞と全12の細胞は外部のテキストベースラインに対してランクインする。
- 参考スコア(独自算出の注目度): 37.64180837016861
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon role-playing demands that characters remain recognizable as they evolve with the narrative. Yet existing work falls short on two fronts: representations are typically static profiles that cannot be updated locally without destabilizing unchanged traits, and benchmarks mainly test persona preservation and memory recall rather than whether a model speaks from a character's currently evolved state. We address both. PHASE-Tree is a multi-timescale character-state tree with an immutable identity root and mutable persona, session, and moment layers, making each mutable field an addressable target for localized within- and cross-episode updates. It conditions generation through explicit textual provision or implicit parametric adaptation. To measure evolved-state generation, we introduce LongEvoRoleBench, which pairs four long-dialogue corpora for cross-episode evolution with four short-dialogue corpora as within-scene state-tracking checks, under a unified next-utterance protocol. On the long-dialogue core, textual PHASE-Tree ranks first in 11 of 12 dataset-metric cells against internal variants and all 12 cells against external textual baselines, improving character-level, semantic, and embedding scores by 19.7%, 12.4%, and 15.1% respectively. In a blinded 200-response study, human ratings correlate with the GPT-4.1 judge (Pearson r= 0.65); on descriptive n= 10 PT and NR prompt subsets, the Overall difference is +0.20. The long-dialogue Sem advantage persists across LLM judges and generation backbones.
- Abstract(参考訳): ロングホライゾンのロールプレイングは、キャラクターが物語とともに進化するにつれて認識され続けることを要求する。
しかし、既存の作業は2つの面で不足している: 表現は典型的に静的プロファイルであり、変化のない特性を不安定にすることなくローカルに更新できない。
私たちは両方に対処します。
PHASE-Treeは不変のIDルートと変更可能なペルソナ、セッション、モーメント層を備えたマルチタイムの文字状態ツリーであり、各変更可能なフィールドをローカライズされた内部および横断的な更新のためのアドレス可能なターゲットにする。
明示的なテキストプロビジョニングや暗黙的なパラメトリック適応を通じて生成する。
進化状態の生成を測定するために,LongEvoRoleBenchを導入する。これは4つの長対話コーパスと4つの短対話コーパスを,一貫した次発話プロトコルの下で,内部状態追跡チェックとして組み合わせたものである。
ロングダイアログコアでは、12のデータセット測定細胞のうち11の1位が内部変種、12の細胞が外部のテキストベースライン、文字レベル、セマンティック、埋め込みスコアが19.7%、12.4%、および15.1%改善している。
盲目200応答研究において、人間の評価はGPT-4.1の判定値(ピアソンr=0.65)と相関し、説明的なn=10 PTおよびNRプロンプトサブセットでは、全体的な差は+0.20である。
長い対話Semのアドバンテージは、LLMの審査員と世代バックボーンにまたがって持続する。
関連論文リスト
- Creating an Atomic User Model for Personality-Aware Large Language Model Interaction [0.0]
原子ユーザモデル(アトミックユーザモデル、Atomic User Model、AUM)は、安定的なアイデンティティー核として人を組織する人間可読表現である。
タスク分類器、コンポーネント選択関数、予算付きレトリバーが生成時にフィールドの小さなペイロードを返すパイプライン。
8つのフィールドを取得することは、コンテキストの23%で完全なユーザモデルのスタイル忠実さと一致した。
論文 参考訳(メタデータ) (2026-09-10T18:11:43Z) - A Three-Tier Persona Vector for Controllable User Simulation in Agentic Evaluation [0.9918136378822991]
23の操作次元を持つ3層ペルソナベクトルを提案する。
我々は64,698件の会話で合成データ生成パイプライン内のペルソナモデルを評価する。
論文 参考訳(メタデータ) (2026-09-08T11:28:02Z) - Beyond Individual Personas: Aligning Synthetic Dialogue to Population-Level Behavior Distributions [21.099809383806598]
GroupPersonaは、合成対話コーパスを参照コーパスの振る舞い分布に合わせるフレームワークである。
それぞれの対話の中核的な行動シグネチャを予測可能な副作用から切り離し、結果として生じる行動グループを使用して、参照人口を定義するインタラクションパターンにユーザエージェントを条件付ける。
論文 参考訳(メタデータ) (2026-06-05T23:03:53Z) - HorizonBench: Long-Horizon Personalization with Evolving Preferences [73.32940850193681]
構造化されたメンタルステートグラフから会話を生成するデータジェネレータを導入する。
そこからHorizonBenchを構築する。これは6ヶ月の会話履歴を持つ360のシミュレーションユーザーから4,245項目のベンチマークである。
HorizonBenchは、長期コンテキストモデリング、メモリ拡張アーキテクチャ、理論・オブ・ミンド推論、ユーザーモデリングのためのテストベッドを提供する。
論文 参考訳(メタデータ) (2026-04-19T06:55:10Z) - Dynamic Context Evolution for Scalable Synthetic Data Generation [0.0]
大規模言語モデルは、多くのバッチで独立して繰り返し出力を生成する。
3つのメカニズムからなる動的コンテキスト進化(DCE)を紹介する。
DCEは、メモリ状態と回転多様性戦略を使用して、各バッチの生成プロンプトを再構築する。
論文 参考訳(メタデータ) (2026-04-08T14:38:11Z) - ClawArena: Benchmarking AI Agents in Evolving Information Environments [61.664633997138004]
ClawArenaは、進化する情報環境におけるAIエージェントの評価のためのベンチマークである。
それぞれのシナリオは、エージェントをノイズ、部分的、時には矛盾するトレースだけに露呈しながら、完全に隠された地上の真実を維持します。
評価は、マルチソースコンフリクト推論、動的信念修正、暗黙のパーソナライゼーションという3つの複合的な課題に基づいて構成される。
論文 参考訳(メタデータ) (2026-04-05T17:55:23Z) - PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments [72.02445514666428]
静的な嗜好リコールを超えてペルマの一貫性を評価するためのベンチマークであるPERMAを紹介する。
PerMAは、複数のセッションとドメインにまたがる時間的に順序付けられたインタラクションイベントと、時間とともに好みに関連するクエリで構成されている。
実験により、関連するインタラクションをリンクすることで、高度なメモリシステムはより正確な好みを抽出し、トークン消費を減らすことができることが示された。
論文 参考訳(メタデータ) (2026-03-24T14:04:11Z) - From Word Sequences to Behavioral Sequences: Adapting Modeling and Evaluation Paradigms for Longitudinal NLP [10.614902538213638]
文献レベルの評価は, 生態学的に有効なモデリングと評価と比較して, かなり異なる結果が得られ, 時には逆の結論がもたらされることが示唆された。
NLP のワードシーケンス評価から $textitbehavior-sequence$ パラダイムへの移行を動機とする,より広範な議論に関連付ける。
論文 参考訳(メタデータ) (2026-01-12T20:38:36Z) - Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents [80.33280979339123]
強化学習(RL)を用いた時間認識メモリ選択ポリシーを学習するフレームワークであるMemory-T1を紹介する。
Time-Dialogベンチマークでは、Memory-T1が7Bモデルを67.0%に引き上げ、オープンソースモデルの新たな最先端パフォーマンスを確立した。
論文 参考訳(メタデータ) (2025-12-23T06:37:29Z) - X-TURING: Towards an Enhanced and Efficient Turing Test for Long-Term Dialogue Agents [56.64615470513102]
チューリングテストは、自然言語の会話においてAIが人間のような振る舞いを示すかどうかを調べる。
従来の設定では、各参加者は一度に1つのメッセージに制限される。
本稿では,textitburstダイアログパターンを用いて,元のテストを強化するtextbftextscX-Turingを提案する。
論文 参考訳(メタデータ) (2024-08-19T09:57:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。