論文の概要: Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment
- arxiv url: http://arxiv.org/abs/2607.17191v2
- Date: Wed, 22 Jul 2026 05:26:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 16:42:31.571679
- Title: Toward Anthropomorphic Dialogue: A Closed-Loop Framework for Human-Like Chat Generation, Evaluation, and Preference Alignment
- Title(参考訳): 擬人化対話に向けて--人型チャット生成・評価・選好アライメントのためのクローズドループフレームワーク
- Authors: Wentao Liu, Siyu Song, Xi Chen, Youjia Li, Xiaokun Wang, Min Ji, Ji Wang,
- Abstract要約: AnthroDialは、システムアーキテクチャ、実行可能評価、診断アライメントの連立問題として人為的対話を定式化するクローズドループフレームワークである。
ロール条件のスケジュールされた対話とペルソナとシナリオカード、長期記憶、仮想時間、シングルドラフトメッセージ決定を組み合わせる。
生成,評価,報酬形成における人為的対話は,同じ行動次元を共有していることを示す。
- 参考スコア(独自算出の注目度): 11.379426404872833
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human-like private chat requires more than fluent response generation: a system must preserve persona, relationship, memory, bounded knowledge, medium-specific timing, and a coherent multi-turn arc. We present AnthroDial, a closed-loop framework that formulates anthropomorphic dialogue as a joint problem of system architecture, executable evaluation, and diagnostic alignment. It combines (1) a role-conditioned scheduled dialogue runtime with persona and scenario cards, long-term memory, virtual time, and single-draft message decisions; (2) an executable benchmark with an L0 validity gate, five per-turn dimensions, and five dialogue-level dimensions; and (3) a post-training pipeline that filters 16,436 scheduled-decision examples for SFT and applies GRPO with a cognitive-diagnostic, ZPD-aware reward. The reward maintains Kalman-filtered capability estimates for each behavioral dimension, upweights dimensions with larger capability deficits, and uses rollout scores as task-level ZPD matches to focus optimization on learnable weak skills. On a benchmark with 55 personas, 50 scenarios, 50 persona-scenario bindings, and 100 role-conditioned cases per model, we evaluate 16 systems spanning frontier baselines, open models, thinking/no-think variants, and SFT/RL ablations. The strongest non-trained baseline reaches 32.00% strict ACC, while Qwen3.6-27B-SFT+RL reaches 39.00% strict ACC and a 98.5 overall score. In the 9B no-think setting, SFT and RL improve strict ACC from 0.00% to 13.00% and 18.37%. These results show that anthropomorphic dialogue benefits when generation, evaluation, and reward shaping share the same behavioral dimensions.
- Abstract(参考訳): システムはペルソナ、関係性、記憶、境界知識、中程度のタイミング、一貫性のあるマルチターンアークを保存する必要がある。
本稿では,システムアーキテクチャ,実行可能評価,診断アライメントの連立問題として擬人化対話を定式化する閉ループフレームワークであるArthhroDialを提案する。
1)ロールコンディショニングされたスケジュール対話ランタイムと,(1)ペルソナとシナリオカード,長期記憶,仮想時間,および単一ドラフトメッセージ決定,(2)L0妥当性ゲート,5つのターン次元,および5つの対話レベル次元を備えた実行可能なベンチマーク,(3)SFTのスケジュール決定例16,436をフィルタリングし,GRPOを認知診断的,ZPD対応の報酬で適用するポストトレーニングパイプラインを組み合わせる。
報酬は、各行動次元、より大きな能力不足を伴う重み付け次元、および、タスクレベルのZPDマッチとしてロールアウトスコアを使用して、学習可能な弱いスキルに最適化を集中させる。
55のペルソナ,50のシナリオ,50のペルソナ-scenarioバインディング,100のロール条件付きケースのベンチマークにおいて,フロンティアベースライン,オープンモデル,思考/思考の変種,SFT/RLの短縮を対象とする16のシステムを評価した。
最強の非トレーニングベースラインは32.00%、Qwen3.6-27B-SFT+RLは39.00%、総合スコアは98.5である。
9Bでは、SFTとRLは厳格なACCを0.00%から13.00%と18.37%に改善した。
これらの結果から, 人為的対話は, 生成, 評価, 報酬形成において, 同一の行動次元を共有できることがわかった。
関連論文リスト
- Benchmarking Speech-to-Speech Translation Models [55.00303727199927]
音声音声翻訳(S2ST)は急速に進歩しているが、オフライン評価には統一されたプロトコルが欠けている。
8次元にわたる46のメトリクスを統合するベンチマークフレームワークを導入する。
FLEURSとCVSSから1,248のモデル言語構成でデプロイする。
論文 参考訳(メタデータ) (2026-06-02T07:01:33Z) - SocialMemBench: Are AI Memory Systems Ready for Social Group Settings? [0.0]
AIアシスタントのメモリシステムは、シングルユーザー対話用に構築され、マルチパーティのソーシャルグループ設定に適用した場合、特徴的にフェールする。
既存のメモリベンチマークでは、ダイアディックや職場での対話が評価されている。
人工ソーシャルグループネットワークのベンチマークであるSocialMemBenchを紹介する。
論文 参考訳(メタデータ) (2026-05-18T03:11:48Z) - The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious [35.76482964927589]
202のマルチターン会話における66のターンレベルメトリクスの自己相関構造を特徴付ける。
標準プールテストでは,42%のアソシエーションがクラスタ・ロバスト補正に成功しなかった。
我々は、Chelton (1983) の有効自由度と会話レベルのブロックブートストラップを組み合わせた2段階補正フレームワークを提案する。
論文 参考訳(メタデータ) (2026-04-15T20:54:39Z) - The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models [0.0]
実証的に、3つの独立したリーダーボード(Open LLM v2、拡張12ベンチマークスイート、LiveBench)は、いずれも[2.86, 4.80]のd_effを持つ。
Nemhauser (1 − 1/e) 保証付き部分モジュラーグリードアルゴリズムは、4つのベンチマークの安定なコアを見つける。
12のベンチマークと27のカテゴリの反実的な検証では、固有構造がどの評価が置き換えられないかを予測している。
論文 参考訳(メタデータ) (2026-04-15T08:56:58Z) - Three Roles, One Model: Role Orchestration at Inference Time to Close the Performance Gap Between Small and Large Agents [0.4666493857924357]
複雑なマルチステップ環境において,推論時足場のみに追加のトレーニング計算を使わずに,小さなモデルの性能を向上させることができるかどうかを検討した。
我々は,AppWorldベンチマークのQwen3-8Bを,完全精度と4ビット量子化構成の両方で評価した。
本格的な推測では、私たちの足場付き8Bモデルは、オリジナルのAppWorld評価からDeepSeek-Coder 33Bインストラクション(7.1%)を上回っています。
論文 参考訳(メタデータ) (2026-04-13T13:40:33Z) - HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions [50.61510609116118]
HuggingR$4$は、Reasoning、Retrieval、Refinement、Reflectionを組み合わせて効率的にモデルを選択する新しいフレームワークである。
作業性率は92.03%、理性率は82.46%に達し、それぞれ26.51%、33.25%を超える。
論文 参考訳(メタデータ) (2025-11-24T03:13:45Z) - One Battle After Another: Probing LLMs' Limits on Multi-Turn Instruction Following with a Benchmark Evolving Framework [51.50565654314582]
大規模言語モデルは、複数のトピックにまたがる対話を通して、ユーザの指示に従うことができる。
既存のベンチマークは、しばしば一定回数のターンに制限されるため、飽和の影響を受けにくく、ユーザのインタラクティブなエクスペリエンスを考慮できない。
マルチターン命令追従能力を評価するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-05T14:39:59Z) - Navigating the Synchrony-Stability Frontier in Adaptive Chatbots [0.0]
コア設計の緊張を明示する計算評価フレームワークを提案する。
人間のログデータセットに対する明示的な適応ポリシーをシミュレートし比較する。
限定されたポリシーは、同期に控えめなコストで、安定性の大幅な向上を実現している。
我々は、フロンティアポリシーが命令のチャーンを減らし、ジャリングレジスタのフリップを減らしたことを示す「素早い正当性」を定量化する。
論文 参考訳(メタデータ) (2025-09-30T22:50:30Z) - Learning Adaptive Parallel Reasoning with Language Models [70.1745752819628]
本稿では,適応並列推論(Adaptive Parallel Reasoning, APR)を提案する。
APRは、spawn()とjoin()操作を使用して適応的なマルチスレッド推論を可能にすることで、既存の推論メソッドを一般化する。
鍵となる革新は、親と子の両方の推論スレッドを最適化して、事前に定義された推論構造を必要とせずにタスクの成功率を高める、エンドツーエンドの強化学習戦略である。
論文 参考訳(メタデータ) (2025-04-21T22:29:02Z) - CoCo: Controllable Counterfactuals for Evaluating Dialogue State
Trackers [92.5628632009802]
本稿では,このギャップを橋渡しし,新たなシナリオにおける対話状態追跡(DST)モデルを評価するための制御可能な対策(CoCo)を提案する。
CoCoは、2つのステップで新しい会話シナリオを生成する: (i) スロットをドロップして追加し、スロット値を置き換えて、 (ii) (i) で条件付きで対話フローと整合する対実会話生成。
人間による評価では、COCO生成された会話は95%以上の精度でユーザー目標を完璧に反映し、元の会話と同じくらい人間らしくなっている。
論文 参考訳(メタデータ) (2020-10-24T09:39:35Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。