論文の概要: Wiki-Talkie: Multilingual Benchmarking of Persona-Based Agents on Real-World Discussions
- arxiv url: http://arxiv.org/abs/2610.08513v1
- Date: Tue, 06 Oct 2026 15:17:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:30.072781
- Title: Wiki-Talkie: Multilingual Benchmarking of Persona-Based Agents on Real-World Discussions
- Title(参考訳): Wiki-Talkie:実世界の議論におけるペルソナエージェントの多言語ベンチマーク
- Abstract要約: Wiki-Talkieは、ウィキペディアトークページから5つの言語にまたがる実世界の会話の多言語データセットである。
我々は,様々なペルソナ条件付け手法を用いて,次回生成タスクにおけるエージェントのインタラクション行動を評価する。
- 参考スコア(独自算出の注目度): 11.86214761071029
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: LLMs are increasingly deployed as autonomous agents in social environments, making it critical to study their ability to faithfully simulate human interactions. Central to this is grounding agents in realistic user personas, yet existing datasets rely on fictional personas and are limited to a handful of languages, lacking the empirical grounding necessary to evaluate behavioral fidelity across diverse populations. We introduce Wiki-Talkie, a multilingual dataset of real-world conversations from Wikipedia Talk pages across five languages spanning two language families: Germanic (German, English) and Romance (Spanish, French, Italian), paired with personas derived from real user communities and encompassing sociodemographic attributes, self-descriptions, and behaviorally grounded interaction traits. Using Wiki-Talkie, we evaluate agent interactional behavior on a next-turn generation task across various persona conditioning strategies. Our evaluation assesses whether agents collectively reproduce the distributional behavioral patterns observed in human discussions. Results show that user's comment history exemplifying interaction behavior consistently outperforms explicit persona information. In addition, models systematically underproduce negative or extreme sentiments, while over producing references and suggestions, revealing biases toward agreeableness and positivity. Crucially, these patterns hold robustly across languages, with small cross-lingual differences.
- Abstract(参考訳): LLMは、社会的環境における自律的なエージェントとしてますます普及しており、人間の相互作用を忠実にシミュレートする能力を研究することが重要である。
これの中心は、現実的なユーザペルソナのエージェントを基盤としているが、既存のデータセットは架空のペルソナに依存しており、少数の言語に限定されている。
ウィキトーキー(Wiki-Talkie)は、ドイツ語(ドイツ語、英語)とロマンス(スペイン語、フランス語、イタリア語)の5つの言語にまたがるウィキペディアの会話ページから、実際のユーザコミュニティから派生したペルソナと組み合わせ、社会的な属性、自己記述、行動に根ざした相互作用特性を包含する多言語データセットである。
Wiki-Talkieを用いて,多種多様なペルソナ条件付け手法を用いて,次回生成タスクにおけるエージェントのインタラクション行動を評価する。
エージェントが人間の議論で観察される分布行動パターンを総合的に再現するかどうかを評価する。
その結果,対話行動を示すユーザのコメント履歴は,明示的なペルソナ情報よりも常に優れていた。
さらに、モデルは、ネガティブまたは極端な感情を体系的に過小評価し、参照と提案を過剰に生成し、同意性や肯定性へのバイアスを明らかにする。
重要なことに、これらのパターンは言語をまたいで頑丈に保ち、言語間の違いは少ない。
関連論文リスト
- MASim: Multilingual Agent-Based Simulation for Social Science [68.04129327237963]
マルチエージェントロールプレイングは近年,言語エージェントを用いた社会行動研究の公約を示している。
既存のシミュレーションは主に単言語であり、言語間相互作用をモデル化することができない。
我々は、最初の多言語エージェントベースのシミュレーションフレームワークであるMASimを紹介する。
論文 参考訳(メタデータ) (2025-12-08T06:12:48Z) - LIFELONG SOTOPIA: Evaluating Social Intelligence of Language Agents Over Lifelong Social Interactions [4.819825467587802]
本稿では,言語エージェントの総合評価を行うための新しいベンチマークLIFELONG-SOTOPIAを提案する。
私たちがテストするすべての言語モデルの目標達成と信頼性が、インタラクション全体を通じて低下していることに気付きました。
以上の結果から,生涯にわたる社会的相互作用による言語エージェントの社会的知性評価にはLIFELONG-SOTOPIAが有効であることが示唆された。
論文 参考訳(メタデータ) (2025-06-14T23:57:54Z) - Training Language Models for Social Deduction with Multi-Agent Reinforcement Learning [31.196865401472664]
自然言語の環境に関する生産的な議論を人間による実演なしで行うように、言語モデルを訓練する。
我々はエージェントの目標を利用して、コミュニケーションを誘導する高密度報酬信号として、世界の有用な情報を予測する。
我々は、容疑者の告発や証拠提供など、我々の技術による創発的行動を分析し、強力な議論を可能にすることを発見した。
論文 参考訳(メタデータ) (2025-02-09T22:44:45Z) - SocialBench: Sociality Evaluation of Role-Playing Conversational Agents [85.6641890712617]
大規模言語モデル(LLM)は、様々なAI対話エージェントの開発を進めてきた。
SocialBenchは、ロールプレイングの会話エージェントの社会的性を個人レベルとグループレベルで評価するために設計された最初のベンチマークである。
個人レベルで優れたエージェントは,集団レベルでの熟練度を示唆しない。
論文 参考訳(メタデータ) (2024-03-20T15:38:36Z) - AgentGroupChat: An Interactive Group Chat Simulacra For Better Eliciting Emergent Behavior [44.82972192477596]
我々はAgentGroupChatを紹介した。これは集団行動を形成する上での言語の役割を解明するシミュレーションである。
我々は,グループ力学における複雑な言語使用を模倣するシミュレーション能力を示すために,AgentGroupChatに基づく4つの物語シナリオを設定した。
その結果,幅広い情報交換環境,多彩な特徴を持つ文字,高い言語的理解,戦略的適応性など,様々な要因から創発的行動が生み出すことが明らかとなった。
論文 参考訳(メタデータ) (2024-03-20T09:21:32Z) - LLM Agents in Interaction: Measuring Personality Consistency and
Linguistic Alignment in Interacting Populations of Large Language Models [4.706971067968811]
簡単な変数誘導サンプリングアルゴリズムを用いて,大規模言語モデル (LLM) エージェントの2群集団を作成する。
人格検査を行ない、共同作業にエージェントを提出し、異なるプロファイルが会話相手に対して異なるレベルの人格整合性および言語的整合性を示すことを確認する。
論文 参考訳(メタデータ) (2024-02-05T11:05:20Z) - Are Personalized Stochastic Parrots More Dangerous? Evaluating Persona
Biases in Dialogue Systems [103.416202777731]
我々は、対話モデルが採用するペルソナに付随する有害な行動の感度であると定義する「ペルソナバイアス」について検討する。
我々は,人格バイアスを有害な表現と有害な合意のバイアスに分類し,攻撃性,有害継続性,関連性,ステレオタイプ合意,および有害合意の5つの側面において,人格バイアスを測定する包括的な評価枠組みを確立する。
論文 参考訳(メタデータ) (2023-10-08T21:03:18Z) - Can You be More Social? Injecting Politeness and Positivity into
Task-Oriented Conversational Agents [60.27066549589362]
人間エージェントが使用する社会言語は、ユーザーの応答性の向上とタスク完了に関連しています。
このモデルは、ソーシャル言語理解要素で拡張されたシーケンスからシーケンスまでのディープラーニングアーキテクチャを使用する。
人的判断と自動言語尺度の両方を用いたコンテンツ保存と社会言語レベルの評価は,エージェントがより社会的に適切な方法でユーザの問題に対処できる応答を生成できることを示している。
論文 参考訳(メタデータ) (2020-12-29T08:22:48Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。