論文の概要: BaZi-Based Character Simulation Benchmark: Evaluating AI on Temporal and Persona Reasoning
- arxiv url: http://arxiv.org/abs/2510.23337v1
- Date: Mon, 27 Oct 2025 13:51:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-10-28 15:28:15.562992
- Title: BaZi-Based Character Simulation Benchmark: Evaluating AI on Temporal and Persona Reasoning
- Title(参考訳): BaZiベースの文字シミュレーションベンチマーク:時間とペルソナ推論におけるAIの評価
- Authors: Siyuan Zheng, Pai Liu, Xi Chen, Jizheng Dong, Sihan Jia,
- Abstract要約: BaZiベースのペルソナ推論のための最初のQAデータセットを作成します。
本研究では,シンボル推論と大規模言語モデルを統合したBaZi-LLMシステムを提案する。
- 参考スコア(独自算出の注目度): 3.3125111019129707
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Human-like virtual characters are crucial for games, storytelling, and virtual reality, yet current methods rely heavily on annotated data or handcrafted persona prompts, making it difficult to scale up and generate realistic, contextually coherent personas. We create the first QA dataset for BaZi-based persona reasoning, where real human experiences categorized into wealth, health, kinship, career, and relationships are represented as life-event questions and answers. Furthermore, we propose the first BaZi-LLM system that integrates symbolic reasoning with large language models to generate temporally dynamic and fine-grained virtual personas. Compared with mainstream LLMs such as DeepSeek-v3 and GPT-5-mini, our method achieves a 30.3%-62.6% accuracy improvement. In addition, when incorrect BaZi information is used, our model's accuracy drops by 20%-45%, showing the potential of culturally grounded symbolic-LLM integration for realistic character simulation.
- Abstract(参考訳): 人間のような仮想キャラクタはゲーム、ストーリーテリング、バーチャルリアリティーには不可欠だが、現在の手法は注釈付きデータや手作りのペルソナプロンプトに大きく依存しているため、現実的でコンテキストに整合したペルソナのスケールアップと生成が困難である。
私たちは、BaZiベースのペルソナ推論のための最初のQAデータセットを作成します。
さらに,大規模な言語モデルとシンボリック推論を統合し,時間的に動的かつ微細な仮想ペルソナを生成するBaZi-LLMシステムを提案する。
DeepSeek-v3 や GPT-5-mini といった主流の LLM と比較して, 精度が 30.3%-62.6% 向上した。
さらに,誤ったBaZi情報を使用すると,モデルの精度が20%~45%低下し,現実的なキャラクタシミュレーションのための文化的なシンボル-LLM統合の可能性を示した。
関連論文リスト
- SimuScene: Training and Benchmarking Code Generation to Simulate Physical Scenarios [71.65387146697319]
大規模言語モデル(LLM)は、数学の競争、複雑なコーディング、科学的推論といったタスクのために広く研究されている。
物理シナリオをシミュレートしてLLMを訓練し,評価する最初の体系的な研究であるSimuSceneを提案する。
品質を保証するために、人間の検証とともに、データ収集のための自動パイプラインを構築します。
論文 参考訳(メタデータ) (2026-02-11T13:26:02Z) - Sim-and-Human Co-training for Data-Efficient and Generalizable Robotic Manipulation [113.13282853889818]
SimHumは、シミュレーションされたロボット行動と実世界の人間の観察から視覚的事前を同時に抽出するフレームワークである。
2つの相補的前提に基づき、実世界のタスクにおいて、データ効率と一般化可能なロボット操作を実現する。
論文 参考訳(メタデータ) (2026-01-27T09:41:28Z) - HumanLLM: Towards Personalized Understanding and Simulation of Human Nature [72.55730315685837]
HumanLLMは個人のパーソナライズされた理解とシミュレーションのために設計された基礎モデルである。
私たちはまず、Reddit、Twitter、Blogger、Amazonといったプラットフォーム上で、現実世界のユーザデータをキュレートした大規模なコーパスであるCognitive Genomeを構築しました。
次に、多様な学習タスクを定式化し、教師付き微調整を行い、モデルの幅広い個人化された人間の行動、思考、経験を予測する。
論文 参考訳(メタデータ) (2026-01-22T09:27:27Z) - TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona Simulation [55.55404595177229]
大型言語モデル(LLM)は、人間のような能力を示す。
TwinVoiceは、さまざまな現実世界のコンテキストにわたるペルソナシミュレーションを評価するためのベンチマークである。
論文 参考訳(メタデータ) (2025-10-29T14:00:42Z) - SimBench: Benchmarking the Ability of Large Language Models to Simulate Human Behaviors [58.87134689752605]
我々は,LLMシミュレーションの堅牢で再現可能な科学のための,最初の大規模標準ベンチマークであるSimBenchを紹介する。
現在、最高のLLMでさえシミュレーション能力が限られ(スコア: 40.80/100)、性能はモデルサイズと対数的にスケールする。
シミュレーション能力は、深い知識集約的推論と最も強く相関していることを示す。
論文 参考訳(メタデータ) (2025-10-20T13:14:38Z) - YuLan-OneSim: Towards the Next Generation of Social Simulator with Large Language Models [50.35333054932747]
本稿では,YuLan-OneSimというソーシャルシミュレータを紹介する。
ユーザは、シミュレータとの自然言語インタラクションを通じて、シミュレーションシナリオを記述し、洗練することができます。
我々は、経済学、社会学、政治、心理学、組織、人口統計学、法律、コミュニケーションを含む8つの領域にまたがる50のデフォルトシミュレーションシナリオを実装した。
論文 参考訳(メタデータ) (2025-05-12T14:05:17Z) - VicSim: Enhancing Victim Simulation with Emotional and Linguistic Fidelity [5.103173705069556]
VicSimはユーザシミュレーションの3つの重要な側面(情報忠実性、感情力学、言語スタイル)に対処する新しいモデルである。
我々の敵対的訓練アプローチは、識別者に対して、文法と感情の手がかりを、合成内容の信頼性のある指標として認識するように教える。
論文 参考訳(メタデータ) (2025-01-06T17:01:45Z) - Agentic Society: Merging skeleton from real world and texture from Large Language Model [4.740886789811429]
本稿では,人口統計データと大規模言語モデルを利用して仮想人口を生成する新しい枠組みについて検討する。
本手法は,社会科学実験において,多様な人間の行動のシミュレーションに不可欠な多様性のあるペルソナを生産することを示す。
しかし, 評価結果から, 現在のLSMの能力に限界があるため, 統計的真理性の弱い兆候しか得られないことが示唆された。
論文 参考訳(メタデータ) (2024-09-02T08:28:19Z) - Human Choice Prediction in Language-based Persuasion Games: Simulation-based Off-Policy Evaluation [20.520648062905433]
我々は,言語に基づく説得ゲームに焦点を合わせ,専門家が言論的なメッセージを通じて意思決定者に影響を与えることを目標としている。
OPEフレームワークでは,1組の専門家エージェントとの遭遇から収集した人間のインタラクションデータに基づいて,予測モデルを訓練する。
専用アプリケーションを用いて,人間による87Kの意思決定データセットを収集した。
論文 参考訳(メタデータ) (2023-05-17T16:38:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。