論文の概要: Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations
- arxiv url: http://arxiv.org/abs/2609.01257v1
- Date: Tue, 01 Sep 2026 13:51:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-02 16:31:36.700024
- Title: Measuring the Behavioral Fidelity of Long-Horizon Human Activity Simulations
- Title(参考訳): 長距離人間活動シミュレーションの行動忠実度の測定
- Authors: Yi Fei Cheng, Fan Yang, Iremsu Bas, Koichiro Niinuma, Narishige Abe, David Lindlbauer,
- Abstract要約: 本研究では,長距離活動シミュレーションにおける行動の忠実度を評価するための枠組みを提案する。
ケーススタディとして、43時間のオフィス活動のデータセットを収集する。
私たちは、行動の忠実度がメトリクス間で均一でないことに気付きました。
- 参考スコア(独自算出の注目度): 14.694276552510685
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: As LLM-based human simulators are increasingly used for policy, evaluation, and training, they must faithfully reproduce real behavioral patterns. While prior work has examined behavioral fidelity in survey responses and dialogue, longer-horizon real-world activity remains largely unexplored. We introduce a framework for evaluating behavioral fidelity in long-horizon activity simulations across temporal granularities and levels of analysis. As a case study, we collect a 43-hour multi-camera dataset of in-the-wild office activity and compare trace-derived conditioning mechanisms: persona descriptors, few-shot exemplars, and statistical transition and time-of-day priors. We find that behavioral fidelity is not uniform across metrics: statistical priors bring activity and sequence distributions closest to real behavior, yet over-fragment routines and suppress within-person variability. These findings motivate a more holistic evaluation that spans multiple metrics, temporal granularities, and levels of analysis.
- Abstract(参考訳): LLMベースの人体シミュレータは、政策、評価、訓練にますます利用されているため、実際の行動パターンを忠実に再現する必要がある。
先行研究は、調査回答と対話における行動の忠実さを調査してきたが、長期的な現実世界の活動はほとんど探索されていない。
本研究では,時間的粒度と解析レベルにまたがる長期水平活動シミュレーションにおける行動忠実度を評価するための枠組みを提案する。
ケーススタディでは、43時間のオフィス活動のマルチカメラデータセットを収集し、ペルソナ記述子、少数ショット例、統計遷移、日々の時間といったトレース由来の条件付けメカニズムを比較した。
統計的事前は、実際の行動に最も近い行動とシーケンス分布をもたらすが、オーバーフラグメントルーチンを持ち込み、個人内変動を抑制する。
これらの知見は、複数の指標、時間的粒度、分析レベルにまたがるより包括的な評価を動機付けている。
関連論文リスト
- Longitudinal Multimodal Sensing of Physical Activity and Well-Being in Older Adults [1.1744028458220426]
実環境下での高齢者66名を対象に, 縦断的マルチモーダル調査を行った。
検出信号と対象変数のアライメントが予測性能に与える影響について検討する。
論文 参考訳(メタデータ) (2026-05-29T20:34:50Z) - Measuring and Mitigating the Distributional Gap Between Real and Simulated User Behaviors [61.610957638373826]
本研究では,実際のユーザ行動とシミュレーションユーザ行動の分布ギャップを計測する手法を提案する。
実会話とシミュレーション会話のデータセットが与えられた場合,本手法は各会話からユーザ行動の表現を抽出する。
ほとんどのシミュレータも同様に振る舞うが、いくつかは独立している。
論文 参考訳(メタデータ) (2026-05-08T15:09:25Z) - From Brain Models to Executable Digital Twins: Execution Semantics and Neuro-Neuromorphic Systems [51.82266520875928]
この調査では、実行のレベルでアプローチを比較するための統一的な視点として、物理的に制約された実行可能性を紹介します。
本稿では,孤立オフラインモデルから協調シミュレーション,オンラインデータによるディジタル双生児の連続実行に至るまで,実行体制の分類について提案する。
実行可能性の概念は、なぜ正確性だけで不十分なのかを明確にし、セマンティック・インターオペラビリティ、ハイブリッド・タイムの正確性、評価プロトコル、スケーラブルな同化、安全なクローズドループ検証を中心にしたアジェンダを動機付けている。
論文 参考訳(メタデータ) (2026-04-15T07:34:46Z) - Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces [81.41397370235102]
我々はOmniBehaviorを紹介した。OmniBehaviorは実世界のデータから構築された最初のユーザシミュレーションベンチマークである。
現在のモデルでは,コンテキストウィンドウが拡大しても,複雑な振る舞いを正確にシミュレートすることが困難であることを示す。
この結果、個人差や長い尾の挙動が失われ、将来の高忠実度シミュレーション研究における重要な方向性が浮き彫りになる。
論文 参考訳(メタデータ) (2026-04-09T15:26:21Z) - Evaluating Few-Shot Temporal Reasoning of LLMs for Human Activity Prediction in Smart Environments [1.411614392022118]
既存のデータ駆動エージェントベースのモデルは、低データ環境において苦労する。
本稿では,人間の知識に基づいて事前学習された大規模言語モデルがこのギャップを埋めるかどうかを検討する。
論文 参考訳(メタデータ) (2026-01-20T20:58:17Z) - In-Context Linear Regression Demystified: Training Dynamics and Mechanistic Interpretability of Multi-Head Softmax Attention [52.159541540613915]
本研究では,マルチヘッド型ソフトマックスアテンションモデルを用いて,線形データを用いたコンテキスト内学習を行う方法について検討する。
この結果から,学習内容の学習能力は,そのアーキテクチャと基礎となるデータ分布の集約的効果として,訓練されたトランスフォーマーから出現することが明らかとなった。
論文 参考訳(メタデータ) (2025-03-17T02:00:49Z) - How Far are LLMs from Being Our Digital Twins? A Benchmark for Persona-Based Behavior Chain Simulation [30.713599131902566]
本稿では,デジタル双生児が連続した人間の行動をシミュレートする能力を評価する最初のベンチマークであるBehavimentChainを紹介する。
BehaviorChainは、多種多様で高品質なペルソナベースの行動連鎖で構成され、1,001のユニークなペルソナに対して15,846の異なる振る舞いがある。
総合的な評価結果は、最先端モデルでさえ、連続した人間の行動の正確なシミュレートに苦慮していることを示している。
論文 参考訳(メタデータ) (2025-02-20T15:29:32Z) - Stateful Offline Contextual Policy Evaluation and Learning [88.9134799076718]
我々は、シーケンシャルデータから、政治以外の評価と学習について研究する。
動的パーソナライズされた価格設定などの問題の因果構造を形式化する。
本報告では,本クラスにおけるアウト・オブ・サンプル・ポリシーの性能改善について述べる。
論文 参考訳(メタデータ) (2021-10-19T16:15:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。