論文の概要: SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data
- arxiv url: http://arxiv.org/abs/2607.19949v3
- Date: Thu, 30 Jul 2026 13:38:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 12:52:12.241858
- Title: SenWorld: A Digital-Twin Simulation for Generating Context-Rich Evaluation Data
- Title(参考訳): SenWorld:コンテキストリッチ評価データを生成するディジタルツインシミュレーション
- Authors: Zenghui Zhou, Xiaoyang Li, Xiaoxuan Qiao, Zhilang Wei, Tianming Lei,
- Abstract要約: 本稿では, 物理的に定式化された, 決定論的, イベントソースのディジタルツインシミュレーションについて述べる。
SenWorldでは、ペルソナは実際の地図、天気、休日、ネットワークデータから構築された世界で一日中生活している。
717の評価ケースにプロジェクションされ、生成されたデータは、製品用スマートフォンアシスタントの78の障害を露呈する。
- 参考スコア(独自算出の注目度): 3.120684802193635
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Smartphone personal assistants reason over longitudinal personal data, yet evaluating them requires context-rich evaluation data whose correct answers are known, and real device traces are too privacy-sensitive to share. To address this challenge, we present SenWorld, a physically grounded, deterministic, event-sourced digital-twin simulation that generates such data with ground truth fixed by construction. In SenWorld, personas live through a full day in a world built from real map, weather, holiday, and network data; every observable signal is archived in full-system snapshots; and each evaluation case is labeled by a pointer to an existing record rather than by post-hoc annotation or a large language model (LLM) judge. We evaluate this method with 16 personas in Beijing. The generated data closely matches the held-out real-user benchmark in category distribution (Jensen--Shannon divergence (JSD) 0.070) and in the daily rhythm of communication records (JSD below 0.1), though generated records remain shorter than real ones. Without scripted interaction, personas form a fully reciprocated dialogue subgraph and differentiated behavioral repertoires. Projected into 717 evaluation cases, the generated data exposes 78 failures in a production smartphone assistant, concentrating on call and Short Message Service (SMS) records while contacts, schedules, and alarms never fail. The snapshot pointer confirms each failure as an assistant-side retrieval error, with no LLM judge involved. Overall, SenWorld offers a privacy-safe, reproducible, and distribution-checked path to evaluation data whose labels are fixed by construction.
- Abstract(参考訳): スマートフォンのパーソナルアシスタントは、縦方向の個人データを判断するが、それらを評価するには、正しい回答が分かっている文脈に富んだ評価データが必要であり、実際のデバイスのトレースは、共有するにはプライバシーに敏感すぎる。
この課題に対処するために、建設によって固定された真理でそのようなデータを生成する、物理的に基底的、決定論的、イベントソースのデジタルツインシミュレーションであるSenWorldを提案する。
SenWorldでは、ペルソナは実際の地図、天気、ホリデー、ネットワークデータから構築された世界で一日中生活し、すべての観測可能な信号はフルシステムスナップショットにアーカイブされ、各評価ケースは、ポストホックアノテーションや大きな言語モデル(LLM)の判断ではなく、既存のレコードへのポインタによってラベル付けされる。
北京の16人を対象に,この手法を評価した。
生成したデータは,カテゴリー分布(Jensen-Shannon divergence (JSD) 0.070) および通信記録の日リズム(JSD 0.1 以下)において保持される実ユーザベンチマークと密接に一致しているが,生成したレコードは実データよりも短いままである。
スクリプトによる相互作用がなければ、ペルソナは完全に相互に交わされた対話のサブグラフを形成し、行動レパートリーを区別する。
717の評価ケースにプロジェクションされ、生成されたデータは、電話やショートメッセージサービス(SMS)レコードに集中し、連絡先、スケジュール、アラームは決して失敗しない。
スナップショットポインタは、それぞれの障害をアシスタント側検索エラーとして確認する。
全体として、SenWorldは、ラベルが構築によって修正されたデータを評価するために、プライバシセーフで再現性があり、配布チェックされたパスを提供する。
関連論文リスト
- RealDESED: A Real-World Domestic Sound Event Detection Benchmark [41.94606140754546]
RealDESED (RealDESED) は、652人の参加者が自宅で収集した5,710の音声録音からなる実世界の家庭内音響イベント検出(SED)ベンチマークである。
各録音は15秒から35秒間の長さで、15の一般的な家庭音の授業のための時間的に正確なアノテーションを含んでいる。
論文 参考訳(メタデータ) (2026-07-18T09:50:21Z) - HumanLM: Simulating Users with State Alignment Beats Response Imitation [84.89761487596844]
本稿では,実際のユーザを正確に反映したユーザシミュレータを構築する新しいトレーニングフレームワークHumanLMを提案する。
HumanLMは、強化学習を通じて、地道的な応答に一致した自然言語の潜伏状態を生成する。
本研究では,公開データに基づく実ユーザシミュレーションのための総合的なベンチマークであるHumanualを開発する。
論文 参考訳(メタデータ) (2026-02-07T20:26:28Z) - Telling Human and Machine Handwriting Apart [7.418311309442571]
手書き動作は、実際のユーザがデバイスやアプリケーションを操作しているかどうかを確認するために、行動バイオメトリクスのユニークな形式として活用することができる。
このタスクは、コンピュータが人間または人工的に入力インスタンスが生成されたかどうかを検知しなければならない逆チューリングテストとしてフレーム化することができる。
浅いリカレントニューラルネットワークをトレーニングして、優れたパフォーマンス(ROC曲線(AUC)スコアで98.3%、すべてのシンセサイザーとデータセットの平均で1.4パーセントのエラー率を実現しています。
論文 参考訳(メタデータ) (2026-01-16T18:45:16Z) - Cyber-Resilient System Identification for Power Grid through Bayesian Integration [49.3054872760439]
電力網は、ますます進化し続けるサイバー脅威の状況下で、リアルタイムな状況認識を必要としている。
この研究は、スナップショットベースの手法とベイジアン統合による時系列モデルを組み合わせたシステム識別を進歩させる。
論文 参考訳(メタデータ) (2025-10-15T19:32:09Z) - Benchmarking Fraud Detectors on Private Graph Data [70.4654745317714]
現在、多くの種類の不正は、グラフ上で動く自動検出アルゴリズムによって部分的に管理されている。
データ保有者が不正検知器の開発を第三者にアウトソースしようとするシナリオを考察する。
サードパーティは、不正検出をデータ保持者に送信し、これらのアルゴリズムをプライベートデータセットで評価し、その結果を公表する。
本システムに対する現実的なプライバシ攻撃を提案し,評価結果のみに基づいて個人データの匿名化を可能にする。
論文 参考訳(メタデータ) (2025-07-30T03:20:15Z) - DetReIDX: A Stress-Test Dataset for Real-World UAV-Based Person Recognition [9.318073879810077]
人物再識別(ReID)技術は、制御された地上レベルの条件下で比較的よく機能すると考えられている。
しかし、現実世界の設定に挑戦するときは壊れる。
本稿では,大規模な地上人物データセットであるDetReIDXを紹介する。
論文 参考訳(メタデータ) (2025-05-07T20:41:06Z) - Towards Realistic Evaluation of Commit Message Generation by Matching Online and Offline Settings [77.20838441870151]
オンラインメトリック - VCSに生成されたメッセージをコミットする前にユーザが導入する編集回数 - を使用して、オフライン実験用のメトリクスを選択します。
我々は,GPT-4が生成したコミットメッセージと,人間の専門家が編集したコミットメッセージからなる57対のデータセットを収集した。
以上の結果から,編集距離が最も高い相関性を示すのに対し,BLEUやMETEORなどの類似度は低い相関性を示すことがわかった。
論文 参考訳(メタデータ) (2024-10-15T20:32:07Z) - Demographic Parity: Mitigating Biases in Real-World Data [0.0]
分類ユーティリティを保ちながら不要なバイアスを除去することを保証する頑健な方法論を提案する。
我々のアプローチは、実世界のデータから導出することで、常にモデルに依存しない方法でこれを達成することができる。
論文 参考訳(メタデータ) (2023-09-27T11:47:05Z) - Not All Errors are Equal: Learning Text Generation Metrics using
Stratified Error Synthesis [79.18261352971284]
人間のアノテーションを必要とせずに、人間の判断と高い相関関係を持つモデルベースの計量であるSESCOREを紹介する。
既存の指標に対してSESCOREを評価し,そのスコアと人間の評価との関係を比較検討した。
SESCOREは、人間による注釈付きトレーニングデータを受け取らず、最高の教師付きメトリックCOMETに匹敵するパフォーマンスを達成している。
論文 参考訳(メタデータ) (2022-10-10T22:30:26Z) - Bridging the Gap Between Clean Data Training and Real-World Inference
for Spoken Language Understanding [76.89426311082927]
既存のモデルはクリーンデータに基づいてトレーニングされ、クリーンデータトレーニングと現実世界の推論の間にtextitgapが発生する。
本稿では,良質なサンプルと低品質のサンプルの両方が類似ベクトル空間に埋め込まれた領域適応法を提案する。
広く使用されているデータセット、スニップス、および大規模な社内データセット(1000万のトレーニング例)に関する実験では、この方法は実世界の(騒々しい)コーパスのベースラインモデルを上回るだけでなく、堅牢性、すなわち、騒々しい環境下で高品質の結果を生み出すことを実証しています。
論文 参考訳(メタデータ) (2021-04-13T17:54:33Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。