論文の概要: RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations
- arxiv url: http://arxiv.org/abs/2610.01780v2
- Date: Fri, 02 Oct 2026 20:03:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-07 04:43:28.523559
- Title: RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations
- Title(参考訳): RealCompanion: 時間的リアルタイム会話に対する推論から人間の理解をベンチマークする
- Abstract要約: われわれはRealCompanionをリリースし、最大120日間で27,218のメッセージを送っている。
各人について、完全な会話、プロファイル、ペルソナ、チャットテスト項目、質問テスト項目を公開します。
すべてのラベルは、それをサポートするメッセージを指し、すべてのチャットラベルには、それを生成した理由が伴う。
- 参考スコア(独自算出の注目度): 6.081688469107579
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: An AI companion that talks with someone for months should come to understand them. It should know who they are, remember what they said, and recognize when something from the past matters now. Testing this needs real conversations, but real conversations are private, so existing benchmarks use invented people and invented questions. We release RealCompanion, ten real relationships between people and an AI companion, with 27,218 messages over up to 120 days. For each person, we release the full conversation, a profile, a persona, chat test items, and question test items. Every label points to the messages that support it, and every chat label comes with the reasoning that produced it. The real data shows three things. First, people rarely refer back. Only 3.4% of their messages depend on something said earlier, and when one does, the earlier message is usually far away (a median of 2,157 messages back). Averages hide this. Looking at the most recent messages finds the needed one 95.9% of the time overall, but only 2.2% of the time when it is far back. Second, AI systems cannot tell when the past matters. The detectors we tested barely beat chance on real messages, and when the same earlier messages are labeled "memories" instead of "earlier messages", models bring up the past 10 to 14 percentage points more often, even when nothing from the past is needed. Third, AI systems read more into a person than the person revealed. Three agent systems rebuild each persona equally well (F1 0.71). They see the person, and then imagine more. Understanding a person depends on knowing when their past matters and where what they shared ends, and only real conversations can test it.
- Abstract(参考訳): 数ヶ月間誰かと話をするAIコンパニオンが、それらを理解するようになるはずだ。
彼らが誰であるかを知り、彼らが言ったことを思い出し、過去の何かが現在重要になっていることを認識すべきである。
これをテストするには本当の会話が必要ですが、実際の会話はプライベートです。
われわれはRealCompanionをリリースし、最大120日間で27,218のメッセージを送っている。
各人について、完全な会話、プロファイル、ペルソナ、チャットテスト項目、質問テスト項目を公開します。
すべてのラベルは、それをサポートするメッセージを指し、すべてのチャットラベルには、それを生成した理由が伴う。
実際のデータは3つだ。
まず、人々はめったに言及しない。
メッセージのわずか3.4%は前述したものに依存しており、その場合、前のメッセージは通常遠く離れている(中央値は2,157メッセージバック)。
平均するとこれを隠す。
最新のメッセージを見ると、全体の95.9%の時間を必要とするが、そのわずか2.2%しか遡っていない。
第二に、AIシステムは過去がいつ重要かを知ることができない。
私たちがテストした検出器は、実際のメッセージでほとんどチャンスを得られず、同じ前のメッセージが"アーリーメッセージ"ではなく"メモリ"とラベル付けられている場合、モデルでは過去から何も必要とされない場合でも、過去10~14ポイントの頻度が上昇します。
第3に、AIシステムは明らかにされた人よりも多くの人に読み込まれている。
3つのエージェントシステムが各ペルソナを等しく再構築する(F1 0.71)。
彼らはその人を見て、さらに想像する。
人を理解することは、過去がいつ重要か、どこで何が共有されたかを知ることに依存し、実際の会話だけがそれをテストできる。
関連論文リスト
- DolphinBench: Mapping the Pareto Frontier of Agent Memory [3.058685580689604]
DolphinBenchは、エージェントのタスク完了を通じてメモリを直接評価するベンチマークである。
DolphinBenchには3つのナレッジワークペルソナがあり、ペルソナ当たりのユーザメッセージのトークンは約500kである。
我々は、エージェントを関連する履歴を持っていなくても実行し、それで成功し、それなしで失敗することで、ペルソナ当たり200のタスクを検証します。
論文 参考訳(メタデータ) (2026-09-21T17:54:35Z) - VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction [92.2925193726566]
VoiceMemは、並列情報脳、感情的右脳、ストリーミングメモリI/O機構を備えたメモリアーキテクチャである。
実験と実世界の展開には3つの利点がある。
論文 参考訳(メタデータ) (2026-08-26T16:50:05Z) - Keep It InMind: Benchmarking the Implicit-Association Blind Spot in Agent Memory [32.094723684433895]
長期記憶システムは、ユーザが外部ストアで言ったことを格納し、関連するクエリが到着したときにそれを検索する。
このインターフェースは、非常に自然な仮定に基づいており、滅多に述べられません:必要なメモリは、それを必要とするクエリに似ているでしょう。
この障害モードを暗黙の連想盲点と呼び、10つの生命ドメインにまたがるベンチマークであるInMindを紹介します。
論文 参考訳(メタデータ) (2026-07-27T12:42:12Z) - Inferential Privacy Leakage in Anonymized Conversational AI Logs [3.075317043745676]
グローバル・サウス4カ国1000人以上のコーパス上で、ChatGPT会話のプライバシー関連の特徴を2つ測定した。
34.5%のユーザーメッセージは、20の分類にまたがる個人情報を含み、中央のユーザーは会話履歴の最初の14%でコンテンツを識別する。
オフシェルフ大言語モデルは、各ユーザの年齢、性別、国をそれぞれ0.84、0.90、0.88の重み付きF1で復元し、会話履歴の最初の5%から中央値のユーザが識別する。
論文 参考訳(メタデータ) (2026-05-22T16:22:14Z) - The Algorithmic Self-Portrait: Deconstructing Memory in ChatGPT [17.579565226391146]
実世界の80人のChatGPTユーザの2,050個のメモリエントリを分析した。
私たちのデータセットの96%のメモリは、会話システムによって一方的に生成されます。
大部分のメモリ(84%)は、ユーザコンテキストで直接ベースになっています。
論文 参考訳(メタデータ) (2026-02-01T21:39:36Z) - OP-Bench: Benchmarking Over-Personalization for Memory-Augmented Personalized Conversational Agents [55.27061195244624]
オーバーパーソナライゼーションを3つのタイプに分類する。
エージェントは不要な場合でも、ユーザメモリを取得およびオーバーアタッチする傾向があります。
我々の研究は、メモリ拡張対話システムにおいて、より制御可能で適切なパーソナライズに向けた最初の一歩を踏み出した。
論文 参考訳(メタデータ) (2026-01-20T08:27:13Z) - PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory [56.81126490418336]
パーソナライゼーションは、AI能力とアライメントの進歩における次のマイルストーンの1つだ。
PersonaMem-v2は300以上のシナリオ、20,000以上のユーザの好み、128kのコンテキストウィンドウで、1,000の現実的なユーザ-チャットボットインタラクションをシミュレートする。
我々はQwen3-4BをトレーニングしてGPT-5を上回り、暗黙のパーソナライゼーションにおいて53%の精度を達成した。
論文 参考訳(メタデータ) (2025-12-07T06:48:23Z) - REALTALK: A 21-Day Real-World Dataset for Long-Term Conversation [51.97224538045096]
本稿では、21日間のメッセージアプリ対話のコーパスであるREALTALKを紹介する。
EI属性とペルソナの整合性を比較し,現実世界の対話による課題を理解する。
その結果,モデルでは対話履歴のみからユーザをシミュレートすることが困難であり,特定のユーザチャットの微調整はペルソナのエミュレーションを改善することがわかった。
論文 参考訳(メタデータ) (2025-02-18T20:29:01Z) - X-TURING: Towards an Enhanced and Efficient Turing Test for Long-Term Dialogue Agents [56.64615470513102]
チューリングテストは、自然言語の会話においてAIが人間のような振る舞いを示すかどうかを調べる。
従来の設定では、各参加者は一度に1つのメッセージに制限される。
本稿では,textitburstダイアログパターンを用いて,元のテストを強化するtextbftextscX-Turingを提案する。
論文 参考訳(メタデータ) (2024-08-19T09:57:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。