VoiceMem: Streaming Dual-Brain Memory for Real-Time Interaction
Abstractの概要
VoiceMemは、事実を扱う「左脳」と感情・ペルソナを重視する「右脳」にメモリを分離し、ストリーミングメモリI/Oを通じて接続する、リアルタイム音声対話向けのメモリアーキテクチャです。左脳は小さなtop-kの制限内で検索を高密度に保つために創発的クラスタリングを伴うスキーマ・エンティティインデックスを用い、右脳は短期および長期のスパンにわたって持続的なペルソナ特性とエンティティに結びついた感情的態度をモデル化します。本論文ではさらに、メモリ認識型音声言語モデルの学習、ChatMem-400Kデータパイプライン、長期音声評価用のChatMem-Bench、交換可能なメモリバックエンドを備えた疎結合デプロイスタックなど、この設計を支える広範なインフラについても説明しています。全体として、本研究は音声アシスタントに求められる正確性、感情的パーソナライゼーション、および低遅延検索の統合を目指しています。
新規性
本論文の主な新規性は、メモリを単一のテキスト中心のストレージとして扱うのではなく、事実検索と感情・ペルソナのモデリングを明示的に分離した音声対話向けストリーミング二重脳メモリ設計にあります。また、このアーキテクチャを4段階の低遅延検索パイプライン、疎結合な上位層ルーティング・下位層エンジン設計、および新たな長期音声ベンチマークと学習パイプラインと組み合わせている点も独自性を持っています。
成果
テキストベンチマークにおいて、VoiceMemは事実メモリで平均76.39、ペルソナメモリで74.16のスコアを記録し、事実メモリでMem0バックエンドを上回り、最強のペルソナベースラインを1.89ポイント上回りました。ChatMem-Benchでは平均68.73を達成して14カテゴリ中11カテゴリで最高性能を示し、特にパラ言語および環境音メモリタスクで大幅な向上を達成しました。さらにLoCoMoでは430メモリトークンかつ134ミリ秒の検索遅延で91.2を記録し、上位層インデックスにより複数のバックエンドでスコアが15.76〜29.52ポイント向上しました。
論文の注目点
- VoiceMemは事実メモリと感情・ペルソナメモリを並行する「左脳」と「右脳」のコンポーネントに分離し、リアルタイム対話中に共同検索を行います。
- スキーマ・エンティティルーティング、創発的クラスタリング、および音声アシスタントの遅延制約を満たす4段階のストリーミング処理により、密なtop-5メモリアクセスを実現する検索設計を採用しています。
- メモリ認識型SLM学習、ChatMem-400K/ChatMem-Benchなどのシステムインフラおよび評価資産を提供し、テキスト、ペルソナ、長期音声メモリベンチマーク全体で性能向上を示しています。
参考リンク
- arXiv: https://arxiv.org/abs/2608.26005v1
- Fugu-MT: https://fugumt.com/fugumt/paper_check/2608.26005v1
- Hugging Face Papers: https://huggingface.co/papers/2608.26005
- Project: https://xzf-thu.github.io/VoiceMem/