論文の概要: LightMem-Ego: Your AI Memory for Everyday Life
- arxiv url: http://arxiv.org/abs/2607.11487v1
- Date: Mon, 13 Jul 2026 12:40:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.466396
- Title: LightMem-Ego: Your AI Memory for Everyday Life
- Title(参考訳): LightMem-Ego: 毎日のAIメモリ
- Authors: Yijun Chen, Boyi Xiao, Yixian Zhao, Haoting Xia, Buqiang Xu, Jizhan Fang, Yanya Li, Yaqi Zheng, Xuehai Wang, Zirui Xue, Liuxin Zhang, Hui Li, Ningyu Zhang,
- Abstract要約: 日常生活支援のための軽量ストリーミングマルチモーダルメモリシステムLightMem-Egoについて紹介する。
このシステムは、エゴセントリックなビジュアルストリームとオーディオストリームを継続的にキャプチャし、共有されたタイムラインにアライメントし、それらを階層的なメモリに整理する。
ユーザクエリが与えられた場合、LightMem-Egoは検索を適切なメモリレベルに動的にルーティングし、マルチモーダルなエビデンスに基づく回答を生成する。
- 参考スコア(独自算出の注目度): 15.591017916133309
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Personal AI assistants on mobile and wearable devices continuously perceive users' daily lives through visual and audio streams. However, answering queries about past experiences requires lightweight multimodal memory that can continuously accumulate, organize, and retrieve long-term experiences, which remains challenging. To address this challenge, we present LightMem-Ego, a lightweight streaming multimodal memory system for everyday-life assistance. The system continuously captures egocentric visual and audio streams, aligns them on a shared timeline, and organizes them into a hierarchical memory consisting of current, short-term, and long-term memory. Given a user query, LightMem-Ego dynamically routes retrieval to the appropriate memory level and generates answers grounded in multimodal evidence. The demonstration can be deployed on smartphones and AI glasses, supporting object finding, conversation recall, life summarization, routine discovery, and personalized assistance. Code is available at https://github.com/zjunlp/LightMem-Ego.
- Abstract(参考訳): モバイルおよびウェアラブルデバイス上のパーソナルAIアシスタントは、視覚的およびオーディオストリームを通じて、ユーザの日常生活を継続的に知覚する。
しかし、過去の経験に関する質問に答えるには、継続的に蓄積し、整理し、回収できる軽量なマルチモーダルメモリが必要である。
この課題に対処するため,日常支援のための軽量ストリーミングマルチモーダルメモリシステムLightMem-Egoを提案する。
このシステムは、エゴセントリックなビジュアルストリームとオーディオストリームを継続的にキャプチャし、共有されたタイムラインにアライメントし、それらを現在の、短期、長期のメモリからなる階層的なメモリに整理する。
ユーザクエリが与えられた場合、LightMem-Egoは検索を適切なメモリレベルに動的にルーティングし、マルチモーダルなエビデンスに基づく回答を生成する。
デモはスマートフォンやAIメガネに展開でき、オブジェクトの検出、会話のリコール、人生の要約、日常的な発見、パーソナライズされた支援をサポートする。
コードはhttps://github.com/zjunlp/LightMem-Ego.comで入手できる。
関連論文リスト
- SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory [14.96864764261795]
SuperMemory-VQAは、実用的な長期記憶タスクでAIアシスタントを評価するデータセットである。
これには、同期RGBビデオ、音声の書き起こし、視線、IMU、SLAMトラジェクトリなど、AIメガネで記録された日常的な活動の52.9時間が含まれている。
対象と位置記憶,意図的リコール,視覚的シーンリコール,タイムライン再構築,会話記憶,コンテキスト内検索にまたがる4,853の質問応答対を構築した。
論文 参考訳(メタデータ) (2026-05-30T17:53:10Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - MEM: Multi-Scale Embodied Memory for Vision Language Action Models [73.3883864595845]
本稿では,マルチスケール・エンボダイドメモリ(MEM)について紹介する。
MEMはビデオベースの短水平メモリをビデオエンコーダで圧縮し、テキストベースの長水平メモリと組み合わせている。
MEMは、キッチンを掃除したり、チーズサンドイッチを焼いたりして、最大15分間のタスクをロボットが実行できるようにする。
論文 参考訳(メタデータ) (2026-03-04T00:03:02Z) - EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning [42.339841548168565]
大きな言語モデル(LLM)は、長期の対話エージェントとしてますますデプロイされているが、その限られたコンテキストウィンドウは、拡張された相互作用よりもコヒーレントな振舞いを維持するのが困難である。
本稿では,EverMemOSについて紹介する。EverMemOSは,計算メモリにエミュレートされたライフサイクルを実装した自己組織型メモリオペレーティングシステムである。
EverMemOSは、メモリ拡張推論タスクで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-01-05T14:39:43Z) - WorldMM: Dynamic Multimodal Memory Agent for Long Video Reasoning [66.24870234484668]
我々は,複数の相補的記憶から構築・取得する,新しいマルチモーダルメモリエージェント WorldMM を紹介する。
WorldMMは5つの長いビデオ質問回答ベンチマークで既存のベースラインを大幅に上回っている。
論文 参考訳(メタデータ) (2025-12-02T05:14:52Z) - LightMem: Lightweight and Efficient Memory-Augmented Generation [72.21680105265824]
我々は、メモリシステムの性能と効率のバランスをとるLightMemという新しいメモリシステムを紹介した。
人間の記憶のアトキンソン・シフリンモデルにインスパイアされたLightMemは、メモリを3つの相補的なステージにまとめる。
GPTとQwenのバックボーンを用いたLongMemEvalの実験では、LightMemは高いベースライン(最大10.9%のゲイン)を上回り、トークンの使用量を最大117倍に削減している。
論文 参考訳(メタデータ) (2025-10-21T17:58:17Z) - EgoTrigger: Toward Audio-Driven Image Capture for Human Memory Enhancement in All-Day Energy-Efficient Smart Glasses [9.926912962527958]
EgoTriggerはマイクからのオーディオキューを使用して、電力集約カメラを選択的に起動する。
EgoTriggerは、平均で54%のフレームを使用でき、両方の電力消費検知コンポーネントのエネルギーを大幅に節約できる。
我々は、このコンテキスト認識トリガー戦略が、エネルギー効率が高く、機能的なスマートグラスを一日中使えるようにするための有望な方向であると考えている。
論文 参考訳(メタデータ) (2025-08-03T20:51:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。