論文の概要: Have I Scene This Before? Spatially Grounded Conversational Memory for Complex Queries in Egocentric Assistants
- arxiv url: http://arxiv.org/abs/2610.05526v1
- Date: Sun, 04 Oct 2026 20:42:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-10 13:19:58.315397
- Title: Have I Scene This Before? Spatially Grounded Conversational Memory for Complex Queries in Egocentric Assistants
- Title(参考訳): 前にもこのシーンはあったか?エゴセントリックアシスタントにおける複雑なクエリのための空間的接地型会話記憶
- Abstract要約: 我々はこの課題を空間的基盤を持つ会話推論(SpaCR)として定式化する。
SpaCR: ユーザ統計事実とエビデンスを組み合わせた、クロスシーン、リコール指向、および反ファクト空間クエリ。
本研究では,3次元再構成とセグメンテーションを用いたオブジェクト中心の作業メモリである空間基底型会話メモリ(SpaC-MEM)を提案する。
- 参考スコア(独自算出の注目度): 19.48482438272428
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Egocentric assistants must connect what users say with what they see across long interaction histories. We formalize this challenge as Spatially grounded Conversational Reasoning (SpaCR): cross-scene, recall-oriented, and counterfactual spatial queries that combine user-stated facts with geometric evidence. Direct vision-language models incur high inference costs and context limits as histories grow, while keyframe selection and retrieval can omit objects or evidence needed for complete recall. We propose Spatially grounded Conversational Memory (SpaC-MEM), an object-centric working memory that uses 3D reconstruction and segmentation to ground conversational information in persistent physical objects. It compresses multimodal histories while preserving spatial evidence and allowing object-specific facts to be updated through dialogue. We also introduce Ego-SpaCR, a benchmark comprising 620 ScanNet video sessions augmented with 95 task-oriented conversations and 3,100 evaluation queries. SpaC-MEM achieves the highest overall answer accuracy among the evaluated methods and improves object recall while requiring substantially fewer reference input tokens than native-video baselines. Removing 3D spatial information substantially degrades performance, highlighting the importance of preserving spatial and conversational evidence together.
- Abstract(参考訳): エゴセントリックなアシスタントは、ユーザーの発言と長い対話履歴を繋げなければならない。
我々は,この課題を空間的根拠を持つ会話推論 (SpaCR) として定式化し,ユーザ定式事実と幾何学的証拠を組み合わせたクロスシーン,リコール指向,および反ファクト的空間クエリを提案する。
直接視覚言語モデルは、履歴が大きくなるにつれて高い推論コストとコンテキスト制限をもたらすが、キーフレームの選択と検索は、完全なリコールに必要なオブジェクトやエビデンスを省略することができる。
本研究では,3次元再構成とセグメンテーションを用いたオブジェクト中心の作業メモリである空間基底型会話メモリ(SpaC-MEM)を提案する。
空間的証拠を保持しながらマルチモーダル履歴を圧縮し、対話を通じてオブジェクト固有の事実を更新する。
Ego-SpaCRは620のScanNetビデオセッションを95のタスク指向の会話と3100の評価クエリで拡張したベンチマークである。
SpaC-MEMは評価手法の中で最も高い回答精度を達成し、ネイティブビデオベースラインよりもはるかに少ない参照入力トークンを必要としながらオブジェクトリコールを改善する。
3次元空間情報の除去は性能を著しく低下させ、空間的証拠と会話的証拠を一緒に保存することの重要性を強調している。
関連論文リスト
- Remember by Asking: Retrieval-Induced Memory Evolution for LLM Agents [10.809831681526058]
RIMEは、メモリ構造をモノリシック圧縮からエビデンス中心の統合に移行する、検索誘起メモリフレームワークである。
推論時には、圧縮されたメモリが唯一の証拠源というよりは、プライマリとして機能する。
Qwen3-235B-A22B と GPT-5.6 Sol による LoCoMo の実験は、RIME が常に最高の性能を達成することを示した。
論文 参考訳(メタデータ) (2026-09-28T06:57:46Z) - PRAGMA: Evaluating Personalized Guidance with Memory Alignment in Lifelong Conversations [21.191446906833303]
大規模言語モデル(LLM)は、長期にわたってユーザと対話するパーソナライズされたアシスタントとして、ますます多くデプロイされている。
会話が長くなるにつれて、完全なインタラクション履歴に依存することが、ますます非効率になり、信頼できなくなる。
本稿では、長期会話におけるパーソナライズされたガイダンスを評価するためのベンチマークであるPRAGMAを紹介する。
論文 参考訳(メタデータ) (2026-09-09T03:31:47Z) - Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering [93.80043825360514]
EQA(Embodied Question answering)は、伝統的にエピソードの定式化の下で評価され、エージェントは各タスクを独立して解決し、エピソード間の内部状態をリセットする。
EQAエージェントを逐次評価する際に異なるメモリアーキテクチャがどのように振る舞うかを検討する。
既存のメモリを単純に保存することは、しばしば不十分である。
連続したシーン表現の視覚的意味的証拠を3次元幾何学にマッピングするアーキテクチャについて, 構造的, 空間的基盤的記憶の必要性を強調した。
論文 参考訳(メタデータ) (2026-07-23T17:50:45Z) - OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping [69.48762031013514]
OmniView-Spaceはマルチモーダルなエゴセントリックなエビデンスを通じて空間の一貫性を維持するために設計されたフレームワークである。
提案手法は, マルチパースペクティブ空間マッピング (MPSM) の3つのコアコンポーネントから構成される。(1) 幾何をクエリ整列型視覚認知マップとテキスト空間グラフに再構成する手法,(2) クエリによって要求されるエゴアンカーを積極的に選択し,対応するMPSM証拠を要求するためのインターリーブドポリシー,(3) MPSM生成トラジェクトリとエゴフレーム報酬を用いてモデルを自己生成認知マップで推論する認知マップ蒸留である。
論文 参考訳(メタデータ) (2026-07-01T12:45:12Z) - SuperMemory-VQA: An Egocentric Visual Question-Answering Benchmark for Long-Horizon Memory [14.96864764261795]
SuperMemory-VQAは、実用的な長期記憶タスクでAIアシスタントを評価するデータセットである。
これには、同期RGBビデオ、音声の書き起こし、視線、IMU、SLAMトラジェクトリなど、AIメガネで記録された日常的な活動の52.9時間が含まれている。
対象と位置記憶,意図的リコール,視覚的シーンリコール,タイムライン再構築,会話記憶,コンテキスト内検索にまたがる4,853の質問応答対を構築した。
論文 参考訳(メタデータ) (2026-05-30T17:53:10Z) - Rethinking How to Remember: Beyond Atomic Facts in Lifelong LLM Agent Memory [88.81430082035617]
LLMエージェントは、蓄積された対話履歴を忠実に保存し、効率的に検索し、深く推論できるメモリシステムを必要とする。
本稿では,ソース識別子に固定された生の対話セグメントを含む3つの共存表現の粒度を格納するTriMemを提案する。
論文 参考訳(メタデータ) (2026-05-19T15:05:06Z) - EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding [89.26501160264199]
EgoMemReasonは、メモリ駆動推論を通じて、1週間のエゴセントリックなビデオ理解を体系的に評価する。
EgoMemReasonには3つのメモリタイプと6つのコア課題に関する500の質問が含まれている。
EgoMemReasonをMLLMとエージェントフレームワークにまたがる17の手法で評価する。
論文 参考訳(メタデータ) (2026-05-11T01:59:59Z) - APEX-MEM: Agentic Semi-Structured Memory with Temporal Reasoning for Long-Term Conversational AI [8.933188286750795]
APEX-MEMは3つの重要なイノベーションを組み合わせた対話型メモリシステムである。
プロパティグラフは、エンティティ中心のフレームワークで時間的に基盤付けられたイベントとして会話を構成する。
検索エージェントは、クエリ時に競合や進化する情報を理解し、解決し、コンパクトでコンテキストに関連のあるメモリサマリを生成する。
論文 参考訳(メタデータ) (2026-04-15T19:25:02Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents [52.567469286881426]
本稿では,対話型ゲームによるエージェントの長期記憶評価のためのプログラムベンチマークEMemBenchを紹介する。
固定された質問セットを使う代わりに、EMemBenchは各エージェント自身の軌道から質問を生成する。
各テンプレートは、下層のゲーム信号から検証済みの真理を計算する。
論文 参考訳(メタデータ) (2026-01-23T12:09:59Z) - Introducing MeMo: A Multimodal Dataset for Memory Modelling in Multiparty Conversations [1.8896253910986929]
MeMo Corpusは参加者のメモリ保持レポートに注釈を付けた最初のデータセットである。
検証された振る舞いと知覚の計測、オーディオ、ビデオ、マルチモーダルアノテーションを統合する。
本稿では,知的システム開発のための対話型メモリモデリングにおける今後の研究の道を開くことを目的とする。
論文 参考訳(メタデータ) (2024-09-07T16:09:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。