論文の概要: ICM-Bench: Person-Level Identity Reasoning in Multimodal Agents with Long-Term Memory
- arxiv url: http://arxiv.org/abs/2609.04438v2
- Date: Tue, 08 Sep 2026 00:10:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 14:43:41.963889
- Title: ICM-Bench: Person-Level Identity Reasoning in Multimodal Agents with Long-Term Memory
- Title(参考訳): ICM-Bench:長期記憶を持つマルチモーダルエージェントにおける個人レベルアイデンティティ推論
- Authors: Shidu Ren, Yunze Liu, Xing Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen,
- Abstract要約: ICM-Bench(Identity-Centric Memory Benchmark, ICM-Bench)は、マルチモーダルエージェントにおける長いビデオメモリに対するアイデンティティ中心の推論を評価するために設計された最初のベンチマークである。
このベンチマークには、141分にわたる839の合成クリップと、1年間のアルバムに収録された6人の成人に関する1217のオープンエンド質問が含まれている。
Gemini 3.1 Proの総合精度は74.0%であるが、長期的なアイデンティティプロファイルを必要とする質問では60.3%に低下している。
- 参考スコア(独自算出の注目度): 12.191829926730472
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Long-horizon multimodal agents should remember not only what happened but also who participated. This capability depends on linking recurring faces, voices, names, person-associated objects, events, and social relations to consistent identities over time. Existing long-video and multimodal-agent benchmarks measure broad memory question answering, but they do not isolate the ability to maintain recurring person identities and reason over their cross-time relations. We introduce ICM-Bench (Identity-Centric Memory Benchmark), which, to the best of our knowledge, is the first benchmark specifically designed to evaluate identity-centric reasoning over long video memories in multimodal agents. The benchmark contains 839 synthetic clips spanning 141 minutes and 1,217 open-ended questions about six recurring adults in a one-year life album. A theme-configurable pipeline generates the video collection and associates each question with its target identities and traceable supporting evidence. We compare direct caption-memory baselines, memory-augmented agents, and graph-retrieval systems. Gemini 3.1 Pro achieves the highest overall accuracy of 74.0%, yet its score falls to 60.3% on questions that require long-term identity profiles. The results show that current systems recover many event-level memories but remain less reliable when evidence must be accumulated around a stable person.
- Abstract(参考訳): ロングホライゾンのマルチモーダルエージェントは、何が起こったかだけでなく、誰が参加したかも記憶すべきである。
この能力は、繰り返し発生する顔、声、名前、人に関連する物、出来事、社会的関係を時間とともに一貫したアイデンティティに結びつけることに依存する。
既存の長ビデオおよびマルチモーダルエージェントのベンチマークは、幅広いメモリ質問応答を計測するが、それらは、反復する人物のアイデンティティと、それらの時間的関係に対する理性を維持する能力の分離はしない。
ICM-Bench (Identity-Centric Memory Benchmark) は,マルチモーダルエージェントにおける長大なビデオメモリに対するアイデンティティ中心の推論を評価するために設計された,最初のベンチマークである。
このベンチマークには、141分にわたる839の合成クリップと、1年間のアルバムに収録された6人の成人に関する1217のオープンエンド質問が含まれている。
テーマ設定可能なパイプラインは、ビデオコレクションを生成し、各質問を対象のアイデンティティと関連付け、追跡可能な支持証拠を生成する。
直接キャプション-メモリベースライン,メモリ拡張エージェント,グラフ検索システムを比較した。
Gemini 3.1 Proの総合精度は74.0%であるが、長期的なアイデンティティプロファイルを必要とする質問では60.3%に低下している。
その結果、現在のシステムは、多くの事象レベルの記憶を回復するが、安定した人物の周囲に証拠を蓄積しなければならない場合、信頼性は低いことが判明した。
関連論文リスト
- ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding [11.461394531496397]
ViSAGEは、自己修正、エンティティ中心のメモリを構築するマルチモーダルなエージェントメモリフレームワークである。
これは、遅延したアイデンティティの証拠を伝播させ、過去の記録を遡って統一し、将来の推論を改善するために、双方向のメモリリファインメントを適用している。
その結果、ViSAGEは最強のベースラインを一貫して上回り、精度は5.9%向上した。
論文 参考訳(メタデータ) (2026-07-29T10:25:23Z) - WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction [72.1620416874118]
マルチモーダルな言語モデルは、長距離エージェントとしてますます多くデプロイされている。
既存のベンチマークは、静的対話上のリコールを測定し、メモリを1つのタスクの精度に分解し、キャプションに対する視覚的な観察を減らす。
マルチモーダルエージェントメモリを,観測可能な4段階ライフサイクルを持つアクションワールドインタラクションループとして定式化する。
論文 参考訳(メタデータ) (2026-05-28T04:27:20Z) - MINTEval: Evaluating Memory under Multi-Target Interference in Long-Horizon Agent Systems [69.06764269022925]
本研究では,現在の記憶増強剤が現実的,干渉重大,長期的設定において果たす役割について検討する。
MINTEvalは、頻繁に更新される情報を備えた、長く高度に相互接続されたコンテキストを特徴とするベンチマークである。
MINTEvalは128.8kのトークンを平均で1インスタンスあたり1.8Mのトークンに拡張し、15.6kの質問応答ペアを持つ。
論文 参考訳(メタデータ) (2026-05-18T15:43:35Z) - MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models [50.25006399944962]
メモリは、長いマルチモーダル相互作用を扱うために、大きな視覚言語モデルにとって不可欠である。
MEMLENSはマルチモーダルマルチセッション会話におけるメモリのベンチマークである。
我々は27個のLVLMと7個のメモリ増強剤を評価した。
論文 参考訳(メタデータ) (2026-05-14T14:41:17Z) - EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding [89.26501160264199]
EgoMemReasonは、メモリ駆動推論を通じて、1週間のエゴセントリックなビデオ理解を体系的に評価する。
EgoMemReasonには3つのメモリタイプと6つのコア課題に関する500の質問が含まれている。
EgoMemReasonをMLLMとエージェントフレームワークにまたがる17の手法で評価する。
論文 参考訳(メタデータ) (2026-05-11T01:59:59Z) - AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents [49.63422082885992]
長軸対話エージェントのための適応型ユーザ中心メモリフレームワークであるAdaMemを提案する。
AdaMemは対話履歴をワーキング、エピソディック、ペルソナ、グラフメモリに整理する。
LoCoMo と PERSONAMEM ベンチマーク上での AdaMem の評価を行った。
論文 参考訳(メタデータ) (2026-03-17T13:22:54Z) - EverMemBench: Benchmarking Long-Term Interactive Memory in Large Language Models [16.865998112859604]
EverMemBenchは、100万以上のトークンにまたがる多人数のマルチグループ会話を特徴とするベンチマークである。
EverMemBenchは、1000以上のQAペアを通じて3次元にわたるメモリシステムを評価する。
論文 参考訳(メタデータ) (2026-02-01T16:13:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。