論文の概要: PersonaVLM: Long-Term Personalized Multimodal LLMs
- arxiv url: http://arxiv.org/abs/2604.13074v1
- Date: Fri, 20 Mar 2026 17:59:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-19 19:09:11.660633
- Title: PersonaVLM: Long-Term Personalized Multimodal LLMs
- Title(参考訳): PersonaVLM: 長期パーソナライズされたマルチモーダルLLM
- Abstract要約: PersonaVLMは、長期的なパーソナライズのための革新的なパーソナライズされたマルチモーダルエージェントフレームワークである。
汎用MLLMを3つの重要な機能を統合することで、パーソナライズされたアシスタントに変換する。
長期的なインタラクションを通じてユーザの進化するパーソナリティを推測し、アウトプットがそれぞれのユニークな特徴と一致し続けることを保証します。
- 参考スコア(独自算出の注目度): 32.13357178547938
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multimodal Large Language Models (MLLMs) serve as daily assistants for millions. However, their ability to generate responses aligned with individual preferences remains limited. Prior approaches enable only static, single-turn personalization through input augmentation or output alignment, and thus fail to capture users' evolving preferences and personality over time (see Fig.1). In this paper, we introduce PersonaVLM, an innovative personalized multimodal agent framework designed for long-term personalization. It transforms a general-purpose MLLM into a personalized assistant by integrating three key capabilities: (a) Remembering: It proactively extracts and summarizes chronological multimodal memories from interactions, consolidating them into a personalized database. (b) Reasoning: It conducts multi-turn reasoning by retrieving and integrating relevant memories from the database. (c) Response Alignment: It infers the user's evolving personality throughout long-term interactions to ensure outputs remain aligned with their unique characteristics. For evaluation, we establish Persona-MME, a comprehensive benchmark comprising over 2,000 curated interaction cases, designed to assess long-term MLLM personalization across seven key aspects and 14 fine-grained tasks. Extensive experiments validate our method's effectiveness, improving the baseline by 22.4% (Persona-MME) and 9.8% (PERSONAMEM) under a 128k context, while outperforming GPT-4o by 5.2% and 2.0%, respectively. Project page: https://PersonaVLM.github.io.
- Abstract(参考訳): MLLM(Multimodal Large Language Models)は、数百万人のための日常的なアシスタントである。
しかし、個々の好みに合わせて反応を生成する能力は依然として限られている。
以前のアプローチでは、入力の増強や出力アライメントによる静的なシングルターンパーソナライズのみが可能であり、時間の経過とともにユーザの進化する好みやパーソナリティをキャプチャできない(図1参照)。
本稿では,PersonaVLMについて紹介する。PersonaVLMは,長期的なパーソナライズを目的とした,革新的なパーソナライズされたマルチモーダルエージェントフレームワークである。
汎用MLLMを3つの重要な機能を統合することで、パーソナライズされたアシスタントに変換する。
(a)対話から時系列的マルチモーダル記憶を積極的に抽出・要約し、それらをパーソナライズしたデータベースにまとめる。
(b)推論:データベースから関連する記憶を検索して統合することによりマルチターン推論を行う。
(c) 応答アライメント: 長期的なインタラクションを通じてユーザの進化するパーソナリティを推測し、アウトプットがそれぞれの特徴と一致し続けることを保証する。
評価のために,2000以上のキュレートされたインタラクションケースからなる総合的なベンチマークであるペルソナ・MMEを構築し,7つの重要な側面と14のきめ細かいタスクにわたる長期MLLMのパーソナライゼーションを評価する。
GPT-4o を5.2%, GPT-4o を0.2%, GPT-4o を5.2%, GPT-4o を5.2%, GPT-4 を22.4%, Persona-MME を9.8%, Persona-MME を9.8%, GPT-4o を5.2%, GPT-4o を0。
プロジェクトページ: https://PersonaVLM.github.io
関連論文リスト
- Synthetic Interaction Data for Scalable Personalization in Large Language Models [67.31884245564086]
本稿ではPersonaGymという高忠実な合成データ生成フレームワークを紹介する。
パーソナライゼーションを静的なペルソナ-参照ペアとして扱う以前の作業とは異なり、PersonaGymは動的な選好プロセスをモデル化する。
我々は,高忠実度マルチターンパーソナライズされたインタラクショントラジェクトリの大規模かつ高品質で多様な合成データセットであるPersonaAtlasをリリースする。
論文 参考訳(メタデータ) (2026-02-12T20:41:22Z) - Rethinking Personalization in Large Language Models at the Token Level [89.64259958702165]
パーソナライズは通常、ベースNLPタスクの上に追加レイヤとしてフレーム化される。
トークンレベルの観点からは、応答中の異なるトークンは、様々な程度にパーソナライズに寄与する。
本稿では,ユーザ固有の情報に対する各出力トークンの依存性を推定する自己コントラスト手法PerContrastを提案する。
論文 参考訳(メタデータ) (2026-02-04T16:05:02Z) - MMPB: It's Time for Multi-Modal Personalization [7.876682671110321]
パーソナライズにおける視覚言語モデル(VLM)を評価するための,最初の広範囲なベンチマークであるMMPBを紹介する。
MMPBは10kイメージクエリペアで構成されており、人間、動物、物体、キャラクターの4つのカテゴリにまたがる111のパーソナライズ可能な概念を含んでいる。
我々は,概念注入,マルチターン対話,パーソナライズクエリといった3段階のプロトコルを用いてパーソナライズ性能を評価する。
論文 参考訳(メタデータ) (2025-09-26T18:24:48Z) - A Personalized Conversational Benchmark: Towards Simulating Personalized Conversations [112.81207927088117]
PersonaConvBenchは、大規模言語モデル(LLM)とのマルチターン会話におけるパーソナライズされた推論と生成を評価するためのベンチマークである。
我々は,複数の商用およびオープンソース LLM を統一的なプロンプト設定でベンチマークし,パーソナライズされた履歴を組み込むことで大幅な性能向上が得られることを観察した。
論文 参考訳(メタデータ) (2025-05-20T09:13:22Z) - Know Me, Respond to Me: Benchmarking LLMs for Dynamic User Profiling and Personalized Responses at Scale [53.059480071818136]
大規模言語モデル(LLM)は、幅広いタスクでユーザのためのパーソナライズされたアシスタントとして登場した。
PERSONAMEMは180以上のユーザ-LLMインタラクション履歴を持つキュレートされたユーザプロファイルを備えている。
LLMチャットボットのユーザプロファイルの現在状況に応じて,最も適切な応答を識別する能力を評価する。
論文 参考訳(メタデータ) (2025-04-19T08:16:10Z) - RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models [53.304699445700926]
MLLMのパーソナライズのための検索強化パーソナライズフレームワークについて紹介する。
一般的なMLLMから始まり、3つのステップでパーソナライズされたアシスタントにします。
大規模データセットを事前トレーニングすることにより、RAP-MLLMは、追加の微調整なしで無限の視覚概念に一般化することができる。
論文 参考訳(メタデータ) (2024-10-17T09:10:26Z) - Aligning LLMs with Individual Preferences via Interaction [51.72200436159636]
調整可能な大きな言語モデル(LLM)をトレーニングします。
木構造における3K以上の多ターン会話を含む多ターン嗜好データセットを開発した。
評価のために、慎重に選択された100のサンプルと、会話中にカスタマイズされたアライメント性能を測定するために適切に設計されたメトリクスからなるALOEベンチマークを確立する。
論文 参考訳(メタデータ) (2024-10-04T17:48:29Z) - PEFT-U: Parameter-Efficient Fine-Tuning for User Personalization [9.594958534074074]
ユーザパーソナライズのためのNLPモデルの構築と評価のための新しいデータセットであるPEFT-Uベンチマークを紹介する。
多様なユーザ中心タスクのコンテキストにおいて、LLMを効率よくパーソナライズし、ユーザ固有の嗜好に適合させるという課題について検討する。
論文 参考訳(メタデータ) (2024-07-25T14:36:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。