論文の概要: Personalizing MLLMs via Reinforced Multimodal Reference Game
- arxiv url: http://arxiv.org/abs/2606.28845v1
- Date: Sat, 27 Jun 2026 10:12:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.704123
- Title: Personalizing MLLMs via Reinforced Multimodal Reference Game
- Title(参考訳): 強化マルチモーダル参照ゲームによるMLLMのパーソナライズ
- Abstract要約: 本稿では,新しいマルチモーダル参照ゲームを通じて識別的記述を促進する学習フレームワークであるReinforced Reference Game(RRG)を紹介する。
我々のアプローチは、強正(同じ概念の異なる見解)と強負(視覚的には似ているが異なる概念)に対する検証可能な対照的な報酬を定式化する。
RRGは、未確認領域を一般化し、概念記述とパーソナライズ固有のRLフレームワークに基づいて既存のメソッドを上回ります。
- 参考スコア(独自算出の注目度): 37.54948724318688
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Personalizing Multimodal Large Language Models (MLLMs) aims to recognize users' unique concepts from visual data and provide personalized responses. Although prior work has shown the benefit of concept descriptions and reasoning for this task, MLLM descriptions often include information, such as state and context, that does not help and may in fact hinder the unique identification of the target concept among other visually similar items. Effective descriptions of personal concepts should instead be accurate, discriminative, and free of distracting details. To achieve such descriptions, we introduce Reinforced Reference Game (RRG), a learning framework that promotes discriminative descriptions through a novel reinforced multimodal reference game. The MLLM plays both the roles of speaker and listener in a contrastive game setting, whose goal is to effectively communicate discriminative information about a target concept. Our approach formulates a verifiable contrastive reward over hard positives (dissimilar views of the same concept) and hard negatives (visually similar but different concepts). Empirically, RRG achieves state-of-the-art across multiple tasks on three personalization benchmarks. RRG generalizes to unseen domains and outperforms existing methods based on concept descriptions and personalization-specific RL frameworks. We will release code and models in the project page.
- Abstract(参考訳): マルチモーダル大規模言語モデル(MLLM)のパーソナライズは、視覚データからユーザのユニークな概念を認識し、パーソナライズされた応答を提供することを目的としている。
MLLMの以前の研究は、このタスクに対する概念記述と推論の利点を示してきたが、MLLMの記述には、状態や文脈などの情報が含まれており、それは役に立たず、実際、他の視覚的に類似したアイテムの中でターゲット概念のユニークな識別を妨げる可能性がある。
個人的概念の効果的な記述は、正確で差別的であり、詳細を気遣うことなくあるべきである。
このような記述を実現するために,新たに強化されたマルチモーダル参照ゲームを通じて識別的記述を促進する学習フレームワークであるReinforced Reference Game(RRG)を紹介した。
MLLMは、ターゲット概念に関する識別情報を効果的に伝達することを目的とした、対照的なゲーム設定において、話者とリスナーの両方の役割を果たす。
我々のアプローチは、強正(同じ概念の異なる見解)と強負(視覚的には似ているが異なる概念)に対して検証可能な対照的な報酬を定式化する。
実証的に、RRGは3つのパーソナライズベンチマークで複数のタスクにまたがる最先端を達成する。
RRGは、未確認領域を一般化し、概念記述とパーソナライズ固有のRLフレームワークに基づいて既存のメソッドを上回ります。
コードとモデルはプロジェクトページでリリースします。
関連論文リスト
- Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models [60.25065199948178]
共起学習を必要とせずに作曲のパーソナライズを可能にするフレームワークであるGate-and-Mergeを紹介する。
パーソナライゼーションの間、各概念は、概念トークンと組み合わせた軽量のLoRAアダプタとして独立に学習される。
推定では,概念固有のLoRA更新を重み空間に直接マージすることで構成を可能にする。
論文 参考訳(メタデータ) (2026-05-09T05:32:28Z) - Beyond Heuristic Prompting: A Concept-Guided Bayesian Framework for Zero-Shot Image Recognition [81.2779530670268]
VLM(Vision-Language Models)は、ゼロショット画像認識を著しく進歩させたモデルである。
本稿では、クラス固有の概念を取り入れることで、プロンプトを強化する。
我々の手法は一貫して最先端の手法より優れている。
論文 参考訳(メタデータ) (2026-03-09T03:11:11Z) - Multi-Domain Explainability of Preferences [20.543061089533673]
本稿では,複数の領域にまたがる好みの概念に基づく説明を自動生成する手法を提案する。
提案手法はLLMを用いて,選択された応答と拒否された応答を区別する概念を同定する。
提案手法は, 高い嗜好予測性能を達成し, ベースラインを上回りながら, 説明も可能である。
論文 参考訳(メタデータ) (2025-05-26T15:01:56Z) - Probe by Gaming: A Game-based Benchmark for Assessing Conceptual Knowledge in LLMs [17.753896112412942]
CK-Arenaは、Undercoverゲーム上に開発されたマルチエージェントインタラクションゲームである。
対話的な設定で概念を推論するために,大規模言語モデルの能力を評価するように設計されている。
CK-Arenaは動的環境における概念推論を評価するためのスケーラブルで現実的なベンチマークを提供する。
論文 参考訳(メタデータ) (2025-05-23T06:06:28Z) - A Multimodal Recaptioning Framework to Account for Perceptual Diversity in Multilingual Vision-Language Modeling [25.43735315887918]
視覚言語モデル(VLM)におけるキャプションの機械翻訳
データは主に英語話者から得られ、知覚バイアスとモデルの柔軟性の欠如を示している。
本稿では、翻訳前の英語字幕のオブジェクト記述を変更するLLMベースのマルチモーダル・リキャプション戦略を提案する。
論文 参考訳(メタデータ) (2025-04-19T17:23:12Z) - MC-LLaVA: Multi-Concept Personalized Vision-Language Model [51.645660375766575]
本稿では,最初のマルチコンセプトパーソナライズパラダイムであるMC-LLaVAを提案する。
MC-LLaVAはマルチコンセプト命令チューニング戦略を採用し、1つのトレーニングステップで複数の概念を効果的に統合する。
総合的質的および定量的実験により、MC-LLaVAは印象的なマルチコンセプトパーソナライズされた応答を達成できることが示された。
論文 参考訳(メタデータ) (2025-03-24T16:32:17Z) - MC-LLaVA: Multi-Concept Personalized Vision-Language Model [51.645660375766575]
本稿では,最初のマルチコンセプトパーソナライズパラダイムであるMC-LLaVAを提案する。
MC-LLaVAはマルチコンセプト命令チューニング戦略を採用し、1つのトレーニングステップで複数の概念を効果的に統合する。
総合的質的および定量的実験により、MC-LLaVAは印象的なマルチコンセプトパーソナライズされた応答を達成できることが示された。
論文 参考訳(メタデータ) (2024-11-18T16:33:52Z) - MyVLM: Personalizing VLMs for User-Specific Queries [78.33252556805931]
視覚言語モデルのパーソナライズに向けての第一歩を踏み出し,ユーザが提供する概念を学習し,推論することを可能にする。
様々なユーザ固有の概念を効果的に認識するために,モデルのトグルとして機能する外部概念ヘッドを付加する。
この概念を認識して、VLMの中間機能空間に埋め込まれた新しい概念を学習する。
この埋め込みは、言語モデルを誘導し、ターゲットの概念を生成された応答に自然に統合する。
論文 参考訳(メタデータ) (2024-03-21T17:51:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。