論文の概要: Navigating User Behavior toward Personalized Multimodal Generation
- arxiv url: http://arxiv.org/abs/2606.24196v1
- Date: Tue, 23 Jun 2026 06:31:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-24 22:16:48.804981
- Title: Navigating User Behavior toward Personalized Multimodal Generation
- Title(参考訳): パーソナライズされたマルチモーダル生成に向けたユーザ行動のナビゲーション
- Authors: Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie,
- Abstract要約: 本稿では、ユーザのインタラクション履歴をダウンストリーム合成のための実行可能な命令に変換する、パーソナライズされたコンテンツ生成について検討する。
協調的なコードとテキストのコードとを二重に結合した,各項目を表すNaviGenを提案する。
製品、ゲーム、ショートビデオ領域での実験では、NaviGenはパーソナライズされた画像とビデオの生成を改善し、次のイテム予測を強化し、より具体的で関連性があり、視覚的に生成可能な命令を生成する。
- 参考スコア(独自算出の注目度): 65.58245647055583
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Modern AIGC pipelines deliver high-fidelity images and videos but presuppose a well-formed creation instruction, while end users rarely articulate visual details, leaving generators misaligned with user demand. We study personalized content generation, which turns a user's interaction history into an executable instruction for downstream synthesis, and identify two obstacles: behavior must be encoded in a form legible to language reasoning, and the model must acquire instruction-writing skill absent from both pretraining and behavior data. We propose NaviGen, which represents each item with a dual identifier coupling a collaborative code and a textual code as a behavioral substrate and a semantic bridge in one token stream. On this representation, a two-stage SFT+RL pipeline first distills preference reasoning and instruction writing from evolutionarily searched supervision, then aligns generation with user intent through hierarchical and self-consistent rewards. Experiments across product, game, and short-video domains show that NaviGen improves personalized image and video generation, strengthens next-item prediction, and yields more specific, relevant, and visually generatable instructions. Our code is anonymously released at: https://github.com/iLearn-Lab/NaviGen.
- Abstract(参考訳): 現代のAIGCパイプラインは、高忠実なイメージとビデオを提供するが、十分に構成された生成命令を前提としている。
ユーザのインタラクション履歴をダウンストリーム合成のための実行可能な命令に変換するパーソナライズされたコンテンツ生成について検討し,2つの障害を識別する。
本研究では,共同コードとテキストコードとを結合した2つの識別子で各項目を表すNaviGenを,1つのトークンストリーム内の動作基板とセマンティックブリッジとして提案する。
この表現において、2段階のSFT+RLパイプラインは、まず、進化的に探索された監督から好みの推論と指示書を蒸留し、次いで階層的かつ自己整合的な報酬を通じて、ユーザ意図に整合する。
製品、ゲーム、ショートビデオ領域での実験では、NaviGenはパーソナライズされた画像とビデオの生成を改善し、次のイテム予測を強化し、より具体的で関連性があり、視覚的に生成可能な命令を生成する。
私たちのコードは、https://github.com/iLearn-Lab/NaviGen.comで匿名でリリースされています。
関連論文リスト
- A Reason-then-Describe Instruction Interpreter for Controllable Video Generation [88.95178842901095]
本稿では,生の命令をダウンストリームビデオジェネレータの正確な動作可能な仕様に変換する汎用型モデル非依存インタプリタReaDeを提案する。
命令忠実度,キャプション精度,下流映像品質が一貫した向上を示した。
論文 参考訳(メタデータ) (2025-11-25T17:59:07Z) - In-Video Instructions: Visual Signals as Generative Control [79.44662698914401]
フレーム内に埋め込まれた視覚信号を命令として解釈することにより、制御可能な画像・映像生成に機能を利用することができるかを検討する。
In-Video Instructionは、オーバーレイテキスト、矢印、軌跡などの要素を通じて、視覚領域に直接ユーザーガイダンスをエンコードする。
Veo 3.1、Kling 2.5、Wan 2.2を含む最先端の3つのジェネレータの実験では、ビデオモデルがそのような視覚的に埋め込まれた命令を確実に解釈し実行できることが示されている。
論文 参考訳(メタデータ) (2025-11-24T18:38:45Z) - Learning Decomposed Contextual Token Representations from Pretrained and Collaborative Signals for Generative Recommendation [17.061613097917217]
本稿では,トークン埋め込みの適応性を高めつつ,事前学習した意味を保存する統一的なフレームワークを提案する。
3つの実世界のデータセットの実験では、DECORが推奨パフォーマンスにおいて、最先端のベースラインを一貫して上回っていることが示されている。
論文 参考訳(メタデータ) (2025-08-22T18:50:38Z) - Lana: A Language-Capable Navigator for Instruction Following and
Generation [70.76686546473994]
LANAは言語対応のナビゲーションエージェントで、人書きのナビゲーションコマンドを実行し、人へのルート記述を提供することができる。
我々は、最近の高度なタスク固有解と比較して、LANAが命令追従と経路記述の両方においてより良い性能を発揮することを実証的に検証した。
加えて、言語生成能力が与えられたLANAは、人間の行動を説明し、人間のウェイフィンディングを支援することができる。
論文 参考訳(メタデータ) (2023-03-15T07:21:28Z) - Accountable Textual-Visual Chat Learns to Reject Human Instructions in
Image Re-creation [26.933683814025475]
合成CLEVR-ATVCデータセット(620K)と手動図形Fruit-ATVCデータセット(50K)の2つの新しいマルチモーダルデータセットを紹介した。
これらのデータセットには、ビジュアルとテキストベースの入力と出力の両方が含まれている。
言語ベースのChatGPT会話と同様に、人間の要求を拒否する際のマルチモーダルシステムの説明責任を容易にするため、データセット内の監視信号として特定のルールを導入する。
論文 参考訳(メタデータ) (2023-03-10T15:35:11Z) - Counterfactual Cycle-Consistent Learning for Instruction Following and
Generation in Vision-Language Navigation [172.15808300686584]
本稿では,2つのタスクを同時に学習し,それぞれのトレーニングを促進するために本質的な相関性を利用するアプローチについて述べる。
提案手法は,様々な追従モデルの性能を改善し,正確なナビゲーション命令を生成する。
論文 参考訳(メタデータ) (2022-03-30T18:15:26Z) - GenNI: Human-AI Collaboration for Data-Backed Text Generation [102.08127062293111]
Table2Textシステムは、機械学習を利用した構造化データに基づいてテキスト出力を生成する。
GenNI (Generation Negotiation Interface) は、対話型ビジュアルシステムである。
論文 参考訳(メタデータ) (2021-10-19T18:07:07Z) - Improving Tree-Structured Decoder Training for Code Generation via
Mutual Learning [27.080718377956693]
コード生成は、入力された自然言語の発話に与えられたコードを自動的に生成することを目的としている。
まず、異なるデコードを持つニューラルコード生成モデル間のコンテキストモデリングの違いを網羅的に分析する。
本稿では,これらのモデルを協調的に学習するための相互学習フレームワークを提案する。
論文 参考訳(メタデータ) (2021-05-31T08:44:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。