論文の概要: Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision
- arxiv url: http://arxiv.org/abs/2605.20309v1
- Date: Tue, 19 May 2026 16:27:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.289911
- Title: Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision
- Title(参考訳): Tiny-Engram: ジェネレーティブビジョンのためのトリガー付きコンセプトテーブル
- Authors: Runyuan Cai, Yiming Wang, Yu Lin, Xiaodong Zeng,
- Abstract要約: 小さく明示的な概念テーブルは、モジュール化された視覚的パーソナライゼーションへの実践的なルートである。
Tiny-Engramは、各概念を、登録されたn-gramマッチによってインデックスされた小さなメモリエントリのセットとしてパラメータ化する。
結果は,小型で明示的な概念表が,モジュール化された視覚的パーソナライゼーションへの実践的な経路であることを示唆している。
- 参考スコア(独自算出の注目度): 9.538470992436883
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Current personalization methods for generative vision models typically encode new concepts through continuous adapters or weight updates, yet provide limited control over whether and when a concept should be retrieved. In this work, we introduce Tiny-Engram, a compact trigger-indexed concept table that gives visual memories an explicit lexical address and activation boundary inside frozen image and video generators. Tiny-Engram parameterizes each concept as a small set of memory entries indexed by registered n-gram matches, which modulate text-encoder hidden states only within the matched trigger region. Outside this lexical support, the conditioning pathway is identical to that of the frozen base model. Across both single-encoder latent diffusion and multi-encoder diffusion-transformer backbones, this formulation binds a rare trigger phrase to a target identity while preserving compositional control from the surrounding prompt. We further evaluate the same table-based memory in a text-conditioned video generation setting, where the trigger path reliably alters the generated subject but fine-grained identity persistence across held-out video prompts remains limited. Taken together, these results suggest that small, explicitly addressed concept tables are a practical route to modular visual personalization, with strongest evidence in image generation. For video diffusion, the remaining gap points to a broader requirement: temporally stable identity likely depends on tighter coupling between text-side memory and the evolving visual state, motivating future work on memory injection beyond the text-conditioning interface.
- Abstract(参考訳): 生成視覚モデルの現在のパーソナライズ手法は、通常、連続的なアダプタや重み付け更新を通じて新しい概念を符号化するが、その概念がいつ回収されるべきかを限定的に制御する。
本稿では,凍結した画像やビデオ生成装置の内部に,視覚記憶に明示的な語彙アドレスとアクティベーション境界を与える,コンパクトなトリガインデックスの概念テーブルであるTiny-Engramを紹介する。
Tiny-Engramは、各概念を、登録されたn-gramマッチによってインデックスされた小さなメモリエントリのセットとしてパラメータ化し、マッチしたトリガ領域内でのみテキストエンコーダの隠れ状態を変調する。
この語彙的支持の外では、条件付け経路は凍結ベースモデルと同一である。
単一エンコーダの潜伏拡散と多エンコーダの拡散変圧バックボーンの両方にまたがって、この定式化は周囲のプロンプトからの組成制御を維持しながら、希少なトリガーフレーズをターゲットアイデンティティに結合する。
さらに、テキスト条件付きビデオ生成設定において、同じテーブルベースのメモリを評価し、トリガーパスは生成対象を確実に変更するが、保持されたビデオプロンプト間できめ細かなアイデンティティ永続性は制限される。
これらの結果は,小型で明示的な概念表が,画像生成において最強の証拠を持つ,モジュール化された視覚的パーソナライゼーションへの実践的な経路であることを示唆している。
時間的に安定なアイデンティティは、テキスト側のメモリと進化する視覚状態との密結合に依存している可能性が高い。
関連論文リスト
- Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory [79.01059178883817]
IAMFlowはトレーニング不要のID対応メモリフレームワークで、永続的なエンティティのIDを明示的にモデル化し追跡する。
VLMは、レンダリングフレームから属性を非同期に検証し、洗練し、暗黙の類似性ベースのマッチングの代わりに明示的なエンティティ追跡を可能にする。
NarraStream-Benchは,6次元にまたがる324のマルチプロンプトスクリプトを備えた,ナラストリームビデオ生成のためのベンチマークである。
論文 参考訳(メタデータ) (2026-05-18T17:54:34Z) - BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning [18.859227273698615]
BoxTuningは、オブジェクトの時空間情報を視覚的モダリティに直接注入する。
トークンコストを大幅に削減し、実際に87-93%のテキストトークン削減を実現している。
また、完全な時間分解能を保ち、軌道はフレーム間の運動方向と速度をさらに符号化する。
論文 参考訳(メタデータ) (2026-04-13T07:49:31Z) - VideoMemory: Toward Consistent Video Generation via Memory Integration [28.605816634949814]
VideoMemoryは、Dynamic Memory Bankを通じてナラティブプランニングとビジュアルジェネレーションを統合する。
ダイナミックメモリバンクは、文字、小道具、背景の明示的な視覚的および意味的な記述を格納する。
この検索更新機構は、遠距離ショット間のエンティティの一貫性のある表現を可能にし、コヒーレントなロングフォーム生成をサポートする。
論文 参考訳(メタデータ) (2026-01-07T07:10:32Z) - AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation [58.844504598618094]
本稿では、被験者駆動ビデオ生成のための明示的なタイムスタンプ条件付きフレームワークAlcheMinTを提案する。
提案手法では,時間間隔の符号化を解き放つ新しい位置符号化機構を導入する。
我々は、視覚的アイデンティティとビデオキャプションの結合を強化するために、主観記述型テキストトークンを導入し、世代間あいまいさを緩和する。
論文 参考訳(メタデータ) (2025-12-11T18:59:34Z) - ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation [36.29956463871403]
テキスト・ツー・ビデオ(T2V)生成は急速に進歩しているが、シーン間で一貫した文字のアイデンティティを維持することは大きな課題である。
テキストと単一の参照画像から文字一貫性のある映像を生成するコンテキスト対応拡散フレームワークである textbfContextAnyone を提案する。
提案手法は,参照画像を共同で再構成し,新しいビデオフレームを生成する。
論文 参考訳(メタデータ) (2025-12-08T09:12:18Z) - StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation [117.13475564834458]
本稿では,一貫性自己注意という新たな自己注意計算手法を提案する。
提案手法を長距離ビデオ生成に拡張するために,新しい意味空間時間運動予測モジュールを導入する。
これら2つの新しいコンポーネントを統合することで、StoryDiffusionと呼ばれるフレームワークは、一貫した画像やビデオでテキストベースのストーリーを記述することができます。
論文 参考訳(メタデータ) (2024-05-02T16:25:16Z) - Redundancy-aware Transformer for Video Question Answering [71.98116071679065]
本稿では,ビデオQAを冗長性に認識してモデル化することを目的とした,トランスフォーマーに基づく新しいアーキテクチャを提案する。
隣接するフレームの冗長性に対処するために,隣接するフレームのオブジェクトレベルの変化を強調するビデオエンコーダ構造を導入する。
クロスモーダルな冗長性については、新たな適応サンプリングを融合モジュールに装備し、視覚と言語間の相互作用を明確に区別する。
論文 参考訳(メタデータ) (2023-08-07T03:16:24Z) - ELITE: Encoding Visual Concepts into Textual Embeddings for Customized
Text-to-Image Generation [59.44301617306483]
高速かつ正確にカスタマイズされた画像生成のための学習ベースエンコーダを提案する。
提案手法は,高速な符号化処理により,高忠実度インバージョンとより堅牢な編集性を実現する。
論文 参考訳(メタデータ) (2023-02-27T14:49:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。