論文の概要: Generating the Wild: Individual-Consistent Image-to-Video Generation for Wildlife
- arxiv url: http://arxiv.org/abs/2610.05587v1
- Date: Sun, 04 Oct 2026 22:41:09 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:27:02.174105
- Title: Generating the Wild: Individual-Consistent Image-to-Video Generation for Wildlife
- Title(参考訳): 野生動物のためのイメージ・ツー・ビデオ・ジェネレーション
- Abstract要約: 本研究では,野生生物の個体の一貫性を高めるための高周波誘導型I2VフレームワークWildIconを提案する。
具体的には、WildIconは、参照画像から個々の特定の高周波キューを抽出する周波数認識ID符号化ブランチを導入する。
凍結したバックボーン上に構築されたWildIconは、ベースI2Vモデルの動作制御性とセマンティック忠実性を保ちながら、参照画像で見える微細なアイデンティティーキューを保存する。
- 参考スコア(独自算出の注目度): 14.34228475855519
- License:
- Abstract: Individual-level wildlife identification often suffers from data scarcity, as varying observations of the same animal under diverse poses, viewpoints, and motions are rarely available. Image-to-video (I2V) generation offers a promising way to mitigate this limitation by synthesizing additional observations from a single reference image. However, existing I2V models mainly emphasize global layout, semantics, and motion, and therefore often fail to preserve fine-grained local appearance cues that distinguish one wildlife individual from another, such as fur texture, stripe boundaries, spot configurations, and contour transitions. We observe that these identity-critical cues are closely related to high-frequency information. To address this challenge, we propose WildIcon, a high-frequency-guided I2V framework for wildlife individual consistency. Specifically, WildIcon introduces a frequency-aware identity encoding branch that extracts individual-specific high-frequency cues from the reference image. Combined with isolated foreground information, the resulting identity tokens are then injected into cross-attention blocks as identity conditioning. Building on a frozen backbone with lightweight identity adaptation, WildIcon preserves fine-grained identity cues visible in the reference image while retaining the motion controllability and semantic fidelity of the base I2V model. In addition, to support the training and evaluation of wildlife individual-consistent I2V, we construct WildlifeVid, a wildlife-centric video dataset with high-quality, temporally coherent clips and individual-level identity labels. Experiments on I2V generation and downstream animal re-identification (ReID) show that WildIcon achieves stronger individual consistency than existing baselines, and that its filtered outputs can serve as useful candidate training augmentations for downstream ReID.
- Abstract(参考訳): 個体レベルでの野生生物の識別はデータ不足に悩まされることが多く、様々なポーズ、視点、動きで同じ動物を観察することはめったにない。
イメージ・ツー・ビデオ(I2V)生成は、単一の参照画像から追加の観測を合成することにより、この制限を緩和する有望な方法を提供する。
しかし、既存のI2Vモデルは、主にグローバルなレイアウト、セマンティクス、動きを強調しており、そのため、毛皮のテクスチャ、ストライプの境界、スポット構成、輪郭の遷移など、ある野生生物とを区別する微細な局部的な外観の手がかりを保存できないことが多い。
これらのアイデンティティクリティカルな手がかりが高周波情報と密接に関連していることが観察された。
この課題に対処するために,野生生物の個体の一貫性を高めるための高周波誘導型I2VフレームワークWildIconを提案する。
具体的には、WildIconは、参照画像から個々の特定の高周波キューを抽出する周波数認識ID符号化ブランチを導入する。
孤立したフォアグラウンド情報と組み合わせて、得られたIDトークンは、ID条件として、クロスアテンションブロックに注入される。
軽量なアイデンティティ適応を備えた冷凍バックボーン上に構築されたWildIconは、ベースI2Vモデルの動作制御性とセマンティック忠実性を保ちながら、参照画像で見える微細なアイデンティティキューを保存する。
さらに,野生生物の個人共存型I2Vのトレーニングと評価を支援するために,高品質で時間的に整合したクリップと個人レベルのアイデンティティラベルを備えた野生生物中心のビデオデータセットWildlifeVidを構築した。
I2V 生成および下流動物再同定(ReID)実験は、WildIcon が既存の基準線よりも強い個人一貫性を達成し、そのフィルタリング出力が下流動物再識別のための候補訓練増強に役立つことを示している。
関連論文リスト
- BEACON: Behavior and Appearance Control for Subject-Specific Video Generation [20.360530698353916]
人固有のビデオ生成のための軽量なフレームワークBEACONを紹介する。
視覚的アイデンティティを表現行動から切り離すことによって、より表現力のあるビデオを生成する。
BEACONは、これらの相補的な信号を条件づけることで、被験者の外観と特徴的顔力学の両方をよりよく保存するビデオを生成する。
論文 参考訳(メタデータ) (2026-09-07T09:09:12Z) - GroupVideo: Multi-Identity Customized Text-to-Video Generation [53.89036635198158]
GroupVideoは、複数の個人写真を利用して、アイデンティティをカスタマイズしたビデオを生成する新しいフレームワークである。
GroupVideoにはマルチモーダルなアイデンティティアライメントが組み込まれており、セマンティックアライメントは動きの自然性を高めるセマンティックな知覚を導入している。
マルチIDビデオデータセットが不足しているため、我々は20,000のビデオの包括的な高品質なデータセットをキュレートした。
論文 参考訳(メタデータ) (2026-07-23T08:09:04Z) - Vera: Identity-Faithful Human Subject-to-Video Generation [66.45205582225942]
単対複数対人生成のための統合人間中心型S2VフレームワークであるVeraを提案する。
まず、人物レベルのクロスクリップ検索により、100万対のアイデンティティに整合した人間の画像画像データセットを構築した。
We show that Vera improves human identity consistency, multi-person subject binding, and motion naturalness, while reduce identity confusion and excess reference-image copying。
論文 参考訳(メタデータ) (2026-07-22T15:08:30Z) - A non-invasive video-based method for individual identification of wildlife using gait dynamics [21.468912995256698]
本稿では,野生生物の歩行分析と個人識別のための完全自動ビデオベースパイプラインを提案する。
提案したパイプラインは、Segment Anything Model 3 (SAM3) を使用して、高品質なRGBとバイナリシルエットマスクを生成する。
コサインは歩行のシグネチャを比較するために使用され、物理的または侵襲的なマーキングに依存することなく、個人の類似性に基づくクラスタリングを可能にする。
論文 参考訳(メタデータ) (2026-07-05T21:47:21Z) - Autonomous UAV Navigation for Individual Wildlife Re-Identification [0.350327094468706]
本稿では、下流のre-IDに対して、画像キャプチャーを積極的に最適化する自律型ドローンナビゲーションシステムを提案する。
このシステムは、YOLOv11オブジェクト検出とDINOv2ベースのポーズを組み合わせて、リアルタイム飛行決定を導く。
本手法はキリン,トラ,ゾウなどの診断面パターンを持つ他の種に一般化されていることを示す。
論文 参考訳(メタデータ) (2026-06-30T14:56:04Z) - UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation [65.53694602893042]
VLMエンコーディングの前にVTとVAE機能を融合した統合ビジュアルコンディショニングフレームワークを提案する。
2つのマルチ参照生成ベンチマークの実験により、UniCustomは主題の一貫性、命令従順、構成の忠実さを一貫して改善することを示した。
論文 参考訳(メタデータ) (2026-05-12T13:10:05Z) - AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation [55.94507360511886]
我々は,任意の文字にスケール可能なトランスフォーマーベースのビデオ生成フレームワークであるAnyCrowdを提案する。
具体的には、まず、DiT処理に先立って文字インスタンスを独立してエンコードするIILR(Instance-Isolated Latent Representation)を導入し、遅延IDの絡み込みを防止する。
この不整合表現に基づいて、さらに、(i)インスタンス認識フォアグラウンドアテンション、(ii)背景中心の相互作用、(iii)世界背景調整に自己注意を分解することで、運転ポーズにアイデンティティを結合するトリステージデカップリングアテンション(TSDA)を提案する。
論文 参考訳(メタデータ) (2026-03-16T15:25:04Z) - SD-ReID: View-aware Stable Diffusion for Aerial-Ground Person Re-Identification [74.36139886192495]
本稿では,AG-ReID のための SD-ReID という新しい生成フレームワークを提案する。
まず、ViTベースのモデルを用いて人物表現を抽出し、個人性や視認性を含む制御可能な条件を抽出する。
次に、安定拡散(SD)モデルを微調整し、これらの制御可能な条件によって導かれる人物表現を強化する。
論文 参考訳(メタデータ) (2025-04-13T12:44:50Z) - An Individual Identity-Driven Framework for Animal Re-Identification [15.381573249551181]
IndivAIDはAnimal ReID用に特別に設計されたフレームワークである。
画像特異的で個人固有のテキスト記述を生成し、動物画像を通して個々の視覚概念をフルにキャプチャする。
8つのベンチマークデータセットと現実世界のStoatデータセットにわたる最先端メソッドに対する評価は、IndivAIDの有効性と適用性を示している。
論文 参考訳(メタデータ) (2024-10-30T11:34:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。