論文の概要: Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation
- arxiv url: http://arxiv.org/abs/2607.26694v1
- Date: Wed, 29 Jul 2026 09:40:23 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-30 21:06:25.612961
- Title: Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation
- Title(参考訳): Visko Orbis 1.0: リアルタイム対話型ロングビデオ生成のためのライブモデル
- Abstract要約: Visko Orbis 1.0はリアルタイムでインタラクティブなロングビデオ生成のためのLive Modelである。
長めのテキスト・トゥ・ビデオ、画像・トゥ・ビデオ、ビデオの継続をサポートする。
境界付きマルチスケールメモリは、サブジェクト、シーン、スタイルをチャンクにわたって保存する。
- 参考スコア(独自算出の注目度): 21.992179037319048
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: We present Visko Orbis 1.0, a Live Model for real-time, interactive long-video generation. Users can change the prompt at any moment during generation, and the update becomes visible in real time. Visko Orbis 1.0 supports long-form text-to-video, image-to-video, and video continuation, with multilingual prompts and prompt switching while generation is in progress. A bounded multi-scale memory preserves subjects, scenes, and style across chunks, sustaining hour-scale rollouts without evident quality or color drift. Built on a distilled chunk-wise streaming generator and a streaming video upscaler, Visko Orbis 1.0 delivers real-time 4K video generation at 24 FPS using an optimized GPU serving engine. In long-form Arena comparisons, Visko Orbis 1.0 obtains the highest overall-preference and temporal-stability ratings among state-of-the-art real-time interactive video-generation systems.
- Abstract(参考訳): Visko Orbis 1.0は、リアルタイムでインタラクティブな長ビデオ生成のためのライブモデルである。
ユーザは世代毎にプロンプトを変更でき、アップデートはリアルタイムで可視になる。
Visko Orbis 1.0は、長文のテキスト・トゥ・ビデオ、画像・トゥ・ビデオ、ビデオ継続をサポートし、複数言語によるプロンプトと、生成が進行中である間に即時切り替えが可能である。
境界付きマルチスケールメモリは、被写体、シーン、スタイルを一括して保存し、1時間単位のロールアウトを、明らかな品質やカラードリフトなしで維持する。
Visko Orbis 1.0は、蒸留チャンクワイドストリーミングジェネレータとストリーミングビデオアップスケーラをベースとして、最適化されたGPUサービスエンジンを使用して、24FPSでリアルタイム4Kビデオ生成を提供する。
長期のアリーナ比較では、Visko Orbis 1.0は最先端のリアルタイムなインタラクティブなビデオ生成システムの中で、最高の全体的な評価と時間安定性の格付けを得る。
関連論文リスト
- Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds [60.18437892555415]
本稿では,2つの目的を持ったオーディオ視覚生成システムであるJoyAI-Echo-1.5を提案する。
この長ビデオ版では、コンポーザブルなクロスショットメモリが導入され、複数の先行ショットと、音声フィルタリングされたフルショットオーディオから派生した話者キューに視覚的エビデンスを集約する。
世界モデルの変種は、不均一なナビゲーション入力を校正されたメートル法6-DoFカメラ軌跡に変換し、幾何学的条件付け経路を介してそれらを注入する。
論文 参考訳(メタデータ) (2026-08-24T15:31:12Z) - Omni-LiveAvatar: Minute-Level Real-Time Streaming Joint Audio-Visual Avatar Generation [26.625772912688387]
我々はOmni-LiveAvatarについて紹介する。Omni-LiveAvatarは、マイクロレベル、リアルタイムストリーミング共同オーディオビデオアバター生成のための最初のフレームワークである。
実験により、Omni-LiveAvatarは高品質で同期された微小なアバターをリアルタイムで生成することが示された。
論文 参考訳(メタデータ) (2026-08-07T15:34:15Z) - Vidu S1: A Real-Time Interactive Video Generation Model [71.6354028517889]
Vidu S1は、デジタル文字の音声制御をサポートするリアルタイムインタラクティブビデオ生成モデルである。
ユーザは音声による指示で、いつでもビデオ生成コンテンツをコントロールできる。
TurboDiffusionとTurboServeで構築されたVidu S1は、通常のGPU上で最大42FPSで540pのリアルタイムビデオを出力する。
論文 参考訳(メタデータ) (2026-07-03T08:58:06Z) - DreamX-World 1.0: A General-Purpose Interactive World Model [27.431807314882935]
DreamX-World 1.0は、制御可能なロングホライゾン生成のためのインタラクティブなテキスト/画像・ビデオの世界モデルである。
カメラナビゲーション、以前に観測された地域への再訪、フォトリアリスティック、ゲームスタイル、スタイル化されたドメイン間での即時イベントをサポートする。
論文 参考訳(メタデータ) (2026-06-15T17:30:33Z) - Incantation: Natural Language as the Action Interface for Multi-Entity Video World Models [18.614835778452345]
Incantationは、ラテンフレームごとの自然言語コンディショニングを備えた世界初のインタラクティブなビデオワールドモデルである。
我々は、クロス・エンタリティ・トランスファーとアウト・オブ・ボキャブラリ・プロンプトのAction-Indexベースラインを超えている。
我々は、同じアーキテクチャとトレーニングのレシピを『The King of Fighters』に適用し、参加者ごとのアクションボキャブラリスロットだけを変更する。
論文 参考訳(メタデータ) (2026-05-18T16:12:52Z) - LPM 1.0: Video-based Character Performance Model [32.6151928707232]
本稿では,LPM 1.0(Large Performance Model)について述べる。
厳密なフィルタリング、音声とビデオのペアリングによるパフォーマンス理解により、人間中心のデータセットを構築する。
我々はこれを低レイテンシで無限長の相互作用のために因果ストリーミングジェネレータ(オンラインLPM)に蒸留する。
論文 参考訳(メタデータ) (2026-04-09T05:26:09Z) - Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model [163.56671779593736]
Seedance 1.5 Proは、ネイティブのジョイントオーディオビデオ生成用に特別に設計された基礎モデルである。
Seedance 1.5 Proは、正確な多言語と方言のリップシンク、ダイナミックシネマカメラコントロール、物語のコヒーレンスの向上を通じて、自分自身を区別する。
論文 参考訳(メタデータ) (2025-12-15T16:36:52Z) - LiveStar: Live Streaming Assistant for Real-World Online Video Understanding [67.71551356747948]
LiveStarは、適応的なストリーミングデコーディングを通じて常時オンのプロアクティブ応答を実現する、先駆的なライブストリーミングアシスタントである。
LiveStar は,(1) 可変長ビデオストリームに対する漸進的なビデオ言語アライメントの実現,動的に進化するフレームシーケンス間の時間的一貫性の維持,(2) 単一前方通過検証による最適なプロアクティブ応答タイミングを決定する応答サイレンスデコードフレームワーク,(3) 最大端メモリ圧縮による10分以上のビデオのオンライン推論によるメモリ認識アクセラレーション,およびストリーミングキー値キャッシュを併用して1.53倍高速推論を実現する。
論文 参考訳(メタデータ) (2025-11-07T15:00:37Z) - MotionStream: Real-Time Video Generation with Interactive Motion Controls [60.403597895657505]
単一GPU上で最大29FPSのストリーミング生成が可能なサブ秒レイテンシを実現するMotionStreamを提案する。
提案手法は,グローバルなテキストプロンプトとローカルなモーションガイダンスに準拠する高品質なビデオを生成するが,リアルタイムでは推論を行わないモーションコントロールによるテキスト・ツー・ビデオモデルの拡張から始まる。
我々のモデルでは、動きの追従と映像の質を2桁高速化し、無限長のストリーミングを可能にする。
論文 参考訳(メタデータ) (2025-11-03T06:37:53Z) - VideoLLM-online: Online Video Large Language Model for Streaming Video [27.073238234038826]
本稿では,ビデオストリーム内での時間的整合性,長コンテキスト性,リアルタイムな会話を可能にする,新しいLearning-In-Video-Streamフレームワークを提案する。
当社のフレームワークは,A100 GPU上で10FPS以上の5分間のビデオクリップでストリーミング対話をサポートする。
また、認識、キャプション、予測など、パブリックなオフラインビデオベンチマークで最先端のパフォーマンスを示す。
論文 参考訳(メタデータ) (2024-06-17T17:55:32Z) - Looking Backward: Streaming Video-to-Video Translation with Feature Banks [65.46145157488344]
StreamV2Vは、ユーザプロンプトによるリアルタイムストリーミングビデオ変換(V2V)を実現する拡散モデルである。
1つのA100 GPU上で20 FPSを実行することができ、FlowVid、CoDeF、Rerender、TokenFlowよりも15x、46x、108x、158x高速である。
論文 参考訳(メタデータ) (2024-05-24T17:53:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。