論文の概要: Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
- arxiv url: http://arxiv.org/abs/2608.13546v2
- Date: Tue, 18 Aug 2026 17:33:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-19 13:45:32.842292
- Title: Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
- Title(参考訳): Alaya-EVOKE:リニアスケーリング・スーパービジョンから無限の世界へ
- Abstract要約: インタラクティブな世界モデルは、永続メモリ、応答性相互作用、長期水平生成をサポートしなければならない。
Alaya-EVOKE(Evoke)は、永続的な世界状態の外部化と、長距離対話型世代のための教師の再設計によって、両方の制限に対処する。
Evokeは、VBench-LongとVBench-2.0で競争力を維持しながら、WBenchで最先端のパフォーマンスを達成した。
- 参考スコア(独自算出の注目度): 34.25175575182297
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Interactive world models must support persistent memory, responsive interaction, and long-horizon generation, yet these requirements place conflicting demands on the model. Maintaining history in the denoiser context or key-value cache incurs growing cost, forcing a trade-off between session length and retained memory, while low-latency interaction relies on few-step generation whose capabilities are bounded by its teacher. Alaya-EVOKE (Evoke) addresses both limitations by externalizing persistent world state and redesigning the teacher for long-horizon interactive generation. Scene geometry is maintained in an external, camera-indexed world state bank, from which only view-relevant information is retrieved, keeping the denoiser context bounded as the session grows. Rather than treating the teacher as a fixed generator, we design it for long-horizon supervision: its sparse attention combines chunk-wise grouping, retrieval of selected distant frames, and a linear-attention global state, yielding linear growth in memory and compute while enabling supervision over long horizons. Such supervision exposes content drift that stays locally plausible within short windows, while per-chunk conditioning enables prompt changes and event control throughout the sequence. A 30-second distribution-matching objective, applied under self-forced rollouts, transfers both capabilities to a three-step student that uses no classifier-free guidance, improving resistance to long-term drift while preserving responsive conditioning. With bounded context and recurrent external memory, Evoke supports open-ended, continuously evolving generation; on a single H200 at $384\times 640$, each $1.5\,\mathrm{s}$ chunk is generated in $2.11\,\mathrm{s}$. As a three-step world model, Evoke achieves state-of-the-art performance on WBench while remaining competitive on VBench-Long and VBench-2.0.
- Abstract(参考訳): インタラクティブな世界モデルは、永続的メモリ、応答性相互作用、長期水平生成をサポートしなければならないが、これらの要求はモデルに矛盾する要求を課す。
Denoiserコンテキストやキーバリューキャッシュの履歴を維持することは、セッション長と保持メモリの間のトレードオフを強制し、コストを増大させる。
Alaya-EVOKE(Evoke)は、永続的な世界状態の外部化と、長距離対話型世代のための教師の再設計によって、両方の制限に対処する。
シーンジオメトリは、外部のカメラインデクシングされた世界銀行で維持され、そこからビュー関連情報のみを検索し、セッションが大きくなるにつれてデノイザーコンテキストがバウンドされる。
本研究は,教師を固定発電機として扱うのではなく,チャンクワイドなグループ化,選択された遠隔フレームの検索,線形アテンションのグローバルな状態とを組み合わせることで,長期的地平線を監督しながら,メモリと計算の線形成長を実現している。
このような監視は、ショートウィンドウ内でローカルに検証可能なコンテンツドリフトを公開し、チャンク単位のコンディショニングは、シーケンス全体を通して即時の変更とイベント制御を可能にする。
自己強化ロールアウト下で適用された30秒の分布マッチング対象は、両方の能力を3段階の学生に転送する。
コンテキスト境界とリカレント外部メモリにより、Evokeはオープンエンドで継続的に進化する生成をサポートする。1つのH200が384\times 640$で、それぞれ1.5\,\mathrm{s}$チャンクが2.11\,\mathrm{s}$で生成される。
3段階の世界モデルとして、EvokeはVBench-LongとVBench-2.0で競争しながらWBenchで最先端のパフォーマンスを達成した。
関連論文リスト
- Long-Horizon Audio-Visual Generation for Persistent Stories and Interactive Worlds [60.18437892555415]
本稿では,2つの目的を持ったオーディオ視覚生成システムであるJoyAI-Echo-1.5を提案する。
この長ビデオ版では、コンポーザブルなクロスショットメモリが導入され、複数の先行ショットと、音声フィルタリングされたフルショットオーディオから派生した話者キューに視覚的エビデンスを集約する。
世界モデルの変種は、不均一なナビゲーション入力を校正されたメートル法6-DoFカメラ軌跡に変換し、幾何学的条件付け経路を介してそれらを注入する。
論文 参考訳(メタデータ) (2026-08-24T15:31:12Z) - ATMA: Length-Invariant Language Modeling via Polar Attention and Gated-Delta Compression Memory [0.0]
ATMAは、新しい3チャンネルアテンション機構を統合するハイブリッドな畳み込みアテンションアーキテクチャである。
また,120回のAblationスイープを用いてATMAの評価を行い,Pola + メモリモデルの組み合わせは誘導針-a-haystack検索精度を90%以上維持することを示した。
論文 参考訳(メタデータ) (2026-06-23T20:43:51Z) - S2GS: Streaming Semantic Gaussian Splatting for Online Scene Understanding and Reconstruction [57.07346645250984]
Streaming Semantic Gaussian Splatting (S2GS) は厳密に因果的かつ漸進的な3D Gaussianセマンティックフィールドフレームワークである。
将来のフレームを活用せず、歴史的フレームを再処理することなく、シーンの幾何学、外観、インスタンスレベルのセマンティクスを継続的に更新する。
S2GSは、ジョイントリコンストラクションとアンダーホールドのベンチマークにおいて、強いオフラインベースラインをマッチまたは上回る。
論文 参考訳(メタデータ) (2026-03-15T05:48:55Z) - MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens [34.228121359393775]
2つの共同設計コンポーネントを備えたトレーニングフリーフレームワークであるMemRoPEを紹介した。
オンラインRoPEインデックスは、回転しないキーをキャッシュし、注意時に位置埋め込みを動的に適用する。
MemRoPEは、時間的コヒーレンス、視覚的忠実度、主観的一貫性において、毎分から1時間単位で既存の手法より優れている。
論文 参考訳(メタデータ) (2026-03-12T23:14:16Z) - RELIC: Interactive Video World Model with Long-Horizon Memory [74.81433479334821]
真のインタラクティブな世界モデルは、リアルタイムの長距離ストリーミング、一貫した空間記憶、正確なユーザ制御を必要とする。
この3つの課題を完全に解決する統合フレームワークであるRELICを紹介します。
単一の画像とテキスト記述が与えられた後、RELICは任意のシーンをリアルタイムにメモリを意識した長期探索を可能にする。
論文 参考訳(メタデータ) (2025-12-03T18:29:20Z) - MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents [84.62985963113245]
我々は,長時間のマルチターンタスクに対して,エージェントが一定のメモリで動作可能な,エンドツーエンドの強化学習フレームワークMEM1を紹介する。
各ターンでMEM1は、メモリ統合と推論を共同でサポートするコンパクトな共有内部状態を更新する。
その結果,MEM1-7Bは16目的のマルチホップQAタスクにおいて,Qwen2.5-14B-Instructと比較してメモリ使用量を3.7倍削減し,3.5倍の性能向上を示す。
論文 参考訳(メタデータ) (2025-06-18T19:44:46Z) - Video World Models with Long-term Spatial Memory [110.530715838396]
本稿では,ビデオワールドモデルの長期的整合性を高める新しい枠組みを提案する。
我々のフレームワークは、長期空間記憶から情報を保存・取得する機構を含んでいる。
評価の結果,関連するベースラインに比べて品質,一貫性,コンテキスト長が向上した。
論文 参考訳(メタデータ) (2025-06-05T17:42:34Z) - Breaking Quadratic Barriers: A Non-Attention LLM for Ultra-Long Context Horizons [0.0]
非常に長いコンテキストウインドウを効率的に処理する大規模言語モデル(LLM)のための新しい非注意型アーキテクチャを提案する。
自己注意機構の性質から2次記憶と過負荷に悩まされている従来のTransformer設計とは異なり、当社のモデルはトークンによる注意の注意を完全に回避している。
論文 参考訳(メタデータ) (2025-05-09T00:25:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。