論文の概要: ReSync: Re-Aligning the Two Clocks of Asynchronous World-Action Models
- arxiv url: http://arxiv.org/abs/2609.33944v1
- Date: Sun, 27 Sep 2026 21:38:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-04 08:25:59.871368
- Title: ReSync: Re-Aligning the Two Clocks of Asynchronous World-Action Models
- Title(参考訳): ReSync: Asynchronous World-Action Modelの2つのクロックの再調整
- Abstract要約: 非同期推論の2時間ビューを形式化し、コミットメントとエビデンスギャップを導入する。
有効間隔は両端で閉じられ、両端はロールアウト前にスケジュールから読み取ることができる。
冷凍ペアのRoboCasaパネルでは、成功率が4.48ポイント向上する。
- 参考スコア(独自算出の注目度): 6.945258421105849
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Jointly generating future video and actions has become a standard recipe for world-action models, and the strongest systems denoise the two streams on separate schedules: actions are decoded in few steps so control stays fast, while the video stream runs longer to keep the predicted future sharp. The design is deliberate, but it leaves the two streams on different clocks, and an action can become executable while the future that should justify it is still largely unresolved. We formalize this as a two-clock view of asynchronous inference and introduce the commitment-evidence gap, a quantity read directly from a model's own sampling schedule rather than measured by search. The gap is predictive: as it widens, candidate utility becomes harder to identify and extra candidate sampling buys less, while advancing the world stream buys more, and the two cross. Spending more world computation is therefore not simply better. The useful interval is closed at both ends, and both ends can be read off the schedule before any rollout. ReSync places the computation inside it: hold the action state, advance only the world within the supported window, then resume native denoising. No parameters change and no candidates are compared. On a frozen paired RoboCasa panel this improves success by 4.48 points, while an equal-compute control that waits without advancing the world does not move, and the same rule transfers to a second benchmark and a second backbone without retuning.
- Abstract(参考訳): アクションは、いくつかのステップでデコードされるので、制御は速く、ビデオストリームは予測される未来をシャープに保つために長く実行されます。
設計は意図的だが、2つのストリームは異なるクロックに残され、アクションは実行可能になり、将来それを正当化するべきものは未解決のままである。
我々はこれを非同期推論の2時間ビューとして形式化し、探索によって測定されるのではなく、モデル自身のサンプリングスケジュールから直接読み取る量であるコミットメントと証拠のギャップを導入する。
ギャップは予測的であり、それが広がるにつれて、候補ユーティリティーの識別が難しくなり、追加の候補サンプリングがより少なくなり、ワールドストリームがより多く購入され、2つが交差する。
したがって、より多くの世界計算を行うことは、単に良いことではありません。
有効間隔は両端で閉じられ、両端はロールアウト前にスケジュールから読み取ることができる。
ReSyncは、その内部に計算を配置する。アクション状態を保持し、サポート対象のウィンドウ内で世界だけを前進させ、ネイティブなdenoisingを再開する。
パラメータは変更されず、候補も比較されない。
凍結したペアのRoboCasaパネルでは、成功率が4.48ポイント向上する一方、世界を前進せずに待機する等計算制御は動かず、同じルールは修正せずに第2のベンチマークと第2のバックボーンに転送される。
関連論文リスト
- DuplexCadence: Exact State and Execution from a Speech Model's Declared Timelines [8.623569542447594]
フル音声モデルはストリーミングインタラクションをサポートし、同時に聞き取り、話す。
本稿では、ネイティブクロックを明示的に宣言し、2つのルールを相互に有効化するDuplexCadenceを提案する。
論文 参考訳(メタデータ) (2026-09-28T13:16:39Z) - Beyond a Scalar: Distributional Serving Interfaces for Watch-Time Prediction [9.334948958049315]
視聴時間は短いビデオフィードの主要なエンゲージメント信号であり、その予測はランキングや露出に直接影響を及ぼす。
既存の方法は、時間バイアスを補正したり、よりリッチな分布をモデル化することで、監視時間の予測を改善する。
本稿では、分散プロバイダ、コンパクトで低次元の要約、各タスクに適した軽量な読み出し機能を備えた分散サービングインタフェース(DSI)を提案する。
論文 参考訳(メタデータ) (2026-09-23T16:57:08Z) - Never Stop Thinking: Continuous-Time Language Agents [0.33451037881913753]
そこで本研究では,軽量な割り込み再生オーケストレータの下で,修正されていないテキストモデルから連続時間認知が出現することを示す。
継続的思考がエージェントの達成を向上するかどうかを測定するために、ReactiveBenchを導入します。
論文 参考訳(メタデータ) (2026-07-11T14:42:13Z) - Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving [0.4376400608266187]
各フレームでセッションはストリーミングオーディオを取り込み、ウォールタイムの期限に応答しなければならない。
リアルタイムスタックでは、持続的な負荷は優雅に機能しない。
Metronomeのエンジン内KVウィンドウは、クラッシュを排除し、フレーム単位のレイテンシをモノトーン負荷信号に変換する。
論文 参考訳(メタデータ) (2026-07-02T15:59:01Z) - Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling [51.38330727868982]
動作チャンキングが学習者と実証者の間の分岐にどのように影響するかを示す。
動作チャンキングをクローズドループ適応でブリッジするテスト時間推論アルゴリズムである双方向デコーディング(BID)を提案する。
提案手法は、7つのシミュレーションベンチマークと2つの実世界のタスクにまたがって、最先端の2つの生成ポリシーの性能を向上させる。
論文 参考訳(メタデータ) (2024-08-30T15:39:34Z) - AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising [49.785626309848276]
AsyncDiffは、複数のデバイスにまたがるモデル並列化を可能にする、普遍的でプラグアンドプレイのアクセラレーションスキームである。
安定拡散 v2.1 では、AsyncDiff は2.7倍の速度アップと4.0倍のスピードアップを実現し、CLIPスコアの 0.38 をわずかに削減した。
我々の実験は、AsyncDiffがビデオ拡散モデルに容易に適用でき、性能を向上できることを示した。
論文 参考訳(メタデータ) (2024-06-11T03:09:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。