論文の概要: From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation
- arxiv url: http://arxiv.org/abs/2605.08712v1
- Date: Sat, 09 May 2026 05:48:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:49.830415
- Title: From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation
- Title(参考訳): 関節キネマティクスから行動記述型手術映像生成のための経路視覚制御へ
- Abstract要約: 動作条件付き手術用ビデオ生成は、ロボット手術にとって非常に難しい問題である。
そこで本研究では,音声キネマティクスを5つの画像整列制御モダリティの統一集合に変換するキネマティクス対視覚リフティングパラダイムを提案する。
本手法は,多様なベースライン上での行動忠実度,視覚的忠実度,ドメイン間の一般化を継続的に改善する。
- 参考スコア(独自算出の注目度): 43.4347713269043
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Action-conditioned surgical video generation is a critical yet highly challenging problem for robotic surgery. The core difficulty is that low-dimensional control vectors must precisely govern complex image-space evolution. In this work, we propose a kinematic-to-visual lifting paradigm that converts articulated kinematics into a unified set of five image-aligned control modalities. Building on this representation, we introduce a hierarchically routed visual control framework that selectively activates the most relevant control modalities and motion scales. Instead of uniformly applying all control signals, our model performs hierarchical routing to dynamically allocate conditioning capacity. We further design kinematic-prior-guided routing loss functions to ensure physically meaningful, temporally stable, and efficient expert utilization. To improve efficiency, we propose a budgeted training and inference scheme that leverages routing-induced sparsity. By selectively discarding low-significance control pathways during training and execution, our approach enables adaptive computation that is complementary to standard distillation. We additionally construct a new benchmark with curated articulated annotations, obtained through human-in-the-loop semantic labeling and differentiable pose tracking, providing realistic supervision for action-conditioned surgical video generation. Extensive experiments demonstrate that our method consistently improves action faithfulness, visual fidelity, and cross-domain generalization over diverse baselines. Moreover, our efficient variant achieves substantial reductions in latency while maintaining strong control accuracy.
- Abstract(参考訳): 動作条件付き手術用ビデオ生成は、ロボット手術にとって非常に難しい問題である。
中心的な困難は、低次元の制御ベクトルが複雑な画像空間の進化を正確に制御しなければならないことである。
そこで本研究では,手話のキネマティクスを5つの画像整列制御モダリティの統一集合に変換するキネマティクス対視覚リフティングパラダイムを提案する。
この表現に基づいて、最も関連性の高い制御モダリティと動き尺度を選択的に活性化する階層的ルーティング型視覚制御フレームワークを導入する。
全ての制御信号を均一に適用する代わりに、我々のモデルは条件付け能力を動的に割り当てる階層的ルーティングを実行する。
さらに、物理的に意味があり、時間的に安定し、効率的な専門家の利用を確保するために、キネマティック優先経路損失関数を設計する。
効率を向上させるために,ルーティングによる疎性を利用した予算付きトレーニングと推論手法を提案する。
トレーニングと実行中に低比重制御経路を選択的に破棄することにより,本手法は標準蒸留と相補的な適応計算を可能にする。
さらに,人間のループ内セマンティックラベリングと識別可能なポーズトラッキングによって得られたアノテーションをキュレートした新しいベンチマークを構築し,アクション条件付き手術ビデオ生成の現実的な監視を可能にした。
広汎な実験により,本手法は多様なベースライン上での行動忠実度,視覚的忠実度,ドメイン間の一般化を一貫して改善することが示された。
さらに, 制御精度を高く保ちながら, 遅延の大幅な低減を実現している。
関連論文リスト
- EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation [35.20482569112933]
EmbodiedVAEは、ロボット操作の世界モデルに適したコンパクトで制御可能な潜在表現を提供する、新しいビデオVAEである。
提案するEmbodiedVAEは,2dBPSNRの改善によりロボット操作シナリオにおいて,より高精度な動作制御を実現するとともに,高い圧縮速度で再現性を実現する。
論文 参考訳(メタデータ) (2026-08-04T01:01:18Z) - Prior-First, Condition-Second: Scalable and Controllable Hand Motion Completion [27.154998447721102]
身体条件付きハンドモーションコンプリートのためのプレファースト・コンプリート・セカンド・フレームワークを提案する。
本研究の枠組みは,身体力学から協調的,運動論的に一貫した手の動きをリアルタイムで生成する。
我々のフレームワークは、エンドツーエンドの条件付きベースラインと比較して、キネマティックな妥当性、堅牢性、および制御性を改善します。
論文 参考訳(メタデータ) (2026-07-07T07:40:13Z) - AI-Enabled Image-Based Hybrid Vision/Force Control of Tendon-Driven Aerial Continuum Manipulators [0.6999740786886535]
本稿では、腱駆動型空中マニピュレータのためのAI対応ハイブリッドビジョン/フォース制御フレームワークを提案する。
提案したコントローラは、画像特徴誤差を安定化しつつ、静的環境との自律的物理的相互作用を可能にするように設計されている。
論文 参考訳(メタデータ) (2026-04-21T01:19:11Z) - Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation [57.28703268044067]
ロボット操作のための新しいデュアルストリームビュー変換器であるCortical Policyを提案する。
われわれのフレームワークは、ロボット操作の新しい視点を提供し、視覚に基づくロボット制御の幅広い応用の可能性を秘めている。
論文 参考訳(メタデータ) (2026-03-22T04:18:54Z) - FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation [50.39748673817223]
本稿では,ロボットビデオ生成における明示的な動作パラメータを完全に活用する2つのトレーニング不要な推論時間手法を提案する。
第一に、アクションスケールの分類器フリーガイダンスは、動作の大きさに比例して誘導強度を動的に調整し、運動強度に対する制御性を高める。
第二に、アクションスケールノイズトランケーションは、初期サンプルノイズの分布を調整し、所望の運動力学とよりよく一致させる。
論文 参考訳(メタデータ) (2025-09-29T03:30:40Z) - Diffuse-CLoC: Guided Diffusion for Physics-based Character Look-ahead Control [16.319698848279966]
物理に基づくルックアヘッド制御のためのガイド付き拡散フレームワークであるDiffuse-CLoCを提案する。
直感的で、ステアブルで、物理的にリアルなモーション生成を可能にする。
論文 参考訳(メタデータ) (2025-03-14T18:42:29Z) - Growing Q-Networks: Solving Continuous Control Tasks with Adaptive Control Resolution [51.83951489847344]
ロボット工学の応用において、スムーズな制御信号はシステム摩耗とエネルギー効率を減らすために一般的に好まれる。
本研究では,離散的な動作空間を粗い状態から細かい制御分解能まで拡大することにより,この性能ギャップを埋めることを目的とする。
我々の研究は、値分解とアダプティブ・コントロール・リゾリューションが組み合わさることで、単純な批判のみのアルゴリズムが得られ、連続制御タスクにおいて驚くほど高い性能が得られることを示唆している。
論文 参考訳(メタデータ) (2024-04-05T17:58:37Z) - TrackDiffusion: Tracklet-Conditioned Video Generation via Diffusion Models [75.20168902300166]
微粒な軌跡条件の運動制御が可能な新しい映像生成フレームワークであるTrackDiffusionを提案する。
TrackDiffusionの重要なコンポーネントは、複数のオブジェクトのフレーム間の一貫性を明確に保証するインスタンスエンハンサーである。
TrackDiffusionによって生成されたビデオシーケンスは、視覚知覚モデルのトレーニングデータとして使用できる。
論文 参考訳(メタデータ) (2023-12-01T15:24:38Z) - Interactive Character Control with Auto-Regressive Motion Diffusion Models [18.727066177880708]
リアルタイム動作合成のためのA-MDM(Auto-Regressive Motion Diffusion Model)を提案する。
我々の条件拡散モデルは初期ポーズを入力とし、前者のフレームに条件付けられた連続した動きフレームを自動回帰的に生成する。
本稿では,タスク指向サンプリング,インペインティング,階層的強化学習など,対話型制御をA-MDMに組み込む一連の手法を紹介する。
論文 参考訳(メタデータ) (2023-06-01T07:48:34Z) - Goal-Conditioned End-to-End Visuomotor Control for Versatile Skill
Primitives [89.34229413345541]
本稿では,制御器とその条件をエンドツーエンドに学習することで,落とし穴を回避する条件付け手法を提案する。
本モデルでは,ロボットの動きのダイナミックな画像表現に基づいて,複雑な動作シーケンスを予測する。
代表的MPCおよびILベースラインに対するタスク成功の大幅な改善を報告した。
論文 参考訳(メタデータ) (2020-03-19T15:04:37Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。