論文の概要: CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction
- arxiv url: http://arxiv.org/abs/2608.03211v1
- Date: Tue, 04 Aug 2026 06:49:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-05 15:30:23.064757
- Title: CrossScope: A Role-Asymmetric World Model for Joint Dual-Scope Surgical Video Prediction
- Title(参考訳): CrossScope:ジョイントデュアルスコープ手術ビデオ予測のためのロール非対称世界モデル
- Authors: Wanhao Liu, Jinsong Lin, Rulin Zhou, Chi Kit Ng, Wenbin Pan, Zhiqing Tang, Dongyue Li, Liwei Luo, Yanshen Wu, Panshuo Li, Zhiyong Xiong, Huxin Gao, Tamas Haidegger, Hongliang Ren,
- Abstract要約: 2つの柔軟なスコープは、キャリブレーションされたステレオ関係なしで相補的ではあるが役割に依存したビューを提供する。
目的の証拠ルーティングを実現しつつ,ビュー固有の専門家を保護した2ストリーム手術世界モデルである textbfCrossScope を提案する。
- 参考スコア(独自算出の注目度): 13.807346106109641
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Visual world models typically learn future dynamics from a single observation stream, limiting their ability to model cooperative systems with multiple independently moving observers. We investigate this challenge in Mother--Child endoscopic retrograde cholangiopancreatography (ERCP), where two flexible scopes provide complementary yet role-dependent views without a calibrated stereo relationship. Unlike conventional multi-view fusion that assumes symmetric information exchange, we formulate \textbf{role-asymmetric dual-scope future prediction}, where cross-view evidence is selectively transferred according to the prediction target and its underlying spatial requirements. We propose \textbf{CrossScope}, a dual-stream surgical world model that preserves view-specific experts while enabling target-specific evidence routing through geometry-guided residual interactions. CrossScope learns two complementary communication directions: geometric motion cues from the Mother view guide Child-view future dynamics, while pose-aligned Child appearance supports Mother-view prediction only when valid spatial correspondence is established. This design allows each scope to contribute task-relevant evidence without compromising its view-specific representation. To evaluate this problem, we establish a paired dual-scope benchmark comprising synchronized phantom and real-world ERCP episodes, with evaluations assessing visual fidelity, structural preservation, target localization, and motion consistency. Experiments demonstrate that CrossScope consistently outperforms strong surgical video generation baselines, validating the importance of role-aware evidence routing for multi-observer visual world modeling.
- Abstract(参考訳): 視覚の世界モデルは通常、1つの観測ストリームから将来のダイナミクスを学習し、複数の独立して動くオブザーバで協調システムをモデル化する能力を制限する。
母子膵管造影(ERCP)におけるこの課題について検討した。
対称情報交換を仮定する従来の多視点融合とは異なり、予測対象とその基礎となる空間的要求に応じてクロスビューエビデンスを選択的に転送する「textbf{role-asymmetric dual-scope future prediction}」を定式化する。
本稿では,図形誘導残差相互作用による目標固有証拠のルーティングを実現しつつ,ビュー固有専門家を保護した2重ストリーム手術世界モデルである「textbf{CrossScope}」を提案する。
CrossScopeは2つの相補的なコミュニケーションの方向を学習する: 母の視線ガイドから幾何学的な動きの手がかりを学習し、一方、ポーズアラインな児童の出現は、有効空間対応が確立された場合にのみ、母の視線予測をサポートする。
この設計により、各スコープは、ビュー固有の表現を妥協することなく、タスク関連エビデンスをコントリビュートすることができる。
この問題を評価するために、視覚的忠実度、構造的保存性、ターゲットの局所性、動きの整合性を評価するために、同期ファントムと実世界のERCPエピソードからなるペア型デュアルスコープベンチマークを構築した。
実験により、CrossScopeは強力な手術用ビデオ生成ベースラインを一貫して上回り、マルチ・オブ・サーバ・ビジュアル・ワールド・モデリングにおけるロール・アウェア・エビデンス・ルーティングの重要性を検証した。
関連論文リスト
- Trimming the Long-Tail of Visual World Modeling Evaluation [67.17191772079316]
本論文では,不規則な物理的相互作用をシミュレートするために世界モデルに挑戦するベンチマークであるTailor-Benchを紹介する。
通常のシナリオは共通のツールとタスクのペアを反映し、従来型のツールを属性互換の代替品に置き換え、Impossibleシナリオは属性違反ツールを導入している。
実験結果から,物理世界モデリングの長期的ギャップは明らかであり,共通相互作用を超越した一般化の限界が示唆された。
論文 参考訳(メタデータ) (2026-06-23T07:43:41Z) - ST-DiffEye: Diffusion-based Continuous Gaze Generation via Joint Scanpath-Trajectory Modeling [36.51837241351688]
視覚刺激を観察しながら視線パターンを生成することを目的とした人間の視線モデリングの課題について検討する。
視線は視聴者やトライアルによって大きく異なるため、この可変性はノイズやモデル視線を生成過程としてではなく、定義特性として扱う。
本稿では,ST-DiffEyeについて紹介する。ST-DiffEyeは,両モードを付加的な生入力チャネルとして結合することで,両モードを結合する共振器拡散フレームワークである。
論文 参考訳(メタデータ) (2026-06-13T21:56:08Z) - Coarse-to-fine Hierarchical Architecture with Sequential Mamba for Brain Reconstruction [5.732406989501624]
画像-fMRI符号化のための新しい階層型2段階フレームワークであるCHASMBrainを提案する。
我々のアーキテクチャは、グローバルなセマンティックトークンと局所的な空間パッチを明確に分離し処理するために、デュアルストリームのMamba設計を活用している。
提案手法はPearsonの0.429とMSE0.261の相関を達成し,評価基準線を上回る結果を得た。
論文 参考訳(メタデータ) (2026-06-03T11:53:23Z) - Automated Detection of Mutual Gaze and Joint Attention in Dual-Camera Settings via Dual-Stream Transformers [0.0]
相互視線(MG)と共同注意(JA)は発達心理学において重要であるが、伝統的に労働集約的な手動コーディングに依存している。
同期デュアルカメラ記録からMGおよびJAを検出するための高効率なデュアルストリームトランスフォーマアーキテクチャを提案する。
論文 参考訳(メタデータ) (2026-04-29T18:49:34Z) - Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning [61.753025885751036]
本稿では,3つのタスクにまたがる異種視点を融合する視覚言語モデルの能力を評価するEgo-to-Worldベンチマークを提案する。
我々は,2段階のフレームワークであるCoRLを提案し,チェイン・オブ・ソート(Chain-of-Thought)を教師付き微調整と強化学習を組み合わせた。
我々は、CoRLが、推論と知覚グラウンドのメトリクスの両方において、強力なプロプライエタリおよびオープンソースベースラインを一貫して超越していることを示します。
論文 参考訳(メタデータ) (2026-03-16T04:27:53Z) - Preoperative-to-intraoperative Liver Registration for Laparoscopic Surgery via Latent-Grounded Correspondence Constraints [51.7011449975586]
Land-Regは変形可能な登録フレームワークで、潜伏した2D-3Dのランドマーク対応を学習する。
厳格な登録のために、Land-Regはクロスモーダルラテントアライメントモジュールを採用している。
類似性マッチングを持つ不確実なオーバーラップランドマーク検出器を提案し, 明確な2D-3Dランドマーク対応を強く推定する。
論文 参考訳(メタデータ) (2026-03-02T10:44:03Z) - V$^{2}$-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence [90.92892171307055]
V2-SAMは、統合されたクロスビューオブジェクト対応フレームワークである。
SAM2は2つの相補的なプロンプトジェネレータを通して、シングルビューセグメンテーションからクロスビュー対応に適応する。
V2-SAMは、Ego-Exo4D(ego-exoオブジェクト対応)、DAVIS-2017(ビデオオブジェクト追跡)、HANDAL-X(robotic-ready cross-view対応)の新たな最先端性能を実現する
論文 参考訳(メタデータ) (2025-11-25T22:06:30Z) - A Variational Information Bottleneck Approach to Multi-Omics Data
Integration [98.6475134630792]
本稿では,不完全な多視点観測のための深い変動情報ボトルネック (IB) 手法を提案する。
本手法は,対象物に関連のある視点内および視点間相互作用に焦点をあてるために,観測された視点の辺縁および結合表現にISBフレームワークを適用した。
実世界のデータセットの実験から、我々の手法はデータ統合から常に利益を得て、最先端のベンチマークより優れています。
論文 参考訳(メタデータ) (2021-02-05T06:05:39Z) - Cascaded Human-Object Interaction Recognition [175.60439054047043]
マルチステージで粗大なHOI理解のためのカスケードアーキテクチャを提案する。
各段階で、インスタンスローカライゼーションネットワークは、HOI提案を段階的に洗練し、インタラクション認識ネットワークにフィードする。
慎重に設計された人間中心の関係機能により、これらの2つのモジュールは効果的な相互作用理解に向けて協調的に機能する。
論文 参考訳(メタデータ) (2020-03-09T17:05:04Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。