Fugu-MT 論文翻訳(概要): VidLPRO: A $\underline{Vid}$eo-$\underline{L}$anguage $\underline{P}$re-training Framework for $\underline{Ro}$botic and Laparoscopic Surgery

論文の概要: VidLPRO: A $\underline{Vid}$eo-$\underline{L}$anguage $\underline{P}$re-training Framework for $\underline{Ro}$botic and Laparoscopic Surgery

arxiv url: http://arxiv.org/abs/2409.04732v2
Date: Wed, 11 Sep 2024 23:12:53 GMT
ステータス: 翻訳完了
システム内更新日: 2024-09-13 13:20:50.118168
Title: VidLPRO: A $\underline{Vid}$eo-$\underline{L}$anguage $\underline{P}$re-training Framework for $\underline{Ro}$botic and Laparoscopic Surgery
Title（参考訳）: VidLPRO: A $\underline{Vid}$eo-$\underline{L}$anguage $\underline{P}$re-training Framework for $\underline{Ro}$botic and Laparoscopic Surgery
Authors: Mohammadmahdi Honarmand, Muhammad Abdullah Jamal, Omid Mohareri,
Abstract要約: ロボットおよび腹腔鏡下手術に特化して設計された新しいビデオ言語(VL)事前学習フレームワークであるVidLPROを紹介する。 VidLPROは、ビデオテキストコントラスト学習、ビデオテキストマッチング、マスキング言語モデリングの目的を統合し、リッチなVL表現を学習する。我々のモデルは21.5%の精度と15.7%のF1スコアの改善を示し、新しいベンチマークをフィールドに設定する。
参考スコア（独自算出の注目度）: 4.12931136981508
License: http://creativecommons.org/licenses/by-nc-sa/4.0/
Abstract: We introduce VidLPRO, a novel video-language (VL) pre-training framework designed specifically for robotic and laparoscopic surgery. While existing surgical VL models primarily rely on contrastive learning, we propose a more comprehensive approach to capture the intricate temporal dynamics and align video with language. VidLPRO integrates video-text contrastive learning, video-text matching, and masked language modeling objectives to learn rich VL representations. To support this framework, we present GenSurg+, a carefully curated dataset derived from GenSurgery, comprising 17k surgical video clips paired with captions generated by GPT-4 using transcripts extracted by the Whisper model. This dataset addresses the need for large-scale, high-quality VL data in the surgical domain. Extensive experiments on benchmark datasets, including Cholec80 and AutoLaparo, demonstrate the efficacy of our approach. VidLPRO achieves state-of-the-art performance in zero-shot surgical phase recognition, significantly outperforming existing surgical VL models such as SurgVLP and HecVL. Our model demonstrates improvements of up to 21.5\% in accuracy and 15.7% in F1 score, setting a new benchmark in the field. Notably, VidLPRO exhibits robust performance even with single-frame inference, while effectively scaling with increased temporal context. Ablation studies reveal the impact of frame sampling strategies on model performance and computational efficiency. These results underscore VidLPRO's potential as a foundation model for surgical video understanding.
Abstract（参考訳）: ロボットおよび腹腔鏡下手術に特化して設計された新しいビデオ言語(VL)事前学習フレームワークであるVidLPROを紹介する。既存の外科的VLモデルは、主にコントラスト学習に依存しているが、複雑な時間的ダイナミクスを捉え、動画を言語に合わせるためのより包括的なアプローチを提案する。 VidLPROは、ビデオテキストコントラスト学習、ビデオテキストマッチング、マスキング言語モデリングの目的を統合し、リッチなVL表現を学習する。この枠組みをサポートするために,GenSurgery 由来の慎重にキュレートされたデータセットであるGenSurg+ を,Whisper モデルで抽出した転写文を用いて GPT-4 で生成されたキャプションと組み合わせた17kの手術用ビデオクリップからなる。このデータセットは、外科領域における大規模で高品質なVLデータの必要性に対処する。 Cholec80やAutoLaparoといったベンチマークデータセットに関する大規模な実験は、我々のアプローチの有効性を実証している。 VidLPROは、ゼロショットの外科的位相認識において最先端のパフォーマンスを達成し、SurgVLPやHecVLといった既存の外科的VLモデルよりも大幅に優れている。本モデルでは,F1スコアの精度が最大21.5\%,F1スコアが15.7%向上し,新たなベンチマークが設定された。特に、VidLPROは、単一フレームの推論でも堅牢なパフォーマンスを示しながら、時間的コンテキストの増大によって効果的にスケールする。アブレーション研究は、フレームサンプリング戦略がモデル性能と計算効率に与える影響を明らかにする。これらの結果は,手術映像理解の基礎モデルとしてのVidLPROの可能性を裏付けるものである。

関連論文リスト

EdgeVLA: Efficient Vision-Language-Action Models [0.4005096060512278]
本稿では,VLA(Vision-Language-Action)モデルの推論速度を大幅に向上する新しい手法であるEdge VLAを紹介する。 1)エンドエフェクタ位置予測の自己回帰要求を排除し,推論の7倍の高速化を実現し,2)小言語モデル(SLM)の効率を向上する。我々の初期の結果は、EVLAがOpenVLAに匹敵するトレーニング特性を達成し、推論速度とメモリ効率を大幅に向上させることを示した。
論文参考訳（メタデータ） (2025-07-18T16:15:09Z)
Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models [31.566051946153802]
自律走行のためのVLA(Vision-Language-Action)モデルは、非構造的なコーナーケースのシナリオにおいて、将来性を示す。 Inmpromptu VLA: 8万以上の細かなキュレートされたビデオクリップを紹介します。このデータセットは,4つの挑戦的未構造化カテゴリの新たな分類に基づいて構築され,リッチで計画指向の質問応答アノテーションと行動軌跡を特徴とする。
論文参考訳（メタデータ） (2025-05-29T17:59:46Z)
Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI [15.513949299806582]
外科的ビデオの自動要約は, 手続き的文書の充実, 外科的訓練の支援, 術後分析の促進に不可欠である。本稿では,コンピュータビジョンと大規模言語モデルの最近の進歩を活用して,包括的な映像要約を生成するマルチモーダルフレームワークを提案する。また,50個の腹腔鏡画像からの計測とアクションアノテーションを用いて,ColecT50データセットを用いて本手法の評価を行った。
論文参考訳（メタデータ） (2025-04-28T15:46:02Z)
Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success [100.226572152954]
視覚言語アクションモデル(VLA)のための最適化された微調整レシピを提案する。われわれのレシピはOpenVLAの4つのタスクスイートの平均成功率を76.5%から97.1%に引き上げ、アクション生成のスループットを26$times$に向上させた。実世界の評価において、我々の微調整のレシピにより、OpenVLAはバイマガルALOHAロボット上でデクスタラスで高周波な制御タスクをうまく実行することができる。
論文参考訳（メタデータ） (2025-02-27T00:30:29Z)
GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models [44.82179903133343]
大型言語モデル(LLM)は視覚言語モデル(VLM)の暗黙の役割を果たす我々のGLOVメタプロンプトは、下流のタスク記述でLLMをメタプロンプトし、適切なVLMプロンプトに問い合わせる。 VLMの2つのファミリーを用いて16種類の多様なデータセット上でGLOVを評価した。
論文参考訳（メタデータ） (2024-10-08T15:55:40Z)
CLIPVQA:Video Quality Assessment via CLIP [56.94085651315878]
VQA問題(CLIPVQA)に対する効率的なCLIPベースのトランスフォーマー手法を提案する。提案したCLIPVQAは、新しい最先端のVQAパフォーマンスを実現し、既存のベンチマークVQAメソッドよりも最大で37%の汎用性を実現している。
論文参考訳（メタデータ） (2024-07-06T02:32:28Z)
OpenVLA: An Open-Source Vision-Language-Action Model [131.74098076670103]
我々は、970kの現実世界のロボットデモの多様なコレクションに基づいて訓練されたオープンソースのVLAであるOpenVLAを紹介した。 OpenVLAは汎用的な操作の強力な結果を示し、RT-2-X (55B) のようなクローズドモデルよりも16.5%高い絶対的なタスク成功率を示した。モデルチェックポイント、微調整ノートブック、そしてOpen X-Embodimentデータセット上で大規模にVLAをトレーニングするためのビルトインサポートを備えたPyTorchをリリースしています。
論文参考訳（メタデータ） (2024-06-13T15:46:55Z)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning [78.23573511641548]
視覚言語事前学習は、幅広い画像言語アプリケーションで性能を大幅に向上させた。しかし、ビデオ関連タスクの事前学習プロセスは、非常に大きな計算とデータリソースを必要とする。本稿では,映像理解のための既存の画像言語事前学習モデルに適用するための,ストレートフォワード,高効率,資源光のアプローチについて検討する。
論文参考訳（メタデータ） (2024-04-25T19:29:55Z)
Video-GroundingDINO: Towards Open-Vocabulary Spatio-Temporal Video Grounding [108.79026216923984]
ビデオグラウンドイングは、入力テキストクエリに対応するビデオ内の時間セクションをローカライズすることを目的としている。本稿では,現在のビデオグラウンドリング手法において,オープン語彙時空間ビデオグラウンドニングタスクを導入することにより,限界に対処する。
論文参考訳（メタデータ） (2023-12-31T13:53:37Z)
VaQuitA: Enhancing Alignment in LLM-Assisted Video Understanding [63.075626670943116]
本稿では,映像情報とテキスト情報の相乗効果を向上するための最先端フレームワークであるVaQuitAを紹介する。データレベルでは、フレームを均一にサンプリングする代わりに、CLIPスコアランキングでガイドされるサンプリング手法を実装している。機能レベルでは、Visual-Query Transformerと一緒にトレーニング可能なVideo Perceiverを統合します。
論文参考訳（メタデータ） (2023-12-04T19:48:02Z)
E-ViLM: Efficient Video-Language Model via Masked Video Modeling with Semantic Vector-Quantized Tokenizer [5.7254320553764]
E-ViLMはビデオ言語コーパスから表現表現を学習し、広範なビデオ言語タスクにうまく一般化することができる。我々のモデルはMSRVTTベンチマークで399.3ドル%トップ1ドル精度に達し、最先端の大規模VLアーキテクチャの精度の91.4ドル%を維持している。
論文参考訳（メタデータ） (2023-11-28T22:57:17Z)
VLAB: Enhancing Video Language Pre-training by Feature Adapting and Blending [78.1399386935455]
CLIPのような大規模画像テキストコントラスト事前学習モデルは、高品質なマルチモーダル表現を効果的に学習することが実証されている。本稿では,VLAB(VLAB: Video Language pre-training by feature generativeality and Blending)という新しいビデオテキスト事前学習手法を提案する。 VLABはCLIP表現をビデオ事前訓練タスクに転送し、幅広いビデオテキストタスクのための統合ビデオマルチモーダルモデルを開発する。
論文参考訳（メタデータ） (2023-05-22T15:54:22Z)
Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions [31.4943447481144]
本稿では,共同学習と言語学習(VL)について検討し,モダリティ間の学習を可能とし,多くの下流作業に役立てる。本モデルでは,10の理解タスクと2の新たなテキスト・ビジュアル生成タスクを実現する。
論文参考訳（メタデータ） (2021-11-19T17:36:01Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。