論文の概要: Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation
- arxiv url: http://arxiv.org/abs/2606.30698v1
- Date: Mon, 29 Jun 2026 07:35:20 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:18.95548
- Title: Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation
- Title(参考訳): ロボット血管内ガイドワイヤナビゲーションのコンテキスト認識リワードモデリングのための視覚言語手続き推論
- Abstract要約: 本稿では,自律ガイドワイヤナビゲーションのための視覚言語プロシージャ推論(VL-PR)フレームワークを提案する。
このフレームワークは、マルチモーダルな大規模言語モデル(MLLM)を、高レベルのナビゲーションコンテキストを推論するためにリアルタイムな視覚的観察を解釈する手続き的推論モジュールとして統合する。
多様な血管シナリオにわたる物理ロボットプラットフォームの実験は、タスク信頼性の向上とナビゲーション効率の合理化を実証した。
- 参考スコア(独自算出の注目度): 6.022893284275472
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Robotic-assisted endovascular interventions demand accurate, stable, and context-aware guidewire navigation in complex and patient-specific vascular anatomies. Despite recent advances in robotic precision and learning-based control, existing autonomous navigation methods remain limited by their reliance on static reward functions and the lack of explicit procedural reasoning regarding anatomical context and task progression. To address these challenges, this paper proposes a vision-language procedural reasoning (VL-PR) framework for autonomous guidewire navigation. The framework integrates a multimodal large language model (MLLM) as a procedural reasoning module that interprets real-time visual observations to infer high-level navigation contexts. Instead of generating low-level control commands, the inferred procedural insights enable context-aware reward adaptation by dynamically adjusting the importance of reward components across different navigation phases. This approach allows a single policy to resolve competing objectives and handle complex transitions while preserving a consistent global task goal. Experiments on a physical robotic platform across diverse vascular scenarios demonstrate enhanced task reliability and streamlined navigational efficiency, highlighting the advantages over static-reward methods and offering a scalable solution for complex and multi-task robotic endovascular procedures.
- Abstract(参考訳): ロボットによる血管内手術は、複雑で患者固有の血管解剖学において、正確で安定した、コンテキスト対応のガイドワイヤナビゲーションを必要とする。
ロボットの精度と学習に基づく制御の進歩にもかかわらず、既存の自律ナビゲーション手法は、静的報酬関数への依存と、解剖学的文脈とタスクの進行に関する明示的な手続き的推論の欠如によって制限されている。
これらの課題に対処するために,自律ガイドワイヤナビゲーションのための視覚言語プロシージャ推論(VL-PR)フレームワークを提案する。
このフレームワークは、マルチモーダルな大規模言語モデル(MLLM)を、高レベルのナビゲーションコンテキストを推論するためにリアルタイムな視覚的観察を解釈する手続き的推論モジュールとして統合する。
低レベルの制御コマンドを生成する代わりに、推論された手続き的洞察は、異なるナビゲーションフェーズ間で報酬コンポーネントの重要性を動的に調整することで、コンテキスト対応の報酬適応を可能にする。
このアプローチは、一貫したグローバルなタスク目標を維持しながら、競合する目標を解決し、複雑なトランジションを処理するための単一のポリシーを可能にする。
さまざまな血管シナリオにわたる物理的なロボットプラットフォームの実験は、タスクの信頼性の向上とナビゲーション効率の合理化、静的リワード法に対するアドバンテージの強調、複雑でマルチタスクのロボット血管内手術のためのスケーラブルなソリューションの提供を実証した。
関連論文リスト
- VAIC: Vision-Guided Humanoid Agile Object Interaction Control via Decoupled Commands [56.029505206531155]
Vision Guided Agile Interaction Control (VAIC)は、現在のコントローラとヒューマノイドロボットのギャップを埋める統合フレームワークである。
まず、特権教師政策は、正確な物体運動学と正確な環境状態を用いて多様な相互作用スキルを習得する。
第二に、デプロイ可能な学生ポリシーは、全体追跡を複数の軸にまたがる速度目標に置き換えることで、これらの能力を蒸留する。
論文 参考訳(メタデータ) (2026-06-08T09:52:55Z) - Current state of the multi-agent multi-view experimental and digital twin rendezvous (MMEDR-Autonomous) framework [0.0]
マシンラーニングベースのメソッドをガイダンス、ナビゲーション、コントロールアーキテクチャに統合して、堅牢なランデブーおよびドッキングフレームワークを設計することができる。
MMEDR-Autonomousは、学習ベースの光ナビゲーションネットワーク、開発中の強化学習ベースのガイダンスアプローチ、ループ内テストベッドからなる統合フレームワークである。
MMEDR-Autonomousフレームワークは現在、マルチエージェントランデブーシナリオにおける統合的な検証に向けて進んでいる。
論文 参考訳(メタデータ) (2026-03-21T00:13:54Z) - Interpreting Context-Aware Human Preferences for Multi-Objective Robot Navigation [6.15445073348032]
本稿では,ロボットがコンテキストに依存したナビゲーションの好みを理解し,適用できるようにするパイプラインを提案する。
Vision-Language Model (VLM)は、搭載された視覚観測から構造化された環境コンテキストを抽出する。
大規模言語モデル(LLM)は、自然言語のユーザフィードバックを解釈可能なコンテキスト依存の行動規則に変換する。
好み翻訳モジュールは、コンテキスト情報と格納されたルールを数値的な好みベクトルにマッピングする。
論文 参考訳(メタデータ) (2026-03-18T09:14:05Z) - RAGNav: A Retrieval-Augmented Topological Reasoning Framework for Multi-Goal Visual-Language Navigation [1.7508558850131373]
Vision-Language Navigation (VLN) は、シングルポイントパスフィンディングからより挑戦的なMulti-Goal VLNへと進化している。
RAGNavは意味論的推論と物理的構造の間のギャップを埋めるフレームワークである。
論文 参考訳(メタデータ) (2026-03-04T05:31:33Z) - AutoFly: Vision-Language-Action Model for UAV Autonomous Navigation in the Wild [62.47761809929869]
視覚言語ナビゲーション(VLN)は、視覚的観察とともに言語指示を解釈することで、知的エージェントが環境をナビゲートする必要がある。
無人航空機(UAV)の現在のVLN研究は、所定のルートに沿ってUAVを誘導するための詳細な指示に依存している。
本稿では,自律型UAVナビゲーションのためのエンド・ツー・エンドのビジョン・ランゲージ・アクションモデルであるAutoFlyを提案する。
論文 参考訳(メタデータ) (2026-02-10T11:08:07Z) - CoINS: Counterfactual Interactive Navigation via Skill-Aware VLM [13.352875026471445]
スキル認識型VLM(CoINS)による対物対話ナビゲーションを提案する。
我々は、スキルの余裕と具体的な制約パラメータを入力コンテキストに組み込んだ、InterNav-VLMというVLMを微調整する。
生成した高レベルプランを実行するために,強化学習による総合的なスキルライブラリを開発する。
論文 参考訳(メタデータ) (2026-01-07T14:10:46Z) - Executable Analytic Concepts as the Missing Link Between VLM Insight and Precise Manipulation [70.8381970762877]
VLM(Vision-Language Models)は、セマンティック推論とタスク計画において顕著な能力を示す。
本稿では,VLMに基づく推論を実行可能な解析概念を通じて基礎づける新しいフレームワークであるGRACEを紹介する。
G GRACEは高レベル命令理解と低レベルロボット制御の統一的で解釈可能なインターフェースを提供する。
論文 参考訳(メタデータ) (2025-10-09T09:08:33Z) - Mechanistic interpretability for steering vision-language-action models [0.23371356738437823]
VLA(Vision-Language-Action)モデルは、一般のエンボディエージェントを実現するための有望な道である。
本稿では,VLAを内部表現で解釈し,操作するための最初のフレームワークを紹介する。
我々は、微調整、報酬信号、環境相互作用を伴わずに、リアルタイムに行動を調整する汎用的なアクティベーションステアリング手法を提案する。
論文 参考訳(メタデータ) (2025-08-30T03:01:57Z) - GoViG: Goal-Conditioned Visual Navigation Instruction Generation [69.79110149746506]
本稿では,Goal-Conditioned Visual Navigation Instruction Generation (GoViG)を紹介する。
GoViGは生のエゴセントリックな視覚データのみを活用し、目に見えない非構造環境への適応性を大幅に改善する。
論文 参考訳(メタデータ) (2025-08-13T07:05:17Z) - Situationally-Aware Dynamics Learning [57.698553219660376]
隠れ状態表現のオンライン学習のための新しいフレームワークを提案する。
提案手法は、非観測パラメータが遷移力学と報酬構造の両方に与える影響を明示的にモデル化する。
シミュレーションと実世界の両方の実験は、データ効率、ポリシー性能、安全で適応的なナビゲーション戦略の出現を著しく改善した。
論文 参考訳(メタデータ) (2025-05-26T06:40:11Z) - Robotic Navigation Autonomy for Subretinal Injection via Intelligent
Real-Time Virtual iOCT Volume Slicing [88.99939660183881]
網膜下注射のための自律型ロボットナビゲーションの枠組みを提案する。
提案手法は,機器のポーズ推定方法,ロボットとi OCTシステム間のオンライン登録,およびインジェクションターゲットへのナビゲーションに適した軌道計画から構成される。
ブタ前眼の精度と再現性について実験を行った。
論文 参考訳(メタデータ) (2023-01-17T21:41:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。