論文の概要: HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare
- arxiv url: http://arxiv.org/abs/2603.08817v1
- Date: Mon, 09 Mar 2026 18:17:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-23 08:17:42.121661
- Title: HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare
- Title(参考訳): HMR-1:身体医療のための視覚言語モデルを用いた階層型マッサージロボット
- Abstract要約: 身体知性は医療、特に理学療法やリハビリテーションにおいて変革の機会を開いている。
我々は、12,190の画像と174,177のQAペアを含むマルチモーダルデータセットを構築し、様々な照明条件と背景をカバーした。
本稿では,ハイレベルなアキューポイント接地モジュールと低レベルな制御モジュールを備えた階層型エンボディマッサージフレームワークを提案する。
- 参考スコア(独自算出の注目度): 28.230151467353647
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The rapid advancement of Embodied Intelligence has opened transformative opportunities in healthcare, particularly in physical therapy and rehabilitation. However, critical challenges remain in developing robust embodied healthcare solutions, such as the lack of standardized evaluation benchmarks and the scarcity of open-source multimodal acupoint massage datasets. To address these gaps, we construct MedMassage-12K - a multimodal dataset containing 12,190 images with 174,177 QA pairs, covering diverse lighting conditions and backgrounds. Furthermore, we propose a hierarchical embodied massage framework, which includes a high-level acupoint grounding module and a low-level control module. The high-level acupoint grounding module uses multimodal large language models to understand human language and identify acupoint locations, while the low-level control module provides the planned trajectory. Based on this, we evaluate existing MLLMs and establish a benchmark for embodied massage tasks. Additionally, we fine-tune the Qwen-VL model, demonstrating the framework's effectiveness. Physical experiments further confirm the practical applicability of the framework.Our dataset and code are publicly available at https://github.com/Xiaofeng-Han-Res/HMR-1.
- Abstract(参考訳): エボディード・インテリジェンス(Embodied Intelligence)の急速な進歩は、医療、特に理学療法やリハビリテーションにおいて変革の機会を開いた。
しかしながら、標準化された評価ベンチマークの欠如や、オープンソースのマルチモーダル・アキューポイント・マッサージデータセットの不足など、堅牢な医療ソリューションの開発において重要な課題が残っている。
これらのギャップに対処するため、MedMassage-12Kという、12,190の画像と174,177のQAペアを含むマルチモーダルデータセットを構築し、様々な照明条件と背景をカバーした。
さらに,高レベルアキューポイント接地モジュールと低レベル制御モジュールを含む階層型エンボディマッサージフレームワークを提案する。
高レベルアキューポイントグラウンドモジュールは、多モードの大規模言語モデルを使用して、人間の言語を理解し、アキューポイントの位置を特定する。
そこで本研究では,既存のMLLMを評価し,マッサージタスクを具体化するためのベンチマークを構築した。
さらに、Qwen-VLモデルを微調整し、フレームワークの有効性を示す。
我々のデータセットとコードはhttps://github.com/Xiaofeng-Han-Res/HMR-1.comで公開されている。
関連論文リスト
- Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models [43.46006663176283]
我々は,ラベル付きデータの追加を必要とせずに,ラベルなし強化学習を利用してモデル性能を向上させる医療MLLMのためのフレームワークであるMed-Evoを提案する。
我々のフレームワークは、2つの重要なイノベーションを紹介している: 1)$ Feature-driven Pseudo Labeling (FPL)は、すべての不均一な候補応答からセマンティックセントロイドを識別し、各ロールアウトで擬似ラベルを選択する。
論文 参考訳(メタデータ) (2026-03-08T03:38:24Z) - MedMO: Grounding and Understanding Multimodal Large Language Model for Medical Images [25.29568841502814]
一般化MLLMアーキテクチャ上に構築された医療基盤モデルであるMedMOを紹介する。
VQAベンチマークでは、MedMOはベースラインよりも平均精度が+13.7%向上した。
医療報告生成において、MedMOは意味的および臨床的正確性の両方において大きな利益をもたらす。
論文 参考訳(メタデータ) (2026-02-06T18:59:59Z) - A Federated and Parameter-Efficient Framework for Large Language Model Training in Medicine [59.78991974851707]
大規模言語モデル(LLM)は、質問応答や診断など、医療ベンチマークにおいて強力なパフォーマンスを示している。
ほとんどの医療用LDMは、異種システムの一般化性と安全性の制限に直面している単一の機関のデータに基づいて訓練されている。
本稿では, LLMを医療応用に適用するためのモデルに依存しない, パラメータ効率のよいフェデレーション学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T18:48:21Z) - Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models [45.285970665585914]
本稿では,継続的学習のための包括的枠組みを提案する。
モデル微調整のためのリアルタイムガイダンスを提供するマルチモーダル多層RAGシステムを用いる。
動的知識蒸留フレームワークを導入する。
論文 参考訳(メタデータ) (2025-12-15T08:09:40Z) - EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents [63.43699771428243]
EmbodiedBenchは、視覚駆動型エンボディエージェントを評価するために設計された広範囲なベンチマークである。
我々はEmbodiedBench内のプロプライエタリおよびオープンソースMLLMを24件評価した。
MLLMは高いレベルのタスクで優れるが、低レベルの操作に苦戦し、最高のモデルであるGPT-4oは平均28.9%のスコアしか獲得できなかった。
論文 参考訳(メタデータ) (2025-02-13T18:11:34Z) - Towards a Multimodal Large Language Model with Pixel-Level Insight for Biomedicine [23.716953682681975]
MedPLIBという名前のバイオメディカルドメインのための新しいエンド・ツー・エンド・マルチモーダル・大規模言語モデルを導入する。
視覚的質問応答(VQA)、任意のピクセルレベルのプロンプト(ポイント、バウンディングボックス、自由形式の形状)、ピクセルレベルの接地をサポートする。
その結果,MedPLIBは複数の医学的視覚言語タスクにおいて最先端の結果を得たことが示唆された。
論文 参考訳(メタデータ) (2024-12-12T13:41:35Z) - ExGra-Med: Extended Context Graph Alignment for Medical Vision-Language Models [95.47808515575382]
ExGra-Medは、医療AIのビジョン言語統合のための新しいフレームワークである。
画像、命令応答、拡張キャプションを潜在空間にアライメントし、セマンティックグラウンドとクロスモーダルコヒーレンスを前進させる。
プレトレーニングデータの10%しか使用せず、VQA-RADで20.13%向上し、フルデータパフォーマンスに近づいた。
論文 参考訳(メタデータ) (2024-10-03T15:52:03Z) - FEDKIM: Adaptive Federated Knowledge Injection into Medical Foundation Models [54.09244105445476]
本研究は,フェデレート・ラーニング・フレームワーク内で医療基盤モデルを拡張するための新しい知識注入手法であるFedKIMを紹介する。
FedKIMは軽量なローカルモデルを活用して、プライベートデータから医療知識を抽出し、この知識を集中基盤モデルに統合する。
7つのモードで12タスクを対象に実験を行い,FedKIMの有効性について検討した。
論文 参考訳(メタデータ) (2024-08-17T15:42:29Z) - Medical Vision-Language Pre-Training for Brain Abnormalities [96.1408455065347]
本稿では,PubMedなどの公共リソースから,医用画像・テキスト・アライメントデータを自動的に収集する方法を示す。
特に,まず大きな脳画像テキストデータセットを収集することにより,事前学習プロセスの合理化を図るパイプラインを提案する。
また,医療領域におけるサブフィギュアをサブキャプションにマッピングするというユニークな課題についても検討した。
論文 参考訳(メタデータ) (2024-04-27T05:03:42Z) - Med-MoE: Mixture of Domain-Specific Experts for Lightweight Medical Vision-Language Models [17.643421997037514]
差別的, 生成的両マルチモーダル医療課題に対処する新しい枠組みを提案する。
Med-MoEの学習は、マルチモーダル医療アライメント、命令チューニングとルーティング、ドメイン固有のMoEチューニングの3つのステップで構成されている。
我々のモデルは最先端のベースラインに匹敵する性能を達成できる。
論文 参考訳(メタデータ) (2024-04-16T02:35:17Z) - Towards a clinically accessible radiology foundation model: open-access and lightweight, with automated evaluation [113.5002649181103]
オープンソースの小型マルチモーダルモデル(SMM)を訓練し、放射線学における未測定臨床ニーズに対する能力ギャップを埋める。
トレーニングのために,697万以上の画像テキストペアからなる大規模なデータセットを組み立てる。
評価のために,GPT-4に基づく実測値CheXpromptを提案する。
LlaVA-Radの推論は高速で、単一のV100 GPU上でプライベート設定で実行できる。
論文 参考訳(メタデータ) (2024-03-12T18:12:02Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。