論文の概要: Sensor-Language-Action Models
- arxiv url: http://arxiv.org/abs/2610.08244v1
- Date: Tue, 06 Oct 2026 12:26:21 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.979534
- Title: Sensor-Language-Action Models
- Title(参考訳): センサ・ランゲージ・アクションモデル
- Abstract要約: 本稿では,マルチモーダルセンサ観測,自然言語,および統合モデル内の動作を接続するフレームワークであるSensor-Language-Action(SLA)モデリングを紹介する。
116,000人以上の個人、79のセンサーモダリティ、60のアクショングループからなる大規模なSLAベンチマークを構築しています。
このフレームワーク上に構築されたOpenSLAは、階層的なアクション予測、状態理解、アクション説明のための統合されたSLAモデルです。
- 参考スコア(独自算出の注目度): 2.8562338929195334
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Sensors are useful not only for understanding the world but also for deciding what to do next. Existing sensor models however largely stop at perception: they recognize states or predict outcomes, leaving actions modeled separately through task-specific and often closed label spaces. We introduce Sensor-Language-Action (SLA) modeling, a framework that connects multimodal sensor observations, natural language, and actions within a unified model. SLA uses language as a semantic interface between sensing and acting, allowing heterogeneous actions to be represented, predicted, and explained while remaining grounded in the underlying sensor evidence. We build a large-scale SLA benchmark consisting of datasets that span more than 116,000 individuals, 79 sensor modalities, and 60 action groups, together with a multi-faceted captioning pipeline that aligns user context, sensor dynamics, and action evidence. Building on this framework, we present OpenSLA, a unified SLA model for hierarchical action prediction, state understanding, and action explanation. Extensive experiments on real-world tasks in clinical prediction, operating rooms, and metabolic health verify its superior performance over the state-of-the-art. OpenSLA also demonstrates intriguing capabilities including language-guided evidence grounding and zero-shot generalization to unseen actions and cohorts.
- Abstract(参考訳): センサーは世界を理解するだけでなく、次に何をすべきかを決めるのにも役立ちます。
既存のセンサーモデルは、状態を認識したり、結果を予測することで、タスク固有の、しばしば閉じたラベル空間を通じて別々にモデル化される。
本稿では,マルチモーダルセンサ観測,自然言語,および統合モデル内の動作を接続するフレームワークであるSensor-Language-Action(SLA)モデリングを紹介する。
SLAは、知覚と行動の間のセマンティックインターフェースとして言語を使用し、基礎となるセンサーエビデンスに基礎を置いている間、異種行動の表現、予測、説明を可能にする。
116,000人以上の個人、79のセンサーモダリティ、60のアクショングループにまたがるデータセットと、ユーザコンテキスト、センサダイナミクス、アクションエビデンスを調整した多面的なキャプションパイプラインで構成される大規模なSLAベンチマークを構築します。
このフレームワーク上に構築されたOpenSLAは、階層的なアクション予測、状態理解、アクション説明のための統合されたSLAモデルです。
臨床予測,手術室,メタボリックヘルスにおける実世界の課題に関する大規模な実験は,最先端技術よりも優れた性能を実証する。
OpenSLAはまた、言語誘導のエビデンスや、目に見えないアクションやコホートへのゼロショットの一般化など、興味深い機能を示している。
関連論文リスト
- Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining [59.2578488860426]
不均一なマルチモーダルリモートセンシングオブジェクト検出は、多様なセンサからオブジェクトを正確に検出することを目的としている。
既存のアプローチでは、下流の微調整中にモーダリティアライメントとタスク固有の最適化が絡み合う遅延アライメントパラダイムが採用されている。
本稿では,下流のタスク学習からモダリティアライメントを明確に分離する,統一型言語パイロット事前学習フレームワークであるBabelRSを提案する。
論文 参考訳(メタデータ) (2026-03-02T11:38:12Z) - DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge [41.030494146004806]
本稿では,逆動力学モデリングを実現するために,包括的世界知識予測を統合した新しいVLAフレームワークであるDreamVLAを提案する。
DreamVLAは、動的領域誘導の世界知識予測を導入し、空間的および意味的な手がかりと統合し、アクション計画のためのコンパクトで包括的な表現を提供する。
実世界とシミュレーション環境での実験では、ドリームVLAが実際のロボットタスクで76.7%の成功率を達成したことが示されている。
論文 参考訳(メタデータ) (2025-07-06T16:14:29Z) - SensorLM: Learning the Language of Wearable Sensors [50.95988682423808]
本稿では,自然言語によるウェアラブルセンサデータ理解を可能にするセンサ言語基盤モデルのファミリーであるSensorLMを紹介する。
本稿では,センサデータから統計的,構造的,意味的な情報を収集する階層的なキャプション生成パイプラインを提案する。
このアプローチにより、これまでで最大のセンサー言語データセットのキュレーションが可能となり、103,000人以上から5970万時間以上のデータを収集した。
論文 参考訳(メタデータ) (2025-06-10T17:13:09Z) - SensorLLM: Aligning Large Language Models with Motion Sensors for Human Activity Recognition [13.796942110105313]
本研究では,Large Language Models(LLM)がセンサ時系列データからHAR(Human Activity Recognition)を実現するためのフレームワークであるSensorLLMを紹介する。
SensorLLMはSensor-Language Alignmentステージを通じて制限に対処する。
その後のタスク・アウェア・チューニングの段階では、HAR分類のモデルを洗練し、最先端の手法に適合または超越した性能を達成する。
論文 参考訳(メタデータ) (2024-10-14T15:30:41Z) - MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in
3D World [55.878173953175356]
マルチ感覚を具現化した大規模言語モデルであるMultiPLYを提案する。
まず,500kデータからなる大規模マルチセンサインタラクションデータセットであるMultisensory Universeを収集する。
我々は,MultiPLYが多種多様な実施タスクを通じて,ベースラインを大きなマージンで上回ることを示す。
論文 参考訳(メタデータ) (2024-01-16T18:59:45Z) - Using Language Model to Bootstrap Human Activity Recognition Ambient
Sensors Based in Smart Homes [2.336163487623381]
本稿では,活動系列分類タスクにおけるLSTMに基づく構造向上のための2つの自然言語処理手法を提案する。
以上の結果から,センサ組織マップなどの有用な情報が得られることが示唆された。
我々のテストでは、埋め込みはターゲットと異なるデータセットで事前トレーニング可能であり、転送学習を可能にしている。
論文 参考訳(メタデータ) (2021-11-23T21:21:14Z) - Learning Universal Representations from Word to Sentence [89.82415322763475]
この研究は普遍的な表現学習、すなわち一様ベクトル空間における言語単位の異なるレベルへの埋め込みを導入し、探求する。
本稿では, 単語, 句, 文の観点から, 類似したデータセットを構築するためのアプローチを提案する。
適切なトレーニング設定を組み込んだよく訓練されたトランスフォーマーモデルが、効果的に普遍的な表現が得られることを実証的に検証する。
論文 参考訳(メタデータ) (2020-09-10T03:53:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。