論文の概要: Multi-model fusion for Aerial Vision and Dialog Navigation based on
human attention aids
- arxiv url: http://arxiv.org/abs/2308.14064v1
- Date: Sun, 27 Aug 2023 10:32:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2023-08-29 17:18:08.365792
- Title: Multi-model fusion for Aerial Vision and Dialog Navigation based on
human attention aids
- Title(参考訳): 注意支援に基づく空中視覚と対話ナビゲーションのための多モデル融合
- Abstract要約: 本稿では,2023年ICCV会話史のための航空航法課題について述べる。
本稿では,人間注意支援型トランスフォーマモデル(HAA-Transformer)と人間注意支援型LSTMモデル(HAA-LSTM)の融合訓練方法を提案する。
- 参考スコア(独自算出の注目度): 69.98258892165767
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Drones have been widely used in many areas of our daily lives. It relieves
people of the burden of holding a controller all the time and makes drone
control easier to use for people with disabilities or occupied hands. However,
the control of aerial robots is more complicated compared to normal robots due
to factors such as uncontrollable height. Therefore, it is crucial to develop
an intelligent UAV that has the ability to talk to humans and follow natural
language commands. In this report, we present an aerial navigation task for the
2023 ICCV Conversation History. Based on the AVDN dataset containing more than
3k recorded navigation trajectories and asynchronous human-robot conversations,
we propose an effective method of fusion training of Human Attention Aided
Transformer model (HAA-Transformer) and Human Attention Aided LSTM (HAA-LSTM)
model, which achieves the prediction of the navigation routing points and human
attention. The method not only achieves high SR and SPL metrics, but also shows
a 7% improvement in GP metrics compared to the baseline model.
- Abstract(参考訳): ドローンは私たちの日常生活の多くの地域で広く使われている。
これは、常にコントローラーを握ることの負担を軽減し、障害や占領された手を持つ人々のために、ドローンのコントロールを使いやすくする。
しかし、制御不能高さなどの要因により、通常のロボットに比べて空中ロボットの制御は複雑である。
したがって、人間と会話し、自然言語コマンドに従う能力を持つインテリジェントなUAVを開発することが不可欠である。
本稿では,2023年ICCV会話史のための航空航法課題について述べる。
3k以上のナビゲーショントラジェクトリと非同期なヒューマンロボット会話を含むAVDNデータセットに基づいて、ナビゲーションルーティングポイントと人間の注意を予測できる、ヒューマンアテンション支援トランスフォーマーモデル(HAA-Transformer)とヒューマンアテンション支援LSTM(HAA-LSTM)モデルの融合訓練法を提案する。
この手法は,高いSR値とSPL値を達成するだけでなく,ベースラインモデルと比較して,GP値の7%向上を示す。
関連論文リスト
- Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation [60.07205156194741]
身体的なナビゲーションでは、エージェントが言語や視覚的な観察を、実際に見たことのない環境を通して実際のロボットを駆動する空間的な行動の流れにマッピングする必要がある。
統合エージェントアーキテクチャであるUni-LaViRAを4つのタスクファミリと4つの異種実ロボットに拡張する。
論文 参考訳(メタデータ) (2026-05-26T18:52:04Z) - AURA: Multimodal Shared Autonomy for Real-World Urban Navigation [49.419374037785815]
複雑な都市環境でのロングホライゾンナビゲーションは、連続した人間の操作に大きく依存している。
AURA(Assistive Urban Robot Autonomy)は、都市ナビゲーションを高レベルなヒューマンインストラクションと低レベルなAI制御に分解する新しいマルチモーダルフレームワークである。
AURAは、効果的に人間の指示に従い、手動操作の労力を減らし、ナビゲーションの安定性を改善し、オンライン適応を可能にしている。
論文 参考訳(メタデータ) (2026-04-02T05:59:31Z) - DreamControl-v2: Simpler and Scalable Autonomous Humanoid Skills via Trainable Guided Diffusion Priors [20.558671221723422]
本研究では,ヒューマノイドロボットの運動空間に直接誘導拡散モデルを訓練する改良されたフレームワークを提案する。
我々のアプローチは、より大きなトレーニングデータ混在のために、幅広いスキルを捉えていることを実証しています。
下流のロバストなRLポリシーを実現するためには,参照トラジェクトリの生成が重要であることを示す。
論文 参考訳(メタデータ) (2026-03-31T20:11:49Z) - ZeroWBC: Learning Natural Visuomotor Humanoid Control Directly from Human Egocentric Video [52.78703020909145]
我々は、人間中心のビデオから直接、自然なヒューマノイドビジュモータ制御ポリシーを学ぶ新しいフレームワークであるZeroWBCを紹介した。
提案手法はまず視覚言語モデル(VLM)を微調整し,テキスト命令とエゴセントリックな視覚コンテキストに基づく将来の身体全体の動作を予測する。
ユニツリーG1ヒューマノイドロボットの実験では,動作の自然性と汎用性において,本手法がベースラインアプローチより優れていることが示された。
論文 参考訳(メタデータ) (2026-03-10T04:19:43Z) - Accelerating Robotic Reinforcement Learning with Agent Guidance [17.75786047468276]
強化学習(RL)は、自律ロボットが試行錯誤を通じて汎用的な操作スキルを習得するための強力なパラダイムを提供する。
近年のHuman-in-the-Loop(HIL)手法は,人間の修正によってトレーニングを加速するが,この手法はスケーラビリティの障壁に直面している。
エージェント誘導政策探索(AGPS)は,人間の監督者をマルチモーダルエージェントに置き換えることで,トレーニングパイプラインを自動化するフレームワークである。
論文 参考訳(メタデータ) (2026-02-12T14:09:32Z) - DroneVLA: VLA based Aerial Manipulation [2.1645011609137295]
本研究は,高レベルの自然言語コマンドを解釈してオブジェクトを検索し,人間の手に届ける,自律航空操作システムという新しい概念を導入する。
このシステムは、Grounding DINOとVision-Language-Actionモデルに基づくMediaPipeと、1-DOFグリップとIntel RealSense RGB-Dカメラを備えたカスタムドローンを統合することを意図している。
実世界におけるローカライゼーションとナビゲーションの実証実験により,最大0.164m,0.070m,0.084m,平均ユークリッド,ルート平均2乗のシステムの有効性を実証した。
論文 参考訳(メタデータ) (2026-01-20T10:08:00Z) - HoverAI: An Embodied Aerial Agent for Natural Human-Drone Interaction [2.6822193190929444]
HoverAIは、ドローンモビリティ、インフラストラクチャ非依存の視覚投影、リアルタイムの会話AIを統合プラットフォームに統合する、実施済みの航空エージェントである。
HoverAIは、視覚と音声を通じてユーザを知覚し、ユーザ人口に適応するリップシンクアバターを介して応答する。
論文 参考訳(メタデータ) (2026-01-20T09:59:49Z) - HACTS: a Human-As-Copilot Teleoperation System for Robot Learning [47.9126187195398]
HACTS(Human-As-Copilot Teleoperation System)は,ロボットアームと遠隔操作ハードウェアを双方向でリアルタイムに同期させるシステムである。
このシンプルで効果的なフィードバックメカニズムは、自動運転車のステアリングホイールに似たもので、人間の操縦士がシームレスに介入し、将来の学習のために行動補正データを収集することを可能にする。
論文 参考訳(メタデータ) (2025-03-31T13:28:13Z) - Learning Human Perception Dynamics for Informative Robot Communication [21.170542003568674]
CoNav-Mazeは、ロボットが局所的な知覚を用いてナビゲートし、人間のオペレーターが不正確な地図に基づいてガイダンスを提供するシミュレーションロボット環境である。
効率的な人ロボット協調を実現するため,情報ゲインモンテカルロ木探索(IG-MCTS)を提案する。
Central to IG-MCTSは、人間がロボットのコミュニケーションからどのように情報を抽出するかを推定する、人間の知覚力学モデルである。
論文 参考訳(メタデータ) (2025-02-03T22:08:04Z) - Proximal Control of UAVs with Federated Learning for Human-Robot Collaborative Domains [3.1043493260209805]
本研究では,Long Short-Term Memory (LSTM) Deep Neural Networks に基づく行動認識制御手法を提案する。
実際のロボットによる実験は96%以上の精度を達成した。
論文 参考訳(メタデータ) (2024-12-03T21:57:04Z) - Neuromorphic Attitude Estimation and Control [17.895261339368815]
本研究では、スパイキングニューラルネットワーク(SNN)を用いた最初のニューロモルフィック制御システムを提案する。
そこで本手法を低レベル姿勢推定・制御に応用し,SNNを小さなクラジフリー上に配置する。
我々の研究は、高エネルギー効率で低遅延のニューロモルフィックオートパイロットの基礎となる、ニューロモルフィック・エンド・ツー・エンド制御の実現可能性を示している。
論文 参考訳(メタデータ) (2024-11-21T08:54:45Z) - Combating Spatial Disorientation in a Dynamic Self-Stabilization Task Using AI Assistants [5.42300240053097]
空間的不整合は、致命的な航空機事故の主要な原因である。
本稿では、パイロットがバランスを維持し、回収不能な制御損失を防止できるAIエージェントの可能性について検討する。
論文 参考訳(メタデータ) (2024-09-09T21:06:22Z) - Human-Agent Joint Learning for Efficient Robot Manipulation Skill Acquisition [48.65867987106428]
本稿では,人間とロボットの協調学習システムについて紹介する。
これにより、ロボットエンドエフェクターの制御を学習支援エージェントと共有することができる。
これにより、ダウンストリームタスクにおいて、収集されたデータが十分な品質であることを保証しながら、人間の適応の必要性を減らすことができる。
論文 参考訳(メタデータ) (2024-06-29T03:37:29Z) - AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents [109.3804962220498]
AutoRTは、人間の監督を最小限に抑えて、完全に見えないシナリオで運用ロボットの展開をスケールアップするシステムである。
われわれはAutoRTが複数の建物にまたがる20以上のロボットに指示を提示し、遠隔操作と自律ロボットポリシーを通じて77万個の実ロボットエピソードを収集するデモを行った。
実験により,AutoRTが収集した「未使用データ」は極めて多種多様であり,AutoRTのLLMを使用することで,人間の好みに合わせることができるデータ収集ロボットの指示が可能であることを実証した。
論文 参考訳(メタデータ) (2024-01-23T18:45:54Z) - Target-Grounded Graph-Aware Transformer for Aerial Vision-and-Dialog
Navigation [10.25089706534778]
本報告では,ICCV CLVL 2023におけるAVDNチャレンジの入賞方法について詳述する。
Aerial Navigation from Dialog History (andH)タスクに対処するため、ドローンエージェントが対話履歴と空中観測を関連付ける必要がある。
ドローンエージェントのクロスモーダルグラウンド機能を改善するために,Target-Grounded Graph-Aware Transformer (TG-GAT) フレームワークを提案する。
論文 参考訳(メタデータ) (2023-08-22T16:45:35Z) - AZTR: Aerial Video Action Recognition with Auto Zoom and Temporal
Reasoning [63.628195002143734]
本稿では,空中映像の行動認識のための新しい手法を提案する。
提案手法は,UAVを用いて撮影したビデオに対して設計されており,エッジやモバイルデバイス上でも動作可能である。
我々は、カスタマイズされたオートズームを使用して、人間のターゲットを自動的に識別し、適切にスケールする学習ベースのアプローチを提案する。
論文 参考訳(メタデータ) (2023-03-02T21:24:19Z) - Aerial Vision-and-Dialog Navigation [10.596163697911525]
本稿では,Aerial Vision-and-Dialog Navigation (AVDN)を紹介した。
連続した環境でドローンシミュレータを構築し、3k以上の航法軌跡を記録した新しいAVDNデータセットを収集する。
本研究では,ナビゲーション経路と人的注意の両方を予測するための効果的なヒューマンアテンション支援変換モデル(HAA-Transformer)を提案する。
論文 参考訳(メタデータ) (2022-05-24T17:28:14Z) - Model Predictive Control for Fluid Human-to-Robot Handovers [50.72520769938633]
人間の快適さを考慮に入れた計画運動は、人間ロボットのハンドオーバプロセスの一部ではない。
本稿では,効率的なモデル予測制御フレームワークを用いてスムーズな動きを生成することを提案する。
ユーザ数名の多様なオブジェクトに対して,人間とロボットのハンドオーバ実験を行う。
論文 参考訳(メタデータ) (2022-03-31T23:08:20Z) - Socially Compliant Navigation Dataset (SCAND): A Large-Scale Dataset of
Demonstrations for Social Navigation [92.66286342108934]
社会ナビゲーションは、ロボットのような自律的なエージェントが、人間のような他の知的エージェントの存在下で、社会的に従順な方法でナビゲートする能力である。
私たちのデータセットには8.7時間、128の軌道、25マイルの社会的に適合した人間の遠隔運転デモが含まれています。
論文 参考訳(メタデータ) (2022-03-28T19:09:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。