論文の概要: S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information
- arxiv url: http://arxiv.org/abs/2607.26047v1
- Date: Tue, 28 Jul 2026 17:56:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.955348
- Title: S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information
- Title(参考訳): S2A2:音響空間情報を用いた操作課題の視覚的模倣学習
- Authors: Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke Kojima,
- Abstract要約: 音響情報は、物体の位置、材料特性、接触や動きによって引き起こされる変化に関する豊富な手がかりを提供する。
本稿では,模倣学習のための音響認識操作タスクについて紹介する。
本稿では,視覚的特徴と音響的空間的および音響的信号情報を統合するマルチモーダル模倣学習フレームワークを提案する。
- 参考スコア(独自算出の注目度): 4.065502917666599
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Acoustic information provides rich cues about object location, material properties, and changes caused by contact or motion. This paper introduces a new set of acoustic-aware manipulation tasks for imitation learning, in which robots must use auditory cues to determine manipulation targets. These tasks require sound source localization and identification for active exploration in robotic manipulation. Also, we propose a multimodal imitation learning framework, Spatial-Spectral Audio Action (S2A2), that integrates visual features with acoustic spatial and acoustic signal information for the acoustic-aware manipulation tasks. We implemented S2A2 models that integrates policies such as ACT, Diffusion Policy, VQ-BeT, and $π_0$, into our framework. Simulation experiments showed that the proposed method is the most effective for tasks requiring both position and timbre. Furthermore, real-robot experiments confirm the applicability of the proposed tasks and framework to real-world manipulation.
- Abstract(参考訳): 音響情報は、物体の位置、材料特性、接触や動きによって引き起こされる変化に関する豊富な手がかりを提供する。
本稿では,ロボットが操作対象を決定するために聴覚的手がかりを使わなければならない,模倣学習のための新しい音響的操作タスクを提案する。
これらのタスクは、ロボット操作の活発な探索のために、音源の定位と識別を必要とする。
また,視覚的特徴と音響的空間的および音響的信号情報を統合するマルチモーダルな模倣学習フレームワークであるS2A2を提案する。
我々は、ACT、拡散ポリシー、VQ-BeT、および$π_0$といったポリシーをフレームワークに統合するS2A2モデルを実装した。
シミュレーション実験により,提案手法は位置と音色の両方を必要とするタスクに対して最も効果的であることがわかった。
さらに、実ロボット実験により、提案したタスクとフレームワークが実世界の操作に適用可能であることを確認する。
関連論文リスト
- From Instruction to Event: Sound-Triggered Mobile Manipulation [40.389756061779444]
エージェントは、明示的な動作指示を伴わずに、アクティブに音波を知覚し、対話しなくてはならない。
これらのタスクを支援するために,音響レンダリングと物理的相互作用を統合するデータプラットフォームHabitat-Echoを開発した。
広汎な実験により,提案したベースラインはエージェントに対して,ケースバイケース命令を不要にすることで,聴覚イベントを積極的に検出し,応答することを可能にする。
論文 参考訳(メタデータ) (2026-01-29T13:02:10Z) - Action Dubber: Timing Audible Actions via Inflectional Flow [27.978450110521486]
聴取行動の時間的局所化の課題について紹介する。
可聴行動の可聴時間座標を同定することを目的としている。
キーアクションは屈折運動によって駆動されるという前提に基づいている。
論文 参考訳(メタデータ) (2025-06-16T10:09:32Z) - Towards Robust Overlapping Speech Detection: A Speaker-Aware Progressive Approach Using WavLM [53.17360668423001]
重なり合う音声検出(OSD)は、会話中に複数の話者が重複する領域を特定することを目的としている。
本研究では,サブタスク間の相関性を高めるために,プログレッシブトレーニング戦略を活用する話者対応プログレッシブOSDモデルを提案する。
実験の結果,提案手法は,AMIテストセット上でF1スコアが82.76%の最先端性能を実現することがわかった。
論文 参考訳(メタデータ) (2025-05-29T07:47:48Z) - Acoustic Wave Manipulation Through Sparse Robotic Actuation [2.621434923709917]
本研究では,空間的にスパースなアクチュエータを通して波に影響を及ぼすことのできるロボットによって部分的に観察される音波の操作について検討する。
この問題は、新しい人工材料、超音波切断ツール、エネルギー収穫などの用途の設計に大きな可能性を秘めている。
本研究では,特定の領域に分散した音響エネルギーを集中させるか,所望のタスクに応じて抑制するかのどちらかに適用可能な,効率的なデータ駆動型ロボット学習法を開発した。
論文 参考訳(メタデータ) (2025-02-12T20:54:46Z) - ActiveRIR: Active Audio-Visual Exploration for Acoustic Environment Modeling [57.1025908604556]
環境音響モデルは、室内環境の物理的特性によって音がどのように変換されるかを表す。
本研究では,非マップ環境の環境音響モデルを効率的に構築する新しい課題であるアクティブ音響サンプリングを提案する。
我々は,音声・視覚センサストリームからの情報を利用してエージェントナビゲーションを誘導し,最適な音響データサンプリング位置を決定する強化学習ポリシーであるActiveRIRを紹介する。
論文 参考訳(メタデータ) (2024-04-24T21:30:01Z) - Learning Speech Representation From Contrastive Token-Acoustic
Pretraining [57.08426714676043]
本研究では、2つのエンコーダを用いて音素と音声を複数モーダル空間に導入するCTAP(Contrastive Token-Acoustic Pretraining)を提案する。
提案したCTAPモデルは、210k音声と音素ペアで訓練され、最小教師付きTS、VC、ASRを実現する。
論文 参考訳(メタデータ) (2023-09-01T12:35:43Z) - Impact Makes a Sound and Sound Makes an Impact: Sound Guides
Representations and Explorations [17.356402088852423]
我々は物理に基づく音響シミュレーションによる現実的なロボット操作シナリオを構築し、本質的な音キュリオシティモジュール(ISCM)を提案する。
ISCMは、堅牢な表現を学び、より効率的な探索行動に報いるために、強化学習者にフィードバックを提供する。
本研究は, 適応中, 適応中, 適応中に有効となる音による実験を行い, ISCM が学習した表現が, 視力のみのベースラインでより優れており, 訓練済みポリシーが下流タスクに適用した場合の学習プロセスの高速化を図っていることを示す。
論文 参考訳(メタデータ) (2022-08-04T14:21:06Z) - Semantic Object Prediction and Spatial Sound Super-Resolution with
Binaural Sounds [106.87299276189458]
人間は視覚的および聴覚的手がかりを統合することで、オブジェクトを強く認識し、ローカライズすることができる。
この研究は、純粋に音に基づく、音生成対象の密接なセマンティックラベリングのためのアプローチを開発する。
論文 参考訳(メタデータ) (2020-03-09T15:49:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。