論文の概要: MS-MEM: Multi-Skill Manipulation-Enhanced Mapping via Uncertainty- and Disturbance-Aware Action Selection
- arxiv url: http://arxiv.org/abs/2609.02493v1
- Date: Wed, 02 Sep 2026 12:01:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-03 17:53:18.300639
- Title: MS-MEM: Multi-Skill Manipulation-Enhanced Mapping via Uncertainty- and Disturbance-Aware Action Selection
- Title(参考訳): MS-MEM:不確実性および外乱認識行動選択によるマルチスキルマニピュレーション強化マッピング
- Authors: Yitian Shi, Jesper Mücke, Nils Dengler, Sicong Pan, Rania Rayyes, Maren Bennewitz,
- Abstract要約: マルチスキルマニピュレーション強化マッピング(Multi-Skill Manipulation-Enhanced Mapping、MS-MEM)は、不確実性を考慮したマッピングのための明らかなフレームワークである。
MS-MEMは、アクティブな視点選択、オブジェクトのプッシュ、把握を統合している。
シーンの乱れを著しく低減しつつ、マッピング精度を向上する。
- 参考スコア(独自算出の注目度): 7.39545658052441
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Accurate scene understanding in confined, cluttered spaces such as shelves is essential for service robots, as many everyday tasks require them to locate and retrieve objects reliably. Yet, it remains challenging due to severe occlusions, restricted accessibility, and the need to avoid excessive scene changes. In this paper, we propose Multi-Skill Manipulation-Enhanced Mapping (MS-MEM), an evidential framework for uncertainty-aware mapping that integrates active viewpoint selection, object pushing, and grasping. MS-MEM combines scene-level metric-semantic evidential belief estimators with an uncertainty-aware grasp representation. This representation is learned using a novel full-evidential grasp estimator that models both grasp affordance and orientation uncertainty. In our framework, candidate perception and manipulation actions are evaluated within a unified action selection pipeline using a common information gain criterion. For manipulation actions, we further introduce a collateral disturbance constraint (CDC) that discourages excessive changes to confident regions of the scene belief. This enables MS-MEM to select actions that effectively reduce map uncertainty while limiting collateral scene changes. Experimental results show that, compared with single-skill and unconstrained baselines that ignore scene disturbance, MS-MEM achieves higher mapping accuracy while substantially reducing scene disturbance, highlighting the synergistic effects of active viewpoint selection, push, and grasp actions.
- Abstract(参考訳): 棚などの密集した散らばった空間における正確なシーン理解は、サービスロボットにとって不可欠である。
しかし、厳密な閉塞、アクセシビリティの制限、過度なシーンの変更を避ける必要性などにより、依然として困難である。
本稿では、アクティブな視点選択、オブジェクトのプッシュ、グルーピングを統合した不確実性認識マッピングのための明らかなフレームワークであるMulti-Skill Manipulation-Enhanced Mapping (MS-MEM)を提案する。
MS-MEMは、シーンレベルのメトリック・セマンティックな明白な信念推定と不確実性を考慮した把握表現を組み合わせる。
この表現は、アベイランスと配向の不確実性の両方をモデル化する、新しいフル・エビデンス・グリーニング推定器を用いて学習される。
本フレームワークでは、共通情報ゲイン基準を用いて、統合された行動選択パイプライン内で、候補認識と操作動作を評価する。
操作行動には,シーン信念の自信のある領域への過度な変化を回避できる側方障害制約(CDC)も導入する。
これにより、MS-MEMは地図の不確実性を効果的に低減し、横方向のシーン変更を制限できる。
その結果,MS-MEMはシーンの乱れを無視する単一スキルと非拘束のベースラインと比較して,シーンの乱れを著しく低減し,アクティブな視点選択,プッシュ,把握動作の相乗効果を強調しながら,マッピング精度の向上を実現していることがわかった。
関連論文リスト
- Learning When to Listen: Gated Affect Fusion for Human Motion Prediction [0.0]
本研究では,感情条件付き予測システムの有用性と時間的制約について検討する。
本稿では,Gated Affect Transformer (GAT)を導入し,モーダル情報の流れを動的に制御する。
以上の結果から, 顔への影響は相補的行動の手がかりとみなす必要があるという実証的証拠が得られた。
論文 参考訳(メタデータ) (2026-07-01T00:47:02Z) - Weakly Supervised Camouflaged Object Detection Based on the SAM Model and Mask Guidance [49.06684374007753]
制約を克服するために,キャモフラージュされた物体検出のための新しい弱い教師付きアプローチを導入する。
具体的には,エッジのあいまいさに対処し,検出に失敗する新しいネットワークMGNetを提案する。
そこで本研究では,Segment Anything Model(SAM)とバウンディングボックスプロンプトを併用して擬似ラベルを生成するBoxSAMを提案する。
論文 参考訳(メタデータ) (2026-05-25T03:26:13Z) - ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning [55.562958315741646]
本稿では, アクティブな視覚的エビデンス獲得とマルチモーダル推論を兼ね備えたエージェントフレームワークであるActFERを提案する。
さらに,エージェントFERに適した強化学習アルゴリズムである実用性キャリブレーションGRPOを開発した。
論文 参考訳(メタデータ) (2026-04-10T05:53:19Z) - TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models [59.13964209628383]
VLA(Vision-Language-Action)ポリシーは、言語指示や視覚的な観察をロボット行動にマッピングする上で大きな進歩を見せている。
本稿では,VLA政策における乱れや外見に起因したバイアスを明示的に軽減する単純な推論時ガイダンス機構であるTAG(Target-Agnostic Guidance)を提案する。
我々は, LIBERO, LIBERO-Plus, VLABenchなどの標準操作ベンチマーク上でTAGを評価し, クラッタ下での堅牢性を一貫して改善し, ニアミスや不正なオブジェクト実行を減らす。
論文 参考訳(メタデータ) (2026-03-25T17:56:32Z) - Transparent and Coherent Procedural Mistake Detection [30.540514590818265]
手続き的誤り検出(英: Procedural mis detection、PMD)は、人間がタスクをうまく実行したかどうかを分類する難しい問題である(手続き的テキストで特定)。
我々は、意思決定に視覚的自己対話的合理性を生成するためにPMDを拡張した。
近年のヴィジュアル・アンド・ランゲージモデル(VLM)で観察される印象的かつ成熟した画像理解能力を考えると、個々のフレームに基づいてPMDに適したベンチマークデータセットをキュレートする。
論文 参考訳(メタデータ) (2024-12-16T16:13:55Z) - Improving Vision Anomaly Detection with the Guidance of Language
Modality [64.53005837237754]
本稿では,マルチモーダルの観点から視覚モダリティの課題に取り組む。
本稿では,冗長な情報問題とスパース空間問題に対処するために,クロスモーダルガイダンス(CMG)を提案する。
視覚異常検出のためのよりコンパクトな潜在空間を学習するために、CMLEは言語モダリティから相関構造行列を学習する。
論文 参考訳(メタデータ) (2023-10-04T13:44:56Z) - MMNet: Multi-Collaboration and Multi-Supervision Network for Sequential
Deepfake Detection [81.59191603867586]
シークエンシャルディープフェイク検出は、回復のための正しいシーケンスで偽の顔領域を特定することを目的としている。
偽画像の復元には、逆変換を実装するための操作モデルの知識が必要である。
顔画像の空間スケールや逐次順列化を扱うマルチコラボレーション・マルチスーパービジョンネットワーク(MMNet)を提案する。
論文 参考訳(メタデータ) (2023-07-06T02:32:08Z) - Calibrating Undisciplined Over-Smoothing in Transformer for Weakly Supervised Semantic Segmentation [51.14107156747967]
弱教師付きセマンティックセマンティックセマンティクス(WSSS)は、完全な教師付きアプローチよりもアノテーションが少ないため、かなりの注目を集めている。
本研究では,非学際的な過密化に対する深い注意を抑えるための適応的再活性化機構 (AReAM) を提案する。
AReAMは既存のWSSS手法と比較してセグメンテーション性能を大幅に改善し、ノイズを低減し、関連するセマンティック領域に焦点を絞る。
論文 参考訳(メタデータ) (2023-05-04T19:11:33Z) - Uncertain Facial Expression Recognition via Multi-task Assisted
Correction [43.02119884581332]
MTACと呼ばれる不確実な表情認識に対処するためのマルチタスク支援補正法を提案する。
具体的には、信頼度推定ブロックと重み付け正則化モジュールを用いて、固体試料をハイライトし、バッチ毎に不確かさサンプルを抑圧する。
RAF-DB、AffectNet、AffWild2データセットの実験は、MTACが合成および実際の不確実性に直面した際のベースラインよりも大幅に改善されていることを示した。
論文 参考訳(メタデータ) (2022-12-14T10:28:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。