論文の概要: Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation
- arxiv url: http://arxiv.org/abs/2607.02845v1
- Date: Fri, 03 Jul 2026 00:48:44 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.432475
- Title: Differential Amplifier-Inspired AmpAttention for Multi-View Robotic Manipulation
- Title(参考訳): 多視点ロボットマニピュレーションのための差動増幅器によるアンプ注意
- Abstract要約: アナログ回路の差動増幅器にインスパイアされた新しいアテンション機構であるAmpAttentionを提案する。
より信頼性の高い知覚のために、注目雑音を抑え、高信号対雑音比の信号を捕捉することを目的としている。
そこで本研究では,タスク誘導型イントラビューとビュー間AmpAttentionを統合したRVAFモデルを提案する。
- 参考スコア(独自算出の注目度): 45.639411531226074
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Multi-view robotic manipulation methods with the attention mechanism have recently achieved significant progress in both training efficiency and task performance. However, the inherent redundancy, occlusion, and viewpoint dependency in robotic view images often lead to severe attention drift. To address this challenge, we propose AmpAttention, a novel attention mechanism inspired by differential amplifiers in analog circuits. It aims to suppress attention noise and capture high signal-to-noise ratio signals for more reliable perception. Based on this, we introduce the RVAF model, which integrates task-guided intra-view and inter-view AmpAttention. Compared to previous state-of-the-art methods, RVAF achieves the optimal average success rate across 18 RLBench tasks (249 variations) while reducing training time by 33.3\%. RVAF also demonstrates strong potential in real-world high-precision tasks, exemplified by its ability to pick up a dart and accurately insert it into the red bullseye. Furthermore, we extend RVAF to RVAF++ by incorporating the SAM2 image encoder. RVAF++ achieves substantial gains on high-precision tasks, achieving a 91\% success rate on the `insert peg' task. More qualitative results are provided at the anonymous project website https://anonymous.4open.science/w/RVAF-Anonymization.
- Abstract(参考訳): 近年,アテンション機構を備えた多視点ロボット操作法は,トレーニング効率とタスク性能の両面で大きな進歩を遂げている。
しかしながら、ロボットビュー画像における固有の冗長性、閉塞性、視点依存性は、しばしば深刻な注意の漂流を引き起こす。
この課題に対処するために、アナログ回路における微分増幅器にインスパイアされた新しい注意機構であるAmpAttentionを提案する。
より信頼性の高い知覚のために、注目雑音を抑え、高信号対雑音比の信号を捕捉することを目的としている。
そこで本研究では,タスク誘導型イントラビューとビュー間AmpAttentionを統合したRVAFモデルを提案する。
従来の最先端の手法と比較して、RVAFは18のRLBenchタスク(249のバリエーション)で最適な平均成功率を達成し、トレーニング時間を33.3\%削減した。
RVAFはまた、現実世界の高精度タスクに強い可能性を示しており、ダーツを拾い上げ、正確にレッドブルシーに挿入する能力によって実証されている。
さらに SAM2 イメージエンコーダを組み込むことで RVAF を RVAF++ に拡張する。
RVAF++は精度の高いタスクで大幅に向上し、‘insert peg’タスクで91倍の成功率を達成した。
より質的な結果は匿名プロジェクトのWebサイトhttps://anonymous.4open.science/w/RVAF-Anonymizationで提供されている。
関連論文リスト
- UAV Video Deblurring via Motion-Aware Diffusion: A Path to Robust Target Detection [10.233658861023612]
無人航空機(UAV)は災害対応から交通監視まで様々なシナリオにおいて重要な役割を果たしている。
我々のゴールは、UAV目標検出性能を向上させるために、計算効率が高く効果的なビデオデブロアリング手法を検討することである。
論文 参考訳(メタデータ) (2026-08-15T14:31:16Z) - Noise-Free One-Step LoRA for Task-Driven Image Restoration with Diffusion Priors [54.200377321709546]
劣化した画像は視覚的品質を低下させるだけでなく、下流の高レベル視覚タスクを損なう。
タスク駆動画像復元(TDIR)は、復元品質とタスク性能を協調的に最適化することでこの問題に対処する。
予め訓練した拡散前処理による雑音のない1段階前処理は,TDIRを大幅に改善できることを示す。
また,タスク性能を犠牲にすることなく,知覚品質を向上させるタスク保存型GANトレーニング戦略を導入する。
論文 参考訳(メタデータ) (2026-07-28T07:51:44Z) - VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution [76.19751531910039]
本稿では,事前学習したテキストから画像へのVARモデルを,ワンステップのISRモデルに変換するフレームワークであるVARestorerを提案する。
VARestorerは、DIV2Kデータセット上で72.32 MUSIQと0.7669 CLIPIQAで最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2026-04-23T09:09:36Z) - DeepInv: A Novel Self-supervised Learning Approach for Fast and Accurate Diffusion Inversion [65.5172878666262]
拡散インバージョンは、実行可能な監視信号が欠如しているため、難しい課題である。
本稿では,Deep Inversion(DeepInv)と呼ばれる自己教師付き拡散インバージョン手法を提案する。
DeepInvはまた、パラメータ化インバージョンソルバをトレーニングするための反復的かつマルチスケールのトレーニングシステムも備えている。
論文 参考訳(メタデータ) (2026-01-04T11:27:26Z) - Blur-Robust Detection via Feature Restoration: An End-to-End Framework for Prior-Guided Infrared UAV Target Detection [29.207964743160968]
赤外線無人航空機(UAV)の標的画像は、しばしば動きのぼやけた劣化に悩まされる。
本稿では,JFD3 と呼ばれる新しい特徴ドメインのデブロアリングとエンドツーエンドのフレームワークを提案する。
IRBlurUAV実験により、JFD3は実時間効率を維持しながら優れた検出性能を発揮することが示された。
論文 参考訳(メタデータ) (2025-11-18T11:27:15Z) - BandRC: Band Shifted Raised Cosine Activated Implicit Neural Representations [0.0]
暗黙の神経表現(INR)はコンピュータビジョンコミュニティで人気を集めている。
これらのネットワークは、離散信号表現が与えられた連続信号表現を抽出することができる。
本稿では,新しいアクティベーション機能であるBand Shifted raised Cosine Activated Implicit Neural Networksを紹介する。
論文 参考訳(メタデータ) (2025-05-16T19:08:01Z) - Acc3D: Accelerating Single Image to 3D Diffusion Models via Edge Consistency Guided Score Distillation [49.202383675543466]
本稿では,単一画像から3次元モデルを生成する拡散過程の高速化に取り組むために,Acc3Dを提案する。
数段階の推論によって高品質な再構成を導出するため,ランダムノイズ状態におけるスコア関数の学習を規則化する上で重要な課題を強調した。
論文 参考訳(メタデータ) (2025-03-20T09:18:10Z) - Open-World Drone Active Tracking with Goal-Centered Rewards [62.21394499788672]
Drone Visual Active Trackingは、視覚的な観察に基づいてモーションシステムを制御することで、対象物を自律的に追跡することを目的としている。
DATは,世界初となるエア・ツー・グラウンド・トラッキング・ベンチマークである。
また,複雑なシナリオにおけるドローン追跡目標の性能向上を目的としたGC-VATを提案する。
論文 参考訳(メタデータ) (2024-12-01T09:37:46Z) - Improving Image Clustering with Artifacts Attenuation via Inference-Time Attention Engineering [1.8786950286587742]
モデルのサイズが大きくなるにつれて、マルチヘッドアテンションのパッチにハイノームアーティファクトが異常に現れる。
推論中に注意関数を操作するITAE(Inference-Time Attention Engineering)を提案する。
ITAEは、複数のデータセットのクラスタリング精度を改善し、潜在空間でより表現力のある機能を示す。
論文 参考訳(メタデータ) (2024-10-07T07:26:10Z) - Towards Robust Visual Tracking for Unmanned Aerial Vehicle with
Tri-Attentional Correlation Filters [19.831557268085234]
マルチレベルの視覚的注意を生かした新しいオブジェクト追跡フレームワークを提案する。
提案トラッカーは,UAVタスクにおける高い運用効率を維持しつつ,困難な要因に対する堅牢な相関力を備えている。
論文 参考訳(メタデータ) (2020-08-02T17:36:25Z) - ADRN: Attention-based Deep Residual Network for Hyperspectral Image
Denoising [52.01041506447195]
ノイズの多いHSIからクリーンなHSIへのマッピングを学習するために,注目に基づくディープ残差ネットワークを提案する。
実験の結果,提案手法は定量的および視覚的評価において最先端の手法よりも優れていた。
論文 参考訳(メタデータ) (2020-03-04T08:36:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。