論文の概要: From Transparent Labware Segmentation to Collision Avoidance: A Real-Time Edge-Aware Perception Pipeline
- arxiv url: http://arxiv.org/abs/2608.04769v1
- Date: Wed, 05 Aug 2026 12:34:34 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.922244
- Title: From Transparent Labware Segmentation to Collision Avoidance: A Real-Time Edge-Aware Perception Pipeline
- Title(参考訳): 透明なラベルウェアセグメンテーションから衝突回避:リアルタイムエッジ認識認識パイプライン
- Authors: Shijun Ding, Chen Qian, Weiwei Shang, Junlin Xiong,
- Abstract要約: 本稿では,透明ガラスでリアルタイムにロボット衝突を回避できるエッジ対応のインスタンスセグメンテーションフレームワークを提案する。
透明な容器は、屈折、反射、安定した内部テクスチャの欠如により従来のセグメンテーションを損なう。
我々は,一段階のリアルタイムインスタンスセグメンテーションバックボーンを軽量なエッジ検出ブランチ,エッジ誘導アテンション融合,パラメータフリーSimAMモジュールで拡張する。
拡張されたモデルは比較手法の中で97.80の最高境界Fスコアを達成し、YOLOでプロンプトされたFastSAMフレームワークを18.93BFポイント上回った。
- 参考スコア(独自算出の注目度): 13.84351152301007
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This paper presents an edge-aware instance segmentation framework that enables real-time robotic collision avoidance with transparent laboratory glassware using purely visual perception. Transparent vessels defy conventional segmentation due to refraction, specular reflection, and the absence of stable interior texture, yet their boundary contours remain comparatively reliable visual cues. Exploiting this observation, we augment a one-stage real-time instance segmentation backbone with a lightweight edge-detection branch, edge-guided attention fusion, and a parameter-free SimAM module, and further construct LabGlass-IS, a 3485-image, 21-category instance segmentation dataset of real laboratory glassware. The enhanced model achieves the highest Boundary F-score of 97.80 among compared methods, outperforming the YOLO-prompted FastSAM framework by 18.93 BF points. Furthermore, it maintains an inference speed of 7.1ms per frame and requires only 2.85% of the parameters of the closest accuracy competitor. Multi-view triangulation of mask centroids further provides 3D positions for conservative bounding-volume collision constraints. Real-robot trials achieve a 93.3% collision avoidance success rate, indicating the feasibility of the proposed perception-to-action pipeline for robot collision avoidance among fragile transparent objects. Our code is available at https://github.com/havishamy/TransYOLO_3D. Our video is available at https://havishamy.github.io/paper-videos/.
- Abstract(参考訳): 本稿では,透明なガラス製品を用いたロボットによるリアルタイム衝突回避を実現するための,エッジ対応のインスタンスセグメンテーションフレームワークを提案する。
透明な容器は、屈折、反射、安定した内部テクスチャの欠如により従来のセグメンテーションを損なうが、その境界の輪郭は比較的信頼性の高い視覚的手がかりのままである。
本研究は,1段階のリアルタイムインスタンスセグメンテーションバックボーンを軽量エッジ検出ブランチ,エッジ誘導アテンション融合,パラメータフリーSimAMモジュールで拡張し,3485イメージ21カテゴリの実際のガラス製品のLabGlass-ISを構築した。
拡張されたモデルは比較手法の中で97.80の最高境界Fスコアを達成し、YOLOでプロンプトされたFastSAMフレームワークを18.93BFポイント上回った。
さらに、フレーム当たり7.1msの推論速度を維持し、最も近い精度の競合のパラメータの2.85%しか必要としない。
マスクセントロイドの多視点三角測量は、保存的境界体積衝突制約に対してさらに3D位置を与える。
実ロボット実験は93.3%の衝突回避率を実現し、脆弱な透明物体間のロボット衝突回避のための知覚対作用パイプラインの実現可能性を示している。
私たちのコードはhttps://github.com/havishamy/TransYOLO_3Dで公開されています。
私たちのビデオはhttps://havishamy.github.io/paper-videos/で公開されています。
関連論文リスト
- Real-Time Structural Detection for Indoor Navigation from 3D LiDAR Using Bird's-Eye-View Images [0.0]
既存の3D手法は計算が禁じられているが、従来の2D幾何学的手法は頑丈さを欠いている。
本稿では,3次元LiDARデータを2D BirdのEye-View画像に投影し,マッピングとナビゲーションに関連する構造要素の効率的な検出を可能にするリアルタイムフレームワークを提案する。
論文 参考訳(メタデータ) (2026-03-20T10:15:49Z) - Transparent Fragments Contour Estimation via Visual-Tactile Fusion for Autonomous Reassembly [69.97596838714595]
視覚触覚融合に基づく一般的な透過的断片輪郭推定フレームワークを提案する。
触覚情報を視覚的手がかりと融合させることにより,視覚触覚融合材料を提案する。
実験の結果,提案手法の有効性が示された。
論文 参考訳(メタデータ) (2026-03-18T14:58:17Z) - A Contrastive Fewshot RGBD Traversability Segmentation Framework for Indoor Robotic Navigation [0.7258309433541204]
純粋な視覚ベースのモデルは、しばしば椅子の脚のような薄い障害物を検出することができず、深刻な安全性のリスクを生じさせる。
RGB画像とスパース1Dレーザー深度情報を利用するマルチモーダルセグメンテーションフレームワークを提案する。
提案手法は, 最大9%のmIoUを1ショットおよび5ショット設定で達成する。
論文 参考訳(メタデータ) (2026-03-06T22:56:39Z) - Fourier Boundary Features Network with Wider Catchers for Glass Segmentation [12.465008923418406]
反射面と透過ガラスのセグメンテーションを制約する新しい手法を提案する。
提案手法はガラス画像分割における最先端技術 (SOTA) 法と比較して, セグメンテーション性能が向上する。
論文 参考訳(メタデータ) (2024-05-15T15:52:27Z) - Temporal Action Localization with Enhanced Instant Discriminability [66.76095239972094]
時間的行動検出(TAD)は、すべての行動境界とその対応するカテゴリを、トリミングされていないビデオで検出することを目的としている。
本稿では,既存の手法による動作境界の不正確な予測を解決するために,TriDetという一段階のフレームワークを提案する。
実験結果から,複数のTADデータセット上でのTriDetの堅牢性と最先端性能が示された。
論文 参考訳(メタデータ) (2023-09-11T16:17:50Z) - CabiNet: Scaling Neural Collision Detection for Object Rearrangement
with Procedural Scene Generation [54.68738348071891]
私たちはまず、さまざまな日常環境において、650万以上の散らばったシーン(前よりも桁違いに多い)を生成します。
このデータから合成部分点雲をレンダリングし、それをCabiNetモデルアーキテクチャのトレーニングに使用します。
CabiNetは、オブジェクトとシーンポイントの雲を受け入れる衝突モデルである。
論文 参考訳(メタデータ) (2023-04-18T21:09:55Z) - FastPillars: A Deployment-friendly Pillar-based 3D Detector [63.0697065653061]
既存のBEVベースの(つまりバードアイビュー)検出器は、トレーニングと推論を高速化するためにスパース・コンボリューション(SPConv)を好む。
FastPillarsは、CenterPoint(SPConvベース)よりも1.8倍のスピードアップと3.8mAPH/L2の改善で、Openデータセットの最先端の精度を提供する
論文 参考訳(メタデータ) (2023-02-05T12:13:27Z) - Detecting Line Segments in Motion-blurred Images with Events [38.39698414942873]
既存のラインセグメント検出方法は、動きのぼやけが発生したときにラインセグメントを検出する際に、厳しい性能劣化に直面している。
本稿では,画像やイベントの相補的な情報を利用して,動きのぼやけた線分を頑健に検出することを提案する。
提案手法は, FE-Wireframeで事前学習し, FE-Blurframeで微調整したモデルを用いて, 平均構造平均精度(msAP)を63.3%向上させる。
論文 参考訳(メタデータ) (2022-11-14T14:00:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。