Fugu-MT 論文翻訳(概要): PACO: Parts and Attributes of Common Objects

論文の概要: PACO: Parts and Attributes of Common Objects

arxiv url: http://arxiv.org/abs/2301.01795v1
Date: Wed, 4 Jan 2023 19:28:03 GMT
ステータス: 翻訳完了
システム内更新日: 2023-01-06 14:00:53.894365
Title: PACO: Parts and Attributes of Common Objects
Title（参考訳）: PACO: 共通オブジェクトの部分と属性
Authors: Vignesh Ramanathan, Anmol Kalia, Vladan Petrovic, Yi Wen, Baixue Zheng, Baishan Guo, Rui Wang, Aaron Marquez, Rama Kovvuri, Abhishek Kadian, Amir Mousavi, Yiwen Song, Abhimanyu Dubey, Dhruv Mahajan
Abstract要約: PACO: 共通オブジェクトの部分と属性について紹介する。 75のオブジェクトカテゴリ、456のオブジェクトパーツカテゴリ、55の属性がイメージ(LVIS)とビデオ(Ego4D)データセットにまたがっている。 260Kオブジェクトボックスにアノテートされた641Kパーシャルマスクを提供する。
参考スコア（独自算出の注目度）: 27.559972499989694
License: http://creativecommons.org/publicdomain/zero/1.0/
Abstract: Object models are gradually progressing from predicting just category labels to providing detailed descriptions of object instances. This motivates the need for large datasets which go beyond traditional object masks and provide richer annotations such as part masks and attributes. Hence, we introduce PACO: Parts and Attributes of Common Objects. It spans 75 object categories, 456 object-part categories and 55 attributes across image (LVIS) and video (Ego4D) datasets. We provide 641K part masks annotated across 260K object boxes, with roughly half of them exhaustively annotated with attributes as well. We design evaluation metrics and provide benchmark results for three tasks on the dataset: part mask segmentation, object and part attribute prediction and zero-shot instance detection. Dataset, models, and code are open-sourced at https://github.com/facebookresearch/paco.
Abstract（参考訳）: オブジェクトモデルは、ただのカテゴリラベルの予測から、オブジェクトインスタンスの詳細な説明まで、徐々に進歩しています。これは、従来のオブジェクトマスクを超えて、パートマスクや属性のようなよりリッチなアノテーションを提供する大きなデータセットの必要性を動機付ける。したがって、PACO: Parts and Attributes of Common Objectsを紹介する。 75のオブジェクトカテゴリ、456のオブジェクトパーツカテゴリ、55の属性がイメージ(LVIS)とビデオ(Ego4D)データセットにまたがっている。 260kのオブジェクトボックスにアノテートされた641kのパートマスクも提供しています。評価指標を設計し、データセット上の3つのタスクのベンチマーク結果を提供する: 部分マスクのセグメンテーション、オブジェクトと属性の予測、ゼロショットのインスタンス検出。データセット、モデル、コードはhttps://github.com/facebookresearch/paco.comでオープンソース化されている。

関連論文リスト

An Attribute-Enriched Dataset and Auto-Annotated Pipeline for Open Detection [7.531866919805308]
我々は、既存のObjects365データセットの拡張であるObjects365-Attrデータセットを紹介し、属性アノテーションによって区別する。このデータセットは、色、材料、状態、テクスチャ、トーンを含む幅広い属性のスペクトルを統合することで、オブジェクト検出の不整合を低減する。 5.6Mのオブジェクトレベルの属性記述の広範なコレクションが含まれており、1.4Mのバウンディングボックスに細心の注意を払って注釈付けされている。
論文参考訳（メタデータ） (2024-09-10T07:53:32Z)
Learning Spatial-Semantic Features for Robust Video Object Segmentation [108.045326229865]
本稿では,空間意味的特徴と識別的オブジェクトクエリを学習する,ロバストなビデオオブジェクトセグメンテーションフレームワークを提案する。 DAVIS 2017 test (textbf87.8%)、YoutubeVOS 2019 (textbf88.1%)、MOSE val (textbf74.0%)、LVOS test (textbf73.0%)を含むベンチマークデータセットの最先端性能を実現する。
論文参考訳（メタデータ） (2024-07-10T15:36:00Z)
MAC: A Benchmark for Multiple Attributes Compositional Zero-Shot Learning [33.12021227971062]
合成ゼロショット学習(CZSL)は、意味的プリミティブ(属性とオブジェクト)を無視して学習し、見知らぬ属性オブジェクトの合成を認識することを目的としている。我々は18,217のイメージと11,067のコンポジションを含む多属性合成データセットを紹介した。我々のデータセットは、より深い意味理解と高次属性関連をサポートし、CZSLタスクのより現実的で挑戦的なベンチマークを提供する。
論文参考訳（メタデータ） (2024-06-18T16:24:48Z)
CustAny: Customizing Anything from A Single Example [73.90939022698399]
10kカテゴリにわたる315kのテキストイメージサンプルを特徴とする,汎用オブジェクトの大規模なデータセットを構築するための新しいパイプラインを提案する。 MC-IDCの助けを借りて、汎用オブジェクトの柔軟なテキスト編集をサポートするゼロショットフレームワークであるCustomizing Anything (CustAny)を紹介した。当社のコントリビューションには、大規模なデータセット、CustAnyフレームワーク、新しいID処理などが含まれています。
論文参考訳（メタデータ） (2024-06-17T15:26:22Z)
1st Place Solution for MOSE Track in CVPR 2024 PVUW Workshop: Complex Video Object Segmentation [72.54357831350762]
本稿では,ビデオオブジェクトのセグメンテーションモデルを提案する。我々は大規模ビデオオブジェクトセグメンテーションデータセットを用いてモデルを訓練した。我々のモデルは、複雑なビデオオブジェクトチャレンジのテストセットで1位(textbf84.45%)を達成した。
論文参考訳（メタデータ） (2024-06-07T03:13:46Z)
EgoObjects: A Large-Scale Egocentric Dataset for Fine-Grained Object Understanding [11.9023437362986]
EgoObjectsは、きめ細かいオブジェクト理解のための大規模なエゴセントリックなデータセットである。パイロットバージョンには、50か国以上の250人の参加者が4つのウェアラブルデバイスを使って収集した9Kビデオが含まれている。 EgoObjectsはまた、各オブジェクトにインスタンスレベルの識別子をアノテートする。
論文参考訳（メタデータ） (2023-09-15T23:55:43Z)
VizWiz-FewShot: Locating Objects in Images Taken by People With Visual Impairments [74.72656607288185]
我々は、撮影した画像の視覚的内容について真に学ぼうとしていた写真家を起源とする、数発のローカライゼーションデータセットを紹介した。視覚障害者が撮影した4500枚以上の画像に、100のカテゴリの約10,000のセグメンテーションが含まれている。既存の数発のオブジェクト検出やインスタンスセグメンテーションデータセットと比較して、私たちのデータセットは、オブジェクトの穴を見つける最初のものです。
論文参考訳（メタデータ） (2022-07-24T20:44:51Z)
Discovering Object Masks with Transformers for Unsupervised Semantic Segmentation [75.00151934315967]
MaskDistillは教師なしセマンティックセグメンテーションのための新しいフレームワークである。我々のフレームワークは、低レベルの画像キューにラッチを付けず、オブジェクト中心のデータセットに限らない。
論文参考訳（メタデータ） (2022-06-13T17:59:43Z)
Scaling up instance annotation via label propagation [69.8001043244044]
本稿では,オブジェクトセグメンテーションマスクを用いた大規模データセット構築のための高効率アノテーション手法を提案する。セグメンテーションモデルによるマスク予測に階層的クラスタリングを用いることにより,これらの類似性を生かした。総アノテーション時間はたった290時間である100万個のオブジェクトセグメンテーションマスクが得られた。
論文参考訳（メタデータ） (2021-10-05T18:29:34Z)
Learning to Predict Visual Attributes in the Wild [43.91237738107603]
260K以上のオブジェクトインスタンスに対して,927K以上の属性アノテーションからなる大規模なウィジェット内属性予測データセットを導入する。本稿では,低レベルCNN機能と高レベルCNN機能の両方を利用するベースモデルを含む,これらの課題に体系的に対処する手法を提案する。これらの技術を用いることで,現状よりも3.7mAP,5.7ポイントのF1点が向上した。
論文参考訳（メタデータ） (2021-06-17T17:58:02Z)
Generating Masks from Boxes by Mining Spatio-Temporal Consistencies in Videos [159.02703673838639]
フレーム毎のバウンディングボックスアノテーションからセグメンテーションマスクを生成する手法を動画で紹介します。得られた正確なマスクを用いて、ビデオオブジェクトセグメンテーション(VOS)ネットワークの弱い教師付きトレーニングを行う。追加データは、VOSとより困難なトラッキングドメインの両方で最先端の結果をもたらす大幅に優れた一般化パフォーマンスを提供します。
論文参考訳（メタデータ） (2021-01-06T18:56:24Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。