論文の概要: TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision
- arxiv url: http://arxiv.org/abs/2609.20869v2
- Date: Thu, 24 Sep 2026 17:01:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-25 21:10:09.274951
- Title: TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision
- Title(参考訳): TAPe+ML:マルチタスクコンピュータビジョンのためのコンパクトな構造化表現
- Abstract要約: TAPe (Theory of Active Perception) に基づく小型コンピュータビジョンシステムを提案する。
このシステムは、共有TAPe表現と、画像分類、オブジェクト検出、インスタンスセグメンテーションのためのモジュール認識アーキテクチャを使用する。
その結果、モデリングの負担の一部をネットワークパラメータから構造化された入力表現にシフトすることで、データ、メモリ、計算要求を低減したコンパクトなマルチタスクビジョンシステムをサポートできることが示唆された。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We present TAPe+ML v3, a compact computer vision system based on TAPe (Theory of Active Perception), a structured representation that encodes relations among perceptual elements before recognition. Instead of operating directly on pixel tensors, the system uses a shared TAPe representation and a modular recognition architecture for image classification, object detection, and instance segmentation. TAPe+ML v3 combines background and contour processing, local object localization, prototype-based classification, and a coordinator for specialized submodels. Across the reported experiments, it uses fewer than 100,000 parameters. On COCO object detection, it obtains 84.7 mAP50 and 65.3 mAP50-95. On COCO instance segmentation, it obtains 80.7 mask mAP50 and 58.4 mask mAP50-95. In classification experiments, it reaches 92 percent validation accuracy on Imagenette under an identical-training comparison with a raw-pixel baseline, and 89.9 percent Top-1 accuracy on ImageNet-Real. We also evaluate compactness in video scene detection and adaptation under distribution shift in an industrial pilot. The results suggest that shifting part of the modeling burden from network parameters to a structured input representation can support compact multi-task vision systems with reduced data, memory, and compute requirements.
- Abstract(参考訳): 本稿では、認識前の知覚要素間の関係を符号化する構造化表現であるTAPe(Theory of Active Perception)に基づくコンパクトコンピュータビジョンシステムTAPe+ML v3を提案する。
ピクセルテンソルを直接操作する代わりに、共有TAPe表現と、画像分類、オブジェクト検出、インスタンスセグメンテーションのためのモジュール認識アーキテクチャを使用する。
TAPe+ML v3は、バックグラウンドと輪郭処理、ローカルオブジェクトのローカライゼーション、プロトタイプベースの分類、特殊サブモデルのコーディネータを組み合わせたものである。
報告された実験全体では、パラメータは10万未満である。
COCO物体検出では84.7 mAP50と65.3 mAP50-95を得る。
COCOインスタンスのセグメンテーションでは、80.7マスクのmAP50と58.4マスクのmAP50-95を得る。
分類実験では、原画素ベースラインと同一のトレーニングによるImagenetteの精度が92%、ImageNet-Realの精度が89.9%に達する。
また,産業パイロットの配電シフト下での映像シーンの検出と適応のコンパクト性も評価した。
その結果、モデリングの負担の一部をネットワークパラメータから構造化された入力表現にシフトすることで、データ、メモリ、計算要求を低減したコンパクトなマルチタスクビジョンシステムをサポートできることが示唆された。
関連論文リスト
- Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding [49.218195440600354]
現在の画像ピラミッドは、複数の解像度を処理するために同じ大規模なモデルを使用しており、計算コストを大幅に上回っている。
我々はCOCO変換画像ピラミッドネットワーク(PIIP)と呼ばれる新しいネットワークアーキテクチャを提案する。
PIIPは、事前訓練されたモデル(ViTまたはCNN)を、より小さなネットワークブランチによって高解像度の画像が処理され、計算コストと性能のバランスをとるマルチスケールイメージの処理に使用する。
論文 参考訳(メタデータ) (2025-01-14T01:57:41Z) - MTP: Advancing Remote Sensing Foundation Model via Multi-Task Pretraining [73.81862342673894]
ファンデーションモデルは、様々な画像解釈タスクを強化することで、リモートセンシング(RS)のランドスケープを再構築した。
事前訓練されたモデルを下流のタスクに転送することは、イメージ分類やオブジェクト識別タスクとして事前訓練の定式化によるタスクの相違に遭遇する可能性がある。
SAMRSデータセット上で、セマンティックセグメンテーション、インスタンスセグメンテーション、回転オブジェクト検出を含むマルチタスクによる事前トレーニングを行う。
我々のモデルは、シーン分類、水平・回転物体検出、セマンティックセグメンテーション、変化検出など、様々なRS下流タスクに基づいて微調整される。
論文 参考訳(メタデータ) (2024-03-20T09:17:22Z) - Improve Supervised Representation Learning with Masked Image Modeling [30.30649867772395]
マスク付き画像モデリングを既存の教師付きトレーニングパラダイムに簡単に統合できる,シンプルで効果的なセットアップを提案する。
アーキテクチャの変更は最小限であり、この設定が学習した表現の質を向上させることができるという仮定のオーバーヘッドはない。
論文 参考訳(メタデータ) (2023-12-01T22:03:25Z) - Global Context Vision Transformers [78.5346173956383]
我々は,コンピュータビジョンのパラメータと計算利用を向上する新しいアーキテクチャであるGC ViT(Global context vision transformer)を提案する。
本稿では,ViTにおける帰納バイアスの欠如に対処し,アーキテクチャにおける可溶性逆残差ブロックを改良して活用することを提案する。
提案したGC ViTは,画像分類,オブジェクト検出,セマンティックセマンティックセグメンテーションタスクにまたがる最先端の処理結果を実現する。
論文 参考訳(メタデータ) (2022-06-20T18:42:44Z) - Vision Transformer with Convolutions Architecture Search [72.70461709267497]
本稿では,畳み込み型アーキテクチャサーチ(VTCAS)を用いたアーキテクチャ探索手法を提案する。
VTCASによって探索された高性能バックボーンネットワークは、畳み込みニューラルネットワークの望ましい特徴をトランスフォーマーアーキテクチャに導入する。
これは、特に低照度屋内シーンにおいて、物体認識のためのニューラルネットワークの堅牢性を高める。
論文 参考訳(メタデータ) (2022-03-20T02:59:51Z) - Improved Multiscale Vision Transformers for Classification and Detection [80.64111139883694]
画像と映像の分類とオブジェクト検出のための統合アーキテクチャとして,MViT(Multiscale Vision Transformer)について検討した。
分割された相対的な位置埋め込みと残留プール接続を組み込んだMViTの改良版を提案する。
我々は、このアーキテクチャを5つのサイズでインスタンス化し、ImageNet分類、COCO検出およびKineeticsビデオ認識のために評価する。
論文 参考訳(メタデータ) (2021-12-02T18:59:57Z) - Complex Network Construction for Interactive Image Segmentation using
Particle Competition and Cooperation: A New Approach [0.0]
ネットワーク構築段階では、特徴集合における各要素の重要性を定義するために重みベクトルが必要である。
本稿では,ネットワーク構築フェーズの変更による重みベクトルの除去を提案する。
論文 参考訳(メタデータ) (2020-07-03T11:42:07Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。