論文の概要: Supermarket Product Detection and Recognition: Utilizing Deep Learning with Rectified Imagery
- arxiv url: http://arxiv.org/abs/2610.08126v1
- Date: Tue, 06 Oct 2026 10:44:33 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-08 02:58:29.942054
- Title: Supermarket Product Detection and Recognition: Utilizing Deep Learning with Rectified Imagery
- Title(参考訳): スーパーマーケット製品の検出と認識: 画像認識によるディープラーニングの利用
- Abstract要約: ホモグラフィー推定とフー変換を用いた補正画像の効果と,その限界が食料品の識別問題に及ぼす影響について検討した。
異なる物体検出モデルによる実験では、角度画像の補正により、画像中の食料品の検出精度が向上することが示唆されている。
- 参考スコア(独自算出の注目度): 5.508843847232953
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Product Identification has sprung up to become one of the most challenging problems in the automation of the retail industry. With the new industry 5.0 standards, automated inventory management, and catalog creation tasks are vitally important. Object identification models have emerged as a viable answer with their unprecedented identification and localization accuracy. However, the close-knit rack design of supermarkets generates the problem of angle variation in capturing images. The angle-variant densely packed images(a single image contains many objects) become overwhelming for these models alone. In this paper, we try to supplement object detection models with traditional Hough transform (HT) and homogeneous estimation concepts. We study the effect of rectified images using homography estimation and hough transform and their limitations on the problem of grocery identification. We make a case for creating a new dataset to test the effects of such rectification and produce analytical results on different scenarios of angle variation and object densities per image. Extensive experiments on different object detection models suggest that image rectification of angled images improves the detection accuracy of grocery products in images. The results also highlight the limitation of rectification on the angle of image capture and the object density of the image.
- Abstract(参考訳): 商品の識別は、小売業の自動化において最も難しい問題の一つになってきた。
新しい業界標準5.0では、自動在庫管理、カタログ作成タスクが極めて重要である。
オブジェクト識別モデルは、前例のない識別と位置化の精度で有効な答えとして現れてきた。
しかし,スーパーマーケットのクローズドニットラック設計は,画像の撮影における角度変化の問題を生じさせる。
角度可変密充填画像(多数の物体を含む単一の画像)は、これらのモデルだけでは圧倒的になる。
本稿では,従来のハフ変換(HT)と等質推定の概念を用いてオブジェクト検出モデルを補足する。
ホモグラフィー推定とフー変換を用いた補正画像の効果と,その限界が食料品の識別問題に及ぼす影響について検討した。
画像毎の角度変化と物体密度の異なるシナリオにおいて,このような補正の効果を検証し,解析結果を生成するための新しいデータセットを作成する。
さまざまな物体検出モデルに対する広範囲な実験により,画像中の食料品の検出精度が向上することが示唆された。
また、画像キャプチャの角度と画像の物体密度の補正の限界も強調した。
関連論文リスト
- The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment [105.31858867473845]
ImageCriticはエージェントフレームワークに統合され、不整合を自動的に検出し、マルチラウンドおよびローカル編集で修正する。
実験では、ImageCriticは様々なカスタマイズされた生成シナリオで詳細に関連する問題を効果的に解決することができ、既存のメソッドよりも大幅に改善されている。
論文 参考訳(メタデータ) (2025-11-25T18:40:25Z) - Detecting Generated Images by Fitting Natural Image Distributions [75.31113784234877]
本稿では,自然画像と生成画像のデータ多様体間の幾何学的差異を利用した新しいフレームワークを提案する。
自然画像に対して一貫した出力を出力するために設計された関数対を用いるが、生成した関数に対しては発散出力を用いる。
データ多様体に沿った変換が、自然画像上で事前訓練された自己教師付きモデルの損失値に有意な変化をもたらす場合、画像は生成されたものとして識別される。
論文 参考訳(メタデータ) (2025-11-03T07:20:38Z) - Edge-case Synthesis for Fisheye Object Detection: A Data-centric Perspective [2.4603149388689514]
フィッシュアイカメラは、大きな歪みを導入し、従来のデータセットでトレーニングされたオブジェクト検出モデルに固有の課題を提起する。
本稿では,モデルの盲点を特定する上で重要な課題に着目し,検出性能を体系的に向上するデータ中心パイプラインを提案する。
論文 参考訳(メタデータ) (2025-07-22T06:07:07Z) - Fast and Accurate Object Detection on Asymmetrical Receptive Field [0.0]
本稿では,物体検出精度を受容場の変化の観点から改善する手法を提案する。
YOLOv5の頭部の構造は、非対称なプール層を付加することによって改変される。
本稿では, 従来の YOLOv5 モデルと比較し, いくつかのパラメータから解析する。
論文 参考訳(メタデータ) (2023-03-15T23:59:18Z) - ViewFool: Evaluating the Robustness of Visual Recognition to Adversarial
Viewpoints [42.64942578228025]
本研究では,視覚認識モデルにミスリードする敵対的視点を見つけるために,ViewFoolという新しい手法を提案する。
現実世界の物体をニューラル放射場(NeRF)として符号化することにより、ViewFoolは多様な敵の視点の分布を特徴付ける。
論文 参考訳(メタデータ) (2022-10-08T03:06:49Z) - Unsupervised Domain Adaption of Object Detectors: A Survey [87.08473838767235]
近年のディープラーニングの進歩は、様々なコンピュータビジョンアプリケーションのための正確で効率的なモデルの開発につながっている。
高度に正確なモデルを学ぶには、大量の注釈付きイメージを持つデータセットの可用性に依存する。
このため、ラベルスカースデータセットに視覚的に異なる画像がある場合、モデルの性能は大幅に低下する。
論文 参考訳(メタデータ) (2021-05-27T23:34:06Z) - Ensembling with Deep Generative Views [72.70801582346344]
生成モデルは、色やポーズの変化などの現実世界の変動を模倣する人工画像の「ビュー」を合成することができる。
そこで本研究では, 画像分類などの下流解析作業において, 実画像に適用できるかどうかを検討する。
StyleGAN2を再生増強の源として使用し、顔の属性、猫の顔、車を含む分類タスクについてこの設定を調査します。
論文 参考訳(メタデータ) (2021-04-29T17:58:35Z) - Object-Centric Image Generation from Layouts [93.10217725729468]
複数のオブジェクトを持つ複雑なシーンを生成するレイアウト・ツー・イメージ生成法を開発した。
本手法は,シーン内のオブジェクト間の空間的関係の表現を学習し,レイアウトの忠実度の向上につながる。
本稿では,Fr'echet Inception Distanceのオブジェクト中心適応であるSceneFIDを紹介する。
論文 参考訳(メタデータ) (2020-03-16T21:40:09Z) - Fine-grained Image-to-Image Transformation towards Visual Recognition [102.51124181873101]
我々は,入力画像の同一性を保った画像を生成するために,微細なカテゴリで画像を変換することを目的としている。
我々は、画像のアイデンティティと非関連要因をアンハングルするために、生成的敵ネットワークに基づくモデルを採用する。
CompCarsとMulti-PIEデータセットの実験では、我々のモデルが生成した画像のアイデンティティを、最先端の画像-画像変換モデルよりもはるかによく保存していることが示された。
論文 参考訳(メタデータ) (2020-01-12T05:26:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。