論文の概要: Synthetic and Derived Training Images for Campus Waste Detection: A Multi-Seed Evaluation with YOLOv8n
- arxiv url: http://arxiv.org/abs/2607.19535v2
- Date: Thu, 23 Jul 2026 15:36:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 16:18:54.641315
- Title: Synthetic and Derived Training Images for Campus Waste Detection: A Multi-Seed Evaluation with YOLOv8n
- Title(参考訳): キャンパス廃棄物検出のための合成・導出訓練画像:YOLOv8nを用いたマルチシード評価
- Abstract要約: ビンマウントカメラは、アイテムが捨てられたときにフィードバックを提供することができる。
合成画像と導出画像がYOLOv8n検出器を改良するかどうかを検討した。
- 参考スコア(独自算出の注目度): 7.485389445371466
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Incorrect disposal can contaminate campus recycling streams, and a bin-mounted camera could provide feedback as an item is discarded. We evaluated whether synthetic and derived images improve a YOLOv8n detector for this view. The real dataset contained 148 campus photographs: 86 for training, 31 for validation, and 31 for testing. Twelve joint-training configurations varied the amount and source of added images. We repeated seven principal settings with four matched seeds and computed bootstrap percentile intervals over those seeds. The real-only model reached a mean mAP@0.5 of 0.691 [0.665, 0.722]. Background replacement reduced the mean to 0.560 [0.499, 0.619], isolated-object images gave 0.680 [0.644, 0.724], and the full augmentation pool gave 0.487 [0.438, 0.537]. We also tested hand-and-forearm composites because every real photo showed a held object. Two cutouts in the initial composite set came from test photographs, so we discarded that experiment, rebuilt the set with training-split cutouts, and reran all four seeds. The corrected paired difference was +0.034 [-0.063, 0.199], which does not support a reliable hand-composite effect. Single-seed transfer experiments produced source-dependent rankings between joint mixing and sequential pretraining. None of the evaluated configurations exceeded the real-only baseline. The reported intervals quantify seed variation; the 31-photo test set remains too small for strong class-specific conclusions.
- Abstract(参考訳): 不正確な廃棄は、キャンパスのリサイクルストリームを汚染し、ビン搭載カメラは、アイテムが廃棄されたときにフィードバックを提供する。
合成画像と導出画像がYOLOv8n検出器を改良するかどうかを検討した。
実際のデータセットには、トレーニング用86枚、検証用31枚、テスト用31枚という、148枚のキャンパスの写真が含まれていた。
12のジョイントトレーニング構成では、追加画像の量とソースが変化した。
実験では,4種のマッチした種子と,それらの種子に対するブートストラップパーセンタイル間隔を計算した7つの主要設定を繰り返した。
実数のみのモデルは平均 mAP@0.5 の 0.691 [0.665, 0.722] に達した。
背景交換により平均は0.560 [0.499, 0.619]、孤立オブジェクト画像は0.680 [0.644, 0.724]、拡張プールは0.487 [0.438, 0.537]となった。
また、実写写真はすべて保持された物体であったため、ハンド・アンド・フォアアーム・コンポジットもテストした。
最初のコンポジットセットの2つのカットアウトは、テスト写真から発生したので、その実験を破棄し、トレーニング分割されたカットアウトでセットを再構築し、4つのシードすべてを再配置しました。
補正されたペア差は+0.034[-0.063, 0.199]であり, 信頼性のある手合成効果は得られなかった。
単座転写実験は、ジョイントミキシングとシーケンシャルプレトレーニングの間にソース依存のランキングを生み出した。
評価された構成はいずれも、実際のベースラインを超えなかった。
報告された間隔は種子の変動を定量化しており、31枚のテストセットは強いクラス固有の結論を出すには小さすぎる。
関連論文リスト
- Automated Perceptually-Motivated Assessment of Photographic Consistency in Paired Clinical Photographs: Pipeline Development and Internal Evaluation [0.0]
我々は、13のキャリブレーションされたサブメトリックにまたがるプレ/ポストペアを分析するパイプラインを開発した。
パイプラインは、患者内公開のプレ/ポストペア134に適合し、同一イメージペア、合成・摂動ペア134とミスマッチしたクロスパブリケーションペア134に対して評価された。
論文 参考訳(メタデータ) (2026-09-14T07:19:17Z) - Solution for UCF UrbanTwin LUMPI Track: Sim-to-Real Urban LiDAR 3D Object Detection [54.03436243843709]
UCF UrbanTwin Sim2Real LiDAR Challenge at the 6th DriveX Workshop, ECCV 2026。
検出器は合成データのみに基づいて訓練され、50個の実LiDARフレームで評価される。
ポイントクラウドリアリズムに対して、別の50フレームの合成提案が評価される。
論文 参考訳(メタデータ) (2026-09-07T15:03:36Z) - Leak-Free Cross-Validated Stacking with Per-Architecture Calibration for Sand-Boil Segmentation in Earthen Levees [0.0]
砂の沸騰は、土の堤防の下にある水が地表に再沈み込む地点であり、初期の内部浸食の警告である。
ディープセグメンテーションネットワークは、検査写真でそれらを見つけるためにますます利用されている。
その不足に対処する2つの一般的な方法は、正確さを秘かに報告している。
両抜け穴を塞ぐ砂岩層セグメンテーションフレームワークを提案する。
論文 参考訳(メタデータ) (2026-07-28T07:21:02Z) - Democratising Camera Trap AI: An Open-Source Model for Detecting UK Mammals [0.0]
我々は,31クラス,英産哺乳類28種,鳥28種,人間用ユーティリティクラス,キャリブレーションポールおよび車両用のオープンソースオブジェクト検出モデルをリリースする。
このモデルは、ホールドアウト検証セット上で0.5 (0.956 at IoU 0.5-0.95)のIntersection over Union (IoU)における平均0.984の平均精度を達成する。
我々は、ONNXフォーマットで訓練された重量を非商用ライセンスでリリースし、ローカルデスクトップとリアルタイムカメラをサポートする。
論文 参考訳(メタデータ) (2026-06-09T14:47:24Z) - Train, Test, Re-evaluate: Schedule-Sensitive Evaluation of Generative Data for Hand Detection [0.5161531917413708]
我々は6つのトレーニング・スケジュール体制の下でYOLOv8nハンド検出器を訓練する。
実験は、塗装されたアクセサリーデータから、実質的なリアルタイムデプロイの利点を抽出する。
論文 参考訳(メタデータ) (2026-06-01T08:38:25Z) - The frame-level leakage trap: rethinking evaluation protocols for intrinsic image decomposition, with source-separable uncertainty as a case study [0.0]
3つのアーキテクチャで、初めてリーク効果を定量化します。
フレームレベルスプリットは、シーンレベルスプリットに対してR_PSNRを1.6〜2.0dB膨張させる。
我々は、S + N で構成された物理インフォームド分解 I = R を、ソース分離可能な三方向不確実性ヘッドで表現する。
論文 参考訳(メタデータ) (2026-05-07T14:37:16Z) - CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling [1.349025992778434]
医用画像とレポートの対比学習により訓練された視覚言語モデルは、強力なゼロショット診断能力を示す。
我々は,左右対称InfoNCE損失を用いた3次元腹部CTボリュームと放射線診断レポートとを一致させるデュアルエンコーダモデルであるMerlinを再現する。
論文 参考訳(メタデータ) (2026-04-15T07:10:01Z) - All Seeds Are Not Equal: Enhancing Compositional Text-to-Image Generation with Reliable Random Seeds [63.753710512888965]
テキスト間拡散モデルは任意のテキストプロンプトからリアルな画像を生成することができる。
彼らはしばしば「2匹の犬」や「ボウルの右側のペンギン」のような作曲のプロンプトに対して矛盾した結果を出す。
論文 参考訳(メタデータ) (2024-11-27T23:32:54Z) - Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation [58.77994391566484]
W1KPは、画像の集合における可変性の人間の校正尺度である。
最高の知覚距離は、9つの基準線を最大18ポイント精度で上回る。
実際のプロンプトの56の言語的特徴を分析し、プロンプトの長さ、CLIP埋め込みノルム、具体性、単語感覚が最も変動に影響を及ぼすことを示した。
論文 参考訳(メタデータ) (2024-06-12T17:59:27Z) - Diffusion Soup: Model Merging for Text-to-Image Diffusion Models [90.01635703779183]
シャードデータに基づいてトレーニングされた拡散モデルの重みを平均化する,テキスト・ツー・イメージ・ジェネレーションの複合化手法であるDiffusion Soupを提案する。
提案手法は,構築により,追加記憶や推論コストを伴わずに,無学習の連続学習とアンラーニングを可能にする。
論文 参考訳(メタデータ) (2024-06-12T17:16:16Z) - Improved Distribution Matching Distillation for Fast Image Synthesis [54.72356560597428]
この制限を解除し、MDDトレーニングを改善する一連の技術であるMDD2を紹介する。
まず、回帰損失と高価なデータセット構築の必要性を排除します。
第2に, GAN損失を蒸留工程に統合し, 生成した試料と実画像との識別を行う。
論文 参考訳(メタデータ) (2024-05-23T17:59:49Z) - Mix-Teaching: A Simple, Unified and Effective Semi-Supervised Learning
Framework for Monocular 3D Object Detection [22.074959519526605]
Mix-Teachingは、ラベル付き画像とラベルなし画像の両方をトレーニング段階で使用するための効果的な半教師付き学習フレームワークである。
Mix-Teaching は MonoFlex と GUPNet を KITTI データセット上で様々なラベル付け比率で大幅に改善している。
論文 参考訳(メタデータ) (2022-07-10T12:07:25Z) - (Certified!!) Adversarial Robustness for Free! [116.6052628829344]
逆方向の摂動が0.5の2ノルム以内であることに制約された場合,ImageNetでは71%の精度が証明された。
これらの結果は,モデルパラメータの微調整や再学習を必要とせず,事前学習した拡散モデルと画像分類器のみを用いて得られる。
論文 参考訳(メタデータ) (2022-06-21T17:27:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。