Fugu-MT 論文翻訳(概要): The Role of Data Curation in Image Captioning

論文の概要: The Role of Data Curation in Image Captioning

arxiv url: http://arxiv.org/abs/2305.03610v2
Date: Fri, 2 Feb 2024 15:46:42 GMT
ステータス: 翻訳完了
システム内更新日: 2024-02-05 20:27:23.509909
Title: The Role of Data Curation in Image Captioning
Title（参考訳）: 画像キャプションにおけるデータキュレーションの役割
Authors: Wenyan Li, Jonas F. Lotz, Chen Qiu, Desmond Elliott
Abstract要約: 本論文は, サンプルの総数を増やすことなく, データセット中の難しいサンプルを積極的にキュレートすることによって, この方向性に寄与する。 BLIPとBEiT-3モデルを用いたFlickr30KとCOCOデータセットの実験は、これらのキュレーション手法が実際に改善された画像キャプションモデルをもたらすことを示した。
参考スコア（独自算出の注目度）: 26.61662352061468
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Image captioning models are typically trained by treating all samples equally, neglecting to account for mismatched or otherwise difficult data points. In contrast, recent work has shown the effectiveness of training models by scheduling the data using curriculum learning strategies. This paper contributes to this direction by actively curating difficult samples in datasets without increasing the total number of samples. We explore the effect of using three data curation methods within the training process: complete removal of an sample, caption replacement, or image replacement via a text-to-image generation model. Experiments on the Flickr30K and COCO datasets with the BLIP and BEiT-3 models demonstrate that these curation methods do indeed yield improved image captioning models, underscoring their efficacy.
Abstract（参考訳）: 画像キャプションモデルは、典型的には全てのサンプルを等しく扱い、不一致や困難なデータポイントを考慮せずに訓練される。対照的に,近年の研究では,カリキュラム学習戦略を用いたデータスケジューリングによる学習モデルの有効性が示された。本論文は, サンプルの総数を増やすことなく, データセット中の難しいサンプルを積極的にキュレートすることによって, この方向性に寄与する。トレーニングプロセスにおける3つのデータキュレーション手法(サンプルの完全除去、キャプション置換、テキスト・ツー・イメージ生成モデルによる画像置換)の効果について検討する。 BLIPとBEiT-3モデルを用いたFlickr30KとCOCOデータセットの実験は、これらのキュレーション手法が実際に改善された画像キャプションモデルを生み出し、その効果を裏付けることを示した。

関連論文リスト

Learning an Image Editing Model without Image Editing Pairs [83.03646586929638]
最近の画像編集モデルは、自然言語編集の指示に従いながら印象的な成果を上げている。それらは、インプットとターゲットのペアの大きなデータセットによる教師付き微調整に依存している。現在の回避策は、既存のモデルのゼロショット機能を利用する合成トレーニングペアを使用する。ペア化されたデータを完全に不要にする新たなトレーニングパラダイムを提案する。
論文参考訳（メタデータ） (2025-10-16T17:59:57Z)
CPSample: Classifier Protected Sampling for Guarding Training Data During Diffusion [58.64822817224639]
拡散モデルはトレーニングデータを正確に再現する傾向がある。 CPSampleは,画像品質を保ちながら,トレーニングデータの複製を防止するためにサンプリングプロセスを変更する手法である。 CPSample は CIFAR-10 と CelebA-64 でそれぞれ 4.97 と 2.97 の FID スコアを達成している。
論文参考訳（メタデータ） (2024-09-11T05:42:01Z)
DataDream: Few-shot Guided Dataset Generation [90.09164461462365]
実データ分布をより忠実に表現する分類データセットを合成するためのフレームワークを提案する。 DataDream fine-tunes LoRA weights for the image generation model on the few real image before generated the training data using the adapt model。次に、合成データを用いてCLIPのLoRA重みを微調整し、様々なデータセットに対する以前のアプローチよりも下流画像の分類を改善する。
論文参考訳（メタデータ） (2024-07-15T17:10:31Z)
Data Attribution for Text-to-Image Models by Unlearning Synthesized Images [71.23012718682634]
テキスト・ツー・イメージ・モデルにおけるデータ帰属の目標は、新しい画像の生成に最も影響を与えるトレーニング画像を特定することである。合成画像の非学習をシミュレートして効率的なデータ帰属法を提案する。次に,学習過程の終了後に有意な損失偏差を伴う訓練画像を特定し,これらを影響力のあるものとしてラベル付けする。
論文参考訳（メタデータ） (2024-06-13T17:59:44Z)
EfficientTrain++: Generalized Curriculum Learning for Efficient Visual Backbone Training [79.96741042766524]
訓練カリキュラムをソフトセレクション機能として再構築する。自然画像の内容の露光は,データ拡張の強度によって容易に達成できることを示す。結果のメソッドであるEfficientTrain++は単純で汎用的だが驚くほど効果的である。
論文参考訳（メタデータ） (2024-05-14T17:00:43Z)
The Journey, Not the Destination: How Data Guides Diffusion Models [75.19694584942623]
大規模なデータセットでトレーニングされた拡散モデルは、顕著な品質と多様性のフォトリアリスティックなイメージを合成することができる。 i)拡散モデルの文脈でデータ属性の形式的概念を提供し、(ii)そのような属性を反実的に検証することを可能にする枠組みを提案する。
論文参考訳（メタデータ） (2023-12-11T08:39:43Z)
T-ADAF: Adaptive Data Augmentation Framework for Image Classification Network based on Tensor T-product Operator [0.0]
本稿ではテンソルT-Product Operatorに基づくAdaptive Data Augmentation Frameworkを提案する。 1つの画像データを3倍にし、これら3つの画像から結果を得る。数値実験により、我々のデータ拡張フレームワークは、元のニューラルネットワークモデルの性能を2%向上させることができることが示された。
論文参考訳（メタデータ） (2023-06-07T08:30:44Z)
Vision-Language Modelling For Radiological Imaging and Reports In The Low Data Regime [70.04389979779195]
本稿では,視覚および言語入力を共通空間に埋め込んだ医用視覚言語モデル(VLM)について検討する。本稿では,新しい画像領域やテキスト領域への汎用事前学習モデルの適用など,低データ性能向上のためのいくつかの候補手法について検討する。テキスト・ツー・イメージ検索をベンチマークとして,2つの胸部X線および放射線学的報告を用いた可変サイズのトレーニングデータセットを用いて,これらの手法の性能評価を行った。
論文参考訳（メタデータ） (2023-03-30T18:20:00Z)
Semi-Supervised Image Captioning by Adversarially Propagating Labeled Data [95.0476489266988]
本稿では、画像キャプションモデルの一般化を改善するための、新しいデータ効率半教師付きフレームワークを提案する。提案手法は,キャプタにペアデータから学習し,段階的に未ペアデータの関連付けを行うよう訓練する。 1)画像ベースと(2)高密度領域ベースキャプションデータセットの両方を総合的かつ包括的な実験結果とし,それに続いて,少ないペアリングデータセットの包括的分析を行った。
論文参考訳（メタデータ） (2023-01-26T15:25:43Z)
Denoising Diffusion Probabilistic Models for Generation of Realistic Fully-Annotated Microscopy Image Data Sets [1.07539359851877]
本研究では,拡散モデルにより,フルアノテートされた顕微鏡画像データセットを効果的に生成できることを実証する。提案されたパイプラインは、ディープラーニングベースのセグメンテーションアプローチのトレーニングにおいて、手動アノテーションへの依存を減らすのに役立つ。
論文参考訳（メタデータ） (2023-01-02T14:17:08Z)
Self-Paced Contrastive Learning for Semi-supervisedMedical Image Segmentation with Meta-labels [6.349708371894538]
メタラベルアノテーションを扱うために、コントラスト学習を適用することを提案する。画像エンコーダの事前トレーニングにはメタラベルを使用し、半教師付きトレーニングを標準化する。 3つの異なる医用画像セグメンテーションデータセットの結果から,本手法は数回のスキャンでトレーニングしたモデルの性能を大幅に向上させることが示された。
論文参考訳（メタデータ） (2021-07-29T04:30:46Z)
Unlabeled Data Guided Semi-supervised Histopathology Image Segmentation [34.45302976822067]
生成法に基づく半教師付き学習(SSL)は,多様な画像特性の活用に有効であることが証明されている。非ラベルデータ分布を利用した病理組織像分割のための新しいデータガイド生成法を提案する。本手法は腺および核データセット上で評価される。
論文参考訳（メタデータ） (2020-12-17T02:54:19Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。