論文の概要: A Human-in-the-Loop Framework for Efficient Prompt Selection in Microscopy Vision-Language Models
- arxiv url: http://arxiv.org/abs/2605.20495v1
- Date: Tue, 19 May 2026 21:02:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-21 19:19:56.379686
- Title: A Human-in-the-Loop Framework for Efficient Prompt Selection in Microscopy Vision-Language Models
- Title(参考訳): 顕微鏡ビジョン・ランゲージモデルにおける効率的なプロンプト選択のためのヒューマン・イン・ザ・ループ・フレームワーク
- Abstract要約: 顕微鏡画像分類のためのディープラーニングパイプラインは、トレーニングのための高品質な基底真理を生成するために、高価な、労働集約的、時間集約的な専門家アノテーションを必要とすることが多い。
近年の研究では、専門家が検証した画像カプセルの小さなプロンプトセットを構築することで、視覚言語モデルの即時チューニングが手作業によるアノテーションを削減できることが示されている。
- 参考スコア(独自算出の注目度): 1.5824473848781937
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Deep-learning pipelines for microscopy image classification often require expensive, labor- and time-intensive expert annotation to produce high-quality ground truth for training. Recent work has shown that prompt tuning of vision-language models (VLMs) can reduce manual annotation by constructing a small prompt set of expert-verified image-caption exemplars that is reused as few-shot context to classify all remaining images at inference time. To further reduce effort, the VLM can draft captions for candidate exemplars, which experts then verify and lightly edit instead of writing text de novo. However, two practical questions remain unaddressed: (1) which unlabeled images should be prioritized for verification, and (2) how many verified exemplars are needed to reach a performance target. In this work, we address these questions by formulating prompt-set construction as a target-driven active learning problem that prioritizes which images to annotate. We study three complementary selection criteria under strict low-resource constraints with small unlabeled pools. Experiments show that our methods reach the target performance with substantially fewer expert-verified images than random selection, achieving 100% test accuracy with as few as 20 annotated images on average. More broadly, our human-in-the-loop framework demonstrates a human-centered use of generative AI in biomedical image analysis, where experts remain actively involved in verifying and refining model output while significantly reducing annotation cost. Code and data will be publicly available.
- Abstract(参考訳): 顕微鏡画像分類のためのディープラーニングパイプラインは、トレーニングのための高品質な基底真理を生成するために、高価な、労働集約的、時間集約的な専門家アノテーションを必要とすることが多い。
近年の研究では、視覚言語モデル(VLM)の迅速なチューニングは、少数ショットのコンテキストとして再利用され、残されているすべての画像を推論時に分類する、専門家が検証した画像カプセルの小さなプロンプトセットを構築することで、手動によるアノテーションを削減できることが示されている。
さらに努力を減らし、VLMは候補者の例題のキャプションを起草し、専門家がテキスト・デ・ノボを書く代わりに検証し、軽々しく編集する。
しかしながら,(1)未ラベルの画像を優先して検証する必要があるか,(2)性能目標に到達するためには,どの程度の検証済みの模範が必要であるか,という2つの実践的な疑問が残る。
本研究では,アノテートを優先するターゲット駆動型能動学習問題として,プロンプトセット構築を定式化し,これらの課題に対処する。
厳密な低リソース制約下での3つの相補的選択基準について検討した。
実験により, 提案手法は, ランダム選択よりも専門家による検証画像が少なく, 平均20個の注釈付き画像で100%の精度で達成できることがわかった。
より広範に、私たちの人間-イン-ザ-ループフレームワークは、バイオメディカル画像分析において、生成AIを人間中心で使用することを示し、そこでは、専門家が、アノテーションコストを大幅に削減しつつ、モデル出力の検証と精錬に積極的に関与している。
コードとデータは公開されます。
関連論文リスト
- Seeing Through Words: Controlling Visual Retrieval Quality with Language Models [68.49490036960559]
本稿では,画像品質の明示的な概念を取り入れつつ,文脈的詳細で短いクエリを充実させる,品質制御可能な検索の新たなパラダイムを提案する。
我々のキーとなる考え方は、生成言語モデルをクエリ補完関数として活用し、未特定クエリを記述形式に拡張することです。
提案手法は,検索結果を大幅に改善し,最新のVLMの表現能力と,短いユーザクエリの未特定特性とのギャップを埋める,効果的な品質管理を提供する。
論文 参考訳(メタデータ) (2026-02-24T18:20:57Z) - Vision-Free Retrieval: Rethinking Multimodal Search with Textual Scene Descriptions [81.33113485830711]
視覚言語モデルに対して,視覚のない単一エンコーダ検索パイプラインを導入する。
VLLM生成した構造化画像記述の助けを借りてテキストからテキストへ移行する。
提案手法は,複数検索および構成性ベンチマークにおいて,最先端のゼロショット性能を実現する。
論文 参考訳(メタデータ) (2025-09-23T16:22:27Z) - Towards More Accurate Personalized Image Generation: Addressing Overfitting and Evaluation Bias [52.590072198551944]
画像パーソナライズの目的は、ユーザが提供する課題に基づいて画像を作成することである。
現在の手法では、テキストプロンプトへの忠実性を保証する上で、課題に直面している。
トレーニング画像の歪みを除去するアトラクタを組み込んだ,新たなトレーニングパイプラインを導入する。
論文 参考訳(メタデータ) (2025-03-09T14:14:02Z) - Zero-Shot Prompting and Few-Shot Fine-Tuning: Revisiting Document Image Classification Using Large Language Models [0.2517406173566782]
スキャンされた文書の分類は、画像、レイアウト、文書理解のためのテキスト分析を含む難しい問題である。
特定のベンチマークデータセット、特にRVL-CDIPでは、最先端のパフォーマンスに近づきつつある。
論文 参考訳(メタデータ) (2024-12-18T13:53:16Z) - FairQueue: Rethinking Prompt Learning for Fair Text-to-Image Generation [28.185503858652456]
テキスト・トゥ・イメージ(T2I)生成のための最先端技術(SOTA)として、即時学習が登場している。
そこで本研究では,この素早い学習に基づくアプローチによって,サンプルの品質が劣化することを明らかにする。
品質問題に対処するため, (i) Prompt Queuing と (ii) Attention Amplification の2つのアイデアを提案する。
論文 参考訳(メタデータ) (2024-10-24T10:16:09Z) - Debiasing Vison-Language Models with Text-Only Training [15.069736314663352]
視覚バイアスを軽減するために,テキスト・アズ・イメージ・トレーニング・パラダイムを活用するTODというテキスト・オン・デバイアス・フレームワークを提案する。
そこで本研究では,テキスト・アズ・イメージ・トレーニングのパラダイムを活用し,視覚バイアスを緩和するテキスト・オン・デバイアス化フレームワークTODを提案する。
論文 参考訳(メタデータ) (2024-10-12T04:34:46Z) - Enhancing Large Vision Language Models with Self-Training on Image Comprehension [131.14381425260706]
本稿では、画像理解に特化して自己学習アプローチを強調する自己学習 on Image (STIC)を紹介する。
まず、ラベルのない画像を用いて、画像記述の好みを自己構築する。
抽出した視覚情報に対する推論をさらに自己改善するため,既存の命令調整データのごく一部をモデルに再利用する。
論文 参考訳(メタデータ) (2024-05-30T05:53:49Z) - Multi-Modal Prompt Learning on Blind Image Quality Assessment [65.0676908930946]
画像品質評価(IQA)モデルは意味情報から大きな恩恵を受け、異なる種類のオブジェクトを明瞭に扱うことができる。
十分な注釈付きデータが不足している従来の手法では、セマンティックな認識を得るために、CLIPイメージテキスト事前学習モデルをバックボーンとして使用していた。
近年のアプローチでは、このミスマッチに即時技術を使って対処する試みがあるが、これらの解決策には欠点がある。
本稿では、IQAのための革新的なマルチモーダルプロンプトベースの手法を提案する。
論文 参考訳(メタデータ) (2024-04-23T11:45:32Z) - A Semi-Paired Approach For Label-to-Image Translation [6.888253564585197]
ラベル・ツー・イメージ翻訳のための半教師付き(半ペア)フレームワークを初めて紹介する。
半ペア画像設定では、小さなペアデータとより大きなペア画像とラベルのセットにアクセスすることができる。
本稿では,この共有ネットワークのためのトレーニングアルゴリズムを提案し,非表現型クラスに着目した希少なクラスサンプリングアルゴリズムを提案する。
論文 参考訳(メタデータ) (2023-06-23T16:13:43Z) - Is a Caption Worth a Thousand Images? A Controlled Study for
Representation Learning [88.5382122413913]
本研究では,従来の画像のみの手法よりも伝達可能な表現を持つ視覚モデルが得られるかを検討した。
画像のみの手法は、より多くの画像データでトレーニングされた場合でも、CLIPの転送性能と一致しないことがわかった。
この結果から,CLIPが既存の事前学習データセットに存在する言語情報を活用できるように,シンプルな処方薬を考案した。
論文 参考訳(メタデータ) (2022-07-15T17:50:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。