論文の概要: Distilling Knowledge into Quantum Vision Transformers for Biomedical Image Classification
- arxiv url: http://arxiv.org/abs/2503.07294v1
- Date: Mon, 10 Mar 2025 13:16:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2025-03-11 15:52:59.715316
- Title: Distilling Knowledge into Quantum Vision Transformers for Biomedical Image Classification
- Title(参考訳): 生体画像分類のための量子ビジョン変換器の蒸留知識
- Authors: Thomas Boucher, Evangelos B. Mazomenos,
- Abstract要約: 線形層を量子ニューラルネットワーク(QNN)に置き換えることで、視覚変換器(ViT)上に構築する量子ビジョン変換器(QViT)
本稿では,生体画像分類のための新しいQViTモデルを提案する。
8種類のデータセットで比較可能なViTの性能について検討する。
- 参考スコア(独自算出の注目度): 1.519321208145928
- License:
- Abstract: Quantum vision transformers (QViTs) build on vision transformers (ViTs) by replacing linear layers within the self-attention mechanism with parameterised quantum neural networks (QNNs), harnessing quantum mechanical properties to improve feature representation. This hybrid approach aims to achieve superior performance, with significantly reduced model complexity as a result of the enriched feature representation, requiring fewer parameters. This paper proposes a novel QViT model for biomedical image classification and investigates its performance against comparable ViTs across eight diverse datasets, encompassing various modalities and classification tasks. We assess models trained from scratch and those pre-trained using knowledge distillation (KD) from high-quality teacher models. Our findings demonstrate that QViTs outperform comparable ViTs with average ROC AUC (0.863 vs 0.846) and accuracy (0.710 vs 0.687) when trained from scratch, and even compete with state-of-the-art classical models in multiple tasks, whilst being significantly more efficient (89% reduction in GFLOPs and 99.99% in parameter number). Additionally, we find that QViTs and ViTs respond equally well to KD, with QViT pre-training performance scaling with model complexity. This is the first investigation into the efficacy of deploying QViTs with KD for computer-aided diagnosis. Our results highlight the enormous potential of quantum machine learning (QML) in biomedical image analysis.
- Abstract(参考訳): 量子ビジョン変換器(QViT)は、自己保持機構内の線形層をパラメータ化された量子ニューラルネットワーク(QNN)に置き換え、量子力学的特性を利用して特徴表現を改善することで、視覚変換器(ViT)上に構築される。
このハイブリッドアプローチは、リッチな特徴表現の結果、モデルの複雑さを著しく減らし、より少ないパラメータを必要とする、優れたパフォーマンスを実現することを目的としている。
本稿では,バイオメディカル画像分類のための新しいQViTモデルを提案する。
高品質の教師モデルから知識蒸留(KD)を用いて、スクラッチから訓練したモデルと事前訓練したモデルを評価する。
以上の結果から,QViTsは平均ROC AUC (0.863 vs 0.846) と精度 (0.710 vs 0.687) に比較して,複数のタスクにおいて最先端の古典モデルと競合する一方で,より効率的である(GFLOPの89%,パラメータ数99.99%)。
さらに、QViTとViTはKDと同等に反応し、QViTはモデル複雑さを伴う事前トレーニング性能のスケーリングを行う。
コンピュータ支援診断におけるKDを用いたQViTのデプロイの有効性に関する最初の研究である。
本研究は,生体画像解析における量子機械学習(QML)の可能性を明らかにするものである。
関連論文リスト
- A Comparative Study of CNN, ResNet, and Vision Transformers for Multi-Classification of Chest Diseases [0.0]
ビジョントランスフォーマー(ViT)は、そのスケーラビリティと大量のデータを処理する能力のため、強力なツールである。
NIH Chest X-rayデータセットを用いて、ImageNetで事前トレーニングされたモデルと、スクラッチからトレーニングされたモデルである2種類のViTモデルを微調整した。
本研究は,14の異なる疾患の多ラベル分類において,これらのモデルの性能を評価するものである。
論文 参考訳(メタデータ) (2024-05-31T23:56:42Z) - DiffiT: Diffusion Vision Transformers for Image Generation [88.08529836125399]
ViT(Vision Transformer)は、特に認識タスクにおいて、強力なモデリング機能とスケーラビリティを実証している。
拡散型生成学習におけるViTの有効性について検討し、拡散ビジョン変換器(DiffiT)と呼ばれる新しいモデルを提案する。
DiffiTはパラメータ効率が大幅に向上した高忠実度画像を生成するのに驚くほど効果的である。
論文 参考訳(メタデータ) (2023-12-04T18:57:01Z) - Quantum machine learning for image classification [39.58317527488534]
本研究では、量子力学の原理を有効計算に活用する2つの量子機械学習モデルを紹介する。
我々の最初のモデルは、並列量子回路を持つハイブリッド量子ニューラルネットワークであり、ノイズの多い中間スケール量子時代においても計算の実行を可能にする。
第2のモデルは、クオン進化層を持つハイブリッド量子ニューラルネットワークを導入し、畳み込みプロセスによる画像の解像度を低下させる。
論文 参考訳(メタデータ) (2023-04-18T18:23:20Z) - Efficiently Training Vision Transformers on Structural MRI Scans for
Alzheimer's Disease Detection [2.359557447960552]
ビジョントランスフォーマー(ViT)は近年、コンピュータビジョンアプリケーションのためのCNNの代替として登場した。
難易度に基づいて,脳神経画像の下流タスクに対するViTアーキテクチャの変種を検証した。
合成および実MRIスキャンで事前訓練した微調整型視覚変換器モデルを用いて、5%と9-10%の性能向上を実現した。
論文 参考訳(メタデータ) (2023-03-14T20:18:12Z) - Q-ViT: Accurate and Fully Quantized Low-bit Vision Transformer [56.87383229709899]
我々は、完全量子化視覚変換器(Q-ViT)のための情報修正モジュール(IRM)と分配誘導蒸留法を開発した。
我々の手法は、先行技術よりもはるかに優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2022-10-13T04:00:29Z) - Improving Vision Transformers by Revisiting High-frequency Components [106.7140968644414]
視覚変換器(ViT)モデルは,CNNモデルよりも画像の高周波成分の捕捉に効果が低いことを示す。
本稿では,画像の高周波成分を直接補うHATを提案する。
HAT は様々な ViT モデルの性能を継続的に向上させることができることを示す。
論文 参考訳(メタデータ) (2022-04-03T05:16:51Z) - ViTAEv2: Vision Transformer Advanced by Exploring Inductive Bias for
Image Recognition and Beyond [76.35955924137986]
我々は、内在性IBを畳み込み、すなわちViTAEから探索するビジョントランスフォーマーを提案する。
ViTAEはいくつかの空間ピラミッド縮小モジュールを備えており、入力イメージをリッチなマルチスケールコンテキストでトークンに埋め込む。
我々は、ImageNet検証セット上で88.5%のTop-1分類精度と、ImageNet実検証セット上で最高の91.2%のTop-1分類精度を得る。
論文 参考訳(メタデータ) (2022-02-21T10:40:05Z) - Efficient Vision Transformers via Fine-Grained Manifold Distillation [96.50513363752836]
視覚変換器のアーキテクチャは多くのコンピュータビジョンタスクで異常な性能を示した。
ネットワーク性能は向上するが、トランスフォーマーはより多くの計算資源を必要とすることが多い。
本稿では,教師のトランスフォーマーから,画像と分割パッチの関係を通して有用な情報を抽出することを提案する。
論文 参考訳(メタデータ) (2021-07-03T08:28:34Z) - Vision Transformers are Robust Learners [65.91359312429147]
ビジョントランスフォーマー(ViT)の一般的な腐敗や摂動、分布シフト、自然逆転例に対する堅牢性について検討します。
ViTsが実際により堅牢な学習者である理由を説明するために、定量的および定性的な指標を提供する分析を提示します。
論文 参考訳(メタデータ) (2021-05-17T02:39:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。