論文の概要: From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM
- arxiv url: http://arxiv.org/abs/2608.15580v1
- Date: Sun, 16 Aug 2026 07:11:00 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-18 19:59:03.344993
- Title: From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM
- Title(参考訳): ジェネラリストからスペシャリストへ:凍結VLMを用いた内視鏡ポリープ報告のためのコンテキスト融合フレームワーク
- Authors: Ruijie Yang, Yan Zhu, Peiyao Fu, Siyuan Li, Te Luo, Zhihua Wang, Quanlin Li, Pinghong Zhou, Xian Yang, Shuo Wang,
- Abstract要約: 汎用視覚言語モデル(VLM)は、画像理解とレポート生成のための統一インターフェースを提供する。
しかし、既存の戦略は一般にタスク固有のモデルやモデルの重み付けに依存している。
本稿では,暗黙的命令コンテキストと明示的コンテキストの両方を通じて,凍結した汎用VLMを専門とするコンテキスト融合フレームワークを提案する。
- 参考スコア(独自算出の注目度): 14.46024645019454
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Reliable endoscopic polyp reporting requires integrating quantitative lesion sizing, standardized Paris classification, and clinically meaningful morphological description within a single record. General-purpose vision-language models (VLMs) offer a unified interface for image understanding and report generation. Existing specialization strategies, however, typically rely on task-specific models or model-weight adaptation, leaving unresolved how to introduce reliable specialist knowledge while preserving both this unified interface and the VLM's pretrained capabilities. We introduce a context-fusion framework that specializes a frozen general-purpose VLM through both implicit instruction context and explicit transduction context without modifying its pretrained weights. Specifically, a self-supervised polyp encoder retrieves related image-report pairs as explicit, query-specific evidence, while learned continuous specialist tokens provide implicit instruction context shared across cases. Experiments were conducted on 2,056 expert-annotated public endoscopic images. We compared the framework with general-purpose VLMs, task-specific predictors, and weight-adaptation methods to assess specialist performance, unified reporting, and adaptation efficiency. Across numerical, categorical, and report-generation metrics, the proposed framework substantially improved direct frozen-VLM inference and achieved the strongest overall performance among the evaluated methods. It added trainable parameters equal to only 0.006% of the frozen VLM's parameter count. When the top-1 retrieved case carried the correct target category, our framework corrected 70.5% of the errors made by a weight-adaptation baseline. These findings support the context-fusion framework as a lightweight and effective strategy for specialist adaptation of a frozen VLM.
- Abstract(参考訳): 信頼性の高い内視鏡的ポリープ報告には、定量的な病変サイズ、標準化されたパリ分類、臨床的に意味のある形態的記述を1つの記録にまとめる必要がある。
汎用視覚言語モデル(VLM)は、画像理解とレポート生成のための統一インターフェースを提供する。
しかし、既存の特殊化戦略は一般にタスク固有のモデルやモデルウェイト適応に依存しており、この統一インターフェースとVLMの事前訓練された能力の両方を維持しながら、信頼性の高い専門知識を導入する方法を未解決のまま残している。
本稿では,暗黙的命令コンテキストと明示的トランスダクションコンテキストの両方を通じて,事前学習した重みを変更することなく,凍結した汎用VLMを専門化するコンテキスト融合フレームワークを提案する。
具体的には、自己教師型ポリプエンコーダは、関連するイメージレポートペアを明示的でクエリ固有の証拠として検索し、学習された連続トークンはケース間で共有される暗黙の命令コンテキストを提供する。
2,056人の専門家が注釈を付けた公開内視鏡画像に対して実験を行った。
我々は,本フレームワークを汎用VLM,タスク固有予測器,および重み適応法と比較し,専門性能,統一報告,適応効率を評価した。
提案手法は, 数値, カテゴリー, レポート生成指標全体にわたって, 直接凍結-VLM推定を著しく改善し, 評価手法の中で最強の総合性能を達成した。
凍結したVLMのパラメータの0.006%に相当するトレーニング可能なパラメータを追加した。
検索した上位1症例が正しい対象カテゴリーであった場合, 重み適応ベースラインによる誤差の70.5%を補正した。
これらの知見は,凍結したVLMの特殊適応のための軽量かつ効果的な戦略としてコンテキスト融合フレームワークを支持する。
関連論文リスト
- Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology [8.2867621159451]
GAUCは,事前学習されたマルチモーダル埋め込み空間で直接動作する,トレーニング不要なコアセット選択法である。
CRC-100K と MHIST が複数のオープンソース VLM アーキテクチャにまたがっている場合、GAUC は精度、キャリブレーション、高速な勾配ロバスト性を改善している。
論文 参考訳(メタデータ) (2026-05-18T13:54:04Z) - Unlocking Biological Workflows for Robust Protein-Text Question Answering: A Dual-Dimensional RAG Framework [60.82334952881798]
タンパク-テキスト質問回答(QA)は、自然言語による生物学的配列の解釈に不可欠である。
2D-ProteinRAGは,大規模言語モデル(LLM)を金本位生物研究ワークフロー内で動作させる新しいフレームワークである。
本研究では,2D-Proteinが常に最先端の性能を達成し,微調整ベースラインや他のRAG法よりも優れた性能を発揮することを示す。
論文 参考訳(メタデータ) (2026-05-17T05:03:24Z) - AnchorDiff: Topology-Aware Masked Diffusion with Confidence-based Rewriting for Radiology Report Generation [2.2748974006378933]
医用画像から臨床的に正確なテキストレポートを自動生成することを目的とする。
既存の手法は自己回帰(AR)言語モデルに依存しており、因果依存性構造は生成を一方向の左から右へのプロセスに制限する。
本稿では,知識グラフに基づく臨床アンカーを拡散言語モデリングに統合したRRGのための最初のマスク付き拡散フレームワークであるAnchorDiffを提案する。
論文 参考訳(メタデータ) (2026-05-16T16:42:43Z) - Cross-Modal Semantic-Enhanced Diffusion Framework for Diabetic Retinopathy Grading [7.923081487850825]
そこで本研究では,糖尿病網膜症(DR)に適応した視覚言語モデルを提案する。
画像特徴と各DRグレードのテキスト記述特徴との間のドット積を計算し、モーダルなセマンティックコンディショニングベクトルを構築する。
APTOS 2019データセットの実験では、提案手法は87.5%の精度で、マクロ平均F1スコアは0.731であり、様々な代表的手法よりも優れていた。
論文 参考訳(メタデータ) (2026-05-10T00:58:17Z) - Synergizing Discriminative Exemplars and Self-Refined Experience for MLLM-based In-Context Learning in Medical Diagnosis [4.619078510367921]
クリニック・ミメティックは、差別的模範的コアセット選択(DECS)と自己修正経験要約(SRES)を相乗化するために設計された新しいインコンテキスト・ラーニング(ICL)フレームワークである。
DECSは、ノイズデータから識別的視覚コアセットを計算レベルで選択することで、臨床医の「アンカーケース」を参照する能力をシミュレートする。
SRESは、多様なロールアウトを動的テキスト体験銀行に蒸留することにより、臨床診断における認知と反射を模倣する。
論文 参考訳(メタデータ) (2026-03-29T15:29:59Z) - Fine-tuning MLLMs Without Forgetting Is Easier Than You Think [72.59321247529975]
分布内および分布外画像およびテキスト入力のモデル性能を評価するための2x2実験フレームワークを設計する。
その結果、トレーニング可能なパラメータの数を制限したり、低学習率を採用するなど、適切な正規化が、アウト・オブ・ディストリビューション・イメージを扱う際の忘れを効果的に防止できることが示唆された。
我々は、このことをタスク固有のオーバーフィッティングとみなし、データハイブリッドトレーニング戦略を導入することでこの問題に対処する。
論文 参考訳(メタデータ) (2026-03-15T17:16:19Z) - Concept-Enhanced Multimodal RAG: Towards Interpretable and Accurate Radiology Report Generation [12.226029763256962]
VLM(Vision-Language Models)による放射線学レポート生成は、ドキュメントの負担軽減、レポートの一貫性の向上、臨床導入の加速を約束する。
既存の研究では、解釈可能性と精度を別々の目的として扱い、概念に基づく説明可能性技術は透明性に重点を置いている。
本稿では,視覚表現を解釈可能な臨床概念に分解する統合フレームワークであるCEMRAG(Concept-Enhanced Multimodal RAG)を提案する。
論文 参考訳(メタデータ) (2026-02-17T15:18:07Z) - A Federated and Parameter-Efficient Framework for Large Language Model Training in Medicine [59.78991974851707]
大規模言語モデル(LLM)は、質問応答や診断など、医療ベンチマークにおいて強力なパフォーマンスを示している。
ほとんどの医療用LDMは、異種システムの一般化性と安全性の制限に直面している単一の機関のデータに基づいて訓練されている。
本稿では, LLMを医療応用に適用するためのモデルに依存しない, パラメータ効率のよいフェデレーション学習フレームワークを提案する。
論文 参考訳(メタデータ) (2026-01-29T18:48:21Z) - AdaFusion: Prompt-Guided Inference with Adaptive Fusion of Pathology Foundation Models [49.550545038402184]
本稿では,新しいプロンプト誘導推論フレームワークであるAdaFusionを提案する。
本手法は,多様なモデルからタイルレベルの特徴を圧縮・整列する。
AdaFusionは、分類タスクと回帰タスクの両方にわたって、個々のPFMを一貫して上回っている。
論文 参考訳(メタデータ) (2025-08-07T07:09:31Z) - Uncertainty-Driven Expert Control: Enhancing the Reliability of Medical Vision-Language Models [52.2001050216955]
既存の方法は、モデル構造を調整したり、高品質なデータで微調整したり、好みの微調整によって、医療ビジョン言語モデル(MedVLM)の性能を向上させることを目的としている。
我々は,MedVLMと臨床専門知識の連携を図るために,Expert-Controlled-Free Guidance (Expert-CFG) という,ループ内のエキスパート・イン・ザ・ループフレームワークを提案する。
論文 参考訳(メタデータ) (2025-07-12T09:03:30Z) - Cycles of Thought: Measuring LLM Confidence through Stable Explanations [53.15438489398938]
大規模言語モデル(LLM)は、様々なベンチマークで人間レベルの精度に到達し、さらに超えることができるが、不正確な応答における過度な自信は、依然として十分に文書化された障害モードである。
本稿では,LLMの不確実性を測定するためのフレームワークを提案する。
論文 参考訳(メタデータ) (2024-06-05T16:35:30Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。