論文の概要: Discrete Diffusion Language Models for Interactive Radiology Report Drafting
- arxiv url: http://arxiv.org/abs/2607.01436v1
- Date: Wed, 01 Jul 2026 19:59:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-03 19:45:08.583366
- Title: Discrete Diffusion Language Models for Interactive Radiology Report Drafting
- Title(参考訳): 対話的放射線学レポート作成のための離散拡散言語モデル
- Abstract要約: 拡散言語モデルは、トークンを右に出力する代わりに、トークンキャンバスを双方向に表記することでテキストを生成する。
実験用拡散言語モデルDiffusionGemma-26Bを適用し,同サイズのARシリングGemma-4-26Bと比較した。
- 参考スコア(独自算出の注目度): 2.2462804525190427
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Diffusion language models, which generate text by denoising a token canvas bidirectionally instead of emitting tokens left to right, have become competitive with autoregressive (AR) generation. Medical foundation models, however, remain almost entirely autoregressive. We adapt a mixture-of-experts diffusion language model, DiffusionGemma-26B, and benchmark it against its same-size AR sibling Gemma-4-26B under an identical LoRA recipe on medical visual question answering datasets, scored by a verbosity-robust LLM judge. Diffusion matches or exceeds AR on all of them, and the finetuned model (3.8B active) is competitive with frontier vision-language models; its decoding is also 3.5-4.4x faster. Beyond this parity, the diffusion model offers a drafting capability AR lacks: any-order infill. Because the canvas is denoised bidirectionally, a radiologist can fix report fragments and have the model fill the text between them, an operation inherent to diffusion but not to autoregression, which is subpar at it. This suits real reports, which are often terse or inconsistent across clinicians and institutions.
- Abstract(参考訳): トークンキャンバスを双方向に識別することでテキストを生成する拡散言語モデルは、左から右にトークンを出力するのではなく、自動回帰(AR)生成と競合するようになっている。
しかし、医療基礎モデルは、ほとんど完全に自己回帰的である。
実験用拡散言語モデルであるDiffusionGemma-26Bを,同サイズのARシリングGemma-4-26Bと同一のLoRAレシピで比較した。
拡散はARに匹敵し、細かなモデル(3.8B)はフロンティアの視覚言語モデルと競合し、復号も3.5-4.4倍高速である。
この同等性以外にも、拡散モデルは、ARに欠けているドラフト機能を提供している。
キャンバスは双方向に識別されるため、放射線学者はレポートの断片を固定し、それらの間のテキストをモデルに埋めることができる。
これは実際の報告に似ており、多くの場合、臨床医や機関間で厳しい、あるいは矛盾している。
関連論文リスト
- AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling [60.04959047453115]
AURORA-LMは、デオード可能なテキスト表現の構築と、その分布のモデル化を分離した連続ラテント言語モデルである。
AURORA-LM は OpenWebText のフリージェネレーションと XSum の要約で評価された連続および拡散に基づく言語モデルの中で最も高い性能を達成している。
論文 参考訳(メタデータ) (2026-08-03T17:59:50Z) - How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation [2.557366331463333]
本稿では,3次元の拡散分類器のバイアス評価であるASOB-Benchを紹介する。
これらの次元は、徹底的な分類としてではなく、テキスト条件の再構成エラースコアがどのように決定に達するかの目標調査として機能する。
拡散分類器はOpenCLIPベースラインよりも属性ミスバインドが少なく、確立されたComCoベンチマークでは、サイズ順ショートカットにかなり敏感である。
ImageNet-Bでは、彼らははるかに大きな精度低下を被り、前景の手がかりを背景に大きく依存していることが判明した。
論文 参考訳(メタデータ) (2026-07-04T11:35:04Z) - DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling [51.39835770694148]
拡散言語モデルは本質的にデコードされたトークン間の相関を捉えない。
3つの成分を持つマスク付き拡散言語モデルの変種であるDiLaDiffを提案する。
論文 参考訳(メタデータ) (2026-05-22T13:15:59Z) - Diffusion Beats Autoregressive in Data-Constrained Settings [50.56893491038853]
自己回帰(AR)モデルは長い間、大きな言語モデルのランドスケープを支配してきた。
近年,ARモデルよりもアドバンテージが低いものの,拡散型言語モデルが将来性のある選択肢として浮上している。
本研究では,限られたデータ上で繰り返し学習を行うデータ制約付き環境で,マスク拡散モデルについて系統的に研究する。
我々の結果は、データが計算ではなくボトルネックである場合、拡散モデルは標準的なARパラダイムに代わる魅力的な代替手段となることを示唆している。
論文 参考訳(メタデータ) (2025-07-21T17:59:57Z) - Generalized Interpolating Discrete Diffusion [65.74168524007484]
仮面拡散はその単純さと有効性のために一般的な選択である。
ノイズ発生過程の設計において、より柔軟性の高い離散拡散(GIDD)を補間する新しいファミリを一般化する。
GIDDの柔軟性をエクスプロイトし、マスクと均一ノイズを組み合わせたハイブリッドアプローチを探索し、サンプル品質を向上する。
論文 参考訳(メタデータ) (2025-03-06T14:30:55Z) - Zero-Shot Medical Phrase Grounding with Off-the-shelf Diffusion Models [12.264115733611058]
テキストガイダンスでローカライズを行うタスクは、通常、フレーズグラウンドディング( phrase grounding)と呼ばれる。
私たちは、この挑戦的なタスクを実行するために、公開のFoundation Model、すなわちLatent Diffusion Modelを使用します。
胸部X線検査の結果から, 病理組織学的にSOTAと競合する可能性が示唆された。
論文 参考訳(メタデータ) (2024-04-19T14:43:48Z) - LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation? [10.72249123249003]
我々は拡散モデルを再検討し、全体論的文脈モデリングと並列復号化の能力を強調した。
本稿では,分割BERTを用いた新しいアーキテクチャLaDiCを導入し,キャプション専用のラテント空間を創出する。
LaDiCは、38.2 BLEU@4と126.2 CIDErのMSデータセット上で拡散ベースのメソッドの最先端のパフォーマンスを達成する。
論文 参考訳(メタデータ) (2024-04-16T17:47:16Z) - Diffusion of Thoughts: Chain-of-Thought Reasoning in Diffusion Language Models [100.53662473219806]
Diffusion-of-Thought (DoT) は、拡散モデルとChain-of-Thoughtを統合する新しいアプローチである。
DoTは、拡散言語モデルを通じて、時間とともに推論ステップが拡散することを可能にする。
本研究は,多桁乗算,論理学,小学校数学におけるDoTの有効性を示すものである。
論文 参考訳(メタデータ) (2024-02-12T16:23:28Z) - DiffusionBERT: Improving Generative Masked Language Models with
Diffusion Models [81.84866217721361]
DiffusionBERTは離散拡散モデルに基づく新しい生成マスク付き言語モデルである。
本稿では,各ステップに付加される雑音の度合いを制御する前方拡散プロセスのための新しいノイズスケジュールを提案する。
非条件テキスト生成の実験では、DiffusionBERTは既存のテキスト拡散モデルよりも大幅に改善されている。
論文 参考訳(メタデータ) (2022-11-28T03:25:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。