論文の概要: JustLLMGRPO: Radiographic Control for Chest X-Ray Generation
- arxiv url: http://arxiv.org/abs/2608.08046v1
- Date: Sat, 08 Aug 2026 10:22:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-11 19:16:36.621523
- Title: JustLLMGRPO: Radiographic Control for Chest X-Ray Generation
- Title(参考訳): JustLLMGRPO:胸部X線生成のための放射線制御
- Authors: Pengxiang Cai, Xiaohan Li, Anglin Liu, Qingyuan Zeng, Zexun Li, Jintai Chen,
- Abstract要約: テキストコンディショニングされた胸部X線生成は、特定の発見を忠実に描写するリアルなラジオグラフィーを合成することを目的としている。
既存の作業は主にイメージジェネレータを更新することで品質を向上し、暗黙的にプロンプトをCXRドメイン適応後の固定として扱う。
このジェネレータ中心のビューは、探索されていないかなりの最適化次元を残していることを示す。
- 参考スコア(独自算出の注目度): 13.493754710933553
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Text-conditioned chest X-ray generation aims to synthesize realistic radiographs that faithfully depict specified findings. Existing work has primarily improved quality by updating image generators, implicitly treating prompts as fixed after CXR-domain adaptation. We show that this generator-centric view leaves a substantial optimization dimension underexplored. With a CXR-adapted Sana generator frozen, one-pass reformulation by an unmodified LLM reduces RadDINO-FID from 54.225 to 27.572. Prompt analysis shows that the LLM suppresses temporal comparisons, uncertainty, and other non-renderable report content while emphasizing visible radiographic findings. However, unconstrained reformulation reduces BioViL-T alignment with source prompts from 0.695 to 0.609. We therefore introduce JustLLMGRPO, which applies standard Group Relative Policy Optimization (GRPO) only to the LLM prompt policy while keeping Sana frozen. Group-relative radiology-aware image feedback retains visual focus while preserving source-prompt alignment. On CheXGenBench, JustLLMGRPO reduces RadDINO-FID to 26.780, a 50.6% improvement over direct prompting, while maintaining alignment (0.696 versus 0.695). It also achieves state-of-the-art distribution coverage and downstream classification utility. These results show that substantial performance can remain latent in how radiographic information is expressed to an adapted generator. Code is publicly available at https://github.com/pxcai/JustLLMGRPO.
- Abstract(参考訳): テキストコンディショニングされた胸部X線生成は、特定の発見を忠実に描写するリアルなラジオグラフィーを合成することを目的としている。
既存の作業は主にイメージジェネレータを更新することで品質を向上し、暗黙的にプロンプトをCXRドメイン適応後の固定として扱う。
このジェネレータ中心のビューは、探索されていないかなりの最適化次元を残していることを示す。
CXRに適応したサナ・ジェネレータが凍結すると、未修正のLLMによるワンパスの改質により、RadDINO-FIDは54.225から27.572に減少する。
プロンプト解析により, LLMは, 時間的比較, 不確実性, その他の非レンダリング可能な報告内容を抑制するとともに, 可視的X線像を強調した。
しかし、制限のない改質により、BioViL-Tとソースプロンプトとのアライメントは0.695から0.609に減少する。
そこで,JustLLMGRPOを導入し,標準的なグループ相対政策最適化(GRPO)をSanaを凍結したままLLMプロンプトポリシーにのみ適用する。
グループ相対ラジオロジー対応画像フィードバックは、ソース・プロンプトアライメントを保ちながら視覚的焦点を保持する。
CheXGenBenchでは、JustLLMGRPOはRadDINO-FIDを26.780に削減し、直接プロンプトよりも50.6%改善し、アライメント(0.696対0.695)を維持した。
また、最先端の配信カバレッジと下流の分類ユーティリティも実現している。
これらの結果から, 放射線情報が適応生成器にどのように表現されるかにおいて, かなりの性能が保たれることが示唆された。
コードはhttps://github.com/pxcai/JustLLMGRPO.comで公開されている。
関連論文リスト
- VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation [65.22452273252428]
VA-$は自動回帰視覚生成を最適化するポストトレーニングフレームワークである。
ピクセル再構成と自己回帰モデリングを統一する。
FIDを14.36から7.65に削減し、ISをLlamaGen-XXLで86.55から116.70に改善する。
論文 参考訳(メタデータ) (2025-12-22T18:54:30Z) - EMRRG: Efficient Fine-Tuning Pre-trained X-ray Mamba Networks for Radiology Report Generation [16.23892817333913]
EMRRGは、トレーニング済みのMambaネットワークを微調整する新しいX線レポート生成フレームワークである。
ハイブリッドデコーダを備えたLCMは、医療レポートを生成し、エンドツーエンドのトレーニングを可能にし、ベンチマークデータセット上で強力な結果を得ることができる。
論文 参考訳(メタデータ) (2025-10-19T09:54:36Z) - RadAlign: Advancing Radiology Report Generation with Vision-Language Concept Alignment [10.67889367763112]
RadAlignは、視覚言語モデルの予測精度と大きな言語モデルの推論能力を組み合わせた、新しいフレームワークである。
本フレームワークは, 幻覚の低減, 自動医用画像の進歩, 予測AIと生成AIの統合による報告分析を両立させながら, 強力な臨床解釈可能性を維持している。
論文 参考訳(メタデータ) (2025-01-13T17:55:32Z) - CheXalign: Preference fine-tuning in chest X-ray interpretation models without human feedback [10.826651024680169]
放射線科医は、医療画像を実行可能なレポートに翻訳する上で重要な役割を担っている。
放射線学における現在の視覚言語モデル(VLM)のほとんどは、教師付き微調整のみに依存している。
胸部X線ラジオグラフィーレポート生成(RRG)に着目した選好フィードバックのための自動パイプラインを提案する。
我々の最高のパフォーマンス設定は、RRGタスクのMIMIC-CXRデータセット上で最先端のCheXbertスコアを達成します。
論文 参考訳(メタデータ) (2024-10-09T16:07:11Z) - CPR: Retrieval Augmented Generation for Copyright Protection [101.15323302062562]
本稿では,著作権保護の強いRAGの新しい手法であるRetrieval(CPR)を用いたCopyProtected生成について紹介する。
CPRは、取得した画像のセットに拡散モデルの出力を条件付けることができる。
CPRは、攻撃者が生成した画像から抽出できる可能性のある情報の量を制限するNear Access Freeness (NAF) を満たすことを証明している。
論文 参考訳(メタデータ) (2024-03-27T18:09:55Z) - Cross-Modal Causal Intervention for Medical Report Generation [107.76649943399168]
放射線医学報告生成(RRG)は, コンピュータ支援診断と薬剤指導に不可欠である。
視覚言語的バイアスによる急激な相関により、正確な病変記述の生成は依然として困難である。
我々はCrossModal Causal Representation Learning (CMCRL)という2段階のフレームワークを提案する。
IU-XrayとMIMIC-CXRの実験により、我々のCMCRLパイプラインは最先端の手法よりも大幅に優れていることが示された。
論文 参考訳(メタデータ) (2023-03-16T07:23:55Z) - Radiomics-Guided Global-Local Transformer for Weakly Supervised
Pathology Localization in Chest X-Rays [65.88435151891369]
Radiomics-Guided Transformer (RGT)は、テキストトグロバル画像情報と、テキストトグロバル情報とを融合する。
RGTは、画像トランスフォーマーブランチ、放射能トランスフォーマーブランチ、および画像と放射線情報を集約する融合層から構成される。
論文 参考訳(メタデータ) (2022-07-10T06:32:56Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。