論文の概要: ReVision3D: Attribution-Guided Recursive Self-Improvement for 3D Medical Perception
- arxiv url: http://arxiv.org/abs/2609.32984v2
- Date: Fri, 02 Oct 2026 18:32:11 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 21:18:52.719055
- Title: ReVision3D: Attribution-Guided Recursive Self-Improvement for 3D Medical Perception
- Title(参考訳): ReVision3D:Attribution-Guided Recursive Self-Improvement for 3D Medical Perception
- Abstract要約: 再帰的自己改善(Recursive self-improvement、RSI)は、現在の医用イメージングエージェントの限られた視覚能力を克服するための有望な道を提供する。
視覚的証拠が失われる場所を決定するために,空間的に接地されたアノテーションで3Dボリュームを利用するRSIシステムであるReVision3Dを導入する。
当社のフレームワークは,プロジェクトのページでインタラクティブなデモを公開しています。
- 参考スコア(独自算出の注目度): 24.450253271912597
- License:
- Abstract: Recursive self-improvement (RSI) offers a promising path for overcoming the limited visual capability of current medical imaging agents. Yet applying RSI to volumetric imaging remains difficult: failures can arise from acquisition, perception, training recipe, or downstream inference, while self-generated feedback and logged trajectories provide little guidance on which component should change. We introduce ReVision3D, an RSI system that leverages 3D volumes with spatially grounded annotations to determine where visual evidence is lost and recursively improve the corresponding visual capability. A frozen language-model designer proposes revisions to acquisition, perception, training, or inference, while the verifier and system-level objective remain fixed. Our key insight is that an annotated volume forms an exact replay world for view rendering and spatial verification: unvisited views can be rendered on demand, and localized predictions can be checked directly against reference masks. This grounded feedback directs targeted revision, while only changes that improve beyond measured seed noise are retained. Each accepted change triggers renewed attribution, allowing the dominant bottleneck to shift across rounds. On abdominal CT, attribution identifies perception as the dominant remaining limitation. Revising that level enables ReVision3D to achieve 79% liver recall and 83% kidney recall at under 0.4 false positives per patient, outperforming the evaluated frozen multimodal foundation models, with the largest gains on small lesions. Our framework is public available with interactive demo in this project page: \url{https://leeh43.github.io/ReVision3D/}
- Abstract(参考訳): 再帰的自己改善(Recursive self-improvement、RSI)は、現在の医用イメージングエージェントの限られた視覚能力を克服するための有望な道を提供する。
しかし、RSIをボリューム画像に適用することは依然として困難であり、取得、認識、トレーニングレシピ、下流の推論から障害が発生する可能性がある。
ReVision3Dは3Dボリュームを空間的接地アノテーションで活用し,視覚的証拠がどこに失われるかを判断し,それに対応する視覚能力を再帰的に改善するシステムである。
冷凍言語モデルデザイナは、検証者およびシステムレベルの目的が固定されている間、獲得、認識、訓練、推論に対する修正を提案する。
我々の重要な洞察は、注釈付きボリュームが、ビューレンダリングと空間的検証のための正確なリプレイの世界を形成することである: 監視されていないビューはオンデマンドでレンダリングでき、局所的な予測は参照マスクに対して直接チェックできる。
この接地されたフィードバックは、ターゲットのリビジョンを指示する一方で、測定されたシードノイズを超えて改善される変更のみが保持される。
承認された各変更は、再帰的な帰属をトリガーし、主要なボトルネックがラウンド間でシフトすることを可能にする。
腹部CTでは、アトリビューションは知覚を主要な残存限度として認識する。
このレベルを改訂することで、ReVision3Dは79%の肝臓リコールと83%の腎臓リコールを患者1人当たり0.4の偽陽性で達成し、評価された凍結したマルチモーダル基礎モデルよりも優れ、小さな病変に対して最大の利益をもたらす。
私たちのフレームワークは、プロジェクトのページでインタラクティブなデモを公開しています。
関連論文リスト
- Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation [18.20369971970953]
On-Policy Self-Distillation (OPSD)は、高密度のトークンレベルの監視を得るために、特権的なリプレイビューの下で生成されたトークンを再スコアする。
結果として得られるサポートは、リプレイビューに含まれる特権情報と、リプレイスキャフォールドによって誘導されるスコアシフトの両方を反映することができる。
本研究では, この問題点を解決するために, OCSD (Observatory-Calibrated Self-Distillation) を提案する。
論文 参考訳(メタデータ) (2026-08-05T12:52:14Z) - ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination [9.288297528741332]
ReGroundはビジョンランゲージモデル(Vision-Language Models)を教えるフレームワークで、失敗を自己診断し、視覚的エビデンスを選択的に再検査する。
画像再注入と目標自己診断の2つの相補的な要素が必要であることが判明した。
論文 参考訳(メタデータ) (2026-08-05T02:41:53Z) - Detecting Clinical Hallucinations in LVLMs via Counterfactual Visual Grounding Uncertainty [22.008964207160663]
視覚的エビデンスを基礎として,任意のLVLM応答を監査する視覚追跡可能な幻覚検出フレームワークを提案する。
我々は、視覚的に検証可能なエンティティを抽出し、医療領域適応Qwen-VL接地検証器を用いて、入力画像上に各エンティティをローカライズする。
複数の医用画像モダリティとLVLMバックボーンを用いた実験により,本手法は幻覚検出性能を継続的に向上することが示された。
論文 参考訳(メタデータ) (2026-06-26T18:15:38Z) - 3D MRI Image Pretraining via Controllable 2D Slice Navigation Task [21.334351019760252]
自己教師付きプレトレーニングは、ラベルなしスキャンからMRI表現を学ぶための主流のアプローチとなっている。
マスクしたパッチの再構築と異なる、固有の自己超越信号が存在するかどうかを問う。
スライスを連続的な位置、向き、スケールでレンダリングすることで、3Dボリュームを高密度なビデオアクションシーケンスに変換することができる。
論文 参考訳(メタデータ) (2026-05-07T16:08:22Z) - ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning [59.558706734431276]
空間知能の現在の評価は、現代の視覚言語モデル(VLM)設定下で体系的に無効にすることができる。
本稿では,各QAペアが実際の入力の下で応答可能で正しいことを保証するためのベンチマークとプロトコルであるReVSIを紹介する。
論文 参考訳(メタデータ) (2026-04-27T10:45:51Z) - Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models [18.624825577944854]
REVISは、抑圧された視覚情報を明示的に再活性化するために設計されたトレーニング不要のフレームワークである。
その結果,REVISは最先端のベースラインに比べて物体幻覚率を約19%削減できることがわかった。
論文 参考訳(メタデータ) (2026-02-12T11:07:44Z) - ReViP: Reducing False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance [50.05984919728878]
本稿では、視覚的接地と摂動下での堅牢性を高めるために、視覚-受容器リバランスを備えた新しいVLAフレームワークReViPを提案する。
具体的には、タスクステージオブザーバとして外部VLMを使用して、視覚的な観察からリアルタイムなタスク中心の視覚的手がかりを抽出する。
本稿では,オブジェクトドロップのような制御された設定を持つLIBERO上に構築された最初のFalse-Completion Benchmark Suiteを提案する。
論文 参考訳(メタデータ) (2026-01-23T11:31:07Z) - Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling [78.78822033285938]
VLM(Vision-Language Models)は視覚的理解に優れ、視覚幻覚に悩まされることが多い。
本研究では,幻覚を意識したトレーニングとオンザフライの自己検証を統合した統合フレームワークREVERSEを紹介する。
論文 参考訳(メタデータ) (2025-04-17T17:59:22Z) - Augment and Criticize: Exploring Informative Samples for Semi-Supervised
Monocular 3D Object Detection [64.65563422852568]
我々は、一般的な半教師付きフレームワークを用いて、難解な単分子3次元物体検出問題を改善する。
我々は、ラベルのないデータから豊富な情報的サンプルを探索する、新しい、シンプルで効果的なAugment and Criticize'フレームワークを紹介します。
3DSeMo_DLEと3DSeMo_FLEXと呼ばれる2つの新しい検出器は、KITTIのAP_3D/BEV(Easy)を3.5%以上改善した。
論文 参考訳(メタデータ) (2023-03-20T16:28:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。