論文の概要: Foreseeing the Invisible: Amodal Reconstruction of Leaf Fossil Images
- arxiv url: http://arxiv.org/abs/2608.04423v1
- Date: Wed, 05 Aug 2026 04:07:15 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.706789
- Title: Foreseeing the Invisible: Amodal Reconstruction of Leaf Fossil Images
- Title(参考訳): 可視性:葉化石画像のアモーダル再構成
- Authors: Liuxiang Yue, Ailin Zhang, Ziyue Zhao, Yikun Duan,
- Abstract要約: AmodalDINOは、単一のRGB画像から4つのマスクを予測するマルチヘッド密度予測モデルである。
合成葉の化石画像にのみ訓練されている。
AmodalDINOは2つのベンチマークデータセット上で動作可能で、KINSでは85.05の完全なmIoU / 66.65の排他的mIoU、COCOA-clでは80.90 / 38.15に達する。
- 参考スコア(独自算出の注目度): 0.27998963147546146
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Fossil leaves are rarely preserved whole -- sedimentary rock hides, breaks, and erodes the lamina, yet paleobotany depends on the complete shape and outline of the leaf. We cast the recovery of the missing tissue as amodal reconstruction and present AmodalDINO, a multi-head dense-prediction model that predicts four masks from a single RGB image: visible leaf, amodal complete leaf, amodal main vein, and fine veins. Unlike essentially all prior amodal work, AmodalDINO is given no visible mask. It predicts the visible and amodal regions jointly, so it needs no upstream instance segmenter at runtime. Two simple but effective changes adapt the model to the amodal segmentation task: fully fine-tune a DINOv3 ViT-L/16 at a small learning rate instead of freezing it, and attach auxiliary venation heads alongside the leaf heads. These two changes enable the model to learn the structural shape prior of leaves. Trained only on synthetic leaf fossil images, AmodalDINO reaches 95.0% Dice / 90.5% IoU on the validation set and transfers well to real fossil specimens. Stripped to two heads, the same recipe can run on two benchmark datasets, reaching 85.05 full mIoU / 66.65 occluded mIoU on KINS and 80.90 / 38.15 on COCOA-cls. The model is also practical: by quantizing to 4-bit weights, it runs entirely offline in a browser, matching the original model with an IoU of 0.910. We also add ruler-based calibration to estimate surface area, and a generative visualization of living leaves on local devices.
- Abstract(参考訳): 化石の葉は全部保存されることはめったにない - 堆積岩がラミナを隠蔽し、破砕し、浸食するが、古植物学は葉の完全な形と輪郭に依存する。
AmodalDinoは1枚のRGB画像から4つのマスク(可視葉、無モダル完全葉、無モダル主静脈、細静脈)を予測する多頭部密度予測モデルである。
アモダルディーノはそれまでのすべてのアモーダルな作品とは異なり、目に見えるマスクは与えられていない。
可視領域とアモーダル領域を同時に予測するので、実行時に上流インスタンスセグメンタは必要ない。
DINOv3 ViT-L/16を凍結する代わりに少量の学習速度で完全に微調整し、葉の頭部に補助的な換気ヘッドを取り付けます。
この2つの変更により、モデルが葉の構造的形状を学習できるようになる。
合成葉の化石画像でのみ訓練されたアモダルディーノは、検証セット上で95.0%のDice / 90.5%のIoUに達し、実際の化石によく移動する。
同じレシピは2つのベンチマークデータセットで実行でき、KINSでは85.05の完全なmIoU / 66.65の占有mIoU、COCOA-clでは80.90 / 38.15に達する。
4ビットの重みに量子化することで、ブラウザ内で完全にオフラインで動作し、元のモデルと0.910のIoUをマッチングする。
また,地表面積を推定するための定規によるキャリブレーションや,局所デバイス上での生き葉の生成可視化も行う。
関連論文リスト
- Iterative Visual Thinking: Teaching Vision-Language Models Spatial Self-Correction through Visual Feedback [0.023227405857540805]
視覚言語モデル(VLM)は、強い単一ショット空間グラウンドを達成するが、自身の予測を観察し修正するメカニズムは欠如している。
本稿では,モデルが境界ボックスを予測するクローズドループフレームワークであるIterative Visual Thinking (IVT)を提案する。
すべてのトレーニングでは、単一のGPU上で2400のサンプルしか使用せず、空間的な自己補正が、適度なスケールで注入できる学習可能な能力であることを実証している。
論文 参考訳(メタデータ) (2026-06-11T10:27:29Z) - DAONet-YOLOv8: An Occlusion-Aware Dual-Attention Network for Tea Leaf Pest and Disease Detection [2.661320179262946]
本報告では,茶葉害虫や病原体を正確に検出するための3つの改良点を有するYOLOv8変異体を提案する。
既存のNet-YOLOv8は92.97%の精度、92.80%のリコール、97.10%のmAP@50、76.90%のmAP@50:95を達成し、YOLOv8nベースラインをそれぞれ2.34、4.68、1.40、および1.80ポイント上回っている。
論文 参考訳(メタデータ) (2025-11-28T14:28:30Z) - Distilling Diversity and Control in Diffusion Models [26.21070624480139]
蒸留拡散モデルは、はるかに少ない時間ステップで画像を生成するが、同じプロンプトから複数の出力を生成する際にサンプルの多様性が低下する。
本研究は, 蒸留モデルに切り替える前に, 最初の臨界時間段階のみに基本モデルを用いたハイブリッド手法である多様性蒸留を導入する。
蒸留モデルにおいて,最初の段階が多様性のボトルネックに集中する理由を示す因果検証と理論的支援の両方を提供する。
論文 参考訳(メタデータ) (2025-03-13T17:59:56Z) - Deep Learning-Based Direct Leaf Area Estimation using Two RGBD Datasets for Model Development [6.663132872468536]
単一葉面積の推定は作物の生育の指標であり,新品種を育むための表現型形質である。
本研究では,実世界のシナリオにおいて,モバイルカメラを用いたRGBD画像の深層学習に基づく葉面積推定について検討する。
論文 参考訳(メタデータ) (2025-03-13T07:39:09Z) - Neural Metamorphosis [72.88137795439407]
本稿では,ニューラル・メタモルファス(NeuMeta)と呼ばれる,自己変形可能なニューラルネットワークの構築を目的とした新たな学習パラダイムを提案する。
NeuMetaはニューラルネットワークの連続重み多様体を直接学習する。
75%の圧縮速度でもフルサイズの性能を維持する。
論文 参考訳(メタデータ) (2024-10-10T14:49:58Z) - Amodal Ground Truth and Completion in the Wild [84.54972153436466]
我々は3Dデータを用いて、実画像中の部分的に隠蔽された物体に対して、真偽のアモーダルマスクを決定するための自動パイプラインを確立する。
このパイプラインは、様々なオブジェクトカテゴリとラベルからなるアモーダル完了評価ベンチマークMP3D-Amodalを構築するために使用される。
論文 参考訳(メタデータ) (2023-12-28T18:59:41Z) - EATFormer: Improving Vision Transformer Inspired by Evolutionary Algorithm [111.17100512647619]
本稿では、実証された実用的な進化的アルゴリズム(EA)と類似したビジョントランスフォーマーの合理性を説明する。
本稿では,EA ベースのトランス (EAT) ブロックのみを含む新しいピラミッド EATFormer バックボーンを提案する。
画像分類,下流タスク,説明実験に関する大規模かつ定量的な実験は,我々のアプローチの有効性と優位性を示すものである。
論文 参考訳(メタデータ) (2022-06-19T04:49:35Z) - MTC: Multiresolution Tensor Completion from Partial and Coarse
Observations [49.931849672492305]
既存の完備化の定式化は、主に1つのテンソルからの部分的な観測に依存する。
この問題を解決するために,効率的なマルチレゾリューション・コンプリート・モデル(MTC)を提案する。
論文 参考訳(メタデータ) (2021-06-14T02:20:03Z) - Learning Vector Quantized Shape Code for Amodal Blastomere Instance
Segmentation [33.558545104711186]
Amodalのインスタンスセグメンテーションは、オブジェクトが完全に見えない場合でも、オブジェクトの完全なシルエットを復元することを目的としている。
本稿では,入力特徴を中間形状コードに分類し,それらから完全なオブジェクト形状を復元することを提案する。
In vitro 受精 (IVF) クリニックにおけるブラストマーの正確な測定が可能となる。
論文 参考訳(メタデータ) (2020-12-02T06:17:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。