論文の概要: VESTIGE: A Knowledge-Guided Masking Strategy for Corruption-Aware Fine-Tuning of Genomic Transformers, Validated on Ancient DNA Reconstruction
- arxiv url: http://arxiv.org/abs/2607.27712v1
- Date: Thu, 30 Jul 2026 05:47:47 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.408155
- Title: VESTIGE: A Knowledge-Guided Masking Strategy for Corruption-Aware Fine-Tuning of Genomic Transformers, Validated on Ancient DNA Reconstruction
- Title(参考訳): VESTIGE: ゲノムトランスフォーマーの微調整を意識した知識誘導型マスキング戦略
- Authors: Angshuman Chakravertty, Rahul Maheshwari,
- Abstract要約: Masked-- model fine-tuning は、再構成の難しさが位置に依存しないとして、トークン位置毎に均一なマスキング確率を適用する。
本稿では,パラメータフリーでドロップイン可能な標準コレータであるVESTIGEを紹介した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Standard masked-language-model fine-tuning applies a uniform masking probability across every token position, assuming reconstruction difficulty is position-agnostic. When the degradation process is characterised and concentrated at predictable positions, this assumption fails: at peak damage sites the model can underperform a frequency-matched random predictor. We introduce VESTIGE, a parameter-free, drop-in replacement for the standard MLM collator that aligns the masking distribution with an empirically measured per-position corruption profile. We apply it to ancient DNA (aDNA) reconstruction, where cytosine deamination produces a position-dependent C-to-T / G-to-A gradient quantified per-position by mapDamage2. Rescaling so the mean C/G masking rate equals 15% - identical to standard MLM - isolates spatial redistribution as the sole variable, with model, data, seed, and hyperparameters held fixed across both DNABERT-2 runs on a mammoth CDS corpus (two specimens, seven genes). Across six terminal-zone widths and 626 paired windows, VESTIGE leads standard MLM at every width (Delta = +4.18 to +10.35 pp, all p < 10^-8), cuts validation cross-entropy by 13% (3.274 vs. 3.757), and yields ESMFold reconstructions with TM-score > 0.95 across all six reconstructions (three genes) even under damage amplified 10-30x beyond authentic PMD rates. A 1D CNN biosecurity classifier returns AUC = 0.935 and clears 98.2% of reconstructed windows, the 1.76% remainder attributable to reference-genome features, not reconstruction artefacts. The principle is domain-agnostic: any measurable position- or context-specific corruption profile - FFPE, bisulfite, metagenomic, or nanopore - substitutes directly for the PMD array, making VESTIGE a knowledge-guided training routine for intelligent systems operating on degraded or noisy sequence inputs.
- Abstract(参考訳): 標準的なマスク付き言語モデルファインチューニングは、再構築の難しさが位置認識不能であると仮定して、トークン位置毎に均一なマスキング確率を適用する。
劣化過程が特徴づけられ、予測可能な位置に集中すると、この仮定は失敗する。
本稿では,パラメータフリーでドロップイン可能な標準MLMコレータであるVESTIGEを紹介した。
そこでは, 位置依存的なC-to-T/G-to-A勾配をmapDamage2により定量した。
平均C/Gマスキング率は15%で、標準のMLMと同一であり、空間再分配を唯一の変数として分離し、モデル、データ、シード、ハイパーパラメータは両方のDNABERT-2に固定され、マンモスCDSコーパス(2つの標本、7つの遺伝子)で実行される。
6つの端末ゾーン幅と626のペアウィンドウで、VESTIGEはすべての幅(Delta = +4.18 - +10.35 pp, all p < 10^-8)で標準のMLMをリードし、検証のクロスエントロピーを13%削減する(3.274 vs. 3.757)。
1D CNNバイオセキュリティ分類器はAUC = 0.935を返却し、再建された窓の98.2%をクリアする。
原則はドメインに依存しない: 測定可能な位置またはコンテキスト固有の汚職プロファイル - FFPE、ビスルファイト、メタゲノミクス、ナノ孔 - は、PMD配列を直接代用し、VESTIGEは劣化またはノイズのあるシーケンス入力を操作するインテリジェントシステムのための知識誘導トレーニングルーチンとなる。
関連論文リスト
- Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation [43.1212452324751]
この領域の既存のデータセットは完全に記述的テキストを欠いているか、あるいは厳しいテキストイメージのセマンティックなミスアライメントに悩まされている。
本稿では,災害対応のための大規模マルチモーダルデータセットの構築と自動検証を行う新しい手法を提案する。
論文 参考訳(メタデータ) (2026-07-30T14:23:01Z) - Post-Operative Glioma Segmentation via Loss Stabilization, Normalization and Subspace Attention [46.03321798937855]
ドメインシフトの際,GDL(Generalized Dice Loss)が不安定であることを示す。
本稿では,ボトルネック機能を再校正するサブスペース・アウェア・クラス・アテンション(SACA)モジュールを提案し,腫瘍の感度を8%向上させる。
論文 参考訳(メタデータ) (2026-07-23T09:59:30Z) - DNA: Dual-stage Native Attribution for Generated Image Source Tracing [75.65470221927096]
既存のプロアクティブな方法は、透かしの埋め込みやモデル修正に依存している。
DNAは、ニューラルネットワークのトレーニングを追加せずに、この階層に従う粗大なフレームワークである。
実験の結果、DNAは89.11%のエンドツーエンドの属性精度を達成している。
論文 参考訳(メタデータ) (2026-07-15T10:27:52Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness [45.148328075418156]
デプロイされた注文エージェントは、階層の固定された分類に分解される。
純粋なスイートは、ロックされたスライス単位のベースラインに対して、すべての変更でCIで動作する。
制御されたレグレッションインジェクションにより、安全でない7つの層に一度に1つの層を分解し、検証する。
論文 参考訳(メタデータ) (2026-06-10T05:55:13Z) - The Dark Regulome: Disentangling Predictability from Regulation in Genomic Foundation Models [0.0]
高次グリオーマはニューロンと機能的なシナプスを介して神経回路に統合される。
ダークゲノムにまたがる規制プログラムは、プローブする天然基質である。
本稿では、予測可能性駆動型RIS分散から分離した残差化・置換診断手法を提案する。
論文 参考訳(メタデータ) (2026-06-05T02:20:12Z) - Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation [6.129872931808218]
キー値(KV)キャッシュの量子化は、Large Language Model(LLM)推論メモリの削減に広く利用されている。
本研究では,KVキャッシュ量子化下でのアライメント保存について検討する。
低ビット量子化は安全アライメントを静かに破壊することができる。
論文 参考訳(メタデータ) (2026-06-01T02:02:20Z) - Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbations [2.7946918847372277]
大規模言語モデルは、数学的推論ベンチマークにおいて強い性能を示すが、意味を保存する表面摂動に対して驚くほど脆弱である。
我々は677 GSM8K問題に対して,3つのオープンウェイトLLM(Mistral-7B,Llama-3-8B,Qwen2.5-7B)を意味論的に等価な変種と組み合わせて評価した。
3つのモデルはいずれも相当な解答フリップ率(28.8%-45.1%)を示し、数字のパラフレーズは名前スワップよりも一貫して破壊的である。
論文 参考訳(メタデータ) (2026-04-02T05:30:20Z) - DAONet-YOLOv8: An Occlusion-Aware Dual-Attention Network for Tea Leaf Pest and Disease Detection [2.661320179262946]
本報告では,茶葉害虫や病原体を正確に検出するための3つの改良点を有するYOLOv8変異体を提案する。
既存のNet-YOLOv8は92.97%の精度、92.80%のリコール、97.10%のmAP@50、76.90%のmAP@50:95を達成し、YOLOv8nベースラインをそれぞれ2.34、4.68、1.40、および1.80ポイント上回っている。
論文 参考訳(メタデータ) (2025-11-28T14:28:30Z) - DNABERT-2: Fine-Tuning a Genomic Language Model for Colorectal Gene Enhancer Classification [0.0]
DNABERT-2は、DNAから可変長トークンを学習するためにバイトペアエンコーディングを使用するトランスフォーマーゲノム言語モデルである。
遺伝子エンハンサーは、いつ、どこで遺伝子がスイッチされるかを制御するが、その配列の多様性と組織特異性は、大腸癌の特定を困難にしている。
大腸癌におけるBPEトークン化を用いた第2世代のゲノム言語モデルを適用した最初の研究である。
論文 参考訳(メタデータ) (2025-09-28T16:10:03Z) - Backdoor Cleaning without External Guidance in MLLM Fine-tuning [76.82121084745785]
Believe Your Eyes (BYE)は、アテンションエントロピーパターンを自己教師信号として活用して、バックドアサンプルを特定してフィルタリングするデータフィルタリングフレームワークである。
クリーンタスクのパフォーマンスを維持しながら、ほぼゼロの攻撃成功率を達成する。
論文 参考訳(メタデータ) (2025-05-22T17:11:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。