論文の概要: On the Design Space of Discrete Diffusion Online Adaptation for Molecular Optimization
- arxiv url: http://arxiv.org/abs/2607.02834v1
- Date: Fri, 03 Jul 2026 00:06:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.431166
- Title: On the Design Space of Discrete Diffusion Online Adaptation for Molecular Optimization
- Title(参考訳): 分子最適化のための離散拡散オンライン適応の設計空間について
- Abstract要約: 分子最適化は、しばしば、有効な分子構造よりも広い事前をキャプチャする事前訓練された生成モデルから始まる。
離散拡散モデルに対する適応問題について検討する。
獲得、報酬形成、モデル脱バイアスは、特に小さな分子に対して、より高い報酬を得るための補完的な経路を提供する。
- 参考スコア(独自算出の注目度): 55.27368653669229
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Molecular optimization often starts from a pretrained generative model that captures a broad prior over valid molecular structures. At test time, however, the goal is not to sample from this prior, but to use a limited oracle budget to shift generation toward task-specific high-reward molecules. We study this adaptation problem for discrete diffusion models. Each online round couples several choices. The loop must decide which candidates to evaluate, how rewards become model updates, which feedback to reuse, and how far to move beyond the pretrained prior. These choices have mostly been studied in isolation, leaving open whether they complement one another, become redundant, or interfere inside a full online adaptation loop. We conduct controlled studies across six small-molecule binding-affinity tasks and three protein-fitness tasks. We find that acquisition, reward shaping, and model debiasing provide complementary routes to higher reward, especially for small molecules. Replay further stabilizes learning, while validity penalties keep small-molecule exploration on the valid molecular manifold. Together, these findings point to a practical recipe for feedback-efficient molecular optimization: online fine-tuning with acquisition, reward shaping, debiasing, replay, and validity control. This recipe outperforms offline fine-tuning and inference-time search baselines under matched oracle-call budgets and GPU-hour accounting. The gains are largest when high-reward candidates require larger shifts from the pretrained prior.
- Abstract(参考訳): 分子最適化は、しばしば、有効な分子構造よりも広い事前をキャプチャする事前訓練された生成モデルから始まる。
しかし、テスト時には、この先からサンプルを採取するのではなく、限られたオラクル予算で生成をタスク特異的な高逆分子にシフトさせることが目標である。
離散拡散モデルに対する適応問題について検討する。
各オンラインラウンドにはいくつかの選択肢がある。
ループは、どの候補を評価するか、どのように報酬がモデル更新になるか、どのフィードバックが再利用されるか、事前訓練された範囲を超えてどこまで進むかを決定する必要があります。
これらの選択は、主に独立して研究され、互いに補完し合うか、冗長になるか、オンライン適応ループの完全な内側で干渉するかのどちらかを残している。
6つの小分子結合親和性タスクと3つのタンパク質適合性タスクの制御研究を行った。
獲得、報酬形成、モデル脱バイアスは、特に小さな分子に対して、より高い報酬を得るための補完的な経路を提供する。
リプレイは学習をさらに安定させ、妥当性の低いペナルティは有効な分子多様体の小さな分子探索を保っている。
これらの知見は共に、フィードバック効率のよい分子最適化の実践的なレシピである、獲得によるオンライン微調整、報酬形成、デバイアス、リプレイ、妥当性管理を示唆している。
このレシピは、一致したオラクルコール予算とGPU時間会計の下で、オフラインの微調整と推論時の検索ベースラインを上回っている。
上位候補が事前訓練されたものよりも大きなシフトを必要とする場合、利得は最大である。
関連論文リスト
- Reference-guided Policy Optimization for Molecular Optimization via LLM Reasoning [58.644854860003704]
大規模言語モデル(LLM)は、教師付き微調整(SFT)と、推論タスクにおける検証可能な報酬(RLVR)による強化学習の恩恵を受ける。
基準分子上の応答のみのSFTは推論を崩壊させ、RLVRは類似性制約下でスパースフィードバックを提供する。
本稿では、軌道データを必要としない参照分子から学習する最適化手法である参照誘導政策最適化(RePO)を紹介する。
論文 参考訳(メタデータ) (2026-03-06T04:39:08Z) - Feedback Efficient Online Fine-Tuning of Diffusion Models [52.170384048274364]
提案手法は, 実現可能なサンプルの多様体上で効率的に探索できる新しい強化学習手法である。
本稿では,3つの領域にまたがる実証的検証とともに,後悔の保証を提供する理論的解析を提案する。
論文 参考訳(メタデータ) (2024-02-26T07:24:32Z) - Augmented Memory: Capitalizing on Experience Replay to Accelerate De
Novo Molecular Design [0.0]
分子生成モデルは、最小限のオラクル評価の下で望ましい目的を満たすことを学ばなければならない。
本稿では,データ拡張と体験再生を組み合わせたAugmented Memoryという新しいアルゴリズムを提案する。
オラクルコールから得られたスコアを再利用してモデルを複数回更新できることを示す。
論文 参考訳(メタデータ) (2023-05-10T14:00:50Z) - Retrieval-based Controllable Molecule Generation [63.44583084888342]
制御可能な分子生成のための検索に基づく新しいフレームワークを提案する。
我々は、与えられた設計基準を満たす分子の合成に向けて、事前学習された生成モデルを操るために、分子の小さなセットを使用します。
提案手法は生成モデルの選択に非依存であり,タスク固有の微調整は不要である。
論文 参考訳(メタデータ) (2022-08-23T17:01:16Z) - CELLS: Cost-Effective Evolution in Latent Space for Goal-Directed
Molecular Generation [23.618366377098614]
本稿では,分子潜在表現ベクトルを最適化した遅延空間におけるコスト効率のよい進化戦略を提案する。
我々は、潜伏空間と観測空間をマッピングするために、事前訓練された分子生成モデルを採用する。
提案手法といくつかの高度な手法を比較した複数の最適化タスクについて広範な実験を行った。
論文 参考訳(メタデータ) (2021-11-30T11:02:18Z) - Reducing the Long Tail Losses in Scientific Emulations with Active
Learning [0.0]
本研究では、コアセット選択と呼ばれるアクティブな学習手法を利用して、事前定義された予算に従ってデータを積極的に選択し、トレーニング用にラベル付けした。
本研究では、天体物理学における銀河ハロ占有分布とプラズマ物理学におけるX線放射分光の2つのケーススタディについて検討した。
論文 参考訳(メタデータ) (2021-11-15T09:02:00Z) - Flow Network based Generative Models for Non-Iterative Diverse Candidate
Generation [110.09855163856326]
本稿では,アクションのシーケンスからオブジェクトを生成するためのポリシーを学習する問題について述べる。
本稿では,生成過程をフローネットワークとして見たGFlowNetを提案する。
提案した目的の任意のグローバルな最小限が、所望の分布から標本化する方針を導出することを証明する。
論文 参考訳(メタデータ) (2021-06-08T14:21:10Z) - MIMOSA: Multi-constraint Molecule Sampling for Molecule Optimization [51.00815310242277]
生成モデルと強化学習アプローチは、最初の成功をおさめたが、複数の薬物特性を同時に最適化する上で、依然として困難に直面している。
本稿では,MultI-Constraint MOlecule SAmpling (MIMOSA)アプローチ,初期推定として入力分子を用いるサンプリングフレームワーク,ターゲット分布からのサンプル分子を提案する。
論文 参考訳(メタデータ) (2020-10-05T20:18:42Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。