論文の概要: Causal dictionary learning reveals and validates transcription-factor binding features in genomic language models
- arxiv url: http://arxiv.org/abs/2607.19618v1
- Date: Tue, 21 Jul 2026 22:54:46 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.939958
- Title: Causal dictionary learning reveals and validates transcription-factor binding features in genomic language models
- Title(参考訳): 因果辞書学習はゲノム言語モデルにおける転写因子結合の特徴を明らかにし、検証する
- Abstract要約: ゲノム基盤モデルにおいて、スパース辞書学習と因果介入を組み合わせて、解釈可能な特徴を抽出し、検証し、因果的にテストする枠組みを導入する。
位置重み行列に対するこれらの特徴の素性検証は,GC合成と反復的要素によって著しく整合されていることを示す。
我々は,特定の特徴が,単にモチーフの存在ではなく,細胞型特異的TF結合を表現するために機能的に用いられていることを確認した。
- 参考スコア(独自算出の注目度): 5.237172334460829
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Genomic language models achieve strong performance across regulatory-genomics tasks, yet what these models internally represent remains opaque, and the field lacks a principled procedure for verifying that an apparent ``concept'' inside a model is real rather than an artifact of sequence composition. We introduce a framework that combines sparse dictionary learning with causal intervention to extract, validate, and causally test interpretable features in genomic foundation models. Training top-$k$ sparse autoencoders on the hidden activations of two architecturally distinct models, Nucleotide Transformer ($6$-mer tokenization) and DNABERT-2 (byte-pair encoding), we recover thousands of monosemantic features that map to transcription-factor (TF) sequence motifs. We show that the naive validation of such features against position weight matrices is severely confounded by GC composition and repetitive elements, producing hundreds of spurious ``TF features'', and we develop a composition-matched, binding-resolved protocol that removes these confounds. Critically, we move beyond correlation: by ablating individual dictionary directions during the model's forward pass and measuring the induced shift in the model's own predictive distribution, we establish that specific features are \emph{causally} used to represent cell-type-specific TF binding, not merely motif presence. Across three transcription factors (CTCF, GATA1, REST) and both architectures, causally validated binding features emerge reproducibly ($7$--$14$ of $15$ tested features per condition), while two classes of negative control, scrambled binding labels and randomly selected features, yield no detectable signal. The framework is purely computational, uses only public data, and provides a reusable standard for interpretability claims in genomic deep learning.
- Abstract(参考訳): ゲノム言語モデルは、規制とゲノムのタスク全体で強いパフォーマンスを達成するが、これらのモデルの内部で表されるものはいまだ不透明であり、その分野は、モデルの内部にある「概念」が、シーケンス合成の成果物というよりも現実的なものであることを検証するための原則的な手順を欠いている。
ゲノム基盤モデルにおいて、スパース辞書学習と因果介入を組み合わせて、解釈可能な特徴を抽出し、検証し、因果的にテストする枠組みを導入する。
アーキテクチャ的に異なる2つのモデル、Nucleotide Transformer(6$-merトークン化)とDNABERT-2(バイトペアエンコーディング)の隠れアクティベーションに対して、トップ$kのスパースオートエンコーダをトレーニングします。
本稿では,GC合成および繰り返し要素により,位置重み行列に対するこれらの特徴の素直な検証が著しく確立され,数百個の「TF特徴」が生成されることを示し,これらの特徴を除去する合成整合型バインディング解決プロトコルを開発した。
モデル前方通過中の個々の辞書方向を非難し、モデル自身の予測分布の誘導的な変化を測定することで、特定の特徴が単にモチーフの存在ではなく、細胞タイプ固有のTF結合を表現するために使われることを確かめる。
3つの転写因子(CTCF、GATA1、REST)と、両方のアーキテクチャにおいて、因果的に検証されたバインディング機能は、再現的に発生します。
このフレームワークは純粋に計算であり、公開データのみを使用し、ゲノム深層学習における解釈可能性主張の再利用可能な標準を提供する。
関連論文リスト
- Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics [49.443264461057645]
拡散および連続フローベースの言語モデルは、言語モデリングに対する非自己回帰的な主要な代替手段として現れている。
両方のパラダイムの進歩は、生成的複雑度(gen-PPL)によって圧倒的に追跡される。
我々は、この指標は正しくないと主張している。構築により、gen-PPLは、文法性やセマンティックコヒーレンスではなく、スコアARの下でのみ予測可能性を測定する。
論文 参考訳(メタデータ) (2026-06-07T02:35:56Z) - Beyond Additive Decompositions: Interpretability Through Separability [1.92520187564634]
解釈可能な機械学習は、正確で構造的にデータに忠実なモデルを必要とする。
本稿では, 段階的にグレディな手続きを施して, 単機能関数のランク1積の総和を学習する回帰モデルである分離学習(TSL)を提案する。
我々は、有界な$p$-次部分微分を持つ関数に対する近似レート保証を確立し、TSLが回帰ベンチマークのブラックボックスモデルと競合することを示す。
論文 参考訳(メタデータ) (2026-05-29T12:08:14Z) - A Mechanistic Study of Tabular Foundation Models [12.26738662548555]
タブラル基礎モデルは、様々な分類タスクと回帰タスクに精度で収束する。
これは、リーダーボードが答えられない疑問を引き起こす。
i)モデルが同一のコンテキスト内アルゴリズムを実行するかどうか,(ii)行,列,およびクラス置換不変性が生じるか,および(iii)モデルが推論されたメカニズムに対してエンジニアリングされた摂動下にあるか,の3つを特徴付ける。
論文 参考訳(メタデータ) (2026-05-20T15:23:16Z) - Spectral Archaeology: The Causal Topology of Model Evolution [0.0]
振る舞いベンチマークは、モデルが何をするかをTextithowに教えてくれますが、textithowではありません。
本研究では,アテンショングラフスペクトルを用いた無トレーニングメカニスティックプローブを提案する。
12のモデルと10の言語にまたがって、標準評価で欠落した不連続を露呈する「安定な指紋」が得られる。
論文 参考訳(メタデータ) (2026-01-06T21:26:54Z) - Unveiling Reasoning Thresholds in Language Models: Scaling, Fine-Tuning, and Interpretability through Attention Maps [3.8936716676293917]
本研究では,異なるモデルサイズと訓練データを持つデコーダのみの変換言語モデルのコンテキスト内学習能力について検討する。
我々は,複数の質問応答におけるコモンセンス推論や帰納的推論といったタスクにおいて,推論性能が著しく向上する重要なパラメータしきい値(160億)を同定する。
論文 参考訳(メタデータ) (2025-02-21T00:48:32Z) - The Complexity of Learning Sparse Superposed Features with Feedback [2.4140387101794283]
モデルの基本となる学習特徴がエージェントからのフィードバックによって効率的に検索できるかどうかを検討する。
スパース設定で特徴行列を学習する際のフィードバックの複雑さを解析する。
この結果は,エージェントがアクティベーションを構築し,スパースシナリオにおいて強い上限を示すことを許された場合に,厳密な境界を確立する。
論文 参考訳(メタデータ) (2025-02-08T01:54:23Z) - Match me if you can: Semi-Supervised Semantic Correspondence Learning with Unpaired Images [76.47980643420375]
本稿では,意味的対応の学習に固有のデータ・ハングリー・マターが存在するという仮説に基づく。
我々は,機械の監督を通じて,ペア化されたキーポイントを確実に強化する単純な機械注釈器を実証する。
我々のモデルは,SPair-71k,PF-PASCAL,PF-WILLOWといった意味対応学習ベンチマークの最先端モデルを上回る。
論文 参考訳(メタデータ) (2023-11-30T13:22:15Z) - Mutual Exclusivity Training and Primitive Augmentation to Induce
Compositionality [84.94877848357896]
最近のデータセットは、標準的なシーケンス・ツー・シーケンスモデルにおける体系的な一般化能力の欠如を露呈している。
本稿では,セq2seqモデルの振る舞いを分析し,相互排他バイアスの欠如と全例を記憶する傾向の2つの要因を同定する。
広範に使用されている2つの構成性データセット上で、標準的なシーケンス・ツー・シーケンスモデルを用いて、経験的改善を示す。
論文 参考訳(メタデータ) (2022-11-28T17:36:41Z) - Does BERT really agree ? Fine-grained Analysis of Lexical Dependence on
a Syntactic Task [70.29624135819884]
目的の構文テンプレート上で,BERTが語彙非依存の主観値数アグリーメント(NA)を実行できる範囲について検討した。
名詞文では,単純なテンプレートに対してモデルがよく一般化されるが,1つのアトラクターが存在する場合,語彙非依存の構文一般化を行うことができないことが示唆された。
論文 参考訳(メタデータ) (2022-04-14T11:33:15Z) - Unnatural Language Inference [48.45003475966808]
我々は、RoBERTaやBARTのような最先端のNLIモデルは、ランダムに並べ替えられた単語の例に不変であり、時にはよりよく機能することさえあります。
我々の発見は、自然言語理解モデルと、その進捗を測定するために使われるタスクが、本当に人間のような構文理解を必要とするという考えに疑問を投げかけている。
論文 参考訳(メタデータ) (2020-12-30T20:40:48Z) - Understanding Neural Abstractive Summarization Models via Uncertainty [54.37665950633147]
seq2seq抽象要約モデルは、自由形式の方法でテキストを生成する。
モデルのトークンレベルの予測のエントロピー、すなわち不確実性について検討する。
要約とテキスト生成モデルをより広範囲に解析する上で,不確実性は有用であることを示す。
論文 参考訳(メタデータ) (2020-10-15T16:57:27Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。