論文の概要: A Deterministic Binary Fingerprinting Framework with Zero-Trained Feature Extraction for Sparse Count Matrices
- arxiv url: http://arxiv.org/abs/2607.14596v1
- Date: Thu, 16 Jul 2026 05:47:52 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-17 17:01:33.005856
- Title: A Deterministic Binary Fingerprinting Framework with Zero-Trained Feature Extraction for Sparse Count Matrices
- Title(参考訳): スパース数行列に対するゼロトレーニング特徴抽出を用いた決定論的バイナリフィンガープリンティングフレームワーク
- Abstract要約: MMTBは、ラベルの監督、モデルフィッティング、勾配に基づく最適化を必要としない、学習されていないバイナリ表現フレームワークである。
密度の高いfloat32表現とは対照的に、MMTBフィンガープリントはメモリを約10倍減らし、固定幅のハミングインデクサブルコードを提供する。
- 参考スコア(独自算出の注目度): 5.730395615441126
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Sparse count matrices from single-cell transcriptomes to k-mer profiles and document-term frequencies are conventionally analyzed via PCA-reduced graph clustering or iterative optimization in continuous embedding spaces. We introduce MMTB, a deterministic non-learned binary representation framework that requires no label supervision, model fitting, or gradient-based optimization. Column-wise Min-Max normalization followed by fixed cutoffs maps each sample to a thermometer fingerprint whose Hamming distances show empirical correspondence with normalized L1 distances, with Pearson correlation approximately 0.92 on single-cell RNA-seq pairs. In a favorable three-cell-line mixture, the 3-threshold fingerprint achieves NMI of 0.99 at 188 bytes per cell. Under a fair Hamming nearest-neighbor graph plus Leiden readout, MMTB approaches PCA plus Leiden on this coarse task. On challenging tissue-like annotations, continuous pipelines often lead; PBMC Seurat NMI is 0.39 for MMTB versus 0.49 for Scanpy, underscoring that MMTB is suited for coarse-grained separation and resource-constrained deployments rather than fine-grained subtype discovery or as a general replacement for continuous embeddings. Relative to dense float32 representations, MMTB fingerprints reduce memory by approximately 10-fold while providing fixed-width Hamming-indexable codes. PCA30 embeddings and sparse CSR may be smaller; we do not claim universal compression. A label-free suitability score is provided as a deployment guideline, not a performance predictor.
- Abstract(参考訳): 単一セルトランスクリプトームからk-merプロファイル,文書長周期のスパース数行列は,PCAによるグラフクラスタリングや連続埋め込み空間における反復的最適化によって解析される。
本稿では,ラベル管理やモデル適合,勾配に基づく最適化を必要としない決定論的非学習型バイナリ表現フレームワークMMTBを紹介する。
カラムワイドのMin-Max正規化に続いて、固定カットオフは各サンプルを、ハミング距離が正常化L1距離と経験的対応を示す温度計の指紋にマッピングし、ピアソン相関は単細胞RNA-seq対で約0.92である。
好適な3-セル-ライン混合では、3-スレッショルド指紋は1セルあたり188バイトで0.99のNMIを達成する。
ハンミング最寄りのグラフとライデンの読み出しで、MMTBはこの粗いタスクでPCAとライデンにアプローチする。
PBMC Seurat NMI は MMTB に対して 0.39 であり、Scanpy では 0.49 であり、MMTB は細粒度のサブタイプ発見や連続的な埋め込みの一般的な代替としてではなく、粗粒度の分離や資源の制限された配置に適している、と論じている。
密度の高いfloat32表現とは対照的に、MMTBフィンガープリントはメモリを約10倍減らし、固定幅のハミングインデクサブルコードを提供する。
PCA30埋め込みとスパースCSRはより小さくなり得る。
ラベルなし適合度スコアは、性能予測器ではなく、デプロイメントガイドラインとして提供される。
関連論文リスト
- Overfitting Mitigation via Singular Value Decomposition in Minimum Bayes Risk Decoding [53.9009465845701]
本稿では,一対のユーティリティ行列をノイズ情報信号としてフレーム化するSVD-MBRを提案する。
実験により、SVD-MBRは復号化に成功し、一般化されたメトリクスの範囲でかなりの利得が得られることが示された。
論文 参考訳(メタデータ) (2026-09-01T12:11:29Z) - Support Operation Factorization: Compositional Readout of Frozen Vision Encoders under Controlled Interventions [87.95757610455173]
我々は、x演算グリッドとSO-OPFをサポートするために、インジェクティブに整合した残余セルアウトプロトコルを導入する。
グリッドが分かっているときにキャリアがホールドアウトバインディングを構成するかどうか、フラットなセルラベルからグリッドを回収できるかどうかという2つの質問を分離する。
論文 参考訳(メタデータ) (2026-08-06T15:38:55Z) - Modeling Normal Is All You Need: Joint Latent Clustering for Anomaly Detection in Multimodal Cyber-Physical Systems [47.027290803102666]
通常の行動は、多くの不均衡で、曲がりくねった、細い範囲の運営体制の結合である。
我々は正規法則を、共同学習された潜在表現と明示的なガウス混合モードクラスタリングでモデル化する。
ポイント調整のない生のポイントワイドメトリクス、自明な検出困難分割、頻度整合F1、列車正規化のみのキャリブレーションを意図的に評価する。
論文 参考訳(メタデータ) (2026-07-07T10:10:00Z) - No More K-means: Single-Stage Sparse Coding for Efficient Multi-Vector Retrieval [51.43543998583709]
SSR(Single-stage Sparse Retrieval)は、高価なクラスタリングを効率的なスパースコーディングに置き換えるパラダイムシフトである。
ColBERTv2と比較してインデックス処理時間を15倍短縮し、検索レイテンシを半減させ、同時に検索性能を向上させる。
論文 参考訳(メタデータ) (2026-05-28T15:53:34Z) - Reframing preprocessing selection as model-internal calibration in near-infrared spectroscopy: A large-scale benchmark of operator-adaptive PLS and Ridge models [0.2609784101826761]
本稿では,探索を1つのキャリブレーションステップに分解できる事例について検討する。
線形演算子適応キャリブレーションは、徹底的な前処理スクリーニングに匹敵する予測品質を与える。
論文 参考訳(メタデータ) (2026-05-13T14:23:00Z) - Representation Before Training: A Fixed-Budget Benchmark for Generative Medical Event Models [0.3250525349446657]
我々は,表現決定が1世紀前の事前学習予算の共有後の下流予測にどのように影響するかを評価する。
我々はMIMIC-IVで28個の整形トランスを訓練し,30個の臨床結果について評価した。
論文 参考訳(メタデータ) (2026-04-18T01:38:47Z) - Once-for-All Channel Mixers (HYPERTINYPW): Generative Compression for TinyML [0.0]
提案するHYPER-TINYPWは圧縮・アズ・ジェネレーション方式で、ほとんどのPW重みを生成された重みに置き換える。
共有マイクロMLPは、レイヤごとの小さなコードからロード時に一度PWカーネルを合成し、それらをキャッシュし、標準的な整数演算子で実行する。
商用のMCUランタイムを保存し、ワンオフでのみ追加する。
論文 参考訳(メタデータ) (2026-03-26T01:08:52Z) - Deterministic Fuzzy Triage for Legal Compliance Classification and Evidence Retrieval [0.0]
法律チームはますます、大量の契約上の証拠をトリアージするために機械学習を使用している。
多くのモデルは不透明で非決定論的であり、HIPAAやNERC-CIPのようなフレームワークと整合するのは難しい。
決定論的双対エンコーダと透明なファジィトリアージバンドに基づく簡単な再現可能な代替法について検討する。
論文 参考訳(メタデータ) (2026-03-08T00:31:34Z) - Identity-Link IRT for Label-Free LLM Evaluation: Preserving Additivity in TVD-MI Scores [3.959606869996232]
本報告では,TVD-MIの2次試行平均値が,非線形リンク関数を使わずに項目応答理論(IRT)に適合する付加的構造で中心確率スコアを得ることを示す。
Giniエントロピーからこのクリップ付き線形評価を導出し、境界飽和を扱うボックス制約最小二乗の定式化を導出する。
論文 参考訳(メタデータ) (2025-10-16T17:59:25Z) - Unsupervised Conformal Inference: Bootstrapping and Alignment to Control LLM Uncertainty [49.19257648205146]
生成のための教師なし共形推論フレームワークを提案する。
我々のゲートは、分断されたUPPよりも厳密で安定した閾値を提供する。
その結果は、ラベルのない、API互換の、テスト時間フィルタリングのゲートになる。
論文 参考訳(メタデータ) (2025-09-26T23:40:47Z) - Pruning Neural Belief Propagation Decoders [77.237958592189]
本稿では,機械学習を用いたBPデコードに対して,過剰完全パリティチェック行列を調整する手法を提案する。
我々は,デコーダの複雑さを低減しつつ,0.27dB,1.5dBのML性能を実現する。
論文 参考訳(メタデータ) (2020-01-21T12:05:46Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。