論文の概要: RareSense: Rarity-Aware Similarity Search for Anomaly Retrieval in Transactional Data
- arxiv url: http://arxiv.org/abs/2607.28879v1
- Date: Thu, 30 Jul 2026 22:48:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-03 14:29:40.512893
- Title: RareSense: Rarity-Aware Similarity Search for Anomaly Retrieval in Transactional Data
- Title(参考訳): RareSense: トランザクションデータにおける異常検索のためのRarity-Aware類似性検索
- Authors: Sidahmed Benabderrahmane, Talal Rahwan,
- Abstract要約: スパーストランザクション異常データのための希少な類似性フレームワークであるRareSenseを紹介する。
RareSenseは最小限のレアなアイテムセットを中間構造として採掘し、信頼できるレアなアソシエーションルールを導出し、オブジェクトを希少なレアルールプロファイルにマッピングし、重み付きジャカルド類似度を用いてそれらと比較する。
- 参考スコア(独自算出の注目度): 1.102914654802229
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: Similarity search over sparse set-valued data is often dominated by frequent background attributes because classical measures such as Jaccard, cosine, and Hamming compare objects through atomic overlap. IDF (Inverse document frequency) weighting partially reduces this effect but remains atom-wise and cannot explicitly represent informative higher-order co-occurrences. We introduce RareSense, a rarity-aware similarity framework for sparse transactional anomaly data. RareSense mines minimal rare itemsets as intermediate structures, derives reliable rare association rules, maps objects into sparse rare-rule profiles, and compares them using weighted Jaccard similarity. Rule weights combine inverse support, confidence, lift, structural complexity, and stability, so that neighborhoods are determined by shared rare evidence rather than uniform feature overlap. We show that IDF-weighted Jaccard is a restricted singleton case of RareSense, and that the induced distance is a pseudometric on the original objects and a metric over equivalence classes defined by identical rule profiles. Experiments across four benchmark families spanning cybersecurity and general categorical domains show that RareSense attains the highest observed macro-average query-conditioned retrieval performance among the evaluated similarity measures. The statistical analysis indicates significant overall differences, with corrected paired comparisons favoring RareSense over the atomic baselines. The gains remain workload-dependent and are strongest when anomalies share repeatable rare higher-order structure. For global anomaly ranking, RareSense achieves the highest observed macro-average performance while remaining statistically comparable to several strong dedicated detectors.
- Abstract(参考訳): スパース集合値データに対する類似性探索は、ジャカード、コサイン、ハミングのような古典的な尺度が原子重なりを通じてオブジェクトを比較するため、しばしば背景属性によって支配される。
IDF(逆文書周波数)の重み付けは、この効果を部分的に減少させるが、原子レベルでは残り、情報的高次共起を明示的に表すことはできない。
スパーストランザクション異常データのための希少な類似性フレームワークであるRareSenseを紹介する。
RareSenseは最小限のレアなアイテムセットを中間構造として採掘し、信頼できるレアなアソシエーションルールを導出し、オブジェクトを希少なレアルールプロファイルにマッピングし、重み付きジャカルド類似度を用いてそれらと比較する。
ルールウェイトは、逆サポート、信頼、リフト、構造的複雑さ、安定性を組み合わせ、一様特徴重なりではなく共有された稀な証拠によって地区が決定される。
IDF重み付きジャカードはRareSenseの制限シングルトンケースであり、誘導距離は元のオブジェクト上の擬似距離であり、同一規則プロファイルで定義される同値クラス上の計量であることを示す。
サイバーセキュリティと一般的なカテゴリドメインにまたがる4つのベンチマークファミリーを対象とした実験により、RareSenseは、評価された類似度対策の中で、最も観測されたマクロ平均クエリ条件付き検索性能を達成している。
統計分析は、原子の基底線よりもRareSenseに有利なペア比較が修正されたことにより、大きな全体差を示している。
利得はワークロード依存のままであり、異常が繰り返し発生する稀な高次構造を共有する場合に最強である。
グローバルな異常ランキングでは、RareSenseは観測されたマクロ平均性能が最も高く、統計学的にはいくつかの強力な専用検出器に匹敵する。
関連論文リスト
- Instance Hardness-Based Relevance for Imbalanced Regression [7.352103534432416]
本研究では,レグレッション問題における稀なインスタンスを識別するインスタンスハーネスに基づく関連関数(InHaR)を提案する。
従来の関連関数とは異なり、提案手法は学習困難を伴い、ターゲット分布から希少性を推定する。
実験の結果,InHaRは2モーダル分布下での希少領域を正しく同定することがわかった。
論文 参考訳(メタデータ) (2026-07-22T14:06:35Z) - Towards Anomaly Detection on Relational Data [51.473064583839296]
属性とリレーショナルエッジの両方から異常を捕捉する再構成に基づくフレームワークを提案する。
RelADは競争効率を保ちながら、他のベースラインを一貫して上回ります。
論文 参考訳(メタデータ) (2026-06-17T02:36:32Z) - Out of Context: Reliability in Multimodal Anomaly Detection Requires Contextual Inference [54.774686416991386]
我々は、マルチモーダルな異常検出は、クロスモーダルな文脈推論問題として再編成されるべきであると主張している。
この観点はモデル設計、評価プロトコル、ベンチマーク構築に影響を及ぼす。
論文 参考訳(メタデータ) (2026-04-14T19:32:55Z) - Anomalous Agreement: How to find the Ideal Number of Anomaly Classes in Correlated, Multivariate Time Series Data [42.48512312730543]
本稿では,時系列間の異常の同期を利用してクラスタ品質を評価するSynchronized Anomaly Agreement Index (SAAI)を紹介する。
本研究では,SAAI の最大化により,相関時系列における乱数 K の真数を求めるタスクの精度が SSC と比較して 0.23 向上し,X-Means に比べて 0.32 向上したことを示す。
論文 参考訳(メタデータ) (2025-01-13T10:04:55Z) - Are Anomaly Scores Telling the Whole Story? A Benchmark for Multilevel Anomaly Detection [46.244213695024]
異常検出(AD)は、通常のトレーニングデータからパターンを学習することで異常を識別する機械学習タスクである。
既存のモデルは、主にバイナリ環境で動作し、それらが生成する異常スコアは通常、通常のデータからのデータポイントのずれに基づいている。
本稿では,実世界のアプリケーションにおける異常の重症度を表す,新しい設定であるマルチレベルAD(MAD)を提案する。
第2に,新たなベンチマークMAD-Benchを導入する。このベンチマークでは,異常検出能力だけでなく,異常スコアが重大度をどの程度効果的に反映しているかをモデルとして評価する。
論文 参考訳(メタデータ) (2024-11-21T14:18:37Z) - Unsupervised Hashing with Similarity Distribution Calibration [127.34239817201549]
教師なしハッシュ法は、特徴空間内のデータポイント間の類似性をバイナリハッシュコードにマッピングすることで保存することを目的としている。
これらの方法は、連続的な特徴空間におけるデータポイント間の類似性が離散的なハッシュコード空間に保存されないという事実をしばしば見落としている。
類似性範囲はコードの長さによって制限され、類似性崩壊と呼ばれる問題を引き起こす可能性がある。
本稿では,この問題を緩和する新しい類似度分布法を提案する。
論文 参考訳(メタデータ) (2023-02-15T14:06:39Z) - Assaying Out-Of-Distribution Generalization in Transfer Learning [103.57862972967273]
私たちは、経験的に対処するメッセージの相違を強調して、以前の作業の統一的なビューを取ります。
私たちは9つの異なるアーキテクチャから、多数の、あるいは少数の設定で31K以上のネットワークを微調整しました。
論文 参考訳(メタデータ) (2022-07-19T12:52:33Z) - A Unified Joint Maximum Mean Discrepancy for Domain Adaptation [73.44809425486767]
本論文は,最適化が容易なjmmdの統一形式を理論的に導出する。
統合JMMDから、JMMDは分類に有利な特徴ラベル依存を低下させることを示す。
本稿では,その依存を促進する新たなmmd行列を提案し,ラベル分布シフトにロバストな新しいラベルカーネルを考案する。
論文 参考訳(メタデータ) (2021-01-25T09:46:14Z) - Deep Weakly-supervised Anomaly Detection [118.55172352231381]
ペアワイズ関係予測ネットワーク(PReNet)は、ペアワイズ関係の特徴と異常スコアを学習する。
PReNetは、学習したペアの異常パターンに適合する見知らぬ異常を検出できる。
12の実世界のデータセットに対する実証的な結果から、PReNetは目に見えない異常や異常を検知する9つの競合する手法を著しく上回っている。
論文 参考訳(メタデータ) (2019-10-30T00:40:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。