論文の概要: TAILOR: Template-Preserving Augmentation for Long-Tailed Log Parsing
- arxiv url: http://arxiv.org/abs/2609.25261v1
- Date: Mon, 21 Sep 2026 18:12:11 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-23 18:04:04.077335
- Title: TAILOR: Template-Preserving Augmentation for Long-Tailed Log Parsing
- Title(参考訳): TAILOR: 長期ログ解析のためのテンプレート保存拡張
- Abstract要約: 本稿では,5インスタンス未満のロググループとして定義される希少なロググループの頻度と影響について検討する。
本稿では,テンプレート拡張による希少なロググループに対するテンプレート推論を改善するフレームワークを提案する。
その他の構造的証拠は静的トークンと動的変数を区別するのに役立ちます。
- 参考スコア(独自算出の注目度): 3.0647588636542964
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Log parsing is essential for system log analysis because it supports tasks such as debugging, monitoring, and anomaly detection by transforming unstructured log messages into structured log templates. However, real-world log datasets exhibit highly imbalanced, long-tailed distributions, where a small number of frequent templates dominate while many rare templates appear only a few times. This imbalance causes evaluation results to be overly optimistic by allowing frequent templates to dominate benchmark metrics, while poor performance on rare yet operationally important events remains largely hidden. In this paper, we investigate the prevalence and impact of rare log groups, defined as log groups with fewer than five instances. Our empirical study on the widely used Loghub-2.0 benchmark shows that rare log groups account for nearly 20% of all templates but less than 0.01% of log messages. Because they contain only a handful of instances, all evaluated parsers experience substantial performance degradation on these groups. To address this challenge, we propose TAILOR, a log parsing framework that improves template inference for rare log groups through template-preserving augmentation. TAILOR enriches rare log groups with template- consistent log messages before template inference. The additional structural evidence helps distinguish static tokens from dynamic variables. Our experimental results show that TAILOR improves parsing accuracy on rare log groups by 19% over the strongest baseline while maintaining competitive performance on complete datasets. We further show that the proposed augmentation strategy generalizes across different LLM backbones and consistently improves existing LLM-based parsers without modifying their core architectures.
- Abstract(参考訳): ログ解析は、非構造化ログメッセージを構造化ログテンプレートに変換することで、デバッグ、監視、異常検出などのタスクをサポートするため、システムログ解析に不可欠である。
しかし、実世界のログデータセットは、非常に不均衡で長い尾の分布を示し、少数の頻繁なテンプレートが支配的であり、稀なテンプレートがほんの数回しか現れない。
この不均衡は、頻繁なテンプレートがベンチマークの指標を支配することを許し、評価結果が過度に楽観的になる。
本稿では,5インスタンス未満のロググループとして定義される希少なロググループの頻度と影響について検討する。
広く使用されているLoghub-2.0ベンチマークに関する実証研究は、レアロググループがすべてのテンプレートの20%近くを占めるが、ログメッセージの0.01%以下であることを示している。
少数のインスタンスしか含まないため、評価されたパーザはすべて、これらのグループで大幅なパフォーマンス劣化を経験する。
この課題に対処するために,テンプレート保存拡張によるレアロググループのテンプレート推論を改善するログ解析フレームワークTAILORを提案する。
TAILORはテンプレート推論の前にテンプレート一貫性のあるログメッセージで希少なロググループを豊かにする。
構造的エビデンスは静的トークンと動的変数を区別するのに役立ちます。
実験の結果,TAILORは,全データセット上での競合性能を維持しつつ,最強のベースラインに対して,レアログ群の解析精度を19%向上することがわかった。
さらに,提案手法は,異なるLLMバックボーンにまたがって一般化し,コアアーキテクチャを変更することなく既存のLLMベースのパーサを一貫して改善することを示す。
関連論文リスト
- TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference [47.62941623025392]
本稿では,非侵入的でログ対応なLLM推論フレームワークであるTELLERについて紹介する。
TELLERはモデルバイナリを変更することなく、NVTX/CUPTIトレースとサービスログを収集する。
リクエスト毎のコールチェーンツリーを再構築し、ログ行と対応する実行ステップをアライメントする。
これらの表現に加えて、TELLERは数値的候補のローカライゼーションとマルチモーダルな根起因モデルを組み合わせる。
論文 参考訳(メタデータ) (2026-08-03T09:39:11Z) - HELP: Hierarchical Embeddings-based Log Parsing [0.25112747242081457]
ログは、ソフトウェアのメンテナンスと障害診断のための、第一級の情報ソースである。
ログ解析は、異常検出、トラブルシューティング、根本原因分析などの自動ログ解析タスクの前提条件である。
既存のオンライン解析アルゴリズムは、ログドリフトの影響を受けやすい。
論文 参考訳(メタデータ) (2024-08-15T17:54:31Z) - Stronger, Cheaper and Demonstration-Free Log Parsing with LLMs [18.240096266464544]
トレーニングプロセスやラベル付きデータを必要としない,費用対効果の高いLCMベースのログであるLogBatcherを提案する。
我々は16の公開ログデータセットの実験を行い、ログ解析にLogBatcherが有効であることを示した。
論文 参考訳(メタデータ) (2024-06-10T10:39:28Z) - Lemur: Log Parsing with Entropy Sampling and Chain-of-Thought Merging [18.823038918091207]
我々は、textbfEntropy サンプリングとチェーン・オブ・シンクトの textbfMerging (model) を用いた最先端の textbfLog 解析フレームワークを導入する。
退屈な手作業のルールを捨てるために,情報エントロピーにインスパイアされた新しいサンプリング手法を提案し,典型的なログを効率的にクラスタリングする。
大規模な公開データセットの実験を行った。
論文 参考訳(メタデータ) (2024-02-28T09:51:55Z) - LogFormer: A Pre-train and Tuning Pipeline for Log Anomaly Detection [73.69399219776315]
本稿では,ログ異常検出(LogFormer)のためのTransformerベースの統合フレームワークを提案する。
具体的には、ログデータの共有セマンティック知識を得るために、まず、ソースドメイン上で事前学習を行う。
そして、そのような知識を共有パラメータを介して対象領域に転送する。
論文 参考訳(メタデータ) (2024-01-09T12:55:21Z) - GLAD: Content-aware Dynamic Graphs For Log Anomaly Detection [49.9884374409624]
GLADは、システムログの異常を検出するように設計されたグラフベースのログ異常検出フレームワークである。
システムログの異常を検出するために設計されたグラフベースのログ異常検出フレームワークであるGLADを紹介する。
論文 参考訳(メタデータ) (2023-09-12T04:21:30Z) - Prompting for Automatic Log Template Extraction [6.299547112893045]
DivLogは、大規模言語モデル(LLM)の非コンテキスト学習(ICL)能力に基づく効果的なログ解析フレームワークである。
プロンプト内の例のセマンティクスをマイニングすることで、DivLogはトレーニング不要な方法でターゲットログテンプレートを生成する。
論文 参考訳(メタデータ) (2023-07-19T12:44:59Z) - Single-Stage Visual Relationship Learning using Conditional Queries [60.90880759475021]
TraCQは、マルチタスク学習問題とエンティティペアの分布を回避する、シーングラフ生成の新しい定式化である。
我々は,DETRをベースとしたエンコーダ-デコーダ条件付きクエリを用いて,エンティティラベル空間を大幅に削減する。
実験結果から、TraCQは既存のシングルステージシーングラフ生成法よりも優れており、Visual Genomeデータセットの最先端の2段階メソッドを多く上回っていることがわかった。
論文 参考訳(メタデータ) (2023-06-09T06:02:01Z) - Examining and Combating Spurious Features under Distribution Shift [94.31956965507085]
我々は、最小限の統計量という情報理論の概念を用いて、ロバストで刺激的な表現を定義し、分析する。
入力分布のバイアスしか持たない場合でも、モデルはトレーニングデータから急激な特徴を拾い上げることができることを証明しています。
分析から着想を得た結果,グループDROは,グループ同士の相関関係を直接考慮しない場合に失敗する可能性が示唆された。
論文 参考訳(メタデータ) (2021-06-14T05:39:09Z) - Self-Supervised Log Parsing [59.04636530383049]
大規模ソフトウェアシステムは、大量の半構造化ログレコードを生成する。
既存のアプローチは、ログ特化や手動ルール抽出に依存している。
本稿では,自己教師付き学習モデルを用いて解析タスクをマスク言語モデリングとして定式化するNuLogを提案する。
論文 参考訳(メタデータ) (2020-03-17T19:25:25Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。