論文の概要: PCAP-LM: An LLM-Native Text Representation for TLS Bulk Traffic Analysis
- arxiv url: http://arxiv.org/abs/2607.28100v1
- Date: Thu, 30 Jul 2026 12:10:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-31 21:37:00.549531
- Title: PCAP-LM: An LLM-Native Text Representation for TLS Bulk Traffic Analysis
- Title(参考訳): PCAP-LM:TLSバルクトラフィック解析のためのLLM-Native Text Representation
- Abstract要約: 本稿では,フロー中心のLLMネイティブテキスト表現であるPCAP-LMについて述べる。
生のキャプチャはPacketGlyphsを使って意味的な要約に変換される。
BPE語彙は159個のトークンで完全に飽和し、tshark -Vに対して812倍の縮小を実現した。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large language models (LLMs) offer powerful reasoning capabilities for network traffic analysis, but standard capture formats and their textual equivalents are prohibitively verbose, overflowing LLM context windows by two orders of magnitude. We present PCAP-LM, a flow-centric, LLM-native text representation that acts as a lossy knowledge extraction step rather than a standard compression tool: raw captures are transcoded into semantic summaries using PacketGlyphs - a novel ASCII alphabet coined in this paper that encodes packet direction, TCP/TLS state, log-scale size, and inter-packet delay. Combined with a constrained PMI-BPE tokenizer and motif run-length encoding, repetitive behavioural patterns are aggressively collapsed. A @REFS side-index preserves lossless drill-down into the original packets. Evaluated on a homogeneous corpus of 5G/4G TLS 1.3 bulk-download traffic, the BPE vocabulary fully saturates at 159 tokens, achieving an 812x size reduction over tshark -V and fitting entire captures within a single LLM context window. In a forensic question-answering evaluation over 30 held-out files, a frontier LLM achieves 99.3% accuracy from PCAP-LM documents versus 51.0% from a token-budget-matched tshark -V prefix. The lossy design introduces known blind spots - most notably a 24% false-negative rate for TCP retransmissions - and extending to heterogeneous mixed-protocol environments will require vocabulary retraining.
- Abstract(参考訳): 大規模言語モデル (LLM) は、ネットワークトラフィック分析に強力な推論機能を提供するが、標準的なキャプチャフォーマットとそのテキスト等価性は禁断に冗長であり、LLMコンテキストウィンドウを2桁にオーバーフローする。
本論文では、パケット方向、TCP/TLS状態、ログスケールサイズ、パケット間遅延をエンコードする新しいASCIIアルファベットであるPacketGlyphsを用いて、生のキャプチャを意味的な要約に変換する。
制約付きPMI-BPEトークンや実行長符号化のモチーフと組み合わせることで、反復的な行動パターンは積極的に崩壊する。
REFSサイドインデックスは、元のパケットへのロスレスドリルダウンを保存する。
5G/4G TLS 1.3バルクダウンロードの均一なコーパスに基づいて評価され、BPE語彙は159トークンで完全に飽和し、tshark -Vよりも812倍のサイズの縮小を実現し、全てのキャプチャを単一のLLMコンテキストウィンドウに収める。
30のホールトアウトファイルに対する法医学的な質問応答評価において、フロンティアLLMは、PCAP-LM文書から99.3%の精度を達成し、トークンバッジにマッチしたtshark -Vプレフィックスから51.0%を得る。
紛失した設計では、既知の盲点(特にTCP再送信の24%の偽陰性率)を導入し、異種混合プロトコール環境に拡張するには語彙の再トレーニングが必要になる。
関連論文リスト
- Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data [49.717366362764956]
大規模ビデオ言語モデル(VLM)に基づくテキスト間検索(TVR)手法は、簡単なテキストクエリで記述することで、興味のあるイベントを検索する可能性がある。
本稿では,最初のカメラトラップTVベンチマークであるPrompting-MammAlpsを紹介し,細粒度で解釈可能なTVR法を提案する。
具体的には、視覚変換器を訓練し、時間的動作のローカライゼーションを行い、その出力を構造化されたテキストに変換し、各ビデオを記述する。
エスロジにインスパイアされたクエリは,LLM(Large-Language Model)ベースのエージェントによって処理される
論文 参考訳(メタデータ) (2026-07-10T18:09:41Z) - LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression [87.04737384323367]
本稿では,RGB画像圧縮のためのトークン化非依存フレームワークLUMIについて述べる。
LUMIは、ピクセル・アズ・テキストのトークン化を、LLMの連続的な埋め込み空間に生の強度とチャネル情報をマッピングするピクセル埋め込みモジュールに置き換える。
画素埋め込み、位置符号化、ソフトパラメータ、予測ヘッドのみが訓練され、LSMバックボーンは固定されている。
論文 参考訳(メタデータ) (2026-07-09T08:16:14Z) - How Code Representation Shapes False-Positive Dynamics in Cross-Language LLM Vulnerability Detection [8.360057179027322]
言語間の脆弱性検出において、コード表現形式がどのように偽陽性行動を形成するかは、まだ理解されていない。
学習時間と推論時間の両方で、原文と刈り取られた抽象構文木を比較し、学習強度とコード表現形式を体系的に変化させる。
言語間のFPRは、トレーニング時間と推論時間の両方の表現の合同効果を反映している。
論文 参考訳(メタデータ) (2026-04-30T11:01:03Z) - Glyph: Scaling Context Windows via Visual-Text Compression [91.20717058018745]
Glyphは、長いテキストを画像にレンダリングし、視覚言語モデルで処理するフレームワークである。
提案手法は,従来の長文モデルに匹敵する精度を維持しつつ,3~4倍のトークン圧縮を実現する。
極端な圧縮では、128KテキストのVLMが1Mレベルのテキストタスクにスケールできる。
論文 参考訳(メタデータ) (2025-10-20T17:58:56Z) - Patch-as-Decodable-Token: Towards Unified Multi-Modal Vision Tasks in MLLMs [88.68484904214142]
Patch-as-Decodable Token (PaDT)を導入し、テキストと多様な視覚出力を生成する。
PaDTの中心は、クエリイメージのビジュアルパッチ埋め込みから派生したVisual Reference Tokens (VRT)である。
MLLMモデルと比較しても,PaDTは最先端の性能を一貫して達成できることを示す。
論文 参考訳(メタデータ) (2025-10-02T12:23:57Z) - Efficient Whole Slide Pathology VQA via Token Compression [19.19109252248347]
病理学における全スライディング画像(WSI)は1万×1万ピクセルまで到達でき、大言語モデル(MLLM)にとって大きな課題となる。
トークン圧縮によりWSI VQAを実行する最初のMLLMアーキテクチャであるToken Compression Pathology LLaVA(TCP-LLaVA)を提案する。
論文 参考訳(メタデータ) (2025-07-19T06:04:25Z) - Vision-centric Token Compression in Large Language Model [51.92055188780033]
Vision Centric Token Compression (Vist)は、人間の読書を反映した高速圧縮フレームワークである。
11のコンテキスト内学習ベンチマークでは、Vistは同じ精度を2.3倍のトークンで達成し、FLOPを16%削減し、メモリを50%削減した。
論文 参考訳(メタデータ) (2025-02-02T13:10:06Z) - Large Language Models as Carriers of Hidden Messages [0.0]
単純な微調整は、隠されたテキストを大きな言語モデル(LLM)に埋め込むことができる。
我々の研究は、隠れたテキストを微調整で埋め込むことが、膨大な数のトリガーによって安全であるように見えるが、抽出に弱いことを実証している。
我々は,LLMの語彙からトークンを反復的に供給し,高いトークン確率を持つシーケンスを明らかにするunconditional Token Forcing (UTF)と呼ばれる抽出攻撃を導入し,隠れテキスト候補を示す。
論文 参考訳(メタデータ) (2024-06-04T16:49:06Z) - Nearest Neighbor Speculative Decoding for LLM Generation and Attribution [87.3259169631789]
Nearest Speculative Decoding (NEST)は、任意の長さの実世界のテキストスパンをLM世代に組み込むことができ、それらのソースへの属性を提供する。
NESTは、様々な知識集約タスクにおいて、基本LMの生成品質と帰属率を大幅に向上させる。
さらに、NESTは、Llama-2-Chat 70Bに適用した場合の推論時間において1.8倍のスピードアップを達成することにより、生成速度を大幅に改善する。
論文 参考訳(メタデータ) (2024-05-29T17:55:03Z) - Semantic Compression With Large Language Models [1.0874100424278175]
大規模言語モデル(LLM)は、情報検索、質問応答、要約、コード生成タスクに革命をもたらしている。
LLMは本質的に、一度に処理できる入力トークンと出力トークンの数によって制限される。
本稿では,LLMの研究への3つの貢献について述べる。
論文 参考訳(メタデータ) (2023-04-25T01:47:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。