論文の概要: From Documentation to Zero-day Vulnerabilities: LLM-Driven Fuzzing of JavaScript Engines in PDF Readers
- arxiv url: http://arxiv.org/abs/2608.06641v1
- Date: Thu, 06 Aug 2026 23:15:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-10 16:21:25.303425
- Title: From Documentation to Zero-day Vulnerabilities: LLM-Driven Fuzzing of JavaScript Engines in PDF Readers
- Title(参考訳): ドキュメントからゼロデイ脆弱性へ:PDFリーダーにおけるJavaScriptエンジンのLLM駆動ファズリング
- Abstract要約: 既存のPDFリーダー用のファズーは、個々のAPI呼び出しだけを含む単純なテストケースに依存している。
複雑で意味のあるAPI呼び出しシーケンスを自動的に生成する新しいPDFエンジンファザであるPDFuzzerを提案する。
- 参考スコア(独自算出の注目度): 19.206300119062103
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Existing fuzzers for PDF readers rely on simple test cases that involve only individual API calls, leading to limited coverage and potentially missing vulnerabilities that require sequences of API calls. To address these limitations, we propose PDFuzzer, a novel PDF engine fuzzer that automatically generates complex and meaningful API call sequences. PDFuzzer first uses a Large Language Model (LLM) to construct context-free grammars and infer the relationships between individual API calls from specifications extracted from JavaScript API manuals and execution traces. Based on the grammars and relationships, PDFuzzer employs a constraint solver to generate concrete API call sequences for fuzzing. Our experiments show that PDFuzzer significantly outperforms state-of-the-art PDF fuzzers (TypeOracle, Favocado, and Cooper) and LLM-based fuzzers (Fuzz4All, naive LLM) on three mainstream PDF readers: Adobe Acrobat Reader, Foxit PDF Reader, and PDF-XChange Editor. PDFuzzer achieves up to 48% higher coverage than existing tools and identifies 31 zero-day vulnerabilities in these readers, from information leakage to arbitrary code execution. Our ablation study validates the necessity of each component, including LLMs, which achieve high accuracy across all pipeline stages (93-98%). We disclosed all vulnerabilities to the vendors via a coordinated vulnerability disclosure process and received bug bounties.
- Abstract(参考訳): 既存のPDFリーダー用のファズーは、個々のAPI呼び出しだけを含む単純なテストケースに依存しており、カバレッジが制限され、API呼び出しのシーケンスを必要とする脆弱性が潜在的に欠落する可能性がある。
これらの制約に対処するため、PDFuzzerは、複雑な意味のあるAPI呼び出しシーケンスを自動的に生成する新しいPDFエンジンである。
PDFuzzerはまずLLM(Large Language Model)を使用して文脈のない文法を構築し、JavaScript APIマニュアルから抽出された仕様から個々のAPI呼び出しと実行トレースの関係を推測する。
文法と関係に基づいて、PDFuzzerは制約解決器を使用してファジィングのための具体的なAPI呼び出しシーケンスを生成する。
実験の結果、PDFuzzerは、Adobe Acrobat Reader、Foxit PDF Reader、PDF-XChange Editorの3つの主流PDFリーダーにおいて、最先端のPDFファザー(TypeOracle, Favocado, Cooper)とLCMベースのファザー(Fuzz4All, naive LLM)を著しく上回ります。
PDFuzzerは、既存のツールよりも最大48%高いカバレッジを実現し、情報漏洩から任意のコード実行に至るまで、これらの読者の31のゼロデイ脆弱性を特定している。
本研究は,全パイプラインステージ(93~98%)で高い精度を実現するLCMを含む各コンポーネントの必要性を検証した。
私たちは、すべての脆弱性をベンダーに、協調した脆弱性開示プロセスを通じて公開し、バグ報奨金を受け取った。
関連論文リスト
- Semantic Integrity Failures in Document-to-LLM Supply Chains [2.7632206861687023]
ドキュメントからLLMアプリケーションは通常、アップロードされたPDFを、ユーザーが観察または監査できない隠された抽出層を通じてテキストに翻訳することで読み取る。
1つの文書は、モデル推論の前に2つのセマンティックビューを持つことができる。
抽出器が攻撃者制御または抽出者依存のテキストを返却する25の抽出ギャップ(EG)をインスタンス化し、レンダリングされたページは良性または異なる内容を表示する。
論文 参考訳(メタデータ) (2026-06-12T23:30:56Z) - Enhancing REST API Fuzzing with Access Policy Violation Checks and Injection Attacks [5.029088739904413]
本稿では,REST APIにおけるアクセスポリシー違反の検出を目的とした,新しい自動オラクルを提案する。
これらのオーラクルは既存のファザに組み込むことができ、ファザリングセッションが完了するとセキュリティテストのフェーズが実行され、これらのオーラクルが検証される。
私たちの新しいテクニックは、REST APIのための最先端のオープンソースファザであるEvoMasterの拡張として統合されています。
論文 参考訳(メタデータ) (2026-04-01T10:05:23Z) - Beyond Next Token Probabilities: Learnable, Fast Detection of Hallucinations and Data Contamination on LLM Output Distributions [60.43398881149664]
LLM出力シグナチャの効率的な符号化を訓練した軽量アテンションベースアーキテクチャであるLOS-Netを紹介する。
非常に低い検出レイテンシを維持しながら、さまざまなベンチマークやLLMで優れたパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-03-18T09:04:37Z) - olmOCR: Unlocking Trillions of Tokens in PDFs with Vision Language Models [16.470130668266055]
olmOCRは、PDFをクリーンで線形化された平文に自然な読み順で処理するためのオープンソースのツールキットである。
olmOCRは大規模バッチ処理に最適化されており、異なるハードウェア設定に柔軟にスケールすることができる。
GPT-4o, Gemini Flash 2, Qwen-2.5-VLといったトップビジョン言語モデルでも, olmOCRの方が優れています。
論文 参考訳(メタデータ) (2025-02-25T18:38:38Z) - Your Fix Is My Exploit: Enabling Comprehensive DL Library API Fuzzing with Large Language Models [49.214291813478695]
AIアプリケーションで広く使用されているディープラーニング(DL)ライブラリは、オーバーフローやバッファフリーエラーなどの脆弱性を含むことが多い。
従来のファジィングはDLライブラリの複雑さとAPIの多様性に悩まされている。
DLライブラリのためのLLM駆動ファジィ手法であるDFUZZを提案する。
論文 参考訳(メタデータ) (2025-01-08T07:07:22Z) - ExploraCoder: Advancing code generation for multiple unseen APIs via planning and chained exploration [70.26807758443675]
ExploraCoderはトレーニング不要のフレームワークで、大規模な言語モデルにコードソリューションで見えないAPIを呼び出す権限を与える。
実験の結果、ExploreaCoderは、事前のAPI知識に欠けるモデルのパフォーマンスを大幅に改善することが示された。
論文 参考訳(メタデータ) (2024-12-06T19:00:15Z) - PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling [63.93112754821312]
マルチモーダル文書理解は,大量のテキスト情報や視覚情報を処理し,理解するための課題である。
大規模言語モデル(LLM)の最近の進歩は、このタスクの性能を大幅に改善した。
長いPDF文書に対する多モーダル質問回答(QA)を強化するために設計された多モーダル大言語モデル(MLLM)であるPDF-WuKongを紹介する。
論文 参考訳(メタデータ) (2024-10-08T12:17:42Z) - Are You Copying My Model? Protecting the Copyright of Large Language
Models for EaaS via Backdoor Watermark [58.60940048748815]
企業は大規模な言語モデル(LLM)に基づいたEmbeddding as a Service(E)の提供を開始した。
Eはモデル抽出攻撃に弱いため、LLMの所有者に重大な損失をもたらす可能性がある。
埋め込みにバックドアを埋め込むEmbMarkerという埋め込み透かし手法を提案する。
論文 参考訳(メタデータ) (2023-05-17T08:28:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。