論文の概要: Toward Inferring Accurate Context-free Grammars for Big Languages in a Black-box Setting
- arxiv url: http://arxiv.org/abs/2607.08959v2
- Date: Mon, 13 Jul 2026 02:24:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-14 17:47:21.272616
- Title: Toward Inferring Accurate Context-free Grammars for Big Languages in a Black-box Setting
- Title(参考訳): ブラックボックス設定におけるビッグ言語のための正確な文脈自由文法の推論に向けて
- Abstract要約: ブラックボックスの文脈自由文法推論は、プログラム分析、リバースエンジニアリング、プログラム理解、ファジング、セキュリティに不可欠である。
我々は、文脈自由文法の決定論的推論のための新しい手法をXVadaで導入する。
XVadaは、文法の精度と文法のコンパクトさの両方において、最高のスコア付け競争相手(TreeVada)を改善している。
- 参考スコア(独自算出の注目度): 4.57316398076587
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Black-box context-free grammar inference is crucial for program analysis, reverse engineering, program understanding, fuzzing, and security. But existing approaches such as Arvada, TreeVada, Kedavra, and Cucio struggle with scalability, accuracy, and grammar readability, especially on larger languages. To address this challenge, we introduce XVada with several new techniques for deterministic inference of context-free grammars. In an empirical comparison that avoids several pitfalls of recent studies, XVada improves on the highest-scoring competitor (TreeVada) both in grammar accuracy and grammar compactness. XVada also found a CVE in the widely used Python Liquid engine. Fuzzing based on the XVada-inferred grammar found five more bugs, which the Python Liquid developers fixed based on our bug reports. XVada and all experimental data and scripts are freely available.
- Abstract(参考訳): ブラックボックスの文脈自由文法推論は、プログラム分析、リバースエンジニアリング、プログラム理解、ファジング、セキュリティに不可欠である。
しかし、Arvada、TreeVada、Kedavra、Cucioといった既存のアプローチはスケーラビリティ、精度、文法の可読性に苦慮している。
この課題に対処するために、文脈自由文法の決定論的推論のための新しい手法をXVadaで導入する。
最近の研究のいくつかの落とし穴を避ける実証的な比較において、XVadaは文法の精度と文法のコンパクトさの両方において、最高のスコア付け競争相手(TreeVada)を改善している。
XVadaはまた、広く使われているPython LiquidエンジンにCVEを発見した。
XVada推論文法に基づくファジィングでは、さらに5つのバグが見つかり、Python Liquid開発者はバグレポートに基づいて修正した。
XVadaとすべての実験データとスクリプトは無償で利用可能である。
関連論文リスト
- Black-box Context-free Grammar Inference for Readable & Natural Grammars [4.995853115126354]
Arvada、TreeVada、Kedavraといった既存のツールは、大規模で複雑な言語でスケーラビリティ、可読性、正確性に苦慮している。
本稿では,新しいLLM誘導文法推論フレームワークであるNatGIを紹介する。
我々は,NatGIがF1スコアにおいて強いベースラインを一貫して上回っていることを示す。
論文 参考訳(メタデータ) (2025-09-30T17:54:25Z) - PyResBugs: A Dataset of Residual Python Bugs for Natural Language-Driven Fault Injection [5.383910843560784]
PyResBugsは、主要なPythonフレームワークからの残留バグのデータセットである。
各バグは、対応するフォールトフリー(固定)バージョンとペアリングされ、マルチレベル自然言語(NL)記述と注釈付けされる。
論文 参考訳(メタデータ) (2025-05-09T04:39:09Z) - NeKo: Toward Post Recognition Generative Correction Large Language Models with Task-Oriented Experts [57.53692236201343]
提案するマルチタスク補正MOEでは,専門家が音声・テキスト・言語・テキスト・視覚・テキスト・データセットの「専門家」になるよう訓練する。
NeKoはマルチタスクモデルとして文法とポストOCR補正を競合的に実行している。
論文 参考訳(メタデータ) (2024-11-08T20:11:24Z) - Incremental Context-free Grammar Inference in Black Box Settings [17.601446198181048]
ブラックボックスの文脈自由文法推論は多くの実践的な設定において重要な課題である。
そこで本研究では,サンプル文字列をより小さな単位に分割し,文法を漸進的に推論する手法を提案する。
我々の手法であるKedavraは、より優れた文法品質(精度とリコールの強化)、より高速な実行、経験的比較による可読性の向上を実証した。
論文 参考訳(メタデータ) (2024-08-29T17:00:38Z) - Multilingual Contrastive Decoding via Language-Agnostic Layers Skipping [60.458273797431836]
対照的なレイヤ(DoLa)によるデコーディングは、大規模言語モデルの生成品質を改善するために設計されている。
このアプローチは英語以外のタスクではうまくいきません。
モデルの前方通過における言語遷移に関する従来の解釈可能性の研究から着想を得て,改良されたコントラスト復号アルゴリズムを提案する。
論文 参考訳(メタデータ) (2024-07-15T15:14:01Z) - Fast Deterministic Black-box Context-free Grammar Inference [7.637155559284357]
State-of-the-artアプローチは、平らなパースツリーから始まる文法規則を一般化する。
アルバダの一般化の多くは、共通の言語概念のネスト規則に違反している。
結果、TreeVadaは経験的な比較で高速で高品質な文法を得た。
論文 参考訳(メタデータ) (2023-08-11T14:45:26Z) - Precise Zero-Shot Dense Retrieval without Relevance Labels [60.457378374671656]
仮説文書埋め込み(英: hypothetical Document Embeddings, HyDE)は、ゼロショット高密度検索システムである。
我々は,HyDEが最先端の非教師付き高密度検索器であるContrieverを著しく上回っていることを示す。
論文 参考訳(メタデータ) (2022-12-20T18:09:52Z) - AdaVQA: Overcoming Language Priors with Adapted Margin Cosine Loss [73.65872901950135]
本研究は,特徴空間学習の観点から,言語先行問題に挑戦する試みである。
適応したマージンコサイン損失は、頻繁でスパースな回答特徴空間を区別するように設計されている。
実験の結果, 適応したマージンコサイン損失はベースラインモデルを大きく向上できることがわかった。
論文 参考訳(メタデータ) (2021-05-05T11:41:38Z) - Counterfactual VQA: A Cause-Effect Look at Language Bias [117.84189187160005]
VQAモデルは、ショートカットとして言語バイアスに依存し、視覚と言語の両方からマルチモーダルな知識を十分に学ばない傾向にある。
本稿では,質問に対する直接的な因果的影響として,言語バイアスを捉えることのできる,新たな反事実推論フレームワークを提案する。
論文 参考訳(メタデータ) (2020-06-08T01:49:27Z) - On the Robustness of Language Encoders against Grammatical Errors [66.05648604987479]
我々は、非ネイティブ話者から実際の文法的誤りを収集し、これらの誤りをクリーンテキストデータ上でシミュレートするために敵攻撃を行う。
結果,全ての試験モデルの性能は影響するが,影響の程度は異なることがわかった。
論文 参考訳(メタデータ) (2020-05-12T11:01:44Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。