論文の概要: Ranked by the Matcher: A Reproducibility Audit of Knowledge Graph Extraction from Threat Reports
- arxiv url: http://arxiv.org/abs/2609.01671v2
- Date: Sat, 05 Sep 2026 05:37:41 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-09 22:37:20.33913
- Title: Ranked by the Matcher: A Reproducibility Audit of Knowledge Graph Extraction from Threat Reports
- Title(参考訳): 分類者による分類:脅威レポートからの知識グラフ抽出の再現性の検討
- Authors: Safayat Bin Hakim, Houbing Herbert Song,
- Abstract要約: 12の検査システムのうち5つのみが記述されたマッチングルールを再実装する。
8つのプロトコルで共有ドキュメントに出力される10のシステムは、45対の注文のうち11を逆転させる。
外部、人間による調整セットでは、機械的なマーカは、-レキシカル、埋め込み、エンテーメント--10で7回以上、レビュアーとアグリーする。
- 参考スコア(独自算出の注目度): 5.580052437190499
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Security teams and researchers choose knowledge-graph extraction tooling for threat reports on the strength of published triple-F1 scores, yet those scores depend on how predicted triples are matched to gold annotations. We could reimplement the stated matching rule for only five of twelve inspected systems. Re-scoring ten system outputs on shared documents under eight protocols reverses eleven of forty-five pairwise orderings; one fixed prediction set spans 0.16--0.70 F1. On an external, human-adjudicated set, no mechanical matcher---lexical, embedding, or entailment---agrees with the reviewers more than seven times in ten; an LLM judge agrees far more often. To separate component effects from matcher rewards, we build CTIForge, whose deterministic validation layer can vary while extraction is held byte-identical. Across seven tested deployment configurations, no hosted backbone loses precision under validation and every offline one does. Backbone, decoding, and prompting covary across those configurations; on the one backbone we could serve both ways, serving alone reproduces the split. It coincides with a roughly 2.8-fold increase in actions explicitly disputing entity type, consistent with hand-written rules encoding the conventions of the extractor against which they were developed. We release the pipeline, protocol suite, and per-triple audit records.
- Abstract(参考訳): セキュリティチームと研究者は、公表されたトリプルF1スコアの強度に関する脅威レポートのためのナレッジグラフ抽出ツールを選択する。
12の検査システムのうち5つのみが記述されたマッチングルールを再実装することができた。
8つのプロトコルで共有ドキュメントに出力される10のシステムの再スコアは、45対の順序の11を逆転させ、1つの固定予測セットは0.16--0.70 F1にまたがる。
外部の、人間に適応したセットでは、機械的なマッカーは、-レキシカル、埋め込み、エンテーメント-- は、レビュアーと10回に7回以上、LLMの審査員は、より頻繁に同意する。
マーカの報酬からコンポーネント効果を分離するために、決定論的検証層を変更できるCTIForgeを構築し、抽出をバイト単位に保持する。
7つのテストされたデプロイメント構成で、ホストされたバックボーンがバリデーションの精度を失い、すべてのオフライン設定が実行されます。
バックボーン、デコード、およびこれらの構成間の共変数のプロンプト。一方のバックボーンでは、どちらの方法でも機能し、分離を再現できる。
これは、エンティティタイプを明確に否定するアクションの約2.8倍の増加と一致し、それらが開発された抽出器の規約を規定する手書きのルールと一致している。
パイプライン、プロトコルスイート、三重監査レコードをリリースしています。
関連論文リスト
- Verification-Aware Training for Speculative Decoding [57.84976863792784]
VAT(Verification-Aware Training)は、トレーニングステップ毎に検証をシミュレートし、その結果の受け入れパターンと拒否パターンを監督するプラグインフレームワークである。
VATはトレーニング対象のみを変更するため、ドラフトアーキテクチャやターゲットモデル、推論手順を変更することなく、既存のメソッドの上にレイヤー化することができる。
VATは平均受理期間を最大11.4%改善し、ウォールクロックのスピードアップを最大8.7%向上させ、数学、コード、チャットベンチマークで一貫した利益を得ている。
論文 参考訳(メタデータ) (2026-08-31T01:42:10Z) - IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages [77.88427845181154]
我々はWMT 2020-2024の共有タスクの系統を、英語のリソースを拡張してインディクシーに集約する:9つの方向対に対して126,754ドルのインスタンス。
セグメントレベルのQEでは,LSMが6つ,COMETが3つ,APEでは3つのシステムをベンチマークした。
論文 参考訳(メタデータ) (2026-08-17T09:50:52Z) - Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents [29.96375986740068]
Harness-IFは、実行証拠から一度に1つの運用ルールをスコアする。
AP-Accは、不正なデフォルトに対してラベル付けされたルールのみをスコアする。
論文 参考訳(メタデータ) (2026-08-12T07:07:57Z) - TRACE-CTI: Auditable Post-Extraction Governance of TTP Claims with Knowledge Graphs [4.960649631468518]
TRACE-CTIは、抽出後のクレーム管理フレームワークである。
実行レベルの予測を構成レベルのGraphAssertionに集約する。
これはConsensusAssertionsとしてセットアップdedlicated corroborationを具体化する。
論文 参考訳(メタデータ) (2026-07-27T15:33:18Z) - Fantastic Adaptive Taxonomies and How to Use Them [100.20614173157708]
AdaMASTは、実行トレースをコンパクトでエビデンスに基づく障害分類に変換する。
コードには手書きのコードはなく、人間による注釈もない。
エージェント・システム・サーチでは、失敗候補の分類コード診断が自由形式より優れている。
論文 参考訳(メタデータ) (2026-07-17T17:41:16Z) - Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction [55.11480729304395]
PointArena 2026は77.2%の精度でベンチマークで2位である。
ap proachは3つの障害モードをターゲットにしている。第一に、エージェント駆動のシンセシスは大きなセマンティクスとアンカー相対的な候補プールを構築する。
次に、determinis tic steerable-dataパイプラインは、認証された10,000サンプルのメインセットと、マスク、テンプレート、パス検証を使用するリザーブサンプルを生成する。
論文 参考訳(メタデータ) (2026-06-29T06:39:03Z) - SkillDAG: Self-Evolving Typed Skill Graphs for LLM Skill Selection at Scale [54.70985426016736]
本稿では,スキル間関係を型付き有向グラフとしてモデル化したSkillDAGを提案する。
各検索はベクトルマッチング、型付きエッジ隣人、競合信号を返す。
ALFWorldとSkillsBench with MiniMax-M2.7では、SkillDAGは67.1%の成功と27.3%の報酬を得た。
論文 参考訳(メタデータ) (2026-06-02T02:45:21Z) - Skill-as-Pseudocode: Refactoring Skill Libraries to Pseudocode for LLM Agents [50.78646963535282]
Skill-as-Pseudocode (SaP) はマークダウンスキルライブラリの型付き擬似コードへの自動変換である。
1つ以上のスキルから引き出された類似の手続きパスのクラスタごとに、SaPは型付きコントラクトを抽出し、それを4チェック決定性検証器を通じてフィルタリングする。
プロモートされた契約は、復元された具体的なアクションテンプレートと共に書き直されたスキルスケルトンにインライン化され、エージェントは2つの補完的な信号を与える。
論文 参考訳(メタデータ) (2026-05-27T04:48:40Z) - Iterative Audit Convergence in LLM-Managed Multi-Agent Systems: A Case Study in Prompt Engineering Quality Assurance [0.0]
AEGISに適用されたエージェント駆動型監査の単一システム事例研究を報告する。
本報告では, 明示的な符号規則, 非単調な収束, 監査スコープの拡がりを含む7カテゴリーの欠陥分類を報告する。
論文 参考訳(メタデータ) (2026-05-12T15:39:04Z) - Pairwise matrices for sparse autoencoders: single-feature inspection mislabels causal axes [2.741152471987327]
標準スパースオートエンコーダプロトコルは、各機能をトップアクティベーションコンテキストからラベル付けし、単一機能ステアリングによって検証する。
本稿では,Qwen3-1.7B-Instruct上での標準ワンコーナプロトコルミスをGemma-2-2B-itで再現した,ペアワイズ行列プロトコルと共変ステアリング係数を提案する。
これら3つの所見はGemmaでモデル特異的な損傷シグネチャを再現し,一致した形状制御はCIを10倍に分離する。
論文 参考訳(メタデータ) (2026-05-04T21:11:21Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。