論文の概要: The agent creates, we validate: A Lightweight Framework for Agentic Artifact Generation
- arxiv url: http://arxiv.org/abs/2607.02615v1
- Date: Wed, 01 Jul 2026 17:28:56 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.356214
- Title: The agent creates, we validate: A Lightweight Framework for Agentic Artifact Generation
- Title(参考訳): エージェントが生成し、検証する:エージェントアーチファクト生成のための軽量フレームワーク
- Authors: Yaniv Melamed, Yoni Zukerman, Michal Shechter, Miri Weissler, Ashwin Patil, Hani Neuvirth-Telem,
- Abstract要約: 我々は,LLMの生成,検証という,中核原理に基づく軽量フレームワークを提案する。
フレームワークは、テスト駆動生成、決定論的、LLMベースの3つの重要な属性に依存している。
セキュリティ領域における3つのアーティファクトタイプ - KQLクエリ生成、MITRE ATT&CKマッピング、エンティティマッピング - に関するフレームワークをデモする。
- 参考スコア(独自算出の注目度): 0.30786914102688595
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generating structured artifacts with Large Language Models - e.g. database queries, threat framework mappings, entity schemas - is relatively straightforward; however, making them reliable enough for production deployments presents challenges. We present a lightweight framework based on a core principle: LLMs generate, we validate. This reframing shifts responsibility from generation quality to validation rigor. The framework rests on three key attributes: First, test driven generation: when tests fail, the LLM receives indicative error messages that expose why the output failed, enabling the LLM to understand its mistakes and refine subsequent attempts. Second, deterministic and LLM-based tests: deterministic tests catch heuristics that can be programmatically verified (schema, syntax, cross-reference), while LLM-based tests evaluate nuanced semantic and delicate features that resist programmatic inspection (intent alignment, logical consistency, domain correctness). Third, expert-distilled judges: LLM-based tests are calibrated to distill and replicate human expert decision distribution, transforming manual human quality gates into scalable, reusable evaluation proxies that reflect professional-grade validation standards. We demonstrate the framework on three artifact types in the security domain - KQL query generation, MITRE ATT\&CK mapping, and entity mapping - deployed in production at Microsoft Sentinel. We believe this framework can be applied beyond security to other artifact generation tasks, providing a path to reliable, high-quality outputs without sacrificing the efficiency gains of LLM generation.
- Abstract(参考訳): 構造化アーティファクトを大規模言語モデル(データベースクエリ、脅威フレームワークマッピング、エンティティスキーマなど)で生成するのは比較的簡単ですが、本番環境のデプロイメントに十分な信頼性を備えています。
我々は,LLMの生成,検証という基本原理に基づく軽量なフレームワークを提案する。
このリフレーミングは、責任を生成品質から検証厳格にシフトさせる。
第一に、テスト駆動生成: テストが失敗すると、LCMは出力が失敗した理由を明らかにする指示的エラーメッセージを受け取り、LCMはその誤りを理解し、その後の試みを洗練します。
第2に、決定論的およびLCMベースのテスト: 決定論的テストは、プログラム的に検証可能なヒューリスティック(スキーマ、構文、相互参照)をキャッチし、LCMベースのテストは、プログラム検査に抵抗するニュアンスドセマンティックおよび繊細な特徴(意図的整合性、論理的整合性、ドメインの正当性)を評価する。
第三に、専門家の蒸留された審査員: LLMベースのテストは、人間の専門家の意思決定分布を蒸留し、再現するために調整され、手動品質ゲートを、プロフェッショナルグレードの検証基準を反映したスケーラブルで再利用可能な評価プロキシに変換する。
セキュリティ領域の3つのアーティファクトタイプ - KQLクエリ生成、MITRE ATT\&CKマッピング、エンティティマッピング — に関するフレームワークをデモして、Microsoft Sentinelで本番環境にデプロイします。
我々は、このフレームワークが他のアーティファクト生成タスクにセキュリティを超えて適用でき、LCM生成の効率向上を犠牲にすることなく、信頼性の高い高品質なアウトプットへのパスを提供できると信じている。
関連論文リスト
- RepoZero: Can LLMs Generate a Code Repository from Scratch? [13.87780777614509]
RepoZeroは、完全に自動化された実行ベースのレポジトリレベルの生成をスクラッチから検証できる最初のベンチマークである。
我々の結果は、RepoZeroをエンドツーエンドのコード生成のための、困難でスケーラブルで信頼性の高いテストベッドとして確立しています。
論文 参考訳(メタデータ) (2026-05-08T01:56:02Z) - Reasoning with Confidence: Efficient Verification of LLM Reasoning Steps via Uncertainty Heads [104.9566359759396]
データ駆動の不確実性スコアに基づくステップレベルの推論検証の軽量な代替案を提案する。
本研究は, LLMの内部状態が不確実性を符号化し, 信頼性の高い検証信号として機能することが示唆された。
論文 参考訳(メタデータ) (2025-11-09T03:38:29Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - Hallucination to Consensus: Multi-Agent LLMs for End-to-End Test Generation [2.794277194464204]
ユニットテストは、ソフトウェアの正しさを保証する上で重要な役割を担います。
従来の手法は、高いコードカバレッジを達成するために、検索ベースまたはランダム化アルゴリズムに依存していた。
CANDORはJavaにおける自動単体テスト生成のための新しいプロンプトエンジニアリングベースのLLMフレームワークである。
論文 参考訳(メタデータ) (2025-06-03T14:43:05Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - RvLLM: LLM Runtime Verification with Domain Knowledge [8.15645390408007]
大規模言語モデル(LLM)は、例外的なテキスト理解と生成能力のため、AIパラダイムの主流として現れている。
不整合または誤ったアウトプットを生成する傾向は、特に正確さと信頼性を必要とする高い領域において、その信頼性に挑戦する。
既存の研究は、多くの場合、ドメイン固有の知識を統合する可能性を見越して、汎用シナリオにおけるモデル誤動作の検出と緩和に重点を置いている。
論文 参考訳(メタデータ) (2025-05-24T08:21:44Z) - Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection [90.71323430635593]
本稿では, LLM生成解を超える包括的解答空間を考察した, 新たな自己検出パラダイムを提案する。
このパラダイムに基づいて、2段階のフレームワークを導入し、まずまずLLMに各候補の回答を反映し、正当化するように指示する。
このフレームワークは、優れた自己検出のための既存のアプローチとシームレスに統合できる。
論文 参考訳(メタデータ) (2024-03-15T02:38:26Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。