論文の概要: TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation
- arxiv url: http://arxiv.org/abs/2607.02615v2
- Date: Wed, 08 Jul 2026 18:37:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-10 16:54:55.15118
- Title: TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation
- Title(参考訳): TAG: テスト駆動型エージェントアーティファクト生成のための軽量フレームワーク
- Abstract要約: 基本原理に基づく軽量なフレームワーク:textit TAGM の生成を検証する。
第一に、textbftest駆動生成: テストがフェールすると、LCMは出力が失敗した理由を明らかにする指示的エラーメッセージを受け取る。
セキュリティドメインの3つのアーティファクトタイプ - KQL生成、TAGRE ATT&CKマッピング、エンティティマッピング – に関するフレームワークをデモして、Microsoft Sentinelで本番環境にデプロイします。
- 参考スコア(独自算出の注目度): 0.30786914102688595
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Generating structured artifacts with Large Language Models - e.g.\ database queries, threat framework mappings, entity schemas - is relatively straightforward; however, making them reliable enough for production deployments presents challenges. We present TAG, a lightweight framework based on a core principle: \textit{LLMs generate, we validate}. This reframing shifts responsibility from generation quality to validation rigor. The framework rests on three key attributes: First, \textbf{test driven generation}: when tests fail, the LLM receives indicative error messages that expose why the output failed, enabling the LLM to understand its mistakes and refine subsequent attempts. Second, \textbf{deterministic and LLM-based tests}: deterministic tests catch heuristics that can be programmatically verified (schema, syntax, cross-reference), while LLM-based tests evaluate nuanced semantic and delicate features that resist programmatic inspection (intent alignment, logical consistency, domain correctness). Third, \textbf{expert-distilled judges}: LLM-based tests are calibrated to distill and replicate human expert decision distribution, transforming manual human quality gates into scalable, reusable evaluation proxies that reflect professional-grade validation standards. We demonstrate the framework on three artifact types in the security domain - KQL query generation, MITRE ATT\&CK mapping, and entity mapping - deployed in production at Microsoft Sentinel. We believe this framework can be applied beyond security to other artifact generation tasks, providing a path to reliable, high-quality outputs without sacrificing the efficiency gains of LLM generation.
- Abstract(参考訳): 構造化アーティファクトを大規模言語モデル(データベースクエリ、脅威フレームワークマッピング、エンティティスキーマなど)で生成するのは比較的簡単ですが、本番環境のデプロイメントに十分な信頼性を備えています。
本稿では,コア原則に基づく軽量フレームワークであるTAGについて述べる。
このリフレーミングは、責任を生成品質から検証厳格にシフトさせる。
第一に、 \textbf{test driven generation}: テストが失敗すると、LCMは出力が失敗した理由を知らせる指示的エラーメッセージを受け取る。
第二に、 {textbf{deterministic and LLM-based tests}: 決定論的テストは、プログラム的に検証可能なヒューリスティック(スキーマ、構文、相互参照)をキャッチし、LSMベースのテストは、プログラム検査に抵抗するニュアンスドセマンティックおよび繊細な特徴(意図的整合性、論理的整合性、ドメインの正当性)を評価する。
第3に、 textbf{expert-distilled judges}: LLMベースのテストは、人間の専門家による意思決定の配布を蒸留し、再現するために調整され、手動品質ゲートを、プロフェッショナルグレードの検証基準を反映したスケーラブルで再利用可能な評価プロキシに変換する。
セキュリティ領域の3つのアーティファクトタイプ - KQLクエリ生成、MITRE ATT\&CKマッピング、エンティティマッピング — に関するフレームワークをデモして、Microsoft Sentinelで本番環境にデプロイします。
我々は、このフレームワークが他のアーティファクト生成タスクにセキュリティを超えて適用可能であり、LCM生成の効率向上を犠牲にすることなく、信頼性の高い高品質なアウトプットへのパスを提供することができると信じている。
関連論文リスト
- PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling [11.1017602726296]
大規模言語モデルは、ますます自律的なエージェントとして機能している。
現在のベンチマークには3つの制限がある。
Evalは、2段階のフレームワークで構築されたベンチマークである。
論文 参考訳(メタデータ) (2026-08-09T13:25:54Z) - Agent-Based Test Assertion Generation via Diverse Perspective Aggregation [13.443058740546164]
AssertMateはエージェントベースのアサーション生成フレームワークである。
これにより、大きな言語モデル(LLM)の生成したアサーションの品質と信頼性が向上する。
コンピレーションの成功とパスレートにおいて、最先端の技術よりも大幅に優れています。
論文 参考訳(メタデータ) (2026-08-06T09:51:43Z) - RepoZero: Can LLMs Generate a Code Repository from Scratch? [13.87780777614509]
RepoZeroは、完全に自動化された実行ベースのレポジトリレベルの生成をスクラッチから検証できる最初のベンチマークである。
我々の結果は、RepoZeroをエンドツーエンドのコード生成のための、困難でスケーラブルで信頼性の高いテストベッドとして確立しています。
論文 参考訳(メタデータ) (2026-05-08T01:56:02Z) - DiffuRank: Effective Document Reranking with Diffusion Language Models [71.16830004674513]
拡散言語モデル(dLLM)に基づいて構築されたフレームワークであるDiffuRankを提案する。
dLLMは、左から右への順序に制約されないより柔軟なデコーディングと生成プロセスをサポートする。
モデルサイズが類似した自己回帰LDMに匹敵する性能を示す。
論文 参考訳(メタデータ) (2026-02-13T02:18:14Z) - Reasoning with Confidence: Efficient Verification of LLM Reasoning Steps via Uncertainty Heads [104.9566359759396]
データ駆動の不確実性スコアに基づくステップレベルの推論検証の軽量な代替案を提案する。
本研究は, LLMの内部状態が不確実性を符号化し, 信頼性の高い検証信号として機能することが示唆された。
論文 参考訳(メタデータ) (2025-11-09T03:38:29Z) - Rethinking Testing for LLM Applications: Characteristics, Challenges, and a Lightweight Interaction Protocol [83.83217247686402]
大言語モデル(LLM)は、単純なテキストジェネレータから、検索強化、ツール呼び出し、マルチターンインタラクションを統合する複雑なソフトウェアシステムへと進化してきた。
その固有の非決定主義、ダイナミズム、文脈依存は品質保証に根本的な課題をもたらす。
本稿では,LLMアプリケーションを3層アーキテクチャに分解する: textbftextitSystem Shell Layer, textbftextitPrompt Orchestration Layer, textbftextitLLM Inference Core。
論文 参考訳(メタデータ) (2025-08-28T13:00:28Z) - CompassVerifier: A Unified and Robust Verifier for LLMs Evaluation and Outcome Reward [50.97588334916863]
評価と結果報酬のための正確で堅牢な軽量検証モデルであるCompassVerifierを開発した。
数学、知識、多種多様な推論タスクにまたがる多分野の能力を示し、様々な答えの型を処理する能力を示す。
我々は,複数のデータソースから収集したモデル出力からなるVerifierBenchベンチマークを導入し,メタエラーパターンを手動で解析してCompassVerifierを強化する。
論文 参考訳(メタデータ) (2025-08-05T17:55:24Z) - TestWeaver: Execution-aware, Feedback-driven Regression Testing Generation with Large Language Models [5.871736617580623]
回帰テストは、コードの変更が意図せずに既存の機能を壊さないようにする。
大規模言語モデル(LLM)の最近の進歩は、回帰テストのためのテスト生成を自動化することを約束している。
テスト生成をより効率的にガイドするために、軽量なプログラム分析を統合する新しいアプローチであるTestWeaverを提案する。
論文 参考訳(メタデータ) (2025-08-02T08:13:02Z) - Use Property-Based Testing to Bridge LLM Code Generation and Validation [38.25155484701058]
大きな言語モデル(LLM)はコード生成において優れていますが、その出力が機能的に正しいことを保証することは、永続的な課題です。
本稿では,Property-Generated Solverを紹介した。Property-Based Testing (PBT)を活用して,高レベルのプログラム特性を検証する新しいフレームワークである。
プロパティ生成ソルバーには、コード生成と反復リファインメント専用のジェネレータと、PBTライフサイクルを管理するテスタという、2つの共同LLMベースのエージェントが使用されている。
論文 参考訳(メタデータ) (2025-06-23T06:01:12Z) - Hallucination to Consensus: Multi-Agent LLMs for End-to-End Test Generation [2.794277194464204]
ユニットテストは、ソフトウェアの正しさを保証する上で重要な役割を担います。
従来の手法は、高いコードカバレッジを達成するために、検索ベースまたはランダム化アルゴリズムに依存していた。
CANDORはJavaにおける自動単体テスト生成のための新しいプロンプトエンジニアリングベースのLLMフレームワークである。
論文 参考訳(メタデータ) (2025-06-03T14:43:05Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - RvLLM: LLM Runtime Verification with Domain Knowledge [8.15645390408007]
大規模言語モデル(LLM)は、例外的なテキスト理解と生成能力のため、AIパラダイムの主流として現れている。
不整合または誤ったアウトプットを生成する傾向は、特に正確さと信頼性を必要とする高い領域において、その信頼性に挑戦する。
既存の研究は、多くの場合、ドメイン固有の知識を統合する可能性を見越して、汎用シナリオにおけるモデル誤動作の検出と緩和に重点を置いている。
論文 参考訳(メタデータ) (2025-05-24T08:21:44Z) - Towards Copyright Protection for Knowledge Bases of Retrieval-augmented Language Models via Reasoning [58.57194301645823]
大規模言語モデル(LLM)は、現実のパーソナライズされたアプリケーションにますます統合されている。
RAGで使用される知識基盤の貴重かつしばしばプロプライエタリな性質は、敵による不正使用のリスクをもたらす。
これらの知識基盤を保護するための透かし技術として一般化できる既存の方法は、一般的に毒やバックドア攻撃を含む。
我々は、無害な」知識基盤の著作権保護の名称を提案する。
論文 参考訳(メタデータ) (2025-02-10T09:15:56Z) - Think Twice Before Trusting: Self-Detection for Large Language Models through Comprehensive Answer Reflection [90.71323430635593]
本稿では, LLM生成解を超える包括的解答空間を考察した, 新たな自己検出パラダイムを提案する。
このパラダイムに基づいて、2段階のフレームワークを導入し、まずまずLLMに各候補の回答を反映し、正当化するように指示する。
このフレームワークは、優れた自己検出のための既存のアプローチとシームレスに統合できる。
論文 参考訳(メタデータ) (2024-03-15T02:38:26Z) - Self-Evaluation Improves Selective Generation in Large Language Models [54.003992911447696]
オープンエンド生成タスクをトークンレベルの予測タスクに再構成する。
我々はLSMに答えを自己評価するように指示する。
自己評価に基づくスコアリング手法をベンチマークする。
論文 参考訳(メタデータ) (2023-12-14T19:09:22Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。