論文の概要: SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models
- arxiv url: http://arxiv.org/abs/2606.29520v1
- Date: Sun, 28 Jun 2026 17:31:14 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-30 18:07:15.948909
- Title: SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models
- Title(参考訳): SAKE: 大規模言語モデルのためのソフトウェアアーキテクチャ知識評価ベンチマーク
- Authors: Tiziano Santilli, Francesco Daghero, Mayhar Tourchi Moghaddam,
- Abstract要約: 大規模言語モデル(LLM)は、ソフトウェア開発ライフサイクル全体にわたってアシスタントとしてますます使われています。
アーキテクチャ上の意思決定は品質特性のトレードオフ、設計パターン、システムレベルの制約に依存します。
我々は、ソフトウェアアーキテクチャの知識を評価するための標準化された再現可能なベンチマークであるSAKEを紹介する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) are increasingly used as assistants across the software development lifecycle, yet their ability to reason about software architecture remains largely unmeasured. Architectural decision-making depends on quality attribute trade-offs, design patterns, and system-level constraints, none of which are exercised by benchmarks that target syntactic or algorithmic tasks. We introduce SAKE (Software Architectural Knowledge Evaluation), a standardized and reproducible benchmark for assessing software architectural knowledge in LLMs. SAKE comprises 2154 expert-curated multiple-choice questions, each with four options, stratified across eight architectural categories and four context-length levels. We evaluate 11 proprietary and open-weight models in zero-shot and five-shot settings. Overall accuracy is high, but performance varies markedly across categories, revealing competency gaps in areas central to professional practice. SAKE, its evaluation scripts, and all results are released as open source to give the community a baseline for tracking architectural reasoning in LLMs.
- Abstract(参考訳): 大規模言語モデル(LLM)は、ソフトウェア開発ライフサイクル全体にわたってアシスタントとしてますます使われていますが、ソフトウェアアーキテクチャについて推論する能力はほとんど測定されていません。
アーキテクチャ上の決定は品質特性のトレードオフ、設計パターン、システムレベルの制約に依存します。
SAKE(Software Architectural Knowledge Evaluation、ソフトウェアアーキテクチャ知識評価)は、LLMにおけるソフトウェアアーキテクチャ知識を評価するための標準化された再現可能なベンチマークである。
SAKEは専門家による2154の複数選択質問で構成されており、それぞれに4つの選択肢があり、8つのアーキテクチャカテゴリと4つのコンテキスト長レベルに階層化されている。
ゼロショットと5ショット設定で11のプロプライエタリモデルとオープンウェイトモデルを評価した。
全体的な精度は高いが、パフォーマンスはカテゴリーによって大きく異なる。
SAKEとその評価スクリプト、およびすべての結果はオープンソースとしてリリースされ、LLMにおけるアーキテクチャ推論を追跡するためのベースラインをコミュニティに提供する。
関連論文リスト
- Bridging Requirements and Architecture: Multi-Agent Orchestration with External Knowledge and Hierarchical Memory [37.071260774880884]
我々は,4つの専門エージェントを編成し,アーキテクチャのブループリントを属性とする知識駆動型フレームワークであるMAAD(Multi-Agent Architecture Design)を提案する。
我々はMAADがベースラインよりも完全でモジュラーでトレーサブルなアーキテクチャを生成することを示し、その専用評価エージェントは構造化された品質評価レポートを自律的に作成する。
論文 参考訳(メタデータ) (2026-05-31T18:18:31Z) - CAKE: Cloud Architecture Knowledge Evaluation of Large Language Models [1.1140384738063094]
CAKEは、ブルームの改訂された分類学の4つの認知レベルに関する188人の専門家による検証された質問で構成されている。
マルチチョイス質問(MCQ)とフリーレスポンス(FR)のためのLCM-as-a-judgeスコア(FR)を併用した22種類のモデル構成の評価を行った。
論文 参考訳(メタデータ) (2026-04-07T11:56:43Z) - SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models [59.90381306452982]
ソフトウェアエンジニアリングのための大規模言語モデル(LLM)の評価は、タスクカバレッジの狭さ、言語バイアス、現実世界の開発者との整合性の不足によって制限されている。
SWE-1は、不均一なコード関連評価を構造化および生産整合性のあるフレームワークに統合する包括的なベンチマークである。
SWE-は8つのタスクタイプ、8つのプログラミングシナリオ、10のプログラミング言語にまたがる。
論文 参考訳(メタデータ) (2025-11-07T18:01:32Z) - Collaborative LLM Agents for C4 Software Architecture Design Automation [0.0]
本研究は,ソフトウェアアーキテクチャの自動設計とその評価手法に寄与する。
我々は,C4ソフトウェアアーキテクチャモデルを自動生成するLLMベースのマルチエージェントシステムを提案する。
5つの標準的なシステムブリーフでテストされたこのワークフローは、高速なC4モデル生成、高いコンパイル成功の維持、セマンティック忠実性の提供を実証する。
論文 参考訳(メタデータ) (2025-10-26T18:43:59Z) - QuArch: A Benchmark for Evaluating LLM Reasoning in Computer Architecture [36.842856470579726]
QuArchは、コンピュータアーキテクチャにおける大規模言語モデル(LLM)機能の開発と評価を容易にするために設計された最初のベンチマークである。
評価の結果,フロンティアモデルはドメイン固有の知識を持っているが,高次思考を必要とするスキルに苦慮していることが明らかとなった。
論文 参考訳(メタデータ) (2025-10-24T23:54:17Z) - MAAD: Automate Software Architecture Design through Knowledge-Driven Multi-Agent Collaboration [20.14573932063689]
アーキテクチャ設計に知識駆動型マルチエージェントシステム(MAS)を利用する自動フレームワークであるMAAD(Multi-Agent Architecture Design)を提案する。
MAADは、要求仕様を協調的に解釈し、アーキテクチャの青写真を作成するために、4つの特殊エージェント(アナリスト、モデル、設計者、評価者)を編成する。
以上の結果から,MAADの優位性は,総合的なアーキテクチャコンポーネントの生成と,洞察に富んだ構造化されたアーキテクチャ評価レポートの提供にあることが示された。
論文 参考訳(メタデータ) (2025-07-28T23:18:25Z) - BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models [50.17907898478795]
本稿では,バイナリ解析タスクにおける大規模言語モデルの性能評価のためのベンチマークであるBinMetricを紹介する。
BinMetricは6つの実用的なバイナリ分析タスクにわたる20の実際のオープンソースプロジェクトから得られた1000の質問で構成されている。
本ベンチマークの実証実験では, 各種LLMのバイナリ解析能力について検討し, その強度と限界を明らかにした。
論文 参考訳(メタデータ) (2025-05-12T08:54:07Z) - The Digital Cybersecurity Expert: How Far Have We Come? [49.89857422097055]
我々は,サイバーセキュリティの専門家が期待する345の知識ポイントに基づいた,きめ細かいサイバーセキュリティ評価フレームワークであるCSEBenchmarkを開発した。
CSEBenchmarkで12のポピュラーな大言語モデル(LLM)を評価し、最高のパフォーマンスモデルでさえ全体の精度は85.42%に過ぎなかった。
各LSMにおける特定の知識ギャップを特定し,対処することにより,事前の誤り予測の修正において最大84%の改善が達成される。
論文 参考訳(メタデータ) (2025-04-16T05:36:28Z) - Semi-Automated Design of Data-Intensive Architectures [49.1574468325115]
本稿では,データ集約型アーキテクチャの開発手法を紹介する。
i) 特定のアプリケーションシナリオに適したアーキテクチャを設計し、(ii) アプリケーションを実装するための具体的なシステムの適切なセットを選択することをアーキテクトに案内します。
私たちが採用している記述言語は、研究者や実践者が提案するデータ集約アーキテクチャの重要な側面を捉えることができる。
論文 参考訳(メタデータ) (2025-03-21T16:01:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。