論文の概要: Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation
- arxiv url: http://arxiv.org/abs/2607.05985v1
- Date: Tue, 07 Jul 2026 08:17:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-08 21:24:51.452968
- Title: Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation
- Title(参考訳): レンズ下のオートDSM:LCMベースのDSM生成のためのブラックボックス評価フレームワーク
- Abstract要約: 本稿では、構造化された技術文書から設計構造行列(DSM)を生成する大規模言語モデル(LLM)の能力を評価するブラックボックス評価フレームワークを提案する。
現在のAuto-DSMパイプラインのクローズソースな性質に触発されたこのフレームワークは、生成されたDSMをベンチマークする再現可能な方法論を導入している。
- 参考スコア(独自算出の注目度): 1.2891210250935148
- License: http://creativecommons.org/licenses/by-nc-nd/4.0/
- Abstract: This paper presents a black-box evaluation framework to systematically assess the ability of Large Language Models (LLMs) to generate Design Structure Matrices (DSMs) from structured technical documentation. Motivated by the closed-source nature of current Auto-DSM pipelines, the framework introduces a reproducible methodology that benchmarks generated DSMs (GEN-DSMs) against manually validated ground-truth matrices (GT-DSMs). The evaluation integrates both single-run and multi-run perspectives, combining structural metrics (Completeness, Correctness, Coupling Density), classification metrics (Selective Accuracy, Abstention Coverage), and stability measures (Entropy, Fleiss' $κ$). To synthesize these aspects, a Composite Quality Score (Q) is proposed. Controlled experiments are conducted on two datasets: a fictive abstract system and a real-world refrigerator decomposition, covering variations in phrasing, parameter-dataset alignment, and system complexity. Results show that LLMs can produce structurally plausible DSMs and achieve high reproducibility under well-structured inputs, but remain sensitive to ambiguity, inconsistent dependency definitions, and prompt formulation. The findings highlight systematic sources of hallucination and abstention failure, demonstrating both the potential and current limitations of LLM-driven DSM automation. The proposed framework provides a transparent benchmark for auditing Auto-DSM pipelines and establishes foundations for integrating LLM-based decomposition methods into model-based systems engineering (MBSE) workflows.
- Abstract(参考訳): 本稿では,大規模言語モデル(LLM)を体系的に評価し,構造化された技術資料から設計構造行列(DSM)を生成するブラックボックス評価フレームワークを提案する。
現行のAuto-DSMパイプラインのクローズソース性によって動機づけられたこのフレームワークは、手動で検証された基底構造行列(GT-DSM)に対して生成されたDSM(GEN-DSM)をベンチマークする再現可能な方法論を導入する。
評価は単一実行と複数実行の両方の視点を統合し、構造的メトリクス(完全性、正確性、結合密度)、分類的メトリクス(選択的正確性、回避的カバレッジ)、安定性尺度(エントロピー、Fleissの$κ$)を組み合わせる。
これらの側面を合成するために,複合品質スコア(Q)を提案する。
制御された実験は、Fictive abstract system と Real-world refrigerator decomposition の2つのデータセットで行われ、フレーズのバリエーション、パラメータ・データセットのアライメント、システムの複雑さをカバーしている。
その結果, LLMは構造的に可塑性なDSMを生成でき, 高い再現性が得られるが, あいまいさ, 一貫性のない依存性定義, 迅速な定式化に敏感であることがわかった。
本研究は, LLM駆動型DSM自動化の潜在的な限界と現在の限界を実証し, 幻覚と禁忌障害の系統的原因を明らかにした。
提案フレームワークは、Auto-DSMパイプラインの監査のための透過的なベンチマークを提供し、LLMベースの分解メソッドをモデルベースシステムエンジニアリング(MBSE)ワークフローに統合するための基盤を確立する。
関連論文リスト
- A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments [2.2404539130909376]
本研究では,Large Language Models (LLMs) を用いた項目類似度自動解析のための2次元フレームワークを提案する。
LLMは構造的分解と意味的関連性を通して類似性を運用する。
心理学的検証は、LCM由来のメトリクスが構成非関連局所依存の指標とより密接に一致していることを示している。
論文 参考訳(メタデータ) (2026-08-25T17:07:16Z) - Coordinates of Capability: A Unified MTMM-Geometric Framework for LLM Evaluation [2.464003792743989]
本稿では,Large Language Models (LLMs) 評価のための汎用多言語多手法(MTMM)フレームワークを提案する。
パラフレーズ不安定度,ドリフトスコア,オーバートン幅,プラナリズムスコアの9つの評価指標を定式化し,共有潜在座標空間内の幾何的測度として解釈する。
タスク非関連摂動を真の能力の範囲から体系的に分離することにより、このフレームワークは、堅牢で経験的に安定したベンチマーク設計のために理論的に基礎とドメインに依存しない分類を提供する。
論文 参考訳(メタデータ) (2026-05-08T22:05:19Z) - Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis [0.8193467416247519]
レビューとメタ分析は、物語を構造化され、数値化された研究記録に変換することに頼っている。
大規模言語モデル(LLM)の急速な進歩にもかかわらず、このプロセスの構造的要件を満たすことができるかどうかは不明だ。
本稿では,LLMに基づくエビデンス抽出をスキーマ制約クエリの進行として評価する構造的診断フレームワークを提案する。
論文 参考訳(メタデータ) (2026-02-11T14:09:43Z) - From Completion to Editing: Unlocking Context-Aware Code Infilling via Search-and-Replace Instruction Tuning [81.97788535387286]
本稿では,エージェントによる検証・編集機構を統一された単一パス推論プロセスに内部化するフレームワークを提案する。
最小限のデータで、SRI-Coderは、ChatモデルがBaseモデルの完了性能を上回ることができる。
FIMスタイルのチューニングとは異なり、SRIは一般的なコーディング能力を保持し、標準のFIMに匹敵する推論遅延を維持する。
論文 参考訳(メタデータ) (2026-01-19T20:33:53Z) - STED and Consistency Scoring: A Framework for Evaluating LLM Structured Output Reliability [11.095198847819573]
大規模言語モデル(LLM)は、構造化データ生成のためにますます多くデプロイされている。
LLM生成した構造化出力の整合性の評価と改善のための総合的なフレームワークを提案する。
論文 参考訳(メタデータ) (2025-11-27T02:49:52Z) - STEM: Efficient Relative Capability Evaluation of LLMs through Structured Transition Samples [3.41981716024098]
大規模言語モデル(LLM)の評価は、モデル機能が急速に進歩するにつれて、ますます困難になっている。
軽量かつ解釈可能な評価フレームワークとして textbfStructured textbfTransition textbfEvaluation textbfMethod (STEM) を提案する。
論文 参考訳(メタデータ) (2025-08-16T16:36:43Z) - Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction [80.88654868264645]
Arranged and Organized extract Benchmarkは、断片化された文書を理解するための大規模言語モデルの能力を評価するために設計された。
AOEには3つの異なるドメインにまたがる11のタスクが含まれており、さまざまな入力クエリに適したコンテキスト固有のスキーマを生成するモデルが必要である。
結果は、最も先進的なモデルでさえ、かなり苦労したことを示している。
論文 参考訳(メタデータ) (2025-07-22T06:37:51Z) - Discrete Tokenization for Multimodal LLMs: A Comprehensive Survey [69.45421620616486]
本研究は、大規模言語モデル(LLM)用に設計された離散トークン化手法の最初の構造的分類と解析である。
古典的および近代的なパラダイムにまたがる8つの代表的なVQ変種を分類し、アルゴリズムの原理を分析し、力学を訓練し、LLMパイプラインとの統合に挑戦する。
コードブックの崩壊、不安定な勾配推定、モダリティ固有の符号化制約など、重要な課題を特定する。
論文 参考訳(メタデータ) (2025-07-21T10:52:14Z) - SCAN: Structured Capability Assessment and Navigation for LLMs [54.54085382131134]
textbfSCAN (Structured Capability Assessment and Navigation) は、大規模言語モデルの詳細な特徴付けを可能にする実用的なフレームワークである。
SCANには4つの重要なコンポーネントが含まれている。
TaxBuilder – クエリから機能表示タグを抽出して階層的な分類構造を構築する。
RealMixは、各機能タグに対する十分な評価データを保証するクエリ合成とフィルタリングのメカニズムである。
PC$2$ベースのLCM-as-a-Judge法は従来のLCM-as-a-Judge法と比較して大幅に精度が向上する
論文 参考訳(メタデータ) (2025-05-10T16:52:40Z) - FACT-AUDIT: An Adaptive Multi-Agent Framework for Dynamic Fact-Checking Evaluation of Large Language Models [79.41859481668618]
大規模言語モデル(LLM)はファクトチェック研究を大幅に進歩させた。
既存のファクトチェック評価手法は静的データセットと分類基準に依存している。
本稿では, LLMのファクトチェック機能を適応的かつ動的に評価するエージェント駆動型フレームワークであるFACT-AUDITを紹介する。
論文 参考訳(メタデータ) (2025-02-25T07:44:22Z) - Attribute Controlled Fine-tuning for Large Language Models: A Case Study on Detoxification [76.14641982122696]
本稿では,属性制御付き大規模言語モデル(LLM)の制約学習スキーマを提案する。
提案手法は, ベンチマーク上での競合性能と毒性検出タスクを達成しながら, 不適切な応答を少ないLCMに導出することを示す。
論文 参考訳(メタデータ) (2024-10-07T23:38:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。