論文の概要: Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models
- arxiv url: http://arxiv.org/abs/2608.01451v1
- Date: Sun, 02 Aug 2026 19:22:02 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.244198
- Title: Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models
- Title(参考訳): Doc2CI: 大規模言語モデルを用いたCI構成生成のマルチサービス研究
- Abstract要約: DOC2CIは、4つのCIサービスの公式ドキュメントから収集された3,363のYAMLペアのベンチマークである。
GPT-4o と GPT-4.1 とともに 7B-34B パラメータから 14 個のオープンウェイトモデルを評価し、53,000 以上の構成を生成する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Adopting Continuous Integration (CI) often requires writing YAML configurations that are error-prone and challenging to maintain. Despite increasing LLM use in software engineering, their ability to generate CI configurations from natural language across services and model families remains unclear. This paper presents a large empirical study on using LLMs to generate CI configurations. We introduce DOC2CI, a benchmark of 3,363 description-to-YAML pairs collected from the official documentation of four CI services, and evaluate 14 open-weight models from 7B-34B parameters together with GPT-4o and GPT-4.1, producing over 53,000 configurations. We assess both reference alignment and schema validity to determine whether the generated configurations are structurally valid. We further develop a failure taxonomy from a manual analysis of 385 configurations and examine why LLMs disagree. Across models and services, exact reference reproduction never exceeds 3.1%, and while 97% of outputs parse as YAML, only 71% satisfy service schemas. Larger models improve structural validity, but code specialization provides no consistent advantage over comparable general models. Model differences are driven largely by output completeness: for the same request, some models generate the expected fragment while others produce a full workflow. Finally, a training-free schema-guided repair method improves schema validity to 94%, while fine-tuning improves similarity to documentation but reduces standalone validity. This suggests that similarity and validity are distinct objectives for CI generation and motivate schema-aware evaluation and tooling for LLM-based configuration generation.
- Abstract(参考訳): 継続的統合(CI)を採用するには、しばしば、エラーが発生し、メンテナンスが難しいYAML構成を書く必要がある。
ソフトウェアエンジニアリングにおけるLLMの使用の増加にもかかわらず、サービスとモデルファミリをまたいだ自然言語からCI設定を生成する能力は、まだ不明である。
本稿では,LLMを用いたCI構成の生成に関する大規模な実証的研究について述べる。
DOC2CIは、4つのCIサービスの公式資料から収集された3,363のYAMLペアのベンチマークであり、7B-34Bパラメータから14のオープンウェイトモデルとGPT-4oとGPT-4.1を併用して評価し、53,000以上の構成を生成する。
参照アライメントとスキーマの妥当性を評価し、生成した構成が構造的に有効かどうかを判定する。
さらに, 385 構成のマニュアル解析から失敗分類法を開発し,なぜ LLM が一致しないのかを検証した。
モデルやサービス全体では、正確な参照再現は3.1%を超えず、出力の97%がYAMLとしてパースされているが、サービススキーマを満たすのはわずか71%である。
より大規模なモデルは構造的妥当性を向上させるが、コード特殊化は同等の一般モデルに対して一貫した優位性を与えない。
同じ要求に対して、いくつかのモデルが期待するフラグメントを生成し、他のモデルが完全なワークフローを生成します。
最後に、トレーニング不要のスキーマ誘導修復手法では、スキーマの妥当性が94%向上し、微調整ではドキュメントとの類似性が向上するが、スタンドアロンの妥当性は低下する。
このことは、類似性と妥当性がCI生成の明確な目的であり、LCMベースの構成生成のためのスキーマ認識評価とツーリングを動機付けていることを示唆している。
関連論文リスト
- Structured Context Engineering for File-Native Agentic Systems: Evaluating Schema Accuracy, Format Effectiveness, and Multi-File Navigation at Scale [0.0]
大規模言語モデルエージェントは、プログラムインターフェイスを介してシステムを操作するようになっている。
しかし、実践者は、これらのエージェントが消費するコンテキストを構造化する方法に関する経験的なガイダンスを欠いている。
11のモデル、4のフォーマット、スキーマ10から10,000のテーブルにわたる9,649の実験を調査した。
論文 参考訳(メタデータ) (2026-02-05T08:39:05Z) - Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks [3.3705400036304205]
セマンティックドリフト(Semantic drift)は、データとガバナンスを妥協し、テキストからRAGまでのサービスの有用性を損なう。
本稿では,多言語エンタープライズパイプラインスクリプトから細粒度スキーマを自動抽出するフレームワークを提案する。
結果:単一推論トレースを使用した32Bオープンソースモデルは、標準プロンプトの下でGPTシリーズに匹敵するパフォーマンスを達成することができる。
論文 参考訳(メタデータ) (2025-08-10T05:04:32Z) - Can LLMs Write CI? A Study on Automatic Generation of GitHub Actions Configurations [0.0]
GitHub Actionsのような継続的インテグレーションサービスは、YAMLベースのコンフィギュレーションを記述する必要がある。
ソフトウェアエンジニアリングタスクの自動化にLLM(Large Language Models)の利用が増えているにも関わらず、CI構成を生成する能力はまだ未定だ。
本稿では、自然言語記述からGitHub Actions設定を生成するための6つのLCMを評価する予備的研究について述べる。
論文 参考訳(メタデータ) (2025-07-23T03:18:04Z) - Beyond Isolated Dots: Benchmarking Structured Table Construction as Deep Knowledge Extraction [80.88654868264645]
Arranged and Organized extract Benchmarkは、断片化された文書を理解するための大規模言語モデルの能力を評価するために設計された。
AOEには3つの異なるドメインにまたがる11のタスクが含まれており、さまざまな入力クエリに適したコンテキスト固有のスキーマを生成するモデルが必要である。
結果は、最も先進的なモデルでさえ、かなり苦労したことを示している。
論文 参考訳(メタデータ) (2025-07-22T06:37:51Z) - Leveraging Machine Learning and Enhanced Parallelism Detection for BPMN Model Generation from Text [75.77648333476776]
本稿では、テキストからBPMNモデルを抽出する自動パイプラインについて紹介する。
この研究の重要な貢献は、新たに注釈付けされたデータセットの導入である。
モデルトレーニング用の32のパラレルゲートウェイを含む15の注釈付き文書でデータセットを増強する。
論文 参考訳(メタデータ) (2025-07-11T07:25:55Z) - Evaluating the Use of LLMs for Documentation to Code Traceability [3.076436880934678]
大規模言語モデルは、様々なソフトウェアドキュメンテーションとソースコードの間のトレースリンクを確立することができる。
私たちは2つのオープンソースプロジェクト(Unity CatalogとCrawl4AI)から2つの新しいデータセットを作成します。
その結果、最高の性能のLLMは2つのデータセットで79.4%と80.4%のF1スコアを達成した。
論文 参考訳(メタデータ) (2025-06-19T16:18:53Z) - Large Language Models are Good Relational Learners [55.40941576497973]
本稿では,グラフニューラルネットワーク(GNN)に基づくエンコーダを用いて,大規模言語モデル(LLM)のための構造化リレーショナルプロンプトを生成する新しいアーキテクチャであるRel-LLMを紹介する。
従来のテキストベースのシリアライズ手法とは異なり,本手法はデータベース固有の関係構造を保ちながら,LLMが複雑なエンティティ関係を処理・推論することを可能にする。
論文 参考訳(メタデータ) (2025-06-06T04:07:55Z) - SLOT: Structuring the Output of Large Language Models [5.683327173793259]
SLOT(Structured LLM Output Transformer)は,非構造化LCM出力を正確な構造化形式に変換するモデルに依存しない手法である。
この結果から,制約付き復号化による微調整Mistral-7Bモデルでは,ほぼ完全なスキーマ精度が得られた。
特に、Llama-3.2-1Bのようなコンパクトなモデルでさえ、はるかに大きなプロプライエタリなモデルの出力能力にマッチまたは超えることができる。
論文 参考訳(メタデータ) (2025-05-06T23:29:43Z) - Elucidating the Design Space of Multimodal Protein Language Models [69.3650883370033]
マルチモーダルタンパク質言語モデル(PLM)は、シーケンスとトークンに基づく構造情報を統合する。
本稿では,マルチモーダルPLMの設計空間を体系的に解明し,その限界を克服する。
我々の進歩はよりきめ細かな監督にアプローチし、トークンベースのマルチモーダルPLMが堅牢な構造モデリングを実現することを実証する。
論文 参考訳(メタデータ) (2025-04-15T17:59:43Z) - StructLM: Towards Building Generalist Models for Structured Knowledge Grounding [49.10029030628653]
大規模言語モデル(LLM)では、最先端(SoTA)モデルの背後にある構造化データラグを平均35%処理できる。
私たちは、MistralとCodeLlamaモデルファミリに基づいたStructLMと呼ばれる一連のモデルをトレーニングします。
我々のStructLMシリーズは、評価された18のデータセットのうち16のタスク固有モデルを超え、8つのSKGタスクに新しいSoTAパフォーマンスを確立する。
論文 参考訳(メタデータ) (2024-02-26T15:47:01Z) - Struc-Bench: Are Large Language Models Really Good at Generating Complex Structured Data? [49.688233418425995]
Struc-Benchは、大きな言語モデル(LLM)を特徴とする包括的なベンチマークである。
Pスコア(Prompting Score)とHスコア(Heuristical Score)の2つの革新的な指標を提案する。
実験の結果,LLaMA-7Bに構造認識の微調整を適用すると,性能が大幅に向上することがわかった。
論文 参考訳(メタデータ) (2023-09-16T11:31:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。