論文の概要: Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development
- arxiv url: http://arxiv.org/abs/2607.19703v1
- Date: Wed, 22 Jul 2026 03:06:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-23 18:51:37.958117
- Title: Bridging Behavior and Implementation: Automated Java Glue Code Generation for Behavior-Driven Development
- Title(参考訳): ブリッジングと実装: 振る舞い駆動開発のためのJava Glueコードの自動生成
- Authors: Xinyu Shi, Zhou Yang, An Ran Chen,
- Abstract要約: 本稿では,自動Javaグルーコード生成のための階層型マルチエージェントフレームワークであるAutoGlueを紹介する。
振る舞い解釈は、シナリオコンテキストからステップの意図を導き、開発者エージェントは関連するBDDアーティファクトとプロジェクトコードを取得する。
私たちは8つのオープンソースプロジェクトから1,307ステップでAutoGlueを評価します。
- 参考スコア(独自算出の注目度): 14.438300737283205
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Behavior-Driven Development (BDD) helps technical and non-technical stakeholders share a common understanding of software requirements through natural-language scenarios. Glue code makes these scenarios executable by mapping each step to the corresponding project code. However, developing and maintaining glue code requires knowledge of both the intended behavior and the underlying codebase, making it a labor-intensive part of BDD as requirements evolve. Although large language models (LLMs) have shown strong code generation capabilities, their use for automated glue code generation remains unexplored. This task requires reasoning over underspecified behavior, related BDD artifacts, and large project codebases. We present AutoGlue, a hierarchical multi-agent framework for automated Java glue code generation. AutoGlue follows a behavior-first workflow that separates behavior interpretation, context retrieval, and code generation. A Behavior Interpreter derives the intent of a step from its scenario context, while a Developer agent retrieves relevant BDD artifacts and project code before generating the final glue code. We evaluate AutoGlue on 1,307 steps from eight open-source Java projects. Compared with few-shot prompting, AutoGlue improves API F1 by 58.7% and CodeBLEU by 43.7%. It produces directly usable glue code for 46.1% of the evaluated steps, while most partially correct outputs require only minor revisions, such as adding missing actions or refining parameters. Ablation results show that behavior interpretation and project-aware context retrieval both contribute substantially to generation quality. These findings demonstrate that LLMs can effectively connect natural-language behavior specifications with project code and support specification-driven software development.
- Abstract(参考訳): 振る舞い駆動開発(BDD)は、技術的および非技術的ステークホルダーが自然言語のシナリオを通じて、ソフトウェア要件の共通理解を共有するのに役立つ。
Glueコードは、各ステップを対応するプロジェクトコードにマッピングすることで、これらのシナリオを実行可能なものにします。
しかしながら、接着剤コードの開発とメンテナンスには、意図した振る舞いと基盤となるコードベースの両方の知識が必要であるため、要求が進化するにつれてBDDの労働集約的な部分になります。
大規模言語モデル(LLM)は強力なコード生成能力を示しているが、自動グルーコード生成には未定である。
このタスクには、不特定な振る舞い、関連するBDDアーティファクト、大規模なプロジェクトコードベースに対する推論が必要です。
本稿では,自動Javaグルーコード生成のための階層型マルチエージェントフレームワークであるAutoGlueを紹介する。
AutoGlueは、振る舞い解釈、コンテキスト検索、コード生成を分離する振る舞いファーストワークフローに従う。
振る舞い解釈(Behavior Interpreter)は、シナリオコンテキストからステップの意図を導き、開発者エージェントは、最終的なグルーコードを生成する前に、関連するBDDアーティファクトとプロジェクトコードを取得する。
私たちは8つのオープンソースプロジェクトから1,307ステップでAutoGlueを評価します。
数発のプロンプトと比較して、AutoGlueはAPI F1を58.7%改善し、CodeBLEUを43.7%改善した。
評価されたステップの46.1%で直接使用可能なグルーコードを生成するが、ほとんどの部分的な正しい出力は、不足したアクションの追加やパラメータの精製など、小さな修正しか必要としない。
アブレーションの結果,行動解釈とプロジェクト対応コンテキスト検索は共に生成品質に大きく寄与することがわかった。
これらの結果から,LLMは自然言語の動作仕様をプロジェクトコードと効果的に結び付けることができ,仕様駆動型ソフトウェア開発をサポートできることが示唆された。
関連論文リスト
- IFEvalCode: Controlled Code Generation [69.28317223249358]
本稿では,Code LLMの命令追従能力を改善するために,前方および後方制約生成を提案する。
IFEvalCodeは、7つのプログラミング言語の1.6Kテストサンプルからなる多言語ベンチマークである。
論文 参考訳(メタデータ) (2025-07-30T08:08:48Z) - Codev-Bench: How Do LLMs Understand Developer-Centric Code Completion? [60.84912551069379]
Code-Development Benchmark (Codev-Bench)は、細粒度で現実世界、リポジトリレベル、開発者中心の評価フレームワークです。
Codev-Agentは、リポジトリのクローリングを自動化し、実行環境を構築し、既存のユニットテストから動的呼び出しチェーンを抽出し、データ漏洩を避けるために新しいテストサンプルを生成するエージェントベースのシステムである。
論文 参考訳(メタデータ) (2024-10-02T09:11:10Z) - A Comprehensive Framework for Evaluating API-oriented Code Generation in Large Language Models [14.665460257371164]
GitHub CopilotやChatGPTのような大規模言語モデル(LLM)は、コード生成の強力なツールとして登場した。
API指向コード生成におけるLLMの機能を評価するために設計されたフレームワークであるAutoAPIEvalを提案する。
論文 参考訳(メタデータ) (2024-09-23T17:22:09Z) - Iterative Refinement of Project-Level Code Context for Precise Code Generation with Compiler Feedback [29.136378191436396]
我々は,コンパイラフィードバックを用いてLLM生成コードを改善する新しいコード生成手法であるCoCoGenを提案する。
CoCoGenは、まず静的解析を利用して、生成されたコードとプロジェクトのコンテキストのミスマッチを特定する。
その後、コードリポジトリから抽出された情報を使用して、識別されたエラーを反復的に調整し、修正する。
論文 参考訳(メタデータ) (2024-03-25T14:07:27Z) - Test-Driven Development for Code Generation [0.850206009406913]
大きな言語モデル(LLM)は、問題ステートメントから直接コードスニペットを生成する重要な機能を示している。
本稿では,テスト駆動開発(TDD)をAI支援コード生成プロセスに組み込む方法について検討する。
論文 参考訳(メタデータ) (2024-02-21T04:10:12Z) - ReACC: A Retrieval-Augmented Code Completion Framework [53.49707123661763]
本稿では,語彙のコピーと類似したセマンティクスを持つコード参照の両方を検索により活用する検索拡張コード補完フレームワークを提案する。
我々は,Python および Java プログラミング言語のコード補完タスクにおけるアプローチを評価し,CodeXGLUE ベンチマークで最先端のパフォーマンスを実現する。
論文 参考訳(メタデータ) (2022-03-15T08:25:08Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。