論文の概要: SEDCoT: Enhancing LLM-Based COBOL Code Translation via Symbolic Execution and Delta Debugging
- arxiv url: http://arxiv.org/abs/2607.04092v1
- Date: Sun, 05 Jul 2026 03:07:10 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.828214
- Title: SEDCoT: Enhancing LLM-Based COBOL Code Translation via Symbolic Execution and Delta Debugging
- Title(参考訳): SEDCoT:シンボル実行とデルタデバッグによるLCMベースのCOBOLコード翻訳の強化
- Authors: Phillip Entin, Wenchao Gu, Alexander Knapp, Chunyang Chen,
- Abstract要約: 古い技術や疎結合なドキュメンテーション、開発者の引退などによって、メンテナンスはますます難しくなっている。
従来のルールベースのトランスコンパイラは、読み書きが難しい出力を出力する。
本稿では,新しいC言語翻訳フレームワークであるSEDCoTを提案する。
- 参考スコア(独自算出の注目度): 49.898541267264115
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: COBOL remains critical across banking, insurance, and government infrastructure. However, maintenance is increasingly challenging due to outdated technologies, sparse documentation, and developer retirement, necessitating code translation into modern languages like C. Traditional rule-based transcompilers yield outputs that are difficult to read and maintain, while general-purpose large language models (LLMs) achieve suboptimal correctness because COBOL is a low-resource language with distinct logic patterns. To bridge this gap, we propose SEDCoT, a novel COBOL-to-C translation framework. SEDCoT first leverages LLMs for initial translation, then combines symbolic execution with LLM guidance to generate test suites and iteratively repair semantic discrepancies. Finally, it integrates delta debugging to minimize failing tests into succinct counterexamples, accelerating automated code repair. Evaluating SEDCoT on a public COBOL-to-C dataset demonstrates that it outperforms state-of-the-art baselines by at least 12% while producing translations with substantially higher readability than rule-based alternatives.
- Abstract(参考訳): COBOLは銀行、保険、政府のインフラにおいて重要な存在である。
従来のルールベースのトランスコンパイラは、読み書きが難しい出力を出力する一方、汎用的な大規模言語モデル(LLM)は、COBOLは異なる論理パターンを持つ低リソース言語であるため、最適以下である。
このギャップを埋めるため,新しいCOBOL-to-C翻訳フレームワークであるSEDCoTを提案する。
SEDCoT はまず LLM を初期翻訳に利用し、次にシンボル実行と LLM ガイダンスを組み合わせてテストスイートを生成し、意味的不一致を反復的に修復する。
最後に、デルタデバッギングを統合して、失敗するテストを簡潔な反例に最小化し、自動コード修正を高速化する。
パブリックなCOBOL-to-Cデータセット上でのSEDCoTの評価は、ルールベースの代替よりも極めて高い可読性を持つ翻訳を生成しながら、最先端のベースラインを少なくとも12%上回っていることを示している。
関連論文リスト
- Weave of Formal Thought [51.56484100374058]
WoFT(Weave of Formal Thought)は、厳密な構文的検証と学習された構造的表現を結合したパラダイムである。
本稿では,非終端文法記号を直接生成にインターリーブするために,言語モデルを訓練する潜時可変微調整法を提案する。
Pythonでは、RWS目的のStarCoder2-3Bを微調整することで、テキストのみのSFTベースラインと比較して、トーケン毎のクロスエントロピーが14.3%削減される。
論文 参考訳(メタデータ) (2026-06-24T15:58:11Z) - LLM Based Long Code Translation using Identifier Replacement [3.833075202213095]
識別子置換を組み込んだゼロショット符号変換法を提案する。
提案手法は,翻訳中にユーザから取得した長い識別子を一般化されたプレースホルダーに置き換えることで,長文翻訳の効率性と費用対効果を向上させる。
論文 参考訳(メタデータ) (2025-10-10T06:28:15Z) - Code Review Without Borders: Evaluating Synthetic vs. Real Data for Review Recommendation [37.86790434630698]
LLM(Large Language Models)は、十分なリソースを持つ言語からのコード変更を、未表現言語や新興言語の等価な変更に変換するために用いられる。
実ラベル付きデータで訓練されたモデルと比較した。
このアプローチは、自動コードレビュー機能を急速に進化するテクノロジスタックに拡張するためのスケーラブルなパスを提供する。
論文 参考訳(メタデータ) (2025-09-05T05:17:14Z) - IFEvalCode: Controlled Code Generation [69.28317223249358]
本稿では,Code LLMの命令追従能力を改善するために,前方および後方制約生成を提案する。
IFEvalCodeは、7つのプログラミング言語の1.6Kテストサンプルからなる多言語ベンチマークである。
論文 参考訳(メタデータ) (2025-07-30T08:08:48Z) - Type-Constrained Code Generation with Language Models [51.03439021895432]
本稿では,型システムを利用してコード生成を誘導する型制約デコード手法を提案する。
そこで本研究では,新しい接頭辞オートマトンと,在来型を探索する手法を開発し,LLM生成コードに適切な型付けを強制するための健全なアプローチを構築した。
提案手法は,コード合成,翻訳,修復作業において,コンパイルエラーを半分以上削減し,機能的正しさを著しく向上させる。
論文 参考訳(メタデータ) (2025-04-12T15:03:00Z) - ExeCoder: Empowering Large Language Models with Executability Representation for Code Translation [57.604506522287814]
既存の大きな言語モデル(LLM)は、事前トレーニング中にのみコードのコンテキスト意味を学習する。
機能的セマンティクスや構文構造,変数依存性といった実行可能性表現を活用するために,ExeCoderを提案する。
ExeCoderは、既存のオープンソースコードLLMを10.88%以上、38.78%以上、27.44%以上、42.97%以上という、2つのメトリクスで、最先端のパフォーマンスを実現している。
論文 参考訳(メタデータ) (2025-01-30T16:18:52Z) - Semantic Alignment-Enhanced Code Translation via an LLM-Based Multi-Agent System [24.52067108242477]
コード翻訳は、ソフトウェアマイグレーション、システムアブレーション、クロスプラットフォーム開発に不可欠である。
従来のルールベースのメソッドは手書きのルールに依存している。
最近では、LLM(Large Language Models)の進歩により、学習ベースのコード翻訳がさらに強化されている。
本稿では,構文誤りや意味的誤りを解消し,LLMに基づくコード翻訳を強化した新しいマルチエージェントシステムTransagENTを提案する。
論文 参考訳(メタデータ) (2024-09-30T02:53:03Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。