論文の概要: LLM-Based Code Documentation Generation and Multi-Judge Evaluation
- arxiv url: http://arxiv.org/abs/2606.09852v1
- Date: Mon, 11 May 2026 11:17:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-06-15 07:09:36.805517
- Title: LLM-Based Code Documentation Generation and Multi-Judge Evaluation
- Title(参考訳): LLMに基づくコードドキュメンテーション生成とマルチジャッジ評価
- Abstract要約: コードとリポジトリからドキュメンテーションを生成するAIフレームワークを提案する。
PocketFlowオーケストレーションフレームワーク上に構築されたこのシステムは、構造化されたコンテキスト対応のドキュメントを生成するために、モジュールパイプラインと高度なプロンプトエンジニアリングを適用する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: High-quality source code documentation is vital yet often neglected, especially in critical domains like healthcare where reliability and maintainability are essential. We presented an AI powered framework that automates documentation generation from code and repositories using eight state of the art Large Language Models (LLMs), including GPT, Gemini, Qwen, and LLaMA variants. Built on the PocketFlow orchestration framework, the system applies modular pipelines and advanced prompt engineering to produce structured, context aware documentation. To ensure quality and guide model selection, we introduced a MultiLLMasJudges evaluation framework, where four independent LLMs assess outputs across nine criteria, such as Completeness, Clarity, and Faithfulness. Experiments conducted on an open-source medical physics library, demonstrated showed a 42% performance gap between top and bottom models. By combining diverse model outputs, optimized prompting, and rigorous evaluation, our approach enhances documentation quality and reduces manual effort, especially in safety critical healthcare software.
- Abstract(参考訳): 高品質なソースコードドキュメンテーションは不可欠だが、特に信頼性と保守性が不可欠である医療のような重要な領域では無視されることが多い。
我々は、GPT、Gemini、Qwen、LLaMAなど8つの最先端のLarge Language Model(LLM)を使用して、コードとリポジトリからドキュメントを生成するAIベースのフレームワークを紹介した。
PocketFlowオーケストレーションフレームワーク上に構築されたこのシステムは、構造化されたコンテキスト対応のドキュメントを生成するために、モジュールパイプラインと高度なプロンプトエンジニアリングを適用する。
そこで我々は,MultiLLMasJudges評価フレームワークを導入し,4つの独立したLCMが完全性,明確性,忠実性などの9つの基準のアウトプットを評価した。
オープンソースの物理ライブラリで実施された実験では、トップモデルとボトムモデルの間に42%のパフォーマンス差が見られた。
多様なモデルアウトプット、最適化プロンプト、厳密な評価を組み合わせることで、ドキュメントの品質を高め、特に安全クリティカルな医療ソフトウェアにおいて手作業を削減する。
関連論文リスト
- From Metrics to Improvement: A Lifecycle-Aware LLM Feedback Framework for Research Software Quality [8.460186703921934]
研究ソフトウェアは、ソフトウェア工学の専門知識が限られている研究者によってしばしば開発される。
これは、メンテナンス性、再利用性、持続可能性を妨げる品質上の問題を引き起こす可能性がある。
本稿では,Large Language Model (LLM) に基づくコード修正と,定量的ソフトウェア品質評価を統合したライフサイクル認識フレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-24T11:28:26Z) - Simulation Code Generation for Fluid Systems using Large Language Models: Benchmarking Models and Prompting Strategies [0.8983000676504388]
大規模言語モデル(LLM)は、自然言語仕様から構文的に正しいコードを生成する強力な能力を示している。
本研究では, LLMを用いて流体系モデルの中立グラフ表現を自動的に実行可能コードに変換する方法について検討する。
論文 参考訳(メタデータ) (2026-07-31T13:09:00Z) - Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production [0.0]
大規模言語モデル(LLM)は、オープンエンド推論や生成言語タスクにおいて強力な機能を示している。
固定ラベル空間を用いた構造化テキスト分類問題に対して、モデル選択は予測性能のみによって駆動されることが多い。
BERTファミリーの細調整エンコーダを用いたモデルでは、競争力があり、しばしば優れた分類性能が得られることを示す。
論文 参考訳(メタデータ) (2026-02-06T03:54:28Z) - Automated and Context-Aware Code Documentation Leveraging Advanced LLMs [0.0]
既存の自動化アプローチは主にコードの要約に重点を置いており、テンプレートベースのドキュメント生成のギャップを残している。
我々は,現代Javaからの重要な構造情報と意味情報を含む,Javadoc生成のための新しいコンテキスト対応データセットを開発する。
LLaMA-3.1, Gemma Phi-3, Mistral, Qwen-2.5を含む5つのオープンソースLCMをゼロショット, 少数ショット, 微調整設定を用いて評価し, その性能の比較分析を行った。
論文 参考訳(メタデータ) (2025-09-16T06:27:09Z) - DocRefine: An Intelligent Framework for Scientific Document Understanding and Content Optimization based on Multimodal Large Model Agents [25.190790899297788]
DocRefineは、インテリジェントな理解、コンテンツの改良、科学的なPDF文書の自動要約のために設計された革新的なフレームワークである。
6つの専門的かつ協調的なエージェントからなる洗練されたマルチエージェントシステムを編成する。
さまざまなタスクにおいて、最先端のベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2025-08-09T15:32:52Z) - Are We on the Right Way for Assessing Document Retrieval-Augmented Generation? [16.717935491483146]
Double-Benchは、大規模、多言語、マルチモーダル評価システムである。
ドキュメントRAGシステム内の各コンポーネントに対してきめ細かい評価を行う。
3,276のドキュメント(72,880ページ)と6言語で5,168のシングルホップクエリで構成されている。
論文 参考訳(メタデータ) (2025-08-05T16:55:02Z) - Training Language Models to Generate Quality Code with Program Analysis Feedback [66.0854002147103]
大規模言語モデル(LLM)によるコード生成は、ますます本番環境で採用されているが、コード品質の保証には失敗している。
実運用品質のコードを生成するためにLLMにインセンティブを与える強化学習フレームワークであるREALを提案する。
論文 参考訳(メタデータ) (2025-05-28T17:57:47Z) - M-DocSum: Do LVLMs Genuinely Comprehend Interleaved Image-Text in Document Summarization? [49.53982792497275]
本稿では,LVLM(Large Vision-Language Models)が文書中のインターリーブ画像テキストを真に理解しているかどうかを検討する。
既存の文書理解ベンチマークは、しばしば質問応答形式を用いてLVLMを評価する。
マルチモーダル文書要約ベンチマーク(M-DocSum-Bench)について紹介する。
M-DocSum-Benchは500の高品質なarXiv論文と、人間の好みに合わせたインターリーブされたマルチモーダル要約で構成されている。
論文 参考訳(メタデータ) (2025-03-27T07:28:32Z) - UltraEval: A Lightweight Platform for Flexible and Comprehensive Evaluation for LLMs [74.1976921342982]
本稿では,ユーザフレンドリな評価フレームワークであるUltraEvalを紹介し,その軽量性,包括性,モジュール性,効率性を特徴とする。
その結果のコンポーザビリティにより、統一された評価ワークフロー内で、さまざまなモデル、タスク、プロンプト、ベンチマーク、メトリクスを自由に組み合わせることができる。
論文 参考訳(メタデータ) (2024-04-11T09:17:12Z) - FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability [70.84333325049123]
FoFoは、大規模言語モデル(LLM)の複雑なドメイン固有のフォーマットに従う能力を評価するための先駆的なベンチマークである。
本稿では,大規模言語モデル(LLM)の複雑なドメイン固有フォーマットに従う能力を評価するための先駆的ベンチマークであるFoFoを提案する。
論文 参考訳(メタデータ) (2024-02-28T19:23:27Z) - Exploring Precision and Recall to assess the quality and diversity of LLMs [82.21278402856079]
我々はtextscLlama-2 や textscMistral のような大規模言語モデル (LLM) のための新しい評価フレームワークを提案する。
このアプローチにより、コーパスの整合を必要とせず、生成したテキストの品質と多様性を微妙に評価できる。
論文 参考訳(メタデータ) (2024-02-16T13:53:26Z) - Language Models Enable Simple Systems for Generating Structured Views of Heterogeneous Data Lakes [54.13559879916708]
EVAPORATEは大規模言語モデル(LLM)を利用したプロトタイプシステムである。
コード合成は安価だが、各文書をLSMで直接処理するよりもはるかに正確ではない。
直接抽出よりも優れた品質を実現する拡張コード実装EVAPORATE-CODE+を提案する。
論文 参考訳(メタデータ) (2023-04-19T06:00:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。