論文の概要: Single-Language Evidence Is Insufficient for Automated Logging: A Multilingual Benchmark and Empirical Study with LLMs
- arxiv url: http://arxiv.org/abs/2604.17529v1
- Date: Sun, 19 Apr 2026 16:43:17 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-21 21:52:52.572265
- Title: Single-Language Evidence Is Insufficient for Automated Logging: A Multilingual Benchmark and Empirical Study with LLMs
- Title(参考訳): シングルランゲージの証拠は自動ロギングには不十分である: LLMを用いた多言語ベンチマークと実証的研究
- Authors: Renyi Zhong, Yichen Li, Yulun Wu, Jinxi Kuang, Yintong Huo, Michael R. Lyu,
- Abstract要約: 本稿では,6つのプログラミング言語エコシステムにまたがるベンチマークおよび実証研究であるMultiLogBenchについて述べる。
統一されたプロトコル下での7つの現代の大規模言語モデルを用いて、ロギングサイトローカライゼーション、フレームワーク・アンカーマッチング、重大度予測、メッセージ生成、変数回復、そしてケースドされた全体的な品質を評価する。
- 参考スコア(独自算出の注目度): 39.533189552746116
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Logging statements are central to debugging, failure diagnosis, and production observability, yet writing them requires developers to decide where to place a logging statement, which API and severity level to use, and what runtime information to expose. Automated logging aims to reduce this burden, but existing evidence remains dominated by Java-centric repository-snapshot dataset. It is therefore unclear whether conclusions about model behavior and model selection generalize across programming-language ecosystems or realistic code evolution. This paper presents MultiLogBench, a multilingual benchmark and empirical study spanning six programming language ecosystems. MultiLogBench contains 63,965 production-code repository-snapshot instances, 744 revision-history cases where developers introduce logging statements during maintenance, and a paired transformed revision-history branch for robustness analysis. Using seven contemporary large language models under a unified protocol, we evaluate logging-site localization, framework-anchor matching, severity prediction, message generation, variable recovery, and cascaded overall quality. Results show clear cross-language variation: framework-anchor matching is the most language-sensitive component, loop and nested-callable sites are the hardest structural contexts, and model rankings are stable only at the top tier. These patterns persist at a coarse level on revision-history data, while transformed inputs do not cause a broad same-direction performance collapse. Overall, MultiLogBench shows that robust claims about automated logging require multilingual evaluation and maintenance-oriented validation.
- Abstract(参考訳): ロギングステートメントは、デバッグ、障害診断、運用可観測性の中心であるが、それを書くには、開発者はロギングステートメントをどこに配置するか、使用するAPIと重大度レベル、公開するランタイム情報を決定する必要がある。
自動ロギングはこの負担を軽減することを目的としているが、既存の証拠はJava中心のリポジトリ・スナップショットデータセットに支配されている。
したがって、モデル行動とモデル選択に関する結論がプログラミング言語のエコシステム全体にわたって一般化されるのか、それとも現実的なコード進化なのかは不明である。
本稿では、6つのプログラミング言語エコシステムにまたがるマルチ言語ベンチマークと実証研究であるMultiLogBenchについて述べる。
MultiLogBenchには、63,965のプロダクションコードリポジトリスナップショットインスタンス、開発者がメンテナンス中にロギングステートメントを導入する744のリビジョンヒストリーケース、堅牢性分析のためのペア化されたリビジョンヒストリーブランチが含まれている。
統一されたプロトコル下での7つの現代の大規模言語モデルを用いて、ロギングサイトローカライゼーション、フレームワーク・アンカーマッチング、重大度予測、メッセージ生成、変数回復、そしてケースドされた全体的な品質を評価する。
フレームワーク-アンカーマッチングが最も言語に敏感なコンポーネントであり、ループとネストしたコール可能なサイトは最も構造的なコンテキストであり、モデルランキングは最上位層でしか安定しない。
これらのパターンは、リビジョン履歴データ上で粗いレベルで持続するが、変換された入力は、広範囲な同方向性能の崩壊を引き起こすことはない。
全体としてMultiLogBenchは、自動ロギングに関する堅牢な主張は、多言語評価とメンテナンス指向の検証を必要とすることを示している。
関連論文リスト
- Identifying Concurrency Bug Reports via Linguistic Patterns [5.794959117360381]
本稿では,バグ報告を自動的に識別する言語パターンに基づくフレームワークを提案する。
730件のバグレポートから58件の言語パターンを抽出した。
我々は,従来の機械学習,大規模言語モデル,事前学習された言語モデルにおいて,マッチング,学習,プロンプトベース,微調整の4つの補完的アプローチを評価する。
論文 参考訳(メタデータ) (2026-01-22T21:54:14Z) - MRG-Bench: Evaluating and Exploring the Requirements of Context for Repository-Level Code Generation [0.7342677574855649]
大規模言語モデルのより正確な評価を提供する新しいデータセットである textbfMRG-Bench を紹介する。
我々は,大規模言語モデル,長期コンテキストモデル,RAG関連手法を含む実験を行う。
その結果、ほとんどの手法は「ユーザ要求を理解することの難しさ」に悩まされており、割り当てられたタスクを正確に理解できないことがわかった。
論文 参考訳(メタデータ) (2025-08-05T01:53:45Z) - Larger Is Not Always Better: Exploring Small Open-source Language Models in Logging Statement Generation [33.501853395036534]
自動ロギングステートメント生成のための大規模言語モデル(LLM)には、プライバシとリソースの問題がある。
本稿では,ロギングステートメントの自動生成のための小規模なオープンソース言語モデル(SOLM)を評価するための大規模な実証的研究について述べる。
論文 参考訳(メタデータ) (2025-05-22T12:26:53Z) - Skeleton-Guided-Translation: A Benchmarking Framework for Code Repository Translation with Fine-Grained Quality Evaluation [37.25839260805938]
Skeleton-Guided-Translationは、リポジトリレベルのJavaからC#へのコード変換のためのフレームワークで、きめ細かい品質評価がある。
本稿では,高品質なオープンソースJavaレポジトリとその対応するC#スケルトンベンチマークであるTransREPO-BENCHを紹介する。
論文 参考訳(メタデータ) (2025-01-27T13:44:51Z) - BabelBench: An Omni Benchmark for Code-Driven Analysis of Multimodal and Multistructured Data [61.936320820180875]
大規模言語モデル(LLM)は、様々な領域でますます重要になっている。
BabelBenchは、コード実行によるマルチモーダルなマルチ構造化データ管理におけるLLMの熟練度を評価する革新的なベンチマークフレームワークである。
BabelBenchの実験結果から,ChatGPT 4のような最先端モデルでさえ,大幅な改善の余地があることが示唆された。
論文 参考訳(メタデータ) (2024-10-01T15:11:24Z) - Teaching Large Language Models to Self-Debug [62.424077000154945]
大規模言語モデル(LLM)は、コード生成において素晴らしいパフォーマンスを達成した。
本稿では,大規模言語モデルで予測プログラムを数発のデモでデバッグする自己デバッグを提案する。
論文 参考訳(メタデータ) (2023-04-11T10:43:43Z) - BenchCLAMP: A Benchmark for Evaluating Language Models on Syntactic and
Semantic Parsing [55.058258437125524]
本稿では,制約付きLanguage Model Parsingを評価するベンチマークであるBenchCLAMPを紹介する。
APIを通じてのみ利用可能な2つのGPT-3変種を含む8つの言語モデルをベンチマークする。
実験により,エンコーダ-デコーダ事前学習言語モデルでは,モデル出力が有効であると制約された場合に,構文解析や意味解析の最先端手法を超えることができることがわかった。
論文 参考訳(メタデータ) (2022-06-21T18:34:11Z) - TextFlint: Unified Multilingual Robustness Evaluation Toolkit for
Natural Language Processing [73.16475763422446]
NLPタスク(TextFlint)のための多言語ロバスト性評価プラットフォームを提案する。
普遍的なテキスト変換、タスク固有の変換、敵攻撃、サブポピュレーション、およびそれらの組み合わせを取り入れ、包括的な堅牢性分析を提供する。
TextFlintは、モデルの堅牢性の欠点に対処するために、完全な分析レポートとターゲットとした拡張データを生成します。
論文 参考訳(メタデータ) (2021-03-21T17:20:38Z) - Robust and Transferable Anomaly Detection in Log Data using Pre-Trained
Language Models [59.04636530383049]
クラウドのような大規模コンピュータシステムにおける異常や障害は、多くのユーザに影響を与える。
システム情報の主要なトラブルシューティングソースとして,ログデータの異常検出のためのフレームワークを提案する。
論文 参考訳(メタデータ) (2021-02-23T09:17:05Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。