論文の概要: Evaluating Code Recommender Systems: A Review
- arxiv url: http://arxiv.org/abs/2609.30351v1
- Date: Thu, 24 Sep 2026 15:20:29 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 18:27:51.074395
- Title: Evaluating Code Recommender Systems: A Review
- Title(参考訳): コードレコメンダシステムの評価: レビュー
- Abstract要約: コードレコメンデーションシステム(コードレコメンデーションシステム、CRS)は、ソフトウェア開発者に自動的に生成されたレコメンデーションを提供するために、ソースアーティファクト上で動作する特殊なソフトウェアシステムである。
重要性の高まりにもかかわらず、これらのシステムを人間中心で評価する状況についてはほとんど分かっていない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Context: Code recommender systems (CRSs) are specialized software systems operating on source artifacts to provide automatically generated recommendations to software developers in all phases of development. The goal is to improve software quality while enhancing developers' efficiency, effectiveness, and experience. Problem: Despite the growing importance, little is known about the state of evaluating these systems in a human-centric manner. Research Approach: We conducted a systematic literature review to identify and to synthesize primary studies evaluating CRSs (2017-2024). Ninety-two publications were included and subjected to a systematic content analysis. Results: Our study confirms that Offline Evaluations are the most common, system-centric evaluation type, whereas user-centric evaluations (Online Evaluations, User Studies) are rarely reported. Evaluations are concentrated on the Software Construction phase. Most studies explicitly report threats to validity, with External threats to study Materials being the most common. Conclusion: The state of evaluations on CRSs is narrowly focused on single or a few system qualities. There is an imbalance between a majority of system-centric evaluations and a minority of user-centric evaluations. Combined, multi-type evaluations are rarely reported.
- Abstract(参考訳): コンテキスト: コードレコメンデーションシステム(CRS)は、開発の全段階において、自動生成されたレコメンデーションをソフトウェア開発者に提供するために、ソースアーティファクト上で動作する特殊なソフトウェアシステムである。
目標は、開発者の効率性、有効性、経験を高めながら、ソフトウェア品質を改善することです。
問題: 重要性が増大しているにもかかわらず、これらのシステムを人間中心の方法で評価する状況についてはほとんど分かっていない。
研究アプローチ: CRS(2017-2024)を評価する初等研究を同定し, 合成するために, 系統的な文献レビューを行った。
12冊の出版物が収録され、体系的な内容分析の対象となった。
結果:本研究では,オフライン評価が最も一般的で,システム中心評価タイプであるのに対して,ユーザ中心評価(オンライン評価,ユーザスタディ)は稀である。
評価はソフトウェア構築フェーズに集中します。
ほとんどの研究は、有効性に対する脅威を明示的に報告し、材料を最もよく研究する外部脅威を報告している。
結論: CRSの評価の状況は,単一あるいは少数のシステム品質に限定しています。
システム中心の評価の大多数とユーザ中心の評価の少数との間には不均衡がある。
複合型評価はめったに報告されない。
関連論文リスト
- Limitations of Current Evaluation Practices for Conversational Recommender Systems and the Potential of User Simulation [19.14733504795247]
本稿では,会話レコメンデーションシステム(CRS)の現在の評価実践について批判的に検討する。
静的テストコレクションへの過度な依存と,既存の評価指標の不十分という,2つの重要な制限を特定します。
本稿では,実際のユーザ満足度に適合するように設計された,一般的な報酬/コストフレームワークに基づく新しい評価指標を提案する。
論文 参考訳(メタデータ) (2025-10-07T07:12:47Z) - Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework [55.078301794183496]
我々は、高品質なピアレビューを支えるコアレビュースキル、すなわち欠陥のある研究ロジックの検出に注力する。
これは、論文の結果、解釈、クレームの間の内部の一貫性を評価することを含む。
本稿では,このスキルを制御条件下で分離し,テストする,完全自動対物評価フレームワークを提案する。
論文 参考訳(メタデータ) (2025-08-29T08:48:00Z) - ReviewEval: An Evaluation Framework for AI-Generated Reviews [9.35023998408983]
学術研究の増大は、資格のあるレビュアーの不足と相まって、ピアレビューに対する革新的なアプローチを必要としている。
本稿では,AIによるレビューを総合的に評価するフレームワークであるReviewEvalを提案する。
本稿では、AIに基づくピアレビューに不可欠な指標を確立し、学術研究におけるAI生成レビューの信頼性と影響を大幅に向上させる。
論文 参考訳(メタデータ) (2025-02-17T12:22:11Z) - Pessimistic Evaluation [58.736490198613154]
情報アクセスシステムの評価は,情報アクセスの伝統に沿わない実用的価値を前提としている。
我々は,最悪のケースユーティリティに着目した情報アクセスシステムの悲観的評価を提唱する。
論文 参考訳(メタデータ) (2024-10-17T15:40:09Z) - A Literature Review of Literature Reviews in Pattern Analysis and Machine Intelligence [51.26815896167173]
本稿では,3つの相補的な側面からPAMIレビューを総合的に分析する。
我々の分析は、現在のレビューの実践において、独特の組織パターンと永続的なギャップを明らかにします。
最後に、最先端のAI生成レビューの評価は、コヒーレンスと組織の進歩を奨励していることを示している。
論文 参考訳(メタデータ) (2024-02-20T11:28:50Z) - Unveiling Bias in Fairness Evaluations of Large Language Models: A
Critical Literature Review of Music and Movie Recommendation Systems [0.0]
生成的人工知能の台頭、特にLarge Language Models (LLMs) は、正確性とともに公正性を精査する衝動を強めている。
近年,レコメンデーションなどの領域におけるLCMの公平性評価が研究されている。
しかし、現在の公平性評価フレームワークがパーソナライズに寄与する程度は未定である。
論文 参考訳(メタデータ) (2024-01-08T17:57:29Z) - A Multicriteria Evaluation for Data-Driven Programming Feedback Systems:
Accuracy, Effectiveness, Fallibility, and Students' Response [7.167352606079407]
データ駆動型プログラミングフィードバックシステムは、初心者が人間の教師がいない状態でプログラムするのに役立つ。
先行評価の結果、これらのシステムはテストスコアやタスク完了効率の点で学習を改善していることがわかった。
これらの側面には、現在の最先端の本質的な誤認、正しい/間違ったフィードバックに対する生徒のプログラミング行動、効果的な/非効率なシステムコンポーネントが含まれる。
論文 参考訳(メタデータ) (2022-07-27T00:29:32Z) - Towards Automatic Evaluation of Dialog Systems: A Model-Free Off-Policy
Evaluation Approach [84.02388020258141]
強化学習におけるオフポリシ評価に基づく人間評価スコア推定のための新しいフレームワークであるENIGMAを提案する。
ENIGMAはいくつかの事前収集された経験データしか必要としないため、評価中にターゲットポリシーとのヒューマンインタラクションは不要である。
実験の結果,ENIGMAは人間の評価スコアと相関して既存手法よりも有意に優れていた。
論文 参考訳(メタデータ) (2021-02-20T03:29:20Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。