論文の概要: Code Sharing In Prediction Model Research: A Scoping Review
- arxiv url: http://arxiv.org/abs/2604.06212v1
- Date: Mon, 16 Mar 2026 15:21:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-04-12 18:41:08.642164
- Title: Code Sharing In Prediction Model Research: A Scoping Review
- Title(参考訳): 予測モデル研究におけるコードの共有: スコープレビュー
- Abstract要約: ReviewはTRIPOD-Codeの開発を知らせるために、現在のコード共有プラクティスを定量化する。
コード共有は時間とともに増加し、2025年には15.8%に達した。
予測モデル研究では、コード共有は依然として比較的稀であり、共有されると再利用可能な状態に陥ることが多い。
- 参考スコア(独自算出の注目度): 3.5537643715513227
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Analytical code is essential for reproducing diagnostic and prognostic prediction model research, yet code availability in the published literature remains limited. While the TRIPOD statements set standards for reporting prediction model methods, they do not define explicit standards for repository structure and documentation. This review quantifies current code-sharing practices to inform the development of TRIPOD-Code, a TRIPOD extension reporting guideline focused on code sharing. We conducted a scoping review of PubMed-indexed articles citing TRIPOD or TRIPOD+AI as of Aug 11, 2025, restricted to studies retrievable via the PubMed Central Open Access API. Eligible studies developed, updated, or validated multivariable prediction models. A large language model-assisted pipeline was developed to screen articles and extract code availability statements and repository links. Repositories were assessed with the same LLM against 14 predefined reproducibility-related features. Our code is made publicly available. Among 3,967 eligible articles, 12.2% included code sharing statements. Code sharing increased over time, reaching 15.8% in 2025, and was higher among TRIPOD+AI-citing studies than TRIPOD-citing studies. Sharing prevalence varied widely by journal and country. Repository assessment showed substantial heterogeneity in reproducibility features: most repositories contained a README file (80.5%), but fewer specified dependencies (37.6%; version-constrained 21.6%) or were modular (42.4%). In prediction model research, code sharing remains relatively uncommon, and when shared, often falls short of being reusable. These findings provide an empirical baseline for the TRIPOD-Code extension and underscore the need for clearer expectations beyond code availability, including documentation, dependency specification, licensing, and executable structure.
- Abstract(参考訳): 解析コードは診断および予後予測モデル研究の再現に不可欠であるが、刊行された文献のコード利用は限られている。
TRIPODステートメントは予測モデルメソッドを報告するための標準を設定しているが、リポジトリ構造とドキュメントの明確な標準を定義していない。
本レビューは,TRIPOD拡張レポートガイドラインであるTRIPOD-Codeの開発を通知するために,現在のコード共有プラクティスを定量化する。
2025年8月11日現在, TRIPOD または TRIPOD+AI を引用したPubMed-indexed の記事のスコーピングレビューを行い, PubMed Central Open Access API で検索可能な研究に限定した。
信頼できる研究は多変量予測モデルを開発し、更新し、検証した。
大規模な言語モデル支援パイプラインが開発され、記事の表示とコードアベイラビリティーステートメントとリポジトリリンクの抽出が行われた。
リポジトリは14の再現性に関連する特徴に対して同じLDMで評価した。
私たちのコードは公開されています。
3,967の論文のうち、12.2%はコード共有ステートメントを含んでいた。
コード共有は時間とともに増加し、2025年には15.8%に達した。
共有の頻度は、雑誌や国によって様々であった。
ほとんどのリポジトリにはREADMEファイル(80.5%)が含まれていたが、特定の依存関係(37.6%、バージョン制約21.6%)が少ないか、モジュール(42.4%)であった。
予測モデル研究では、コード共有は依然として比較的稀であり、共有されると再利用可能な状態に陥ることが多い。
これらの発見は、TRIPOD-Code拡張の実証的なベースラインを提供し、ドキュメント、依存性仕様、ライセンス、実行可能な構造を含む、コードの可用性以上の、より明確な期待の必要性を強調している。
関連論文リスト
- Vibe Coding in Software Development: A Multivocal Literature Review [2.1794203097646125]
ビブコーディング(Vibe coding)は、開発者が自然言語への意図を述べ、大きな言語モデルがコードを生成するソフトウェア開発のプラクティスである。
我々の知る限り、既存のレビューは、バイブコーディングに関するピアレビューとグレーの文献をまだ統合していない。
これは、ピアレビューとグレーの文献を単一の文書化されたプロトコルでビブコーディングに統合した最初のレビューの1つである。
論文 参考訳(メタデータ) (2026-07-22T17:43:41Z) - Empirical Study on the Characteristics and Evolution of AI-usage in GitHub Repositories: Evidence from Code Comments [7.213400161126317]
私たちは、AIの使用と関連するコードブロックを明示的に参照する、35,361のGitHubコードコメントを分析します。
最初に500のユニークなコメントとコードブロックをオープンにし、AI支援開発活動の分類を導き出しました。
次に、2つのLCMベースの分類器と、Dawid-Skene予測最大化による集約予測を用いて、全データセットに注釈を付ける。
論文 参考訳(メタデータ) (2026-06-05T02:37:44Z) - CIDR: A Large-Scale Industrial Source Code Dataset for Software Engineering Research [0.0]
データセットは、138言語にまたがる2,440のリポジトリで構成され、総コード数は373万行で、リポジトリごとのメタデータが構造化されている。
このデータセットは、コードインテリジェンス、ソフトウェア品質分析、コード言語モデルの事前トレーニングと微調整、開発者行動研究、エージェント評価ベンチマークの構築をサポートすることを意図している。
論文 参考訳(メタデータ) (2026-05-12T14:07:17Z) - Leveraging Large Language Models to Extract and Translate Medical Information in Doctors' Notes for Health Records and Diagnostic Billing Codes [0.0]
本論文では,オープンウェイトなLarge Language Models (LLMs) を用いて医師ノートから臨床情報を抽出し,クラウドベースのサービスに依存しないICD-10-CM診断コードに変換する。
複数のオープンウェイトモデルを評価するために、Ollama、LangChain、コンテナ化された環境を使用して、プライバシを重視したパイプラインが開発された。
その結果、厳密なスキーマ適用は100%近いコンプライアンスを達成したが、より小さなモデルでは、特定の診断符号の正確な生成は困難であることが判明した。
論文 参考訳(メタデータ) (2026-01-14T12:21:12Z) - Probability-Biased Attention over Directed Bipartite Graphs for Long-Tail ICD Coding [12.66839524860715]
コード間の微粒な共起関係をモデル化する学習手法を提案する。
提案手法は,Macro-F1において特に顕著な改良を施した最先端性能を実現する。
論文 参考訳(メタデータ) (2025-10-31T04:47:09Z) - CodeRAG: Finding Relevant and Necessary Knowledge for Retrieval-Augmented Repository-Level Code Completion [11.329578913209623]
リポジトリレベルのコード補完は、リポジトリからのより広範な情報に基づいて、未完成のコードを自動的に予測する。
CodeRAGは、リポジトリレベルのコード補完を検索するために必要な知識を特定するためのフレームワークである。
論文 参考訳(メタデータ) (2025-09-19T15:57:40Z) - CoCoNUTS: Concentrating on Content while Neglecting Uninformative Textual Styles for AI-Generated Peer Review Detection [60.52240468810558]
我々は、AI生成ピアレビューの詳細なデータセットの上に構築されたコンテンツ指向ベンチマークであるCoCoNUTSを紹介する。
また、マルチタスク学習フレームワークを介してAIレビュー検出を行うCoCoDetを開発し、レビューコンテンツにおけるAIのより正確で堅牢な検出を実現する。
論文 参考訳(メタデータ) (2025-08-28T06:03:11Z) - Towards A Generalist Code Embedding Model Based On Massive Data Synthesis [35.04242699869519]
汎用コード検索のための最先端の埋め込みモデルである textbfCodeR (underlineCode underlineRetrieval) を導入する。
CodeRの優れたパフォーマンスは、DRU原則に基づいて構築された大規模な合成データセットであるCodeR-Pile上に構築されている。
論文 参考訳(メタデータ) (2025-05-19T04:37:53Z) - Is Compression Really Linear with Code Intelligence? [60.123628177110206]
textitFormat Annealingは、事前訓練されたモデルの本質的な能力を同等に評価するために設計された、軽量で透明なトレーニング手法である。
我々の経験的結果は、測定されたコードインテリジェンスとビット・パー・キャラクタ(BPC)の基本的な対数関係を明らかにする。
私たちの研究は、コードインテリジェンスの開発における圧縮の役割をより微妙に理解し、コードドメインにおける堅牢な評価フレームワークに貢献します。
論文 参考訳(メタデータ) (2025-05-16T16:59:14Z) - CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval [103.116634967815]
CodeXEmbedは400Mから7Bパラメータの大規模なコード埋め込みモデルのファミリーである。
我々の新しいトレーニングパイプラインは、複数のプログラミング言語を統合し、様々なコード関連タスクを共通の検索フレームワークに変換する。
私たちの7Bモデルは、コード検索において新しい最先端(SOTA)を設定し、以前の主要なモデルであるVoyage-CodeをCoIRベンチマークで20%以上上回っています。
論文 参考訳(メタデータ) (2024-11-19T16:54:45Z) - OpenCoder: The Open Cookbook for Top-Tier Code Large Language Models [76.59316249991657]
コードのための大規模言語モデル(LLM)は、コード生成、推論タスク、エージェントシステムなど、さまざまな領域で必須になっている。
オープンアクセスのコード LLM はプロプライエタリなモデルの性能レベルに近づきつつあるが、高品質なコード LLM は依然として限られている。
トップクラスのコードLLMであるOpenCoderは、主要なモデルに匹敵するパフォーマンスを達成するだけでなく、研究コミュニティの"オープンクックブック"としても機能します。
論文 参考訳(メタデータ) (2024-11-07T17:47:25Z) - VersiCode: Towards Version-controllable Code Generation [58.82709231906735]
大規模言語モデル(LLM)は、コード生成において大きな進歩を遂げていますが、既存の研究は、ソフトウェア開発の動的な性質を説明できません。
バージョン別コード補完(VSCC)とバージョン別コードマイグレーション(VACM)の2つの新しいタスクを提案する。
VersiCodeについて広範な評価を行い、バージョン管理可能なコード生成が確かに重要な課題であることを示した。
論文 参考訳(メタデータ) (2024-06-11T16:15:06Z) - DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories [83.5195424237358]
既存のベンチマークは、現実世界のコードリポジトリと不整合である。
我々はDevEvalという新しいベンチマークを提案し、これは3つの進歩がある。
DevEvalは117のリポジトリから1,874のサンプルを持ち、10の人気のあるドメインをカバーする。
論文 参考訳(メタデータ) (2024-05-30T09:03:42Z) - MDACE: MIMIC Documents Annotated with Code Evidence [7.200839302089557]
本稿では,長期医療文書上での極端に多ラベルな分類課題に対するエビデンス/リレール抽出のためのデータセットを提案する。
このデータセットは、302の入院患者チャート、3,934のエビデンス、52のプロフィーチャート、5,563のエビデンスで構成されている。
論文 参考訳(メタデータ) (2023-07-07T22:45:59Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。