論文の概要: Measuring the Installed Base: Nordic Health Dataset Catalogues Against HealthDCAT-AP Release 7
- arxiv url: http://arxiv.org/abs/2608.27720v1
- Date: Thu, 27 Aug 2026 21:23:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-31 17:16:04.151798
- Title: Measuring the Installed Base: Nordic Health Dataset Catalogues Against HealthDCAT-AP Release 7
- Title(参考訳): インストールベースの測定:HealthDCAT-APリリース7に対する北欧の健康データセットカタログ
- Abstract要約: 2026年8月25日、欧州のデータポータルが収集した北欧の11のカタログには2,811のデータセットが記載されている。
HealthDCAT-APがデータセットに必須とする8つのプロパティをすべて満足する人はいません。
北欧のカタログは評価の上位に到達せず、11の5つはDCAT-AP準拠の0パーセントで報告されている。
我々は、語彙、形、収穫者の情報を公開し、すべての評定をデータセットの特性ではなく、日付付き観測として記録し、この規律が出版前に捉えた5つの誤りを報告します。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The European Health Data Space requires member states to publish machine readable descriptions of the health datasets available for secondary use, and the European Commission publishes HealthDCAT-AP as the metadata profile those descriptions are meant to satisfy. The profile has been designed and validated against curated examples, never against the catalogues already live. We report that measurement for the Nordic region. On 25 August 2026 the 11 Nordic national catalogues harvested by the European data portal held 2,811 dataset descriptions carrying the EU health theme, and none satisfies all eight properties HealthDCAT-AP Release 7 makes mandatory on a dataset. Three of the eight are present on exactly zero records across five countries. Set beside the portal's own quality assessment, which validates DCAT-AP and never mentions the health profile, this is not a health extension skipped on top of sound generic practice: no Nordic catalogue reaches the assessment's top rating band, 5 of the 11 are reported at zero per cent DCAT-AP compliant, and the properties surviving in both layers are the ones a human types into a form, not the ones needing a value bound to a controlled vocabulary. Two further results follow. Finland contributes 2,259 descriptions to the European portal of which 1,146 carry a theme, and not one uses the EU theme authority vocabulary, so a European health filter returns no Finnish dataset at all. Separately, the authority namespace answers HTTP 200 with a well formed empty document for terms it never defined, letting 1,238 datasets across the wider portal carry theme IRIs that resolve to nothing while passing any status code check. We publish the vocabulary, the shapes and the harvesters, record every verdict as a dated observation rather than a property of the dataset, and report the five errors this discipline caught before publication.
- Abstract(参考訳): 欧州保健データ空間は加盟国に対して、二次使用が可能な健康データセットの機械可読な説明を発行することを求めており、欧州委員会は、それらの説明が満足するためのメタデータプロファイルとしてHealthDCAT-APを発行している。
プロファイルはキュレートされた例に対して設計され、検証されている。
我々はこの測定を北欧地域で報告する。
2026年8月25日、欧州データポータルが収集した北欧の11の国別カタログは、EUの健康テーマを含む2,811のデータセット記述を持ち、HealthDCAT-AP Release 7がデータセットに必須である8つのプロパティすべてを満たすものはない。
8か国のうち3か国は5か国で正確にゼロの記録に登録されている。
DCAT-APを検証し、健康状態に言及しないポータル自身の品質評価に加えて、これはサウンドジェネリックなプラクティスの上にスキップされた健康拡張ではない: 評価の最高評価帯域にノルディックカタログは到達せず、11の5つはDCAT-AP準拠の0パーセントで報告される。
さらに2つの結果が得られた。
フィンランドは2,259の記載を欧州ポータルに提供しており、そのうち1,146がテーマを持ち、EUのテーマ・オーソリティ・ボキャブラリを使用していないため、欧州保健フィルターはフィンランドのデータセットを全く返さない。
別として、権限名称空間はHTTP 200に、定義されていない用語について、よく形成された空のドキュメントで回答する。
我々は、語彙、形、収穫者の情報を公開し、すべての評定をデータセットの特性ではなく、日付付き観測として記録し、この規律が出版前に捉えた5つの誤りを報告します。
関連論文リスト
- Structural Pattern Mining in Inka Khipus: Unsupervised Clustering, Provenance Classification, and a Computational Validation of the Santa Valley Match [0.0]
54,403コードと110,677ノットからなる619 khipus の公開データベースである Open Khipu Repository (OKR) に適用した機械学習パイプラインを提案する。
我々は,khipu当たり27個の構造的特徴を設計し, (i) UMAPおよびHDBSCANを介して教師なしクラスタリングを適用し, 3つの構造的異なるグループを復元した。
我々は、n-gramとしてエンコードされた結び目型のシーケンス順序を再現し、集約的な特徴以外の信号を追加しないという負の結果を報告した。
論文 参考訳(メタデータ) (2026-06-30T21:06:38Z) - ACCORD: Action-Conditioned Contextual Grounding for Language Agents [69.73525608707764]
ACCORD(Action-Conditioned Contextual Grounding)は、適応的なグラウンドのためのエージェントフレームワークである。
現状のエージェントは、しばしばそうすることができないことを示す。それらは、観察された特定の情報よりもむしろ仮定から行動し、収集した可能性のある情報を見落とし、既に返された証拠を組み込むことに失敗する。
論文 参考訳(メタデータ) (2026-06-15T09:05:55Z) - DocAtlas: Multilingual Document Understanding Across 80+ Languages [58.715440331861295]
本稿では,82言語を対象とした高忠実度OCRデータセットとベンチマークを構築するフレームワークDocAtlasを紹介する。
我々のデュアルパイプライン、ネイティブDOCX文書の微分レンダリング、左右スクリプトの合成ベース生成は正確な構造アノテーションを生成する。
論文 参考訳(メタデータ) (2026-05-12T18:09:38Z) - VIDS: A Verified Imaging Dataset Standard for Medical AI [0.0]
既存の標準では、データセット構造、アノテーションの証明、品質ドキュメント、MLの準備にマシンで強化可能なバリデーションを提供していません。
本稿では、フォルダレイアウト、ファイルの命名、アノテーション証明スキーマ、品質文書、および2つのコンプライアンスプロファイルにわたる21のマシン強化検証ルールを定義するオープン仕様であるVIDSを提案する。
論文 参考訳(メタデータ) (2026-04-19T16:36:22Z) - GS-BrainText: A Multi-Site Brain Imaging Report Dataset from Generation Scotland for Clinical Natural Language Processing Development and Validation [1.5543568410302504]
GS-BrainTextは、ジェネレーション・スコットランドのコホートから8,511個の脳放射線学レポートを収集したデータである。
2,431が24種類の脳疾患の表現型に注釈付けされている。
このデータセットは5つのスコットランドNHSヘルスボードにまたがっており、幅広い年齢表現を含んでいる。
論文 参考訳(メタデータ) (2026-03-27T09:57:20Z) - Improving Social Determinants of Health Documentation in French EHRs Using Large Language Models [5.070772241416699]
健康の社会的決定因子(SDoH)は、健康結果、病気の進行、治療の順守、健康格差に影響を及ぼす。
本研究では,フランスの臨床ノートから13のSDoHカテゴリーを抽出するための大規模言語モデル(LLM)に基づくアプローチを提案する。
Flan-T5-Largeをフランスのナント大学病院で臨床ノートから注釈付き社会史のセクションで訓練した。
論文 参考訳(メタデータ) (2025-07-04T09:41:33Z) - ECOSoundSet: a finely annotated dataset for the automated acoustic identification of Orthoptera and Cicadidae in North, Central and temperate Western Europe [51.82780272068934]
ECOSoundSet (European Cicadidae and Orthoptera Sound dataSet) は,北欧,中央ヨーロッパ,温帯西ヨーロッパに分布する200種,24種(亜種を含む場合,それぞれ217種,26種)から10,653種を収録したデータセットである。
このデータセットは、北ヨーロッパ、中央ヨーロッパ、温帯ヨーロッパにおけるオルソプターとシカダの音響分類のための深層学習アルゴリズムの訓練のために、既にオンラインで入手可能な記録に意味のある補完となる可能性がある。
論文 参考訳(メタデータ) (2025-04-29T13:53:33Z) - MedAlign: A Clinician-Generated Dataset for Instruction Following with
Electronic Medical Records [60.35217378132709]
大型言語モデル(LLM)は、人間レベルの流布で自然言語の指示に従うことができる。
医療のための現実的なテキスト生成タスクにおけるLCMの評価は依然として困難である。
我々は、EHRデータのための983の自然言語命令のベンチマークデータセットであるMedAlignを紹介する。
論文 参考訳(メタデータ) (2023-08-27T12:24:39Z) - Few-Shot Cross-lingual Transfer for Coarse-grained De-identification of
Code-Mixed Clinical Texts [56.72488923420374]
事前学習型言語モデル (LM) は低リソース環境下での言語間移動に大きな可能性を示している。
脳卒中におけるコードミキシング(スペイン・カタラン)臨床ノートの低リソース・実世界の課題を解決するために,NER (name recognition) のためのLMの多言語間転写特性を示す。
論文 参考訳(メタデータ) (2022-04-10T21:46:52Z) - NorDiaChange: Diachronic Semantic Change Dataset for Norwegian [63.65426535861836]
NorDiaChangeはノルウェーにおける最初のダイアクロニックなセマンティックチェンジデータセットである。
ノルウェーの約80の名詞が、時間とともに格付けされた意味変化で注釈付けされている。
論文 参考訳(メタデータ) (2022-01-13T18:27:33Z) - Predicting Unplanned Readmissions with Highly Unstructured Data [0.0]
深層学習技術は、医療センターにおける患者の未計画の寛解を予測するのに成功している。
現在提案されているほとんどのモデルは、英語のテキストデータに合わせており、電子カルテは先進国で一般的な標準に従っていると仮定している。
本稿では,従来の文献のモデルに比べて構造化の少ないデータを消費する未計画の読み出しを予測するためのディープラーニングアーキテクチャを提案する。
論文 参考訳(メタデータ) (2020-03-19T23:21:00Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。