論文の概要: Domain-Specific Data Quality Analysis Using Technology-Independent Query Templates
- arxiv url: http://arxiv.org/abs/2607.24151v1
- Date: Mon, 27 Jul 2026 08:31:13 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-28 22:34:15.363142
- Title: Domain-Specific Data Quality Analysis Using Technology-Independent Query Templates
- Title(参考訳): 技術に依存しないクエリテンプレートを用いたドメイン特化データ品質分析
- Authors: Arno Kesper, Lukas Sebastian Hofmann, Markus Matoni, Gabriele Taentzer,
- Abstract要約: 品質分析はデータ品質管理の中心的な側面である。
ドメインの専門家は、品質分析を実装するのに必要なクエリ言語の専門知識を欠いていることが多い。
データ品質分析のためのテンプレートを定義するためのモデル駆動型アプローチであるQPM(Quality Pattern Model framework)を提案する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: In an increasingly data-driven world, effectively working with data depends heavily on its quality. Quality analysis is a central aspect of data quality management. As data quality is typically domain- and context-specific, the definition of quality requirements is primarily the responsibility of domain experts. However, domain experts often lack the query language expertise needed to implement quality analyses. Therefore, the process of defining quality analyses results in a resource-intensive workflow that requires the involvement of technical experts, effectively excluding domain experts from independently managing data quality. To address this challenge, we present the Quality Pattern Model framework (QPM), a model-driven approach to define templates for data quality analyses that are independent of specific database technologies and application domains. QPM can eliminate the need for deep technical expertise and prevent the need for defining quality analyses several times for different database technologies. We present a proof-of-concept implementation of this approach for three database technologies: XML, RDF, and Neo4j. We evaluate the expressiveness of our approach, its applicability in the cultural heritage domain, and its usability by domain experts. For this purpose, we conducted a qualitative user study and empirically collected quality problems in a catalog. Our findings suggest that QPM matches and even exceeds the expressiveness of common database query languages. Furthermore, the results indicate that our tool enables domain experts to define template-based quality analyses independently, without requiring support of IT experts.
- Abstract(参考訳): ますますデータ駆動の世界では、効果的にデータを扱うことは、その品質に大きく依存する。
品質分析はデータ品質管理の中心的な側面である。
データ品質は一般的にドメイン固有であり、コンテキスト固有であるため、品質要件の定義は主にドメインの専門家の責任である。
しかし、ドメインの専門家は品質分析を実装するのに必要なクエリ言語の専門知識を欠いていることが多い。
したがって、品質分析を定義するプロセスは、技術専門家の関与を必要とするリソース集約的なワークフローをもたらす。
この課題に対処するために、特定のデータベース技術やアプリケーションドメインに依存しないデータ品質分析のためのテンプレートを定義するためのモデル駆動アプローチであるQuality Pattern Model framework(QPM)を紹介します。
QPMは、深い技術的専門知識の必要性を排除し、異なるデータベース技術に対して、品質分析を何回も定義する必要がなくなる。
本稿では,XML,RDF,Neo4jの3つのデータベース技術に対して,このアプローチの概念実証実装を提案する。
我々は,我々のアプローチの表現力,文化遺産領域における適用性,ドメインの専門家による利用性を評価した。
そこで我々は,定性的なユーザスタディを行い,カタログの質問題を実証的に収集した。
以上の結果から,QPMは一般的な問合せ言語と一致し,その表現性を超えていることが示唆された。
さらに,本ツールにより,IT専門家の支援を必要とせず,テンプレートベースの品質分析を独立して定義することが可能であることが示唆された。
関連論文リスト
- A Model-Driven Pipeline for Data Quality Specification and Operationalization: A No-Code Approach for Domain Experts [0.0]
データ品質制約を形式化し、運用するためのパイプラインを提案する。
再利用可能な品質分析のためのテンプレートを定義するメタモデルであるQPMを用いて、このパイプラインをサポートします。
Constrainifyはテンプレートを特定の概念的な要件に合わせて調整し、実行可能な品質分析に変換することを可能にする。
論文 参考訳(メタデータ) (2026-07-27T10:32:26Z) - Heterogeneous Multi-Agent Modeling for Measurement and Network Analysis of the Data Service Market [50.00393065059756]
本稿では,異種マルチエージェントモデリングに基づくデータサービス市場計測とネットワーク分析手法を提案する。
サービスエコシステム理論を導入することで、データサービス市場の参加者と外部要因を明らかにする。
さらに、異種ネットワークが実用性に与える影響を正確に評価するために分析手法が考案された。
論文 参考訳(メタデータ) (2026-05-22T08:44:56Z) - DepthCharge: A Domain-Agnostic Framework for Measuring Depth-Dependent Knowledge in Large Language Models [51.56484100374058]
大きな言語モデルは一般的な質問に答えるときに有能に見えるが、ドメイン固有の詳細にプッシュされると失敗することが多い。
3つのイノベーションを通じて知識の深さを測定するドメインに依存しないフレームワークであるDepthChargeを紹介します。
モデルが実際に言及している概念に基づいてフォローアップ質問を生成する適応的探索、権威のある情報源からのオンデマンドの事実検証、あらゆる深さのサンプルサイズが一定である生存統計。
論文 参考訳(メタデータ) (2026-03-05T20:49:11Z) - Data Therapist: Eliciting Domain Knowledge from Subject Matter Experts Using Large Language Models [25.633548292173643]
Data Therapistは、ドメインの専門家が混合開始プロセスを通じて暗黙の知識を外部化するのを助けるWebベースのシステムである。
得られた構造化知識ベースは、人間と自動化された可視化設計の両方に通知することができる。
論文 参考訳(メタデータ) (2025-05-01T11:10:17Z) - Enhancing Data Quality in Federated Fine-Tuning of Foundation Models [54.757324343062734]
本稿では,基礎モデルのファインチューニングのためのデータ品質制御パイプラインを提案する。
このパイプラインは、トレーニングデータの質を反映したスコアを計算し、統一された標準のグローバルしきい値を決定する。
実験の結果,提案した品質制御パイプラインはモデルトレーニングの有効性と信頼性を向上し,性能が向上することが示された。
論文 参考訳(メタデータ) (2024-03-07T14:28:04Z) - Analyzing Dataset Annotation Quality Management in the Wild [63.07224587146207]
最先端モデルのトレーニングと評価に使用される一般的なデータセットでさえ、誤ったアノテーションやバイアス、アーティファクトの量は無視できない。
データセット作成プロジェクトに関するプラクティスやガイドラインは存在するが、品質管理の実施方法に関する大規模な分析はまだ行われていない。
論文 参考訳(メタデータ) (2023-07-16T21:22:40Z) - Unsupervised Quality Estimation for Neural Machine Translation [63.38918378182266]
既存のアプローチでは、大量の専門家アノテートデータ、計算、トレーニング時間が必要です。
MTシステム自体以外に、トレーニングや追加リソースへのアクセスが不要なQEに対して、教師なしのアプローチを考案する。
我々は品質の人間の判断と非常によく相関し、最先端の教師付きQEモデルと競合する。
論文 参考訳(メタデータ) (2020-05-21T12:38:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。