論文の概要: ProbSPARQL: Querying Knowledge Graphs with Multi-dimensional, Uncertain Numeric Data
- arxiv url: http://arxiv.org/abs/2607.18262v1
- Date: Sat, 16 May 2026 14:28:37 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.095295
- Title: ProbSPARQL: Querying Knowledge Graphs with Multi-dimensional, Uncertain Numeric Data
- Title(参考訳): ProbSPARQL: 多次元で不確実な数値データによる知識グラフのクエリ
- Abstract要約: SFB 1574 Circular Factoryは、返却された製品に関する情報を統合するための共有知識グラフ基盤を構築している。
現在のRDFとSPARQL技術は、調和したクエリと不確実な数値測定データの分析をネイティブにサポートしていない。
本稿では、このインフラストラクチャのアーリーステージクエリ層パイロットとして開発された、上向き互換性のあるSPARQL拡張であるProbSPARQLを紹介する。
- 参考スコア(独自算出の注目度): 12.834579846922049
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The SFB 1574 Circular Factory is building a shared knowledge graph infrastructure for integrating data about returned products. A central challenge is that circular-factory data include numeric measurements that (i) originate from sensors or are derived from sensor-based measurements, (ii) are frequently multi-dimensional, and (iii) are inherently uncertain, while downstream triage, validation, reliability-modeling, and reassembly-planning modules require queryable uncertainty representations. Current RDF and SPARQL technologies lack native support for harmonized querying and analysis of such uncertain numeric measurement data. To address this gap, we present ProbSPARQL, an upward-compatible SPARQL extension developed as an early-stage query-layer pilot for this infrastructure. ProbSPARQL models uncertain numeric values as random variables whose distributions are encoded by probabilistic RDF literal datatypes, and supports distribution-aware expressions, probabilistic filters, and divergence-based joins. We implement ProbSPARQL on Apache Jena ARQ and expose it through a Fuseki-compatible execution layer. We assess real-data applicability using project-derived measurement fragments covering GMM-encoded uncertainty and histogram-based empirical roughness distributions, and evaluate scalability separately on controlled ontology-conformant benchmarks with up to 5,000 angle-grinder instances and 1.5M triples. The results show feasible in-engine execution, filter-pushdown speedups over application-layer post-processing, and latency-accuracy trade-offs among divergence-join decision strategies.
- Abstract(参考訳): SFB 1574 Circular Factoryは、返却された製品に関する情報を統合するための共有知識グラフ基盤を構築している。
中心的な課題は、円積データには数値測定が含まれることである。
一 センサに由来するもの、又は、センサによる測定に由来するもの
(ii) しばしば多次元で、
一方、下流のトリアージ、検証、信頼性モデリング、再組み立て計画モジュールはクエリ可能な不確実性表現を必要とする。
現在のRDFとSPARQL技術は、調和したクエリとそのような不確実な数値測定データの分析をネイティブにサポートしていない。
このギャップに対処するために、このインフラストラクチャの初期段階のクエリ層パイロットとして開発された、上向き互換性のあるSPARQL拡張であるProbSPARQLを紹介します。
ProbSPARQLは、確率的RDFリテラルデータ型によって符号化された確率変数として不確実な数値をモデル化し、分散認識式、確率的フィルタ、分散ベースの結合をサポートする。
我々はApache Jena ARQにProbSPARQLを実装し、Fuseki互換実行層を通じて公開します。
GMMエンコードされた不確実性とヒストグラムに基づく経験的粗さ分布をカバーするプロジェクト由来の計測フラグメントを用いて実データの適用性を評価し,5,000角級のインスタンスと1.5万のトリプルを持つ制御オントロジー・コンフォーマントベンチマーク上で,スケーラビリティを別々に評価した。
その結果, エンジン内実行の実現可能性, アプリケーション層後処理によるフィルタプッシュダウン高速化, 分岐結合決定戦略間の遅延精度トレードオフが示された。
関連論文リスト
- MedSegBenchmarker: A Raw-Count-First Framework for Controlled 2D Medical Image Segmentation Benchmarks [1.0230975056328007]
MEDSEGBENCHMARKER(MSB)は,2次元データセットのベンチマーク制御のための構成駆動フレームワークである。
MSBは、評価コンテキストとともに、サンプルレベルおよびクラスレベルの画素数と予測をエクスポートする。
3つの異種2Dデータセットと256画素および512ピクセルの入力解像度で評価された複数の視覚モデルを含むケーススタディでMSBを実証した。
論文 参考訳(メタデータ) (2026-08-30T09:20:38Z) - UniPAR: A Unified Framework for Pedestrian Attribute Recognition [14.613498516126498]
歩行者属性認識のための統合トランスフォーマーベースのフレームワークUniPARを提案する。
統一されたデータスケジューリング戦略と動的分類ヘッドを組み込むことで、UniPARは単一のモデルで多様なデータセットを同時に処理できる。
MSP60K、DukeMTMC、EventPARなど、広く使われているベンチマークデータセットの実験結果は、UniPARが特別なSOTAメソッドに匹敵するパフォーマンスを達成することを実証している。
論文 参考訳(メタデータ) (2026-03-05T12:34:35Z) - Beyond Raw Detection Scores: Markov-Informed Calibration for Boosting Machine-Generated Text Detection [105.14032334647932]
機械生成テキスト(MGT)は偽情報やフィッシングなどのリスクを生じさせ、信頼性の高い検出の必要性を強調している。
MGTの統計的に区別可能な特徴を抽出するメトリックベース法は、オーバーフィットしがちな複雑なモデルベース法よりも実用的であることが多い。
本稿では,2つのコンテキスト検出スコアの関係をモデル化したマルコフ情報を用いたスコアキャリブレーション手法を提案する。
論文 参考訳(メタデータ) (2026-02-08T16:06:12Z) - TokaMark: A Comprehensive Benchmark for MAST Tokamak Plasma Models [56.94569090844015]
TokaMarkは、Mega Ampere Spherical Tokamak (MAST)から収集された実実験データに基づいてAIモデルを評価するための構造化ベンチマークである。
TokaMarkは、データ駆動型AIベースのプラズマモデリングの進歩を加速することを目的としている。
論文 参考訳(メタデータ) (2026-02-05T16:49:44Z) - Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions [50.1404916337174]
大規模言語モデル(LLM)における母国語の確率的サンプリングの大規模,統計的に活用された最初の監査について述べる。
バッチ生成は, ほぼ完全に崩壊する一方, 中央値のパスレートが13%であり, 統計的妥当性はわずかであることがわかった。
現在のLCMには機能的な内部サンプルが欠如しており、統計的保証を必要とするアプリケーションに外部ツールを使う必要があると結論付けている。
論文 参考訳(メタデータ) (2026-01-08T22:33:12Z) - SPARQL-LLM: Real-Time SPARQL Query Generation from Natural Language Questions [1.3856736555085554]
SPARQL-LLMは、軽量メタデータを利用して、自然言語テキストからSPARQLクエリを生成する、オープンソースでトリプルストアに依存しないアプローチである。
SPARQL-LLMは、チャレンジに参加している他のシステムよりも最大36倍高速で、1問あたり最大0.01ドルのコストがかかることを示す。
論文 参考訳(メタデータ) (2025-12-16T10:39:46Z) - ZeroLM: Data-Free Transformer Architecture Search for Language Models [54.83882149157548]
現在の自動プロキシ発見アプローチは、検索時間の拡張、データの過度なオーバーフィットへの感受性、構造的な複雑さに悩まされている。
本稿では,効率的な重み統計によるモデルキャパシティの定量化を目的とした,新しいゼロコストプロキシ手法を提案する。
本評価は,FlexiBERT ベンチマークで Spearman's rho 0.76 と Kendall's tau 0.53 を達成し,このアプローチの優位性を示すものである。
論文 参考訳(メタデータ) (2025-03-24T13:11:22Z) - Reducing Hallucinations in Language Model-based SPARQL Query Generation Using Post-Generation Memory Retrieval [9.860751439256754]
大型言語モデル (LLM) は、KG要素の生成時に幻覚や分布外誤差に感受性がある。
この結果、このような誤りの検出と緩和を目的とした研究が増加している。
本稿では,非パラメトリックメモリモジュールを組み込んだ KG 要素検索用モジュール PGMR を紹介する。
論文 参考訳(メタデータ) (2025-02-19T02:08:13Z) - Scalable Random Feature Latent Variable Models [8.816134440622696]
ブロック座標降下変動推論(BCD-VI)と呼ばれる明示的なPDFと新しいVBIアルゴリズムを得るために,ディリクレプロセス(DP)のスティック破断構成を導入する。
これにより、RFLVMのスケーラブルバージョン、あるいは略してSRFLVMの開発が可能になる。
論文 参考訳(メタデータ) (2024-10-23T09:22:43Z) - Source-Free Collaborative Domain Adaptation via Multi-Perspective
Feature Enrichment for Functional MRI Analysis [55.03872260158717]
安静時MRI機能(rs-fMRI)は、神経疾患の分析を助けるために多地点で研究されている。
ソース領域とターゲット領域の間のfMRIの不均一性を低減するための多くの手法が提案されている。
しかし、マルチサイト研究における懸念やデータストレージの負担のため、ソースデータの取得は困難である。
我々は、fMRI解析のためのソースフリー協調ドメイン適応フレームワークを設計し、事前訓練されたソースモデルとラベルなしターゲットデータのみにアクセスできるようにする。
論文 参考訳(メタデータ) (2023-08-24T01:30:18Z) - Feature Quantization Improves GAN Training [126.02828112121874]
識別器の特徴量子化(FQ)は、真と偽のデータの両方を共有離散空間に埋め込む。
本手法は,既存のGANモデルに容易に接続でき,訓練における計算オーバーヘッドがほとんどない。
論文 参考訳(メタデータ) (2020-04-05T04:06:50Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。