論文の概要: Automated High-Precision Extraction and Forensic Verification of Data-Bearing Vector Figures
- arxiv url: http://arxiv.org/abs/2606.31345v1
- Date: Tue, 30 Jun 2026 08:43:32 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-01 18:27:19.144029
- Title: Automated High-Precision Extraction and Forensic Verification of Data-Bearing Vector Figures
- Title(参考訳): データベアリングベクトル図の自動高精度抽出と法医学的検証
- Authors: Bowen Sun, Chaowei Xiao,
- Abstract要約: 科学と工学の量的記録は、テキストや表ではなく数字によってもたらされる。
図をグラフィックとして保存すると、そのデータは画像によって近似されず、エンコードされる。
これを3つのコントリビューションに変換します。
- 参考スコア(独自算出の注目度): 45.39546965981896
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: The quantitative record of science and engineering is increasingly carried by figures rather than text or tables, and a reader who needs the underlying numbers must usually re-digitize them by hand: slowly, imprecisely, and with no way to prove the result is faithful. Yet when a figure is stored as vector graphics, its data are not approximated by the picture but encoded in it: the renderer writes each marker and vertex at a printed precision that, for the dominant scientific toolchain, exceeds the data's own. We turn this into three contributions, one per shortcoming of hand digitization. First, a precision theory bounding how accurately data can be recovered for a given renderer and export format: bit-exact float32 for matplotlib markers, and a calibration-limited three to four significant figures end to end. Second, an automatic extractor that decodes a figure in one pass with no human in the loop, in place of the slow point-by-point tracing a digitizer demands. Third, a verification theory: recovery is injective except on a characterized, vanishingly small interval near zero; accidental agreement between unrelated data is astronomically unlikely; and a re-rendering certificate binds the recovered values to the markers, lines, and ticks the figure draws, not its text, making a result non-repudiable. With no ground truth used during recovery, decoded figures match external archives (Planck 2018 to 10^-9; the Keeling CO2 record to 5*10^-4, and one decoded figure independently reproduces a correction to the Chinchilla scaling-law confidence interval. We map the achievable precision across common renderers and their PDF, SVG, and EPS formats. What we deliver is certified data; the scientific significance of any particular dataset lies outside this paper's scope, and recovered values are candidates for human review, never accusations.
- Abstract(参考訳): 科学と工学の量的記録は、テキストや表ではなく数字によってますます持ち込まれており、基礎となる数字を必要とする読者は通常、ゆっくりと、不正確で、結果が忠実であることを示す方法がないまま、それらを手動で再デジタル化しなければならない。
レンダラーは、各マーカーと頂点を印刷精度で書き込み、支配的な科学的ツールチェーンは、データ自身を超える。
これを3つのコントリビューションに変換します。
まず、所定のレンダラーとエクスポートフォーマットに対して、どれだけ正確にデータを復元できるかをバウンドする精度理論: 行列マーカ用のbit-exact float32と、キャリブレーションに制限された3〜4つの重要な数字が終端する。
第2に、デジタイザ要求をスローポイント・バイ・ポイントトレーシングする代わりに、ループ内に人間がいない1回のパスでフィギュアをデコードする自動抽出器。
第3に、検証理論:リカバリは、特徴的でゼロに近い小さな間隔を除いて注入され、無関係なデータ間の偶発的な一致は天文学的に不可能であり、再レンダリング証明書は、回収された値をマーカー、線に結合し、そのテキストではなくフィギュアの描画を行ない、その結果を再確認不能にする。
復号された数字は、回復に使用する根拠がないため、外部のアーカイブと一致する(Planck 2018 - 10^-9, Keeling CO2 record to 5*10^-4, and one decoded figure is successfully to the Chinchilla scaling-law confidence interval)。
達成可能な精度を、一般的なレンダラーとそのPDF、SVG、ESSフォーマットにマップする。
特定のデータセットの科学的意義は、この論文の範囲外にあり、回収された値は人間のレビューの候補であり、非難されることはない。
関連論文リスト
- PointSplat: Compact Gaussian Splatting via Human-Centric Prediction [70.45838533838104]
本研究では,ハエのインプットビューから3次元人間表現を創出する新しい人間中心のアプローチであるPointSplatを提案する。
提案手法は,まず粗い幾何学的プロキシを推定し,冗長点を起点とするレイキャスティングを行う。
その後、ポイント・イメージ・トランスフォーマーを使用して外観と幾何学的特徴を融合させ、ガウスの属性を1つの前方通過で予測する。
論文 参考訳(メタデータ) (2026-06-30T17:59:05Z) - ConnectomeBench2: A Unified Benchmark for Automated Connectomic Proofreading [0.1527216171684335]
ConnectomeBench2は、716,485以上の専門家がラベル付けした証明読解決定を統一した多種データセットです。
メッシュ幾何学と電子顕微鏡のための共有エンコーダを持つ単一のビジョン変換器は、分割誤差補正とマージエラー識別のために、種間で人間レベルの精度に達する。
このベンチマークは、コネクトロミックな証明読解のための、ますます有能なビジョンモデルを訓練し、評価するインフラを提供する。
論文 参考訳(メタデータ) (2026-06-19T05:37:42Z) - When Probing Accuracy Saturates, Fragility Resolves: A Complementary Metric for LLM Pre-Training Analysis [1.0829694003408499]
線形探索は、隠された状態の分類器が高い精度を達成したときに「符号化された」プロパティを宣言する。
標準的な線形探査は最初の数千歩以内に飽和し、ほとんどの訓練は楽器に見えないままである。
我々は,プローブ精度が崩壊するアクティベーションノイズレベルとして定義される,層ごとの相補的測定値であるフラキシビリティを導入する。
論文 参考訳(メタデータ) (2026-06-09T19:00:23Z) - GRAD: Graph-Retrieved Adaptive Decoding for Hallucination Mitigation [12.69955054591315]
コーパス由来の証拠を再学習せずに生成する復号時間法であるグラフ検索適応復号法(GRAD)を導入する。
3つのモデルと様々な質問応答ベンチマークで、GRADは一貫してベースラインを超えている。
GRADは、コントラストデコーディングやナレッジグラフの拡張に対して、軽量でプラグアンドプレイの代替手段を提供する。
論文 参考訳(メタデータ) (2025-11-05T22:51:16Z) - GraphComp: Extreme Error-bounded Compression of Scientific Data via Temporal Graph Autoencoders [7.129137910302658]
科学データの誤り境界圧縮のためのグラフベース手法である GraphCOMP を提案する。
グラフニューラルネットワーク(GNN)に着想を得て,グラフのサイズを大幅に縮小する潜在表現を学習するための時間グラフオートエンコーダを提案する。
圧縮はプロセスを逆転させ、学習したグラフモデルと潜在表現を用いて元のデータの近似を再構築する。
論文 参考訳(メタデータ) (2025-05-08T18:58:54Z) - Fact Checking Beyond Training Set [64.88575826304024]
本稿では,レトリバーリーダが,あるドメインのラベル付きデータに基づいてトレーニングし,別のドメインで使用する場合,性能劣化に悩まされることを示す。
本稿では,レトリバー成分を分散シフトに対して頑健にするための逆アルゴリズムを提案する。
次に、これらのデータセットから8つの事実チェックシナリオを構築し、モデルと強力なベースラインモデルのセットを比較します。
論文 参考訳(メタデータ) (2024-03-27T15:15:14Z) - LABELMAKER: Automatic Semantic Label Generation from RGB-D Trajectories [59.14011485494713]
この研究は、完全に自動化された2D/3Dラベリングフレームワークを導入し、RGB-Dスキャンのラベルを同等(あるいはそれ以上)の精度で生成できる。
我々は、ScanNetデータセットのラベルを大幅に改善し、これまでラベル付けされていなかったARKitScenesデータセットを自動的にラベル付けすることで、LabelMakerパイプラインの有効性を実証する。
論文 参考訳(メタデータ) (2023-11-20T20:40:24Z) - Learning 3D Human Pose Estimation from Dozens of Datasets using a
Geometry-Aware Autoencoder to Bridge Between Skeleton Formats [80.12253291709673]
本稿では,アフィン結合型オートエンコーダ(ACAE)法を提案する。
このアプローチは、28人の人間のポーズデータセットを使って1つのモデルを監督する、極端なマルチデータセット体制にスケールします。
論文 参考訳(メタデータ) (2022-12-29T22:22:49Z) - Supervision by Registration and Triangulation for Landmark Detection [70.13440728689231]
本稿では,マルチビュー映像を用いた教師なし手法である登録・三角測量(srt)による監視を行い,ランドマーク検出器の精度と精度を向上させる。
ラベルのないデータを活用することで、検出者は大量のラベルのないデータから自由に学べる。
論文 参考訳(メタデータ) (2021-01-25T02:48:21Z) - Unsupervised Performance Analysis of 3D Face Alignment with a
Statistically Robust Confidence Test [32.43769049247355]
本稿では3次元顔アライメント(3DFA)の性能解析の問題点について述べる。
提案手法の中核となる要素は、予測されたランドマークとモデルランドマークの間の剛性変換の頑健な評価である。
その結果、提案手法は教師付きメトリクスと一致しており、予測されたランドマークと自動アノテーション付き3DFAデータセットの精度を測定できることがわかった。
論文 参考訳(メタデータ) (2020-04-14T14:33:57Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。