論文の概要: Position: Early-Stage Quality Assurance in Annotation Pipelines Is More Cost-Effective Than Late-Stage Validation
- arxiv url: http://arxiv.org/abs/2605.15714v1
- Date: Fri, 15 May 2026 08:07:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-18 21:22:26.215456
- Title: Position: Early-Stage Quality Assurance in Annotation Pipelines Is More Cost-Effective Than Late-Stage Validation
- Title(参考訳): 注記パイプラインの早期品質保証は後期検証よりもコスト効果が高い
- Authors: Sunil Kothari, Sumukha Sharma Thoppanahalli Chandramouli, Naman Khandelwal, Parth Kulshreshtha, Ashi Jain, Kriti Banka, Tanuja Chintada, Venkata Triveni, Gulipalli Praveen Kumar, Manish Mehta, Tao Liu,
- Abstract要約: このポジションペーパーでは、マシンラーニングコミュニティは、後期検証の一般的な実践よりも、アノテーションパイプラインの早期品質保証を優先すべきである、と論じている。
本稿では,事前アノテーション(T0),後アノテーション(T1),後レビュー(T2)の3つのQAトリガポイントの分類法を提案する。
- 参考スコア(独自算出の注目度): 17.77280120142941
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: This position paper argues that the machine learning community should prioritize early-stage quality assurance in annotation pipelines over the prevailing practice of late-stage validation. Data quality bottlenecks increasingly limit foundation model improvement, yet quality assurance research focuses almost exclusively on validation methods rather than validation timing. When validation occurs, not merely what methods are employed, fundamentally determines both error rates and annotation costs. This temporal neglect is puzzling given the well-established "shift-left" principle from software engineering, where empirical studies demonstrate 4--100x cost multipliers for defects detected in later stages (Boehm, 1981; Shull et al., 2002). Annotation pipelines exhibit analogous dynamics: errors caught before annotation begins cost a fraction of those discovered after review cycles complete. We propose a taxonomy of three QA trigger points, namely pre-annotation (T0), post-annotation (T1), and post-review (T2), that decompose annotation workflows into discrete validation opportunities. A parametric error-propagation model formalizes when timing affects final error rates versus only economics, making timing a measurable design variable rather than a configuration afterthought. A survey of 47 recent papers reveals that only 4% report when validation occurs, a striking gap given timing's demonstrated impact in adjacent fields. Without explicit attention to QA timing, the community risks optimizing validation methods while ignoring the structural variable that may matter most. Acting on this position requires three steps: researchers should report QA timing configurations alongside validation methods; annotation platforms should expose timing as a first-class parameter; and the community should run controlled experiments that measure stage-specific detection rates directly.
- Abstract(参考訳): このポジションペーパーでは、マシンラーニングコミュニティは、後期検証の一般的な実践よりも、アノテーションパイプラインの早期品質保証を優先すべきである、と論じている。
データ品質のボトルネックは、基盤モデルの改善をますます制限しますが、品質保証の研究は、バリデーションのタイミングよりもバリデーションメソッドにのみ焦点を合わせています。
バリデーションが発生すると、どのメソッドが使用されるかだけでなく、エラー率とアノテーションのコストの両方を根本的に決定する。
この時間的無視は、後段で検出された欠陥に対して4-100倍のコスト乗算を実証する経験的研究(Boehm, 1981; Shull et al , 2002)という、ソフトウェア工学から確立された「シフト・レフト」の原理に反するものである(Boehm, 1981; Shull et al , 2002)。
アノテーションパイプラインは、類似のダイナミクスを示す: アノテーションが始まる前に捕捉されたエラーは、レビューサイクルが完了した後で発見されたエラーのごく一部を犠牲にする。
本稿では,前アノテーション(T0),後アノテーション(T1),後レビュー(T2)の3つのQAトリガポイントの分類法を提案する。
パラメトリック誤差プロパゲーションモデルは、タイミングが最終的なエラー率に影響を及ぼす場合と、経済のみに影響を及ぼす場合を定式化し、タイミングを設定後から考えるよりも測定可能な設計変数にする。
47件の最近の調査では, 検証時の報告は4%に過ぎなかった。
QAのタイミングに明示的に注意を払わずに、コミュニティは最も重要な構造変数を無視しながら、バリデーション方法を最適化するリスクがある。
研究者は検証方法とともにQAタイミング設定を報告し、アノテーションプラットフォームは第1級パラメータとしてタイミングを公開し、コミュニティはステージ固有の検出率を直接測定する制御実験を実行する必要がある。
関連論文リスト
- FACTOR: Counterfactual Training-Free Test-Time Adaptation for Open-Vocabulary Object Detection [63.91351553178842]
FACTORはオープン語彙オブジェクト検出のためのトレーニング不要なテスト時間適応である。
属性依存性の予測を選択的に抑制するために、属性の感度、意味的関連性、予測のバリエーションを定量化する。
PASCAL-C, COCO-C, FoggyCityscapes の実験では、FACTOR が従来の TTA 法より一貫して優れていたことが示されている。
論文 参考訳(メタデータ) (2026-05-05T02:31:18Z) - LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation [75.05397479715576]
大規模言語モデル(LLM)とエージェントは有望な進歩を示しているが、その真の能力と失敗モードは未だ不明である。
CプログラムのためのLCMおよびエージェントベースの形式仕様生成に関する、最初の体系的および汚染に配慮した研究を提案する。
論文 参考訳(メタデータ) (2026-05-02T11:31:33Z) - Distill-Belief: Closed-Loop Inverse Source Localization and Characterization in Physical Fields [19.32007397161956]
正しさを効率から分離する教師学生向けフレームワークである textbfDistill-Belief を提案する。
実験の結果,Distill-Beliefはセンサコストを一貫して低減し,成功率,後部収縮率,ベースライン上の推定精度を向上することがわかった。
論文 参考訳(メタデータ) (2026-04-28T20:18:29Z) - SAFE: Stepwise Atomic Feedback for Error correction in Multi-hop Reasoning [35.58279719577653]
我々は,非接地型Chain-of-Thought(CoT)を,厳密に検証可能な基底要素列に置き換える動的ベンチマークフレームワークSAFEを提案する。
筆者らのフレームワークは,(1) 列車時検証,(1) 原子エラー分類と知識グラフ(KG) の地下検証パイプラインの確立,最大14% のインスタンスを調査不能と判断,(2) 推論時検証,(2) 検証されたデータセットに基づいてトレーニングされたフィードバックモデルがリアルタイムで非地下ステップを動的に検出する,という2つのフェーズで運用されている。
論文 参考訳(メタデータ) (2026-04-02T12:59:30Z) - Forecasting Anomaly Precursors via Uncertainty-Aware Time-Series Ensembles [9.53248032827498]
FATE(Forecasting Anomalies with Time-Series Ensembles)を提案する。
FATEは将来の値を予測し、アンサンブルの不一致を利用して、推論時にターゲット値にアクセスすることなく、潜在的な異常の早期兆候を示す。
5つの実世界のベンチマークデータセットの実験により、FATEはPTaPR AUCの19.9ポイント、早期検出のF1スコアの20.02ポイントの平均的な改善を達成している。
論文 参考訳(メタデータ) (2026-02-19T02:48:09Z) - PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering [71.15346406323827]
本稿では,プロセス・アウトカム・アライメント・アライメント・検証における検証結果を評価するベンチマークであるPRIMEを紹介する。
現在の検証器は、しばしば導出欠陥を検出するのに失敗する。
本稿では,PRIMEで選択した検証手法を利用したプロセス認識型RLVRトレーニングパラダイムを提案する。
論文 参考訳(メタデータ) (2026-02-12T04:45:01Z) - Revisiting Multivariate Time Series Forecasting with Missing Values [65.30332997607141]
現実の時系列では欠落値が一般的である。
現在のアプローチでは、計算モジュールを使用して、不足した値を補う、計算済みの予測フレームワークが開発されている。
このフレームワークは、致命的な問題を見落としている: 欠落した値に対して基礎的な真理は存在せず、予測精度を劣化させる可能性のあるエラーの影響を受けやすいようにしている。
本稿では,Information Bottleneck原則に基づく新しいフレームワークであるConsistency-Regularized Information Bottleneck(CRIB)を紹介する。
論文 参考訳(メタデータ) (2025-09-27T20:57:48Z) - The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models [69.798277882245]
大規模言語モデルの推論効率を向上させるために,Unsupervised Prefix Fine-Tuning (UPFT)を導入した。
UPFTはラベル付きデータや徹底的なサンプリングの必要性を取り除く。
実験の結果,UPFTは教師付き手法の性能と一致していることがわかった。
論文 参考訳(メタデータ) (2025-03-04T18:56:03Z) - Generalized Robust Test-Time Adaptation in Continuous Dynamic Scenarios [18.527640606971563]
テスト時間適応(TTA)は、未ラベルのテストデータストリームのみを使用する推論フェーズにおいて、事前訓練されたモデルに分散をテストする。
本稿では,問題に効果的に対応する汎用ロバストテスト時間適応(GRoTTA)法を提案する。
論文 参考訳(メタデータ) (2023-10-07T07:13:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。