論文の概要: RAPT: Retrieval-Augmented Post-hoc Thresholding for Multi-Label Classification
- arxiv url: http://arxiv.org/abs/2605.16535v1
- Date: Fri, 15 May 2026 18:31:04 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:46.615087
- Title: RAPT: Retrieval-Augmented Post-hoc Thresholding for Multi-Label Classification
- Title(参考訳): RAPT: Retrieval-Augmented Post-Hoc Thresholding for Multi-Label Classification
- Authors: Lasal Jayawardena, Nirmalie Wiratunga, Ikechukwu Nkisi-Orji, Darren Nicol,
- Abstract要約: 本稿では、RAPTという、デプロイメント指向の検索強化スコア閾値ラッパーを提案する。
RAPTは、類似性検索のための文書表現とラベルの信頼度スコアのモデルに依存しないラッパーである。
工業環境では、RAPTはメートル法学習者による最高の予測性能を達成し、0.87マクロF1に達した。
- 参考スコア(独自算出の注目度): 1.2599533416395765
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Industrial multi-label document understanding pipelines score candidate labels and threshold or rank them to form a label set per document. This early selection step directly affects the accuracy of downstream information extraction from the document, as well as the associated verification effort. In practice, OCR noise, label imbalance, instance-dependent label cardinality, and asymmetric error costs make global score thresholds brittle and hard to maintain as document formats evolve. We present RAPT, a deployment-oriented retrieval-augmented score thresholding wrapper, applied post-hoc to improve label set selection without retraining the underlying classifier. RAPT is a model-agnostic wrapper: any predictor that provides document representations for similarity search and per label confidence scores can be used, including metric learning encoders and fine-tuned transformer classifiers. For each query document, given a classifier's score vector, RAPT retrieves similar document thresholding situations (cases) and adapts the query's label set selection threshold using their outcomes. The adaptation selects the final label set by locally aggregating neighbour solutions (e.g. average label count, cutoff calibration). Evaluation compared multi-label classifiers (metric learners and transformers) combined with RAPT against global and label-wise thresholding baselines, and against few-shot LLMs. Across an industrial dataset and six public benchmarks, RAPT consistently outperformed global and label-wise static thresholding baselines. In the industrial setting, RAPT achieved its best predictive performance with metric learners, reaching 0.87 Macro-F1, while fine-tuned transformer variants on average achieved 0.775 Macro-F1, outperforming fewshot LLM baselines (K = 5) by 2x and requiring at least 115x less inference time and 13.5x less GPU memory.
- Abstract(参考訳): 産業用マルチラベル文書理解パイプラインは、候補ラベルと閾値をスコアし、文書ごとにラベルセットを形成するようにランク付けする。
この早期選択ステップは、文書から下流情報抽出の精度と関連する検証作業に直接影響する。
実際には、OCRノイズ、ラベルの不均衡、インスタンス依存ラベルの濃度、および非対称なエラーコストは、文書フォーマットが進化するにつれて、グローバルスコアの閾値が不安定で維持し難くなる。
RAPTは,分類器の再学習を伴わずに,ラベルセットの選択を改善するためにポストホックを応用した,展開指向の検索強化スコア閾値ラッパーである。
RAPTはモデルに依存しないラッパーであり、類似性検索のための文書表現とラベル毎の信頼スコアを提供する予測器は、メートル法学習エンコーダや微調整変換器の分類器を含むことができる。
各クエリ文書に対して、分類器のスコアベクトルが与えられたとき、RAPTは類似の文書しきい値(ケース)を取得し、結果を用いてクエリのラベルセット選択しきい値に適応する。
適応は、局所的に隣り合う解(例えば平均ラベル数、カットオフ校正)を集約して設定した最終ラベルを選択する。
RAPTと組み合わせたマルチラベル分類器(メトリック学習器とトランスフォーマー)を、グローバルおよびラベル単位の閾値付けベースライン、および数ショットLLMと比較した。
産業データセットと6つの公開ベンチマークを通じて、RAPTは、グローバルおよびラベル単位の静的しきい値ベースラインを一貫して上回りました。
工業環境では、RAPTは平均0.87 Macro-F1に到達し、微調整されたトランスフォーマーの変種は0.775 Macro-F1に到達し、少ショットLDMベースライン(K = 5)を2倍に上回り、少なくとも115倍の推論時間と13.5倍のGPUメモリを必要とした。
関連論文リスト
- Multimodal Consistency-Guided Reference-Free Data Selection for ASR Accent Adaptation [0.05219568203653524]
ASRアクセント適応のためのマルチモーダル整合性誘導型参照フリーデータ選択パイプラインを提案する。
パイプラインは、共有埋め込み空間における音声テキストアライメントと予測された単語エラー率の2つの基準自由信号を用いて、各仮説をスコアする。
単純なパーセンタイルベースの選択規則は、ノイズ発声を排除しながら微調整のための信頼できる擬似ラベルを保持する。
論文 参考訳(メタデータ) (2026-02-03T21:35:58Z) - Prompt-based Pseudo-labeling Strategy for Sample-Efficient Semi-Supervised Extractive Summarization [12.582774521907227]
半教師付き学習(SSL)は、ラベル付きデータが不足し、ラベルなしデータが豊富であるシナリオで広く使われているテクニックである。
標準SSLメソッドは、まず分類モデルをトレーニングし、次に分類器の信頼性値を使用して擬似ラベルを選択するために教師-学生パラダイムに従う。
より正確な擬似ラベルでラベルなしのサンプルを抽出するLLMを用いたプロンプトベースの擬似ラベル方式を提案する。
論文 参考訳(メタデータ) (2023-11-16T04:29:41Z) - Generating Unbiased Pseudo-labels via a Theoretically Guaranteed
Chebyshev Constraint to Unify Semi-supervised Classification and Regression [57.17120203327993]
分類におけるしきい値と擬似ラベルプロセス(T2L)は、ラベルの品質を決定するために信頼性を使用する。
本質的には、レグレッションは高品質なラベルを生成するためにバイアスのない方法も必要である。
チェビシェフの不等式に基づく不偏ラベルを生成するための理論的に保証された制約を提案する。
論文 参考訳(メタデータ) (2023-11-03T08:39:35Z) - Ground Truth Inference for Weakly Supervised Entity Matching [76.6732856489872]
弱監督タスクのための単純だが強力なラベル付けモデルを提案する。
次に、エンティティマッチングのタスクに特化してラベルモデルを調整します。
その結果,従来の手法よりもF1スコアが9%高い結果が得られた。
論文 参考訳(メタデータ) (2022-11-13T17:57:07Z) - Self-Adaptive Label Augmentation for Semi-supervised Few-shot
Classification [121.63992191386502]
Few-shotの分類は、ラベル付きサンプルがわずかにあれば、新しいタスクをうまく一般化できるモデルを学ぶことを目的としている。
そこで本研究では,手動で定義した指標を用いて,ラベルのない各サンプルに適切なラベルを割り当てる半教師付き小ショット分類手法を提案する。
SALAの目新しいところは、タスク適応計量であり、エンドツーエンドの方法で異なるタスクに対するメトリックを適応的に学習することができる。
論文 参考訳(メタデータ) (2022-06-16T13:14:03Z) - Multi-Label Gold Asymmetric Loss Correction with Single-Label Regulators [6.129273021888717]
本稿では,単一ラベルレギュレータ(GALC-SLR)を用いたGold Asymmetric Loss Correctionを提案する。
GALC-SLRは、単一ラベルサンプルを用いてノイズ混乱行列を推定し、推定された混乱行列を介して非対称な損失補正を構築し、雑音ラベルへの過度な適合を避ける。
実験結果から,本手法は,全ての汚損レベルにおいて,最先端の非対称損失マルチラベル分類器よりも優れた性能を示すことが示された。
論文 参考訳(メタデータ) (2021-08-04T12:57:29Z) - Unsupervised Label Refinement Improves Dataless Text Classification [48.031421660674745]
データレステキスト分類は、ラベル記述と組み合わせた文書にスコアを割り当てることで、文書を未確認のラベルに分類することができる。
有望ながら、それは重要なダウンストリームタスクごとにラベルセットの正確な説明に依存します。
この依存により、データレス分類器はラベル記述の選択に非常に敏感になり、実際にはデータレス分類の幅広い適用を妨げる。
論文 参考訳(メタデータ) (2020-12-08T03:37:50Z) - Coping with Label Shift via Distributionally Robust Optimisation [72.80971421083937]
分散ロバスト最適化(DRO)に基づく目的最小化モデルを提案する。
そこで我々は,提案した目的を最適化するために,大規模問題に適した勾配降下近位ミラー上昇アルゴリズムを設計し,解析する。
論文 参考訳(メタデータ) (2020-10-23T08:33:04Z) - Identifying noisy labels with a transductive semi-supervised
leave-one-out filter [2.4366811507669124]
本稿では,LGC_LVOF(Local and Global Consistency (LGC) アルゴリズムに基づく一括フィルタリング手法)を導入する。
私たちのアプローチは、大量のラベルのないデータを持つデータセットに最も適していますが、ラベルは多くありません。
論文 参考訳(メタデータ) (2020-09-24T16:50:06Z) - Unsupervised Person Re-identification via Multi-label Classification [55.65870468861157]
本稿では,教師なしのReIDを多ラベル分類タスクとして定式化し,段階的に真のラベルを求める。
提案手法は,まず,各人物画像に単一クラスラベルを割り当てることから始まり,ラベル予測のために更新されたReIDモデルを活用することで,多ラベル分類へと進化する。
マルチラベル分類におけるReIDモデルのトレーニング効率を高めるために,メモリベースマルチラベル分類損失(MMCL)を提案する。
論文 参考訳(メタデータ) (2020-04-20T12:13:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。