論文の概要: Curating Merchant-Matching Training Data with Two Confidence-Gated Local LLM Judges
- arxiv url: http://arxiv.org/abs/2609.33878v2
- Date: Sun, 04 Oct 2026 03:35:55 GMT
- ステータス: 情報取得中
- システム内更新日: 2026-10-06 20:38:53.678508
- Title: Curating Merchant-Matching Training Data with Two Confidence-Gated Local LLM Judges
- Title(参考訳): 2つの信頼度付きローカルLLM判事によるマーチャントマッチングトレーニングデータの算出
- Abstract要約: マーチャントマッチングは、検索された商人エンティティにノイズの多い支払い記述子を解決し、マッチを返さない。
トレーニングラベルをキュレートする上で重要な課題は、教師の棄権と、受け入れられる実体が存在しないという証拠を区別することである。
2つの局所的大言語モデルの裁判官間の合意が擬似ラベルの信頼性を向上させるかどうかを検討する。
- 参考スコア(独自算出の注目度): 1.8717456484053328
- License:
- Abstract: Merchant matching resolves a noisy payment descriptor to a retrieved merchant entity or returns no match. A key challenge in curating training labels is distinguishing teacher abstention from evidence that no acceptable entity exists: false no-match labels contaminate pseudo-labeled data, while conservative labeling reduces coverage. We investigate whether agreement between two local large language model judges improves pseudo-label reliability. A label is retained only when the judges agree, with separate ordered thresholds for selections and abstentions that guarantee disjoint positive and negative label sets. Retrospective replay on 2,000 expert-annotated queries shows that higher selection thresholds can improve positive-label purity, whereas higher abstention thresholds increase false no-match labels. At thresholds (0.86, 0.80), Muse Glimmer 30B and Gemma 4 31B jointly label 1,633 queries (81.7% coverage) at 96.88% purity; positive and negative purities are 99.47% and 93.38%. This exceeds either constituent model at the same thresholds by more than two percentage points, with lower coverage. A split-half check finds only 0.14 percentage points of threshold-selection optimism. A symmetric threshold of 0.86 adds 40 erroneous no-match labels, while 46 false abstentions persist even with no confidence threshold. Across five matched within-model comparisons, higher reasoning effort yields no clear F0.5 gain and increases median latency by 1.8-5.0 times. These results motivate separate thresholding and auditing for positive and negative pseudo-labels. The study establishes label purity, not student utility; fresh-data curation and student fine-tuning remain necessary to demonstrate downstream value.
- Abstract(参考訳): マーチャントマッチングは、検索された商人エンティティにノイズの多い支払い記述子を解決し、マッチを返さない。
トレーニングラベルをキュレートする上で重要な課題は、教師の棄権と許容できる実体が存在しないという証拠を区別することである。
2つの局所的大言語モデルの裁判官間の合意が擬似ラベルの信頼性を向上させるかどうかを検討する。
ラベルは、審査員が同意した時点でのみ保持され、選択のための異なる順序付きしきい値と、不一致の正と負のラベルセットを保証する棄却値が与えられる。
2,000のエキスパートアノテートクエリに対するふりかえりのリプレイは、高い選択しきい値が正のラベルの純度を改善する一方で、高い禁忌しきい値が偽のノーマッチラベルを増大させることを示している。
しきい値 (0.86, 0.80) では、Muse Glimmer 30B と Gemma 4 31B が、96.88%の純度で 1,633 のクエリ (81.7%) を共同でラベル付けし、99.47% と93.38% である。
これは、同じ閾値における構成モデルのいずれかを、より低いカバレッジで、2%以上のポイントで上回る。
スプリットハーフチェックでは、しきい値選択楽観主義の0.14ポイントしか見つからない。
対称閾値0.86は40個の非マッチラベルを付加し、46個の偽の棄権は信頼しきい値のないまま持続する。
5つ以上のモデル内比較が一致し、高い推論の努力は、明確なF0.5の利得を得られず、中央値のレイテンシを1.8-5.0倍に向上させる。
これらの結果は、正と負の擬似ラベルに対する別個のしきい値と監査を動機付けている。
この研究は、学生の実用性ではなく、ラベルの純度を確立し、下流の価値を示すために、新しいデータキュレーションと学生の微調整が依然として必要である。
関連論文リスト
- The Model Proposes, the Code Disposes: A Pre-Registered Ablation of a Verifier-and-Acceptance Stage in an LLM-Orchestrated Offensive-Security Agent [0.0]
決定的コードによって検証が強制されるモデル検証装置である検証受理段階が、LCMが主導する攻撃セキュリティエージェントが報告するものを変更するかどうかを評価する。
本報告では,15回の探索パイロット,20回の予備登録検定アブレーション,および2回の故意に脆弱な検査対象を40回実施した2×2因子分析を行った。
検証者はシステムが提供するものを変更し、決定論的コードは強制と監査性を提供します。
論文 参考訳(メタデータ) (2026-09-14T17:13:05Z) - Decision Shifts, Lost Label Functionality, and an Inconclusive Grounding Audit in Correctness-Gated Multi-Teacher Distillation [0.0]
決定の正しさと根拠は異なる目的である。
固定実験において, 高精度多教師蒸留法について検討した。
未ろ過蒸留と比較して, 正度重み付きアームの精度は+0.1660。
論文 参考訳(メタデータ) (2026-09-09T04:39:56Z) - Unmatched Does Not Mean False: Incomplete Reference Sets Can Reverse Calibration Rankings in Open-Ended Theory-of-Mind Tracking [0.5735035463793009]
Open-ended Theory-of-Mind (ToM) トラッカーは有限参照を欠く有効な信念を出力する。
有限参照+マーチャントパイプラインは、不正な出力をマークし、適切なスコアモデル選択をリバース可能なプロキシラベルを生成する。
論文 参考訳(メタデータ) (2026-08-26T11:36:31Z) - The Label Complexity of Class-Conditional Coverage under Distribution Shift [0.614481021961242]
整形予測は、分類器の予測セットが真理をカバーし、その証明が限界であることを示す。
多くの認識ベンチマークは、分散を評価にシフトさせ、トレーニングとテストの分割に相容れない条件を配置する。
本物のクロステーマのベンチマークでは、限界範囲は90%近く、最悪のクラスは70%程度である。
論文 参考訳(メタデータ) (2026-07-20T15:54:45Z) - Appeal: Allow Mislabeled Samples the Chance to be Rectified in Partial Label Learning [55.4510979153023]
部分ラベル学習(PLL)では、各インスタンスは候補ラベルのセットに関連付けられ、そのうち1つだけが接地真実である。
誤記されたサンプルの「アペアル」を支援するため,最初の魅力に基づくフレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-18T09:09:52Z) - Generating Unbiased Pseudo-labels via a Theoretically Guaranteed
Chebyshev Constraint to Unify Semi-supervised Classification and Regression [57.17120203327993]
分類におけるしきい値と擬似ラベルプロセス(T2L)は、ラベルの品質を決定するために信頼性を使用する。
本質的には、レグレッションは高品質なラベルを生成するためにバイアスのない方法も必要である。
チェビシェフの不等式に基づく不偏ラベルを生成するための理論的に保証された制約を提案する。
論文 参考訳(メタデータ) (2023-11-03T08:39:35Z) - Shrinking Class Space for Enhanced Certainty in Semi-Supervised Learning [59.44422468242455]
そこで我々はShrinkMatchと呼ばれる新しい手法を提案し、不確実なサンプルを学習する。
それぞれの不確実なサンプルに対して、元の Top-1 クラスを単に含むスランク類空間を適応的に求める。
次に、スランク空間における強と弱に強化された2つのサンプル間の整合正則化を課し、識別的表現を試みます。
論文 参考訳(メタデータ) (2023-08-13T14:05:24Z) - Dist-PU: Positive-Unlabeled Learning from a Label Distribution
Perspective [89.5370481649529]
本稿では,PU学習のためのラベル分布視点を提案する。
そこで本研究では,予測型と基底型のラベル分布間のラベル分布の整合性を追求する。
提案手法の有効性を3つのベンチマークデータセットで検証した。
論文 参考訳(メタデータ) (2022-12-06T07:38:29Z) - Learning with Proper Partial Labels [87.65718705642819]
部分ラベル学習は、不正確なラベルを持つ弱い教師付き学習の一種である。
この適切な部分ラベル学習フレームワークには,従来の部分ラベル学習設定が数多く含まれていることを示す。
次に、分類リスクの統一的非バイアス推定器を導出する。
論文 参考訳(メタデータ) (2021-12-23T01:37:03Z) - A Theory-Driven Self-Labeling Refinement Method for Contrastive
Representation Learning [111.05365744744437]
教師なしのコントラスト学習は、正のイメージの作物と、負のイメージの作物とをラベル付けする。
本研究は, コントラスト学習において, 不正確なラベル割り当てがセマンティック・インスタンス識別の一般化を著しく損なうことを最初に証明する。
この理論に触発されて、コントラスト学習のための新しい自己ラベル改善手法を提案する。
論文 参考訳(メタデータ) (2021-06-28T14:24:52Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。