論文の概要: Positional task conditioning for scalable defect detection across product families in large product catalogs
- arxiv url: http://arxiv.org/abs/2609.09567v2
- Date: Thu, 10 Sep 2026 17:58:57 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-11 14:47:34.2993
- Title: Positional task conditioning for scalable defect detection across product families in large product catalogs
- Title(参考訳): 大規模製品カタログにおける製品ファミリー間のスケーラブルな欠陥検出のための位置対応型タスクコンディショニング
- Abstract要約: 大規模な製品カタログの製品ファミリーは、重複やユニットミスマッチなどの不整合に悩まされている。
我々は、コンテキストを減らし、エラータイプを分離する集中サブタスクに検出を分解することで、この問題に対処する。
拡張性のあるデプロイメントには、この機能を単一の小さなモデルに蒸留する、位置タスクコンディショニング(PTC)を導入します。
- 参考スコア(独自算出の注目度): 0.9048024204321056
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Product families in large product catalogs suffer from inconsistencies such as duplicates and unit mismatches that degrade customer experience. Detecting these requires reasoning over multiple error types across lengthy product listings, where LLM classification quality degrades due to long-context limitations. We address this by decomposing detection into focused sub-tasks that reduce context and isolate error types, improving F1 from 52% to 87%. For scalable deployment, we introduce Positional Task Conditioning (PTC), which distills this capability into a single smaller model by reinforcing task identity at structural prompt boundaries. PTC outperforms rationale-based distillation across five models and two architecture families, achieving within 1.79% F1 of the frontier at upto 98% lower cost. Our system is deployed across multiple countries processing 10+ million product families.
- Abstract(参考訳): 大規模な製品カタログの製品ファミリーは、顧客の経験を損なう重複やユニットミスマッチなどの不整合に悩まされる。
これらの検出には、LLM分類の品質が長いコンテキスト制限のために低下する、長い製品リストにまたがる複数のエラータイプを推論する必要がある。
検出を集中サブタスクに分解してコンテキストを減らし、エラータイプを分離し、F1を52%から87%に改善することで、この問題に対処する。
拡張性のあるデプロイメントのために,構造的プロンプト境界におけるタスクの同一性を強化することで,この機能を単一の小さなモデルに蒸留するPTC(Phystal Task Conditioning)を導入する。
PTCは5つのモデルと2つのアーキテクチャーファミリで合理的に基づく蒸留を上回り、フロンティアの1.79%のF1を最大98%のコストで達成している。
当社のシステムは,100万人以上の製品ファミリを処理する複数の国に展開しています。
関連論文リスト
- Scaling E-Commerce Attribute Extraction with Parallel Decoding [25.167068017765768]
電子商取引カタログは乱雑で構造化されていないため、どの属性が最も重要かを特定するのは困難だ。
まず2段階のLCMパイプラインを導入し、各製品カテゴリの購入識別属性のコンパクトでランク付けされたスキーマを最初に発見する。
このパイプラインは85%の抽出精度を達成し、蒸留した基礎LLMと同等にし、推算コストを92%削減した。
論文 参考訳(メタデータ) (2026-09-09T05:01:28Z) - From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix [55.08143827481755]
200以上の内部アプリケーションから1つのモデルにトラフィックを集約します。
我々は、各軸ごとに別々のGRPOエキスパートを訓練し、2段階のSLERPを介してそれらをマージする。
このモデルは、プラットフォームトラフィックの50%、月1億6600万リクエストをサービスコストのごく一部で吸収する。
論文 参考訳(メタデータ) (2026-09-01T17:39:26Z) - How Fast Do Agents Rot? An Empirical Study of Long-Horizon Degradation in LLM Agents for Production Decision-Making [0.0]
大規模言語モデル(LLM)エージェントのプロダクションデプロイメントは、ベンチマーク成功率が着実に上昇しても、長期間のマルチステップでは信頼性が低いままである。
この効果を直接測定し, 分解剤の形状を特徴付けるとともに, その原因を解明する。
エージェントのオーケストレーションと信頼性を大規模に管理するチームにとって、これらの結果は地平線を考慮した評価と信頼性の予算化を主張する。
論文 参考訳(メタデータ) (2026-08-31T19:11:47Z) - PCFBench: A Diagnostic Benchmark for Product Carbon Footprint Estimation [0.0]
我々はPCFモデリングを独立に評価可能なタスクに彫る最初のベンチマークであるPCFBenchを紹介する。
6つのタスクにまたがる614のエキスパートラベル付き項目で構成されている。これらを合わせて、不特定性、矛盾するコンテキスト、数値的な制約の下で推論を探索する。
ターゲットとする進捗をサポートするために、データセットと評価ハーネスをリリースします。
論文 参考訳(メタデータ) (2026-08-27T21:08:49Z) - Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs [1.799279866735219]
プロダクトリンクは断片化されたリストを集約するので、下流の検索、レコメンデーション、広告は製品ごとに1つのクリーンなエントリを見ることができる。
市場規模では、何十億もの騒々しいマルチカテゴリのレコードが、何千万もの標準製品に対して解決されなければならない。
本稿では, 難易度に比例した生産回収マッチカスケードを提案する。
論文 参考訳(メタデータ) (2026-08-25T18:26:34Z) - Lines and Ladders: A Context-Aware Multi-Agent Framework for Large-Scale Retail Price Taxonomy [0.00559762074594338]
商品の変種間の一貫性のない価格設定は、顧客価値の認識を歪め、販売を共食いさせる。
本稿では,"Lines and Ladders"の価格設定の自動化を目的とした,コンテキスト対応マルチエージェントフレームワークを提案する。
論文 参考訳(メタデータ) (2026-08-13T00:22:22Z) - Douyin Multimodal Embedding Model Technical Report [77.9018834072698]
マルチモーダル表現学習は、現代のAIの基盤となっている。
両強度を組み合わせた2段階のモデルであるDME(Douyin Multimodal Embedding)を提案する。
論文 参考訳(メタデータ) (2026-08-03T12:31:49Z) - Apertus LLM Family Expansion via Distillation and Quantization [68.33467651353419]
Apertus-v1.1 - 1.7Tの許容ライセンストークンでトレーニングされた最大4Bパラメータを持つ、蒸留されたモデルのファミリーを生成する。
我々は,幅広いハードウェアおよびシステム要件をカバーするために,提案手法のコスト効率と高い精度性能を示す。
論文 参考訳(メタデータ) (2026-05-27T21:40:10Z) - From Correlation to Cause: A Five-Stage Methodology for Feature Analysis in Transformer Language Models [0.0]
変換言語モデルにおける因果的特徴分析のための5段階の手法を提案する。
Indirect Object Identification (IOI) タスクを実行するGPT-2のエンド・ツー・エンドを実証する。
論文 参考訳(メタデータ) (2026-05-21T13:25:16Z) - ReFlect: An Effective Harness System for Complex Long-Horizon LLM Reasoning [5.523132953818281]
本稿では,LLM推論のためのシステムであるReFlectについて述べる。
6つの推論領域にまたがる制御された実験により、100個の監査された反射ブロックのうち90個の問題にフラグを付けない、プロンプトレベルの自己批判が公式テンプレートを生成することが示された。
我々のReFlectハーネスは, GPT-4o-miniで41%, Claude Sonnet 4.5で56%のタスク成功率を実現している。
論文 参考訳(メタデータ) (2026-05-07T06:29:34Z) - OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation [57.505743202759646]
OccuBenchは10の業界カテゴリと65の専門ドメインにわたる100の現実のプロフェッショナルタスクシナリオをカバーするベンチマークである。
我々のマルチエージェント合成パイプラインは, 可溶性, 校正困難, 文書基底の多様性を保証した評価インスタンスを自動生成する。
論文 参考訳(メタデータ) (2026-04-13T00:27:32Z) - DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems [48.971606069204825]
DoVerは、大規模言語モデル(LLM)ベースのマルチエージェントシステムのための介入駆動デバッグフレームワークである。
ターゲットの介入を通じて、アクティブな検証によって仮説生成を増強する。
DoVerは失敗試験の18~28%を成功させ、最大16%のマイルストーンを達成し、失敗仮説の30~60%を検証または否定する。
論文 参考訳(メタデータ) (2025-12-07T09:23:48Z) - An Aligned Constraint Programming Model For Serial Batch Scheduling With Minimum Batch Size [16.447342678728827]
連続的なバッチスケジューリングでは、類似のファミリーのジョブがバッチにグループ化され、繰り返し設定を避けるために順次処理される。
本稿では,バッチの仮想集合に依存しない新しいCPモデルを提案する。
キーアライメントパラメータを使用して、マシン上でスケジュールされた同じ家族のジョブのシーケンスを直接推論する。
論文 参考訳(メタデータ) (2025-11-20T05:05:52Z) - ShortcutBreaker: Low-Rank Noisy Bottleneck with Global Perturbation Attention for Multi-Class Unsupervised Anomaly Detection [59.89803740308262]
ShortcutBreakerはMUADタスクのための新しい統合された機能再構成フレームワークである。
ショートカットの問題に対処する2つの重要なイノベーションが特徴だ。
提案手法は,4つのデータセットに対して,99.8%,98.9%,90.6%,87.8%の顕著な画像レベルのAUROCを実現する。
論文 参考訳(メタデータ) (2025-10-21T06:51:30Z) - Self-Refinement Strategies for LLM-based Product Attribute Value Extraction [51.45146101802871]
本稿では,製品属性値抽出タスクに2つの自己補充手法を適用した。
実験の結果, 2つの自己補充技術は, 処理コストを大幅に増大させながら, 抽出性能を著しく向上させることができないことがわかった。
開発データを持つシナリオでは、ファインチューニングが最もパフォーマンスが高いのに対して、ファインチューニングの上昇コストは製品記述の量が増加するにつれてバランスがとれる。
論文 参考訳(メタデータ) (2025-01-02T12:55:27Z) - Small Effect Sizes in Malware Detection? Make Harder Train/Test Splits! [51.668411293817464]
業界関係者は、モデルが数億台のマシンにデプロイされているため、マルウェア検出精度の小さな改善に気を配っている。
学術研究はしばしば1万のサンプルの順序で公開データセットに制限される。
利用可能なサンプルのプールから難易度ベンチマークを生成するためのアプローチを考案する。
論文 参考訳(メタデータ) (2023-12-25T21:25:55Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。