論文の概要: RE-AD: Real-Time Requirement Adherence for Data Labeling
- arxiv url: http://arxiv.org/abs/2607.20455v1
- Date: Thu, 14 May 2026 22:50:22 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 00:46:13.178184
- Title: RE-AD: Real-Time Requirement Adherence for Data Labeling
- Title(参考訳): RE-AD: データラベリングのリアルタイム要求適合性
- Abstract要約: 本稿では,ラベリング品質を積極的に検証するために,大規模言語モデルを活用したリアルタイム要求順守フレームワークを提案する。
我々の手法は、自己回帰を通じて標準動作手順(SOP)を原子規則に分解し、複雑さによって分類し、結合された検証戦略を適用することである。
プロダクションデプロイメントの結果、アノテータはフレームワークによってフラグ付けされたエラーの82%を受け入れ、修正した。
- 参考スコア(独自算出の注目度): 0.7270112855088836
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Human-annotated data remains fundamental to training frontier Large Language Models (LLMs). However, crowd-sourced annotations often suffer from quality issues stemming from annotator misunderstanding or lack of engagement. To address this, we introduce a real-time requirement adherence (RE-AD) framework that leverages LLMs to proactively validate labeling quality. Our methodology involves decomposing Standard Operating Procedures (SOPs) into atomic rules via self-reflection, categorizing them by complexity, and applying tiered validation strategies. Evaluated on a synthetic benchmark, the system achieved an F1 score of 0.749. Furthermore, production deployment resulted in annotators accepting and fixing 82% of the errors flagged by the framework. We include ablation studies to demonstrate the impact of our core design decisions.
- Abstract(参考訳): 人間の注釈付きデータは、フロンティアのLarge Language Models (LLMs) のトレーニングの基礎のままである。
しかし、クラウドソースアノテーションは、アノテータの誤解やエンゲージメントの欠如に起因する品質の問題に悩まされることが多い。
これを解決するために,LLMを利用してラベル付け品質を積極的に検証するリアルタイム要求適合(RE-AD)フレームワークを導入する。
提案手法では,SOP(Standard Operating Procedures)を自己回帰によって原子規則に分解し,複雑性によって分類し,結合された検証戦略を適用する。
合成ベンチマークで評価され、F1スコアは0.749となった。
さらに、本番環境へのデプロイは、アノテータがフレームワークによってフラグ付けされたエラーの82%を受け入れ、修正する結果となった。
コア設計決定の影響を示すためのアブレーション研究も含んでいます。
関連論文リスト
- CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement [50.91045324738942]
CLAIMは、オープンドメイン環境でのアクティブな明確化学習のための不確実性駆動フレームワークである。
本研究では,不確実性推定とセマンティッククラスタリングと推論に基づく判断を統合したエントロピー駆動型合成データ生成パイプラインを提案する。
実験の結果,手動でラベル付けしたデータに頼ることなく,CLAIMが安定かつ一般化可能な明確化戦略を学習できることが確認された。
論文 参考訳(メタデータ) (2026-08-12T04:27:45Z) - DualEval: Joint Model-Item Calibration for Unified LLM Evaluation [67.99119926012686]
DualEvalは、モデルと評価項目を共有空間で表現する潜在モデルイテムキャリブレーションフレームワークである。
我々はDualEvalを、コーディング、数学、雑多なドメイン知識タスク、汎用的な日常的なユーザクエリの4つの領域にまたがって適用する。
論文 参考訳(メタデータ) (2026-06-24T22:40:46Z) - CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems [19.083967725767387]
CompliBenchは、マルチターン対話におけるガイドライン違反の検出とローカライズを行うLLM審査員の能力を評価するために設計された新しいベンチマークである。
ユーザとエージェントのインタラクションをシミュレートするスケーラブルで自動化されたデータ生成パイプラインを開発した。
我々の制御可能な欠陥注入プロセスは、自動的に、違反したガイドラインと正確な会話ターンの正確な接地木ラベルを出力する。
論文 参考訳(メタデータ) (2026-04-14T05:42:41Z) - Modernizing Ground Truth: Four Shifts Toward Improving Reliability and Validity in AI in Education [3.275822752813799]
ジェネレーティブ・人工知能(GenAI)は現在、教育に広く普及しているが、GenAIシステムの有効性は、それらを訓練し評価するために使用されるラベル付きデータの質と解釈に制約されている。
我々は,多くの教育評価や実践支援設定には,高参照構造やスキュードラベル分布などの課題が含まれていると論じている。
1) IRR を機械的受容閾値(例えば k > 0.8 )ではなく,不一致を局所化し,構成を洗練するための診断信号として扱うこと,(2) レーダの専門知識,コードブックの開発,和解手順,セグメンテーションの透過的な報告を必要とすること,の4つの実践的シフトを提案する。
論文 参考訳(メタデータ) (2026-03-31T01:47:01Z) - Reliable and Reproducible Demographic Inference for Fairness in Face Analysis [63.46525489354455]
本稿では、従来のエンドツーエンドトレーニングをモジュラートランスファー学習アプローチで置き換える、完全に再現可能なDAIパイプラインを提案する。
このパイプラインは、正確性、公正性、そしてアイデンティティ内整合性によって定義される、新たに導入された堅牢性の概念の3つの次元にわたって監査する。
以上の結果から,提案手法は特に民族性において,強い基準線を上回り,その特性はより困難であることが示唆された。
論文 参考訳(メタデータ) (2025-10-23T12:22:02Z) - Audited Reasoning Refinement: Fine-Tuning Language Models via LLM-Guided Step-Wise Evaluation and Correction [1.41282143488996]
人間の直接監督や高品質なラベルが不足している場合、タスク固有の小さな推論モデルのトレーニングは困難である。
本稿では,Reason-Refine-then-Align (R2tA)を提案する。
論文 参考訳(メタデータ) (2025-09-15T21:47:52Z) - Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization [58.390885294401066]
Retrieval-augmented Generation (RAG) は知識基底型大規模言語モデル(LLM)を実現するためのパラダイムとして広く採用されている。
RAGパイプラインは、モデル推論が得られた証拠と整合性を維持するのに失敗することが多く、事実上の矛盾や否定的な結論につながる。
批判駆動アライメント(CDA)に基づく新しい反復的枠組みであるAlignRAGを提案する。
AlignRAG-autoは、動的に洗練を終了し、批判的な反復回数を事前に指定する必要がなくなる自律的な変種である。
論文 参考訳(メタデータ) (2025-04-21T04:56:47Z) - GRAMMAR: Grounded and Modular Methodology for Assessment of Closed-Domain Retrieval-Augmented Language Model [6.106667677504318]
Retrieval-Augmented Generation (RAG) システムは、クローズドドメインや社内知識ベースを問うために様々な産業で広く利用されている。
これらのシステムを評価することは、クローズドドメインデータのプライベートな性質と、真理を検証できるクエリの不足により、大きな課題となる。
本稿では,グラウンドドデータ生成プロセスを含む評価フレームワークであるGRAMMARと,欠陥モジュールを効果的に特定する評価プロトコルを紹介する。
論文 参考訳(メタデータ) (2024-04-30T03:29:30Z) - KIEval: A Knowledge-grounded Interactive Evaluation Framework for Large Language Models [53.84677081899392]
KIEvalは、大規模言語モデルのための知識ベースでインタラクティブな評価フレームワークである。
動的汚染耐性評価を達成するために、LSMを動力とする"インターアクター"の役割を初めて取り入れている。
5つのデータセットにわたる7つのLLMの大規模な実験により、KIEvalの有効性と一般化が検証された。
論文 参考訳(メタデータ) (2024-02-23T01:30:39Z) - DCR-Consistency: Divide-Conquer-Reasoning for Consistency Evaluation and
Improvement of Large Language Models [4.953092503184905]
この研究は、LLM(Large Language Models)生成したテキストの一貫性を評価し改善する自動化フレームワークであるDCRを提案する。
本稿では,DCEからの出力を解釈可能な数値スコアに変換する自動計量変換器(AMC)を提案する。
また,本手法は出力不整合の90%近くを著しく低減し,効果的な幻覚緩和の可能性を示唆している。
論文 参考訳(メタデータ) (2024-01-04T08:34:16Z) - Robust Representation Learning for Unreliable Partial Label Learning [86.909511808373]
部分ラベル学習(Partial Label Learning, PLL)は、弱い教師付き学習の一種で、各トレーニングインスタンスに候補ラベルのセットが割り当てられる。
これはUn Reliable partial Label Learning (UPLL) と呼ばれ、部分ラベルの本質的な信頼性の欠如とあいまいさにより、さらなる複雑さをもたらす。
本研究では,信頼できない部分ラベルに対するモデル強化を支援するために,信頼性に欠けるコントラスト学習を活用するUnreliability-Robust Representation Learning framework(URRL)を提案する。
論文 参考訳(メタデータ) (2023-08-31T13:37:28Z) - Bring Your Own Data! Self-Supervised Evaluation for Large Language
Models [52.15056231665816]
大規模言語モデル(LLM)の自己教師型評価のためのフレームワークを提案する。
閉書知識,毒性,長期文脈依存性を測定するための自己指導型評価戦略を実証する。
自己監督評価と人監督評価との間には強い相関関係が認められた。
論文 参考訳(メタデータ) (2023-06-23T17:59:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。