論文の概要: CompOrca: Corpus-Scale Compliance Labelling of Instruction-Tuning Data
- arxiv url: http://arxiv.org/abs/2609.37807v1
- Date: Tue, 29 Sep 2026 15:25:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-30 21:28:47.68106
- Title: CompOrca: Corpus-Scale Compliance Labelling of Instruction-Tuning Data
- Title(参考訳): CompOrca: インストラクションチューニングデータのコーパススケールコンプライアンスラベリング
- Abstract要約: 我々は,4,233,923個のOpenOrcaコーパス全体に対するコンプライアンスラベルであるCompOrcaを提示する。
いずれの例も、オープンウェイトLSM判事の5つの独立したパスによって、準拠または非準拠に分類された。
シングルパスのフラグは2.7-3.2%で、コーパスの2.7-3.2%は準拠していない。
- 参考スコア(独自算出の注目度): 0.17188280334580197
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Studying how fine-tuning shapes refusal and noncompliance behaviour requires identifying training examples that refuse, evade or otherwise fail to fulfil the requested task. But existing annotation covers evaluation sets of a few thousand prompts at most. We present CompOrca, a compliance labelling over the entirety of the 4,233,923-example OpenOrca corpus. Every example was classified as compliant or noncompliant by five independent passes of an open-weight LLM judge (LongCat-2.0, 1.6T parameters), and the corpus is released as unanimous compliance (94.75%), unanimous noncompliance (1.28%), and nonunanimous rows (3.97%) along with the raw vote counts. A single pass flags 2.7-3.2% of the corpus as noncompliant, while only 1.28% is flagged by all five, allowing for filtering the most ambiguous samples. Against 450 human-annotated examples, 150 of them annotated twice (human-human $κ= 0.93$), the unanimous compliance and noncompliance labels are 97.3% and 86.7% precise, the latter a high-precision subset, not a complete enumeration, of noncompliance. Published refusal-detection methods recall only between 0.4% and 94.1% of the noncompliance class. We release the full corpus with its per-row labels and vote counts at https://huggingface.co/datasets/cemiu/CompOrca
- Abstract(参考訳): きめ細やかな形状の拒絶と非コンプライアンスの振る舞いを研究するには、要求されたタスクを拒否、回避、あるいは失敗するトレーニング例を特定する必要がある。
しかし、既存のアノテーションは、せいぜい数千のプロンプトの評価セットをカバーしている。
我々は,4,233,923個のOpenOrcaコーパス全体に対するコンプライアンスラベルであるCompOrcaを提示する。
いずれの例も、LongCat-2.0, 1.6Tパラメータの5つの独立したLSM判事のパスによって準拠または非準拠に分類され、コーパスは全会一致(94.75%)、全会一致不一致(1.28%)、非全会一致行(3.97%)、生の投票数とともに解放される。
単一のパスフラグは2.7-3.2%のコーパスを非準拠とし、1.28%は5つ全てでフラグ付けされており、最も曖昧なサンプルをフィルタリングすることができる。
450人の注釈が付けられた例に対して、150人の注釈が2回(人間と人間の$κ= 0.93$)、全一致のコンプライアンスと非準拠のラベルは97.3%、86.7%正確であり、後者は完全列挙ではなく高精度なサブセットである。
非準拠クラスの0.4%から94.1%しかリコールされない。
私たちは、全コーパスを、そのローラベルと投票カウントをhttps://huggingface.co/datasets/cemiu/CompOrcaでリリースします。
関連論文リスト
- Frozen Judges, Moving Agents: Version-Dependent LLM-Judge Error and the Limits of Judge-Assisted Agent Evaluation [7.504639516424482]
言語モデル審査員はエージェントのアップグレードを前任者と比較するが、固定された審査員はバージョンに依存した誤りを犯すことがある。
公開コーディングエージェント35件、カスタマーサービスエージェント2件、専門家ラベル付きエージェントRewardBenchトラジェクトリ1,106件を分析した。
論文 参考訳(メタデータ) (2026-09-28T03:10:18Z) - Where the Verifier Fails: A Category-Level Audit of Reward Signals in RLVR [0.0]
報酬付き強化学習(RLVR)と標準ベンチマーク評価はどちらも、無料テキスト回答をバイナリ報酬に変換する自動検証に頼っている。
以前の調査では、1つの評価ハーネスは、自身の真実の答えの94%しか受け入れず、解析を非難している。
モデルではなく検証器にメタモルフィックテストを適用し、検証された等価解の変種を生成する。
我々は、307,420以上の4つの広く使用されている検証結果に対して、回答カテゴリごとの拒絶を計測する。
論文 参考訳(メタデータ) (2026-09-01T14:57:59Z) - The Exclusion Ratchet: False-Positive Suppression Accumulates and Persists in Detection Rule Repositories [0.0]
ルールがあまりにも多くの誤報を発生させた場合、アナリストは除外を加える。
近年の縦断作業では、キュレーションは収束しないが、後に回復したリビジョンのためにのみ回復時間を計測した。
9年と8,234回のSigmaHQ corpusの改訂を行い、意味論的に抑制を検出し、ブラインドハンドラベリングに対して検証した。
論文 参考訳(メタデータ) (2026-08-31T16:40:24Z) - The Architect, the Adversary, and the Judge: Closed-Loop Generation of Standards-Aligned Assessment Items at Scale [13.85834524293015]
CLAIMは、K-12アセスメント・イテム生成のための生産パイプラインである。
パイプラインは9,074イテムの生産で97.8%のエキスパート評価パスレートに達する。
論文 参考訳(メタデータ) (2026-08-26T08:54:32Z) - Dear Algo: A Precision-First Agentic Intent Layer for Unified Search and Recommendation [14.580988352516457]
emphmore NBA News や emphless politics といったオープンエンドのリクエストは、ワンショットの結果リストではなく、その後のフィードレコメンデーションを操縦する。
Dear Algo on Threadsは、明示的に、推論され、ネガティブで、複雑なインテントを、地上の実行可能なプランにコンパイルする。
提案手法は, 精度優先評価フレームワークを用いて, フィードレコメンデーションに自然言語の意図がどのように適用できるかを示す。
論文 参考訳(メタデータ) (2026-08-16T17:59:12Z) - Metric Match: A Subset Selection Approach to Evaluating LLM Judge Reliability [28.15461581779256]
限定アノテーションからLLM判定器の相関に基づく信頼性指標を推定する手法を開発した。
Metric Matchは、サブセットが人口信頼度と一致するように、人間のアノテーションのためのサンプルのサブセットを選択する。
我々は,Metric Matchがランダムなサブセット選択に対して0.838の勝利率を達成することを実証的に示す。
論文 参考訳(メタデータ) (2026-06-12T23:54:16Z) - Hierarchical Certified Semantic Commitment for Byzantine-Resilient LLM-Agent Collaboration [30.310793549183117]
本稿では,BFTにインスパイアされたプロトコルH-CSC(Hierarchical Certified Semantic Commitment)を紹介する。
H-CSCはBFT対応バケット(0.31から2.04度)に低角偏差でコミットし、意図したようにBFTを超えるラウンド(n3f+1)の100%を中止する。
論文 参考訳(メタデータ) (2026-06-05T14:35:58Z) - CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks [47.027290803102666]
アンサンブル自己評価を通じて信頼性の高いタスク固有信号を提供するオープンフレームワークであるCoEvalを提案する。
モデルのプールは教師、学生、裁判官の3つの役割すべてを通して回転し、新鮮な汚染のないベンチマークを生成する。
論文 参考訳(メタデータ) (2026-06-02T13:41:43Z) - Agreement Metrics for LLM-as-Judge Evaluation: What to Report and Why [34.429649156970015]
最近のLLM-as-judge論文24件の調査では、判定尺度、ネクタイハンドリング、不正出力、禁断ハンドリングに絡み合ったメトリックの選択が見つかった。
Pearson's $r$、Spearman's $、Kendall's $_b$、phi係数$$、Matthews correlation Coefficientはすべて1つの数に還元される。
論文 参考訳(メタデータ) (2026-05-25T07:31:44Z) - Distributional Energy-Based Models for Uncertainty-Aware Structured LLM Reasoning [40.342912574072024]
大規模言語モデルは、旅行計画やコードソリューションのような構造化されたアウトプットを生成する。
個々の推論ステップは正しく見えるが、アウトプット全体が予算に違反したり、テストケースに失敗したり、あるいは以前の推論に矛盾することがある。
構造化LCM出力の検証のための決定論的解析制約付き学習品質スコアラを提案する。
論文 参考訳(メタデータ) (2026-05-15T17:08:27Z) - From Black Box to Glass Box: Cross-Model ASR Disagreement to Prioto Review in Ambient AI Scribe Documentation [43.148402136307716]
異種ASRシステム間のクロスモデル不一致は、基準のない不確実性信号として機能する。
商用APIとオープンソースエンジンにまたがる8つのASRシステムを備えた,50の公開医療用オーディオクリップを転写した。
低アグリメント領域は内容の不一致に富み、高リスク質量のクインタイル全体では53.9%から73.9%に増加した。
論文 参考訳(メタデータ) (2026-03-02T13:02:13Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。