論文の概要: Selection Shapes the Boundary: A Preregistered Replication of Monotonicity and Label Agreement in Unselected NLI Populations
- arxiv url: http://arxiv.org/abs/2607.19231v1
- Date: Tue, 21 Jul 2026 16:03:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.483458
- Title: Selection Shapes the Boundary: A Preregistered Replication of Monotonicity and Label Agreement in Unselected NLI Populations
- Title(参考訳): 境界の選別形:非選択NLI集団におけるモノトニック性とラベルの一致の事前登録
- Abstract要約: 以前の研究では、上向きの単調性演算子を含む仮説はラベルの一致が低かった。
我々は,同じオペレータタグと4段階の順序一致結果を用いて,この境界の複製を事前登録した。
より初期の負の境界は、人口レベルの特性よりも低アグリメント選択に条件づけられた構造であると結論付けている。
- 参考スコア(独自算出の注目度): 1.9177583131035885
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Prior work on human label variation (HLV) in natural language inference (NLI) has often relied on re-annotation resources that select items by disagreement level. An earlier study (arXiv:2607.15870) found that hypotheses containing non-upward monotonicity operators showed lower label agreement in ChaosNLI (Cliff's delta = -0.284), which is restricted to items whose majority label carries exactly three of five votes. We preregistered a replication of this boundary in the unselected populations that ChaosNLI was drawn from: the SNLI and MultiNLI development sets, using the same operator tagger and a four-level ordinal agreement outcome. The registered prediction fails. All seven contrasts return a positive Cliff's delta (non-upward items agree slightly more, not less), the only significant confirmatory contrast has the opposite sign to the registration, and every effect is far below our smallest effect size of interest (0.10). Robustness checks support the measurement: simulated tagger misclassification shrinks the effects rather than manufacturing them, and a manual re-tagging audit reaches four-class agreement of 0.875 on a fresh 200-item sample. We conclude that the earlier negative boundary is plausibly a structure conditional on low-agreement selection rather than a population-level property, and that HLV structure claims built on selected re-annotation resources should state their selection conditional explicitly.
- Abstract(参考訳): 自然言語推論(NLI)における人間ラベル変動(HLV)の先行研究は、しばしば不一致レベルで項目を選択する再注釈リソースに依存してきた。
以前の研究 (arXiv:2607.15870) では、上向きの単調性演算子を含む仮説はChaosNLI (Cliff's delta = -0.284) において低いラベル一致を示しており、これは多数ラベルが正確に5票のうち3票に制限されている。
SNLIとMultiNLIの開発セットは,同じオペレータタグと4段階の順序合意結果を用いて,ChaosNLIが引き起こした未選択集団におけるこの境界の複製を事前登録した。
登録された予測は失敗する。
7つのコントラストは全て正のクリフのデルタ(上向きでない項目はわずかに一致する)を返し、唯一の重要な確認コントラストは登録と反対の符号を持ち、すべての効果は我々の最小効果サイズ(0.10)よりはるかに低い。
シミュレーションされたタグの誤分類は、製造よりも効果を減らし、手動によるリタグ監査は、新しい200石のサンプルに対して0.875の4クラス合意に達する。
より初期の負の境界は、人口レベルの特性よりも低アグリメント選択に条件づけられた構造であり、選択された再アノテーションリソース上に構築されたHLV構造クレームは、その選択条件を明示的に記述すべきである、と結論付けている。
関連論文リスト
- Abliteration Is Not a Scalpel: Off-Target Effects of Refusal Removal on Decision Disposition Across Model Families [51.56484100374058]
放棄 — モデルの拒絶方向を重みから取り除く — は、一般的な"アンセンソルド"なオープンウェイトモデルの標準的なレシピである。
ディスポジションプローブとして21,600個の決定を不確実性の下で使用し、凍結パイプラインを通じて再生することにより、決定層モデルが唯一の変数となる。
3つのエフェクトは2つのファミリーにまたがって複製される(ゼロを除く週間クラスターCI)
4つ目の効果は符号を逆転する:同じ操作によりGemmaで読み取られた方が自信が弱まり、Qwenで読み取られたものがより多くなる(ファミリーCIは重複しない)。
論文 参考訳(メタデータ) (2026-07-19T22:27:00Z) - How Much Human Label Variation Does Formal Semantic Structure Explain?: Group-Level Effects and Item-Level Ceilings in NLI [1.9177583131035885]
自然言語推論における人間のラベルの変化は、ノイズよりも信号として扱われることが増えている。
ルールベース演算子と単調タグを用いたChaosNLIのSNLIとMNLIの3,113項目をMEDに対して検証した。
このサンプルでは、形式的な意味構造は、アノテータが少人数で不一致しているかどうかをシフトし、それらが不一致していることを検出できない。
論文 参考訳(メタデータ) (2026-07-17T11:34:30Z) - Null-Calibrated Conformal Selection via Target-Membership Scores [0.6599344783327052]
コンフォーマル選択は、未知の応答がターゲット領域に落下するテスト候補を偽発見率を制御しながら特定することを目的としている。
選択の自然なスコアは、代わりにターゲットメンバーシップの確率である、と我々は主張する。
会員スコアに基づくコンフォメーション選択について検討し、コンフォメーション・キャリブレーション・ルートの1つ、Null-Calibrated Conformal Selectionを分離する。
論文 参考訳(メタデータ) (2026-06-21T05:03:04Z) - Multi-Label Test-Time Adaptation with Bayesian Conditional Priors [15.878958356965159]
Conditional Priors Estimation (BCP) は、バックボーンをチューニングせずにラベル依存性を注入する勾配のないテスト時間適応法である。
BCPは、未ラベルのテストストリームからアンカー条件の事前値をオンラインで推定することで、ターゲットアノテーションなしで動作します。
BCPは、標準のマルチラベルベンチマークと複数のCLIPバックボーンで、強力なTTAベースラインを一貫して上回る。
論文 参考訳(メタデータ) (2026-06-11T05:29:00Z) - A Held-Out Transition-Pair Falsifier for Long-Horizon Non-Abelian State Tracking [0.5076419064097734]
有限非アベリア群追跡のためのホールドアウト遷移ペアファルシファイアを導入する。
制御された$S_3 times S_3$ベンチマークでは、長さ8列のみに基づいてトレーニングされた投影されたリカレント状態モデルがエラーのない最終状態予測を生成する。
論文 参考訳(メタデータ) (2026-06-05T13:26:41Z) - Metric-Dependent Annotation Saturation for Learning from Label Distributions [0.0]
我々は,ChaosNLIをサブサンプルとしたラベル分布のNLIモデルを微調整する。
3クラス NLI では、エントロピー相関は N 20-50 のアノテータを収束させる必要がある。
ソフトラベルは、ラベルの平滑化が再現できないアイテム固有の信号を運ぶ。
論文 参考訳(メタデータ) (2026-05-28T11:46:51Z) - Project-Probe-Aggregate: Efficient Fine-Tuning for Group Robustness [61.45587642780908]
画像テキスト基礎モデルのパラメータ効率向上のための3段階のアプローチを提案する。
本手法は, マイノリティ標本同定とロバストトレーニングアルゴリズムの2つの重要な要素を改良する。
我々の理論分析は,PPAが少数群の識別を向上し,バランスの取れたグループエラーを最小限に抑えるためにベイズが最適であることを示している。
論文 参考訳(メタデータ) (2025-03-12T15:46:12Z) - Appeal: Allow Mislabeled Samples the Chance to be Rectified in Partial Label Learning [55.4510979153023]
部分ラベル学習(PLL)では、各インスタンスは候補ラベルのセットに関連付けられ、そのうち1つだけが接地真実である。
誤記されたサンプルの「アペアル」を支援するため,最初の魅力に基づくフレームワークを提案する。
論文 参考訳(メタデータ) (2023-12-18T09:09:52Z) - Shrinking Class Space for Enhanced Certainty in Semi-Supervised Learning [59.44422468242455]
そこで我々はShrinkMatchと呼ばれる新しい手法を提案し、不確実なサンプルを学習する。
それぞれの不確実なサンプルに対して、元の Top-1 クラスを単に含むスランク類空間を適応的に求める。
次に、スランク空間における強と弱に強化された2つのサンプル間の整合正則化を課し、識別的表現を試みます。
論文 参考訳(メタデータ) (2023-08-13T14:05:24Z) - Ambiguity-Resistant Semi-Supervised Learning for Dense Object Detection [98.66771688028426]
本研究では,一段階検出器のためのAmbiguity-Resistant Semi-supervised Learning (ARSL)を提案する。
擬似ラベルの分類とローカライズ品質を定量化するために,JCE(Joint-Confidence Estimation)を提案する。
ARSLは、曖昧さを効果的に軽減し、MS COCOおよびPASCALVOC上で最先端のSSOD性能を達成する。
論文 参考訳(メタデータ) (2023-03-27T07:46:58Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。