論文の概要: Floor, Ceiling, and the Fusion Gap: How Much of Crowd Reading Attention Can Machines Predict?
- arxiv url: http://arxiv.org/abs/2608.01704v1
- Date: Mon, 03 Aug 2026 05:09:49 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.330581
- Title: Floor, Ceiling, and the Fusion Gap: How Much of Crowd Reading Attention Can Machines Predict?
- Title(参考訳): Floor, Ceiling, and the Fusion Gap: 群衆の読書注意は機械が予測できるのか?
- Abstract要約: ベンチマークスコアは、自明なメソッドが何を達成し、最良のメソッドが何を達成できるかを知らなければ何の意味も持たない。
読者の群集が、それぞれの目的、無給、無命令、盲目などのために、120のWebドキュメントでマークされている文を予測します。
- 参考スコア(独自算出の注目度): 1.8620637029128544
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: A benchmark score means nothing without knowing what a trivial method achieves and what the best possible method could achieve. We construct both bounds for a task with a rare kind of ground truth: predicting which sentences a crowd of readers -- highlighting for their own purposes, unpaid, uninstructed, and blind to each other -- marked in 120 web documents. The floor is naive truncation (lead); the ceiling is a split-half oracle: half the crowd predicting the other half. The gap between them is +0.2028 AP [+0.1698, +0.2342, domain-clustered], and three findings structure it. First, the gap is semantic: position and length features recover 5% of it. Second, frontier language models reach 35-53% of it zero-shot -- far above classical baselines, far below the crowd; a state-of-the-art prompt compressor (LLMLingua-2) lands below the floor, indistinguishable from random selection. Third, an unweighted cross-vendor fusion of five frontier rankings plus a position prior reaches 60%, beating the best single model by +0.0159 [+0.0044, +0.0269; Holm p=0.019] -- a gain that survives ablation of its best member, split-half arm selection, prompt paraphrase, and label, gate, and seed perturbations, and was CONFIRMED by a pre-registered replication on 217 independent documents (+0.0179, Holm p=0.042). Finally, the bracket compresses: distilling the fusion into one open-weight 8B student that reads the whole document retains 90% of the fusion's edge and reaches statistical parity with the strongest single frontier model (+0.0070 [-0.0068, +0.0200]), where a local-context student retains only 63% -- the crowd's signal lives in document-level structure, and the cheapest known improvement is to ask several different models and average.
- Abstract(参考訳): ベンチマークスコアは、自明なメソッドが何を達成し、何が最良のメソッドを達成できるかを知らなければ何の意味も持たない。
読者の群集が、それぞれの目的、無給、無命令、盲目などのために、120のWebドキュメントでマークされている文を予測します。
天井は二分半のオラクルで、群衆の半分が残りの半分を予測している。
それらの間隙は+0.2028 AP [+0.1698, +0.2342, domain-clustered] であり、その構造は3つある。
第一に、ギャップは意味的であり、位置と長さの特徴はその5%を回復する。
第2に、フロンティア言語モデルは、ゼロショットの35~53%に達する -- 古典的なベースラインよりもはるかに上、群衆よりはるかに低い; 最先端のプロンプト圧縮機(LLMLingua-2)が床下に着陸し、ランダムな選択とは区別できない。
第3に、5つのフロンティアランクと以前のポジションが60%に達し、ベストシングルモデルに+0.0159 [+0.0044, +0.0269; Holm p=0.019] -- 最高のメンバーのアブレーション、分割半身選択、即時パラフレーズ、ラベル、ラベル、ゲート、シードの摂動に耐えるゲイン -- を圧倒し、217の独立文書(+0.0179, Holm p=0.042)で事前登録された複製によってCONFIRMEDされた。
最後に、ブラケットは圧縮する: ドキュメント全体を読み取るオープンウェイトな8B学生に融合を蒸留すると、融合の端の90%を保持し、最も強い単一フロンティアモデル(+0.0070 [-0.0068, +0.0200])と統計的に同等に達する。
関連論文リスト
- The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models [22.461983628330277]
多くの少数ショット適応手法は、ゼロショットテキストプロトタイプとKラベル付き画像特徴の平均の凸の組み合わせで分類される。
正しい比率は何か、検証データなしで見積もることができるのか、パフォーマンスがどこにあるのかを尋ねる。
4800以上の細胞(SigLIPを含む5つのバックボーン、5つのショットカウント、5つのシード、4つのプロンプトレベル)が、理論上最適な比率は間違った量の信頼できる推定値である。
検証不要な線形プローブは、オラクルチューニングされたブレンド(CLAPは+1.9ポイント、LP++は+1.5ポイント)を破る。
論文 参考訳(メタデータ) (2026-08-23T15:02:33Z) - Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk [0.0]
クレジットスコアリングは、決定ロジックをパラメータから読み取ることができないモデルに依存している。
共通する提案は、言語モデルとのギャップを埋める: 特徴属性を計算し、それらを LLM に渡し、合理的に記述させる。
このようなシステムをエンド・ツー・エンドに構築し、約束の後半が成立するかどうかをテストします。
論文 参考訳(メタデータ) (2026-08-08T13:22:14Z) - When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models [45.91367912142692]
異なるモデルがいまだに同じ狭い部分集合を選択している可能性を示し、単一の引用が誤りを犯さずに、引用モノカルチャーを生成する。
3つのベンダーの11のモデルが、30のランダムなパネルから少なくとも10の論文を選択しており、実際のタイトルと抽象物があるが、作者が作り直され、再割り当て年、隠れた会場と引用数がある。
論文 参考訳(メタデータ) (2026-08-03T14:27:46Z) - Language Models Agree With Each Other, Not With Readers [1.8620637029128544]
我々は、その目的のために構築された誰もいない人間の参照に対する収束を測定する。
120のWebドキュメントに2,523のリードマークがある。
読者が読むものよりも確実に読者に同意するモデルはない。
論文 参考訳(メタデータ) (2026-07-31T10:44:10Z) - Measuring Alignment With Reader Highlights Net of Position and Length [1.8620637029128544]
120のウェブ文書(少なくとも12の独立した読者)では、言語モデルに重点を置くランキングが38.4%と一致した隣人の19.9%に対して群衆マーク付き文を維持している。
GPT-5.4 (+0.002 [-0.081, +0.088]) と区別できない 0.182 に到達し、5以下となる。
論文 参考訳(メタデータ) (2026-07-30T06:24:38Z) - The Model as One Rater Among Several: Measuring Political Positions in Data-Sparse Regions with a Language-Model Panel [0.0]
パネルと、空白とゼロのスコアを区別する適用性ルールと、アクターが何をするかを区別するレンズシステムについて説明する。
私は、まだ欠落している人間のバリデーションを含め、このメソッドができないことを平気で考え、楽器とデータをフルにリリースします。
論文 参考訳(メタデータ) (2026-06-22T08:48:50Z) - The Long Tail, Not the Front Page: Cold-Start Prediction of Crowd Highlight Salience [1.8620637029128544]
ソーシャル・ハイライトの最も有用なシグナルは、既に多くの人が読んでいる文書にのみ存在する。
文書の集合的な群衆のサリエンスを、そのマークが蓄積される前にテキストから予測できるのか?
このデータに関する以前の研究で、ゼロショット言語モデルが、簡単なリード(配置)ベースラインよりも低い位置のハイライトを回復していることが判明した。
ハイライトコーパスでトレーニングされたモデルがそのベースラインを上回ることができるかどうかを問う。
論文 参考訳(メタデータ) (2026-06-10T04:37:23Z) - Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search [50.16356451328644]
シャノン型エントロピーの不等式を証明することは情報理論の基本的な課題である。
我々は,原子実証のステップを微調整した小規模大規模言語モデルがこのプロセスを自動化することができるか検討する。
GPT-5.5は0ショットプロンプトで1.7%のサンプルを解き、Psitipは33.3%のサンプルを解いた。
論文 参考訳(メタデータ) (2026-06-04T05:43:12Z) - Amplifying, Not Learning: Fine-Tuned AI Text Detectors Amplify a Pretrained Direction [51.56484100374058]
テキスト検出器は、事前訓練された典型軸を増幅する。
タスク監督前の生エンコーダでは、3つのアーキテクチャでNYT-vs-HC3 AUROC 0.806/0.944/0.834を達成する。
RoBERTaベースでは、生のプロジェクションは微調整を超えるが、RoBERTaベースでは、フル微調整は、試験された流線型人口の双方で生よりも識別を小さくする。
論文 参考訳(メタデータ) (2026-05-20T19:08:38Z) - How Far Is Document Parsing from Solved? PureDocBench: A Source-TraceableBenchmark across Clean, Degraded, and Real-World Settings [56.70440596502351]
昨年は20以上のオープンドキュメントパースモデルが見られたが、ベンチマークはほぼOmniDocBenchにのみ依存している。
HTML/CSSのドキュメントイメージをレンダリングするベンチマークであるPureDocBenchは、10のドメイン、66ページ、1,475ページをカバーしています。
論文 参考訳(メタデータ) (2026-05-08T09:30:31Z) - BibTeX Citation Hallucinations in Scientific Publishing Agents: Evaluation and Mitigation [34.429649156970015]
以前の評価では、検索なしでベースモデルをテストしたが、これは現在の慣行を反映していない。
3つの検索可能なフロンティアモデルでは、9つのフィールドと6方向のエラー分類に基づいてBibエントリを生成する。
全体的な精度は83.6%だが、完全な正確さは50.9%に過ぎない。
論文 参考訳(メタデータ) (2026-04-03T16:30:58Z) - CLUE: Non-parametric Verification from Experience via Hidden-State Clustering [64.50919789875233]
隠れアクティベーションの軌跡内の幾何的に分離可能なシグネチャとして解の正しさが符号化されていることを示す。
ClUE は LLM-as-a-judge ベースラインを一貫して上回り、候補者の再選において近代的な信頼に基づく手法に適合または超えている。
論文 参考訳(メタデータ) (2025-10-02T02:14:33Z) - HuBERT: Self-Supervised Speech Representation Learning by Masked
Prediction of Hidden Units [81.53783563025084]
本稿では、BERTのような予測損失に対して、アライメントされたターゲットラベルを提供するオフラインクラスタリングステップを提案する。
提案手法の重要な要素は,マスク領域にのみ予測損失を適用することである。
HuBERTは、より困難なdev-otherおよびtest-other評価サブセットに対して、最大19%と13%の相対的なWER削減を示す。
論文 参考訳(メタデータ) (2021-06-14T14:14:28Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。