論文の概要: Attention Limited Reward Learning
- arxiv url: http://arxiv.org/abs/2607.04590v1
- Date: Mon, 06 Jul 2026 01:33:12 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-07 22:26:29.986353
- Title: Attention Limited Reward Learning
- Title(参考訳): 注意制限リワード学習
- Abstract要約: 限定的な注意が対比較を根本的に歪めることを示す。
分析の結果,学習はラベルの原数ではなく,各ラベルが持つ情報量によって管理されていることがわかった。
この視点は、人間のフィードバックは直接的に明らかな嗜好ではなく、注意に制限された測定プロセスとして扱うべきであることを示唆している。
- 参考スコア(独自算出の注目度): 1.4554818659491644
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Pairwise human comparisons are a primary interface through which modern AI systems learn human preferences. RLHF and related alignment pipelines typically model such comparisons with Bradley--Terry log-odds, where choice probabilities are governed by latent reward differences. This paper examines what this assumption misses through a reduced-form model motivated by rational inattention, in which each label is generated by a low-capacity evaluation channel. The model separates two forms of ambiguity that standard reward modeling tends to conflate: a comparison may be difficult because the two candidates are genuinely close in value, or because the relevant distinction is hard to detect under limited attention. We show that limited attention can fundamentally distort what pairwise comparisons reveal. In particular, passive comparison data cannot generally distinguish reward, attention, and default tendencies, and heterogeneous attention can make standard Bradley--Terry reward modeling recover misleading rankings. Our analysis shows that learning is governed not by the raw number of labels, but by the amount of attended information each label carries. A case study on human votes over language-model pairs from Chatbot Arena exhibits the predicted signature, a cyclic component of the comparison data that exceeds sampling noise and that no scalar reward can represent; a second case study on perceptual comparisons shows that response times and gaze carry gap information that the labels do not. This perspective suggests that human feedback should be treated not as direct revealed preference, but as an attention-limited measurement process: a weak preference signal may reflect hidden evaluation difficulty rather than genuine indifference.
- Abstract(参考訳): ペアワイズ人間比較は、現代のAIシステムが人間の好みを学習する主要なインターフェースである。
RLHFと関連するアライメントパイプラインは典型的にはブラッドリー-テリー対数ノードとの比較をモデル化し、選択確率は遅延報酬差によって制御される。
本稿では,この仮定が,低容量評価チャネルによって各ラベルが生成される有理的意図によって動機づけられた縮小形式モデルによってどのような損失を犯すかを検討する。
このモデルでは、標準的な報酬モデリングが強調する傾向にある2つの曖昧さを区別している: 比較は、2つの候補が真に値が近いため、または、関連する区別が限定的な注意の下では検出し難いため、難しいかもしれない。
限定的な注意は、ペアワイズ比較が示すものを根本的に歪ませる可能性があることを示す。
特に、受動的比較データは一般的に報酬、注意、デフォルトの傾向を区別することができず、不均一な注意がBradleyの標準となる。
分析の結果,学習はラベルの原数ではなく,各ラベルが持つ情報量によって管理されていることがわかった。
Chatbot Arenaの言語モデル対に対する人間の票に関するケーススタディでは、サンプリングノイズを超える比較データの循環成分である予測シグネチャが示され、スカラー報酬が表現できない。
この視点は、人間のフィードバックは直接的に明らかな嗜好ではなく、注意制限された測定プロセスとして扱うべきであることを示唆している: 弱い選好信号は真の偏見よりも隠れた評価の難しさを反映する。
関連論文リスト
- Mitigating Spurious Correlations with Memorization-Guided Dataset De-Biasing [8.645414910735449]
コアおよびスパイラル特徴の学習力学をアンハングリングする2段階のサンプルスコアリング関数を開発した。
提案手法は,提案手法を用いて,突発的相関を伴わずに,情報的サンプルの発見と優先順位付けを行うアルゴリズムを提案する。
論文 参考訳(メタデータ) (2026-06-01T19:48:20Z) - The Benefits of Diversity: Combining Comparisons and Ratings for Efficient Scoring [9.86498390490516]
興味深いことに、どちらの形態の選好誘発も、一つの種類の焦点よりも優れていることが示される。
両信号から学習が可能な統一確率モデルであるSCoRaを紹介する。
論文 参考訳(メタデータ) (2026-02-08T16:08:26Z) - How Many Human Judgments Are Enough? Feasibility Limits of Human Preference Evaluation [0.38991526486631006]
優先信号がプロンプト間で拡散している場合、比例アロケーションは最小値最適であることを示す。
以上の結果から,非決定的あるいは否定的な評価結果が,モデル等価性よりも低パワー評価を反映していることが示唆された。
論文 参考訳(メタデータ) (2026-01-14T02:34:58Z) - Weakly-Supervised Contrastive Learning for Imprecise Class Labels [50.57424331797865]
正対と負対を定義するために「連続的意味的類似性」の概念を導入する。
弱教師付きコントラスト学習のためのグラフ理論フレームワークを提案する。
我々のフレームワークは非常に多用途であり、多くの弱い教師付き学習シナリオに適用できる。
論文 参考訳(メタデータ) (2025-05-28T06:50:40Z) - Beyond correlation: The Impact of Human Uncertainty in Measuring the Effectiveness of Automatic Evaluation and LLM-as-a-Judge [51.93909886542317]
一つの集計相関スコアを*参照することで、人名と自動評価の基本的な違いが曖昧になることを示す。
本研究では,評価性能のより堅牢な解析を行うために,ラベルの不確実性による階層化データを提案する。
論文 参考訳(メタデータ) (2024-10-03T03:08:29Z) - Virtual Category Learning: A Semi-Supervised Learning Method for Dense
Prediction with Extremely Limited Labels [63.16824565919966]
本稿では,ラベルの修正を伴わずに,混乱したサンプルを積極的に使用することを提案する。
仮想カテゴリー(VC)は、モデルの最適化に安全に貢献できるように、各混乱したサンプルに割り当てられる。
私たちの興味深い発見は、密集した視覚タスクにおけるVC学習の利用に注目しています。
論文 参考訳(メタデータ) (2023-12-02T16:23:52Z) - Crowdsourcing subjective annotations using pairwise comparisons reduces
bias and error compared to the majority-vote method [0.0]
本稿では,ランダムな誤差と測定バイアスが,主観的構成物のクラウドソースアノテーションにどのように入るかを理解するための理論的枠組みを提案する。
次に、Eloスコアとペア比較ラベリングを組み合わせたパイプラインを提案し、両種類の測定誤差を低減するために、ユビキタスな多数投票法より優れていることを示す。
論文 参考訳(メタデータ) (2023-05-31T17:14:12Z) - SeedBERT: Recovering Annotator Rating Distributions from an Aggregated
Label [43.23903984174963]
単一ラベルからアノテータ評価分布を復元するSeedBERTを提案する。
人間の評価は,SeedBERTの注意機構がアノテータの不一致の原因と一致していることを示している。
論文 参考訳(メタデータ) (2022-11-23T18:35:15Z) - Rethinking Missing Data: Aleatoric Uncertainty-Aware Recommendation [59.500347564280204]
本稿では, Aleatoric Uncertainty-aware Recommendation (AUR) フレームワークを提案する。
AURは、新しい不確実性推定器と通常のレコメンデータモデルで構成されている。
誤ラベルの可能性がペアの可能性を反映しているため、AURは不確実性に応じてレコメンデーションを行う。
論文 参考訳(メタデータ) (2022-09-22T04:32:51Z) - Debiased Contrastive Learning [64.98602526764599]
我々は,同ラベルデータポイントのサンプリングを補正する,偏りのあるコントラスト目的の開発を行う。
実証的に、提案する目的は、視覚、言語、強化学習ベンチマークにおける表現学習の最先端を一貫して上回る。
論文 参考訳(メタデータ) (2020-07-01T04:25:24Z) - Do Public Datasets Assure Unbiased Comparisons for Registration
Evaluation? [96.53940048041248]
画像誘導神経外科医の登録をベンチマークするために、2つのデータセットで手動で注釈付けされたランドマークをスクリーニングするために、ヴァリグラムを使用します。
Variograms を用いて, 潜在的に有意な症例を同定し, 経験者により検討した。
論文 参考訳(メタデータ) (2020-03-20T20:04:47Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。