論文の概要: Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons
- arxiv url: http://arxiv.org/abs/2608.10045v1
- Date: Mon, 10 Aug 2026 13:01:48 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-12 19:14:45.76538
- Title: Finding the Signal in the Spam: Jointly Learning Rewards and Worker Reliability from Pairwise Comparisons
- Title(参考訳): スパムにおける信号の発見 : ペアワイズ比較による共同学習と作業者の信頼性
- Abstract要約: ペアワイズ比較に基づいてアイテム報酬を学習するためのEMベースのアルゴリズムを提案する。
実世界および合成データセットに関する広範な実験を行う。
- 参考スコア(独自算出の注目度): 14.609458985201757
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: The problem of learning from pairwise comparisons has been widely studied across many domains such as recommendation systems, social choice, and more recently, fine-tuning large language models. In this problem, the goal is to learn item rewards based on pairwise comparisons between them. In many scenarios, these comparisons are elicited from crowdworkers using platforms such as Amazon Mechanical Turk, Scale AI, etc. However, crowdworkers are often unreliable due to limited domain knowledge or revenue-maximizing (spamming) behavior. In this work, our goal is to understand whether worker reliability (competency) can be learned jointly with item rewards. To this end, we adopt the Boltzmann-rational model for pairwise comparisons, which extends the Bradley-Terry-Luce model by incorporating worker competencies. We derive an EM-based algorithm for learning under this model by introducing Polya-Gamma latent variables to transform the logistic likelihood into a conditionally Gaussian form, enabling tractable optimization and leading to a simplified $Q$ function in the E-step of the algorithm. This technique allows us to reduce our formulation to a matrix sensing problem, using which we establish theoretical convergence guarantees for our algorithm. We conduct extensive experiments on real-world and synthetic datasets. These experiments demonstrate the advantages of using our algorithm over several baselines and confirm its strong robustness to both spammers and adversarial workers, highlighting its practical effectiveness in realistic crowdsourcing and reward learning settings. The code and data is publicly available at https://github.com/KaustubhShejole/BoRa_EM.
- Abstract(参考訳): ペア比較から学習する問題は、レコメンデーションシステムや社会的選択、最近では微調整された大規模言語モデルなど、多くの領域で広く研究されている。
この問題では、アイテム間のペアワイズ比較に基づいてアイテム報酬を学習することが目的である。
多くのシナリオにおいて、これらの比較は、Amazon Mechanical TurkやScale AIなどのプラットフォームを使用して、クラウドワーカーから引き出される。
しかし、クラウドワーカーはドメイン知識の制限や収益の最大化(スパミング)の振る舞いのために信頼できないことが多い。
本研究の目的は,作業者の信頼性(能力)を項目報酬とともに学習できるかどうかを理解することである。
この目的のために、Boltzmann-rational modelをペア比較に適用し、Bradley-Terry-Luceモデルを拡張した。
このモデルに基づくEMベースの学習アルゴリズムは,ロジスティック確率を条件付きガウス形式に変換するために,ポリア・ガンマ潜伏変数を導入し,抽出可能な最適化を実現し,アルゴリズムのEステップにおける単純化された$Q$関数を実現する。
この手法により、行列センシング問題への定式化を減らし、アルゴリズムの理論収束保証を確立することができる。
実世界および合成データセットに関する広範な実験を行う。
これらの実験は,我々のアルゴリズムをいくつかのベースラインで活用することの利点を実証し,スパマーと敵の労働者の両方に対して強い堅牢性を確認し,現実的なクラウドソーシングと報奨学習設定における実践的有効性を強調した。
コードとデータはhttps://github.com/KaustubhShejole/BoRa_EMで公開されている。
関連論文リスト
- Inverse Entropic Optimal Transport Solves Semi-supervised Learning via Data Likelihood Maximization [72.69498649272347]
条件分布は機械学習の中心的な問題です
ペアデータとペアデータの両方を統合する新しいパラダイムを提案する。
提案手法は任意の誤差で理論上真の条件分布を復元可能であることを示す。
論文 参考訳(メタデータ) (2024-10-03T16:12:59Z) - Are Good Explainers Secretly Human-in-the-Loop Active Learners? [0.0]
説明可能なAI(XAI)技術は、ここ数年で複数のユースケースで人気を集めている。
ここでは、モデル予測の研究において、追加のトレーニングデータ収集に使用することを検討する。
これは、クエリ戦略がヒューマン・イン・ザ・ループを含むアクティブ・ラーニングと等価である、と我々は主張する。
論文 参考訳(メタデータ) (2023-06-24T10:50:42Z) - Inverse Preference Learning: Preference-based RL without a Reward
Function [34.31087304327075]
Inverse Preference Learning (IPL) は、オフラインの嗜好データから学習するために特別に設計された。
我々の重要な洞察は、固定されたポリシーに対して、$Q$関数は報酬関数に関する全ての情報をエンコードし、効果的に交換可能であることである。
IPLは、トランスフォーマーベースおよび非マルコフ報酬関数を利用するより複雑なアプローチと比較して、競争性能が向上する。
論文 参考訳(メタデータ) (2023-05-24T17:14:10Z) - Principled Reinforcement Learning with Human Feedback from Pairwise or
$K$-wise Comparisons [79.98542868281473]
RLHF(Reinforcement Learning with Human Feedback)の理論的枠組みを提供する。
学習した報酬モデルに基づいてポリシーをトレーニングする際、MLEは失敗し、悲観的なMLEは特定のカバレッジ仮定の下で性能を改善したポリシーを提供する。
論文 参考訳(メタデータ) (2023-01-26T18:07:21Z) - Multi-Task Off-Policy Learning from Bandit Feedback [54.96011624223482]
本稿では,階層型非政治最適化アルゴリズム (HierOPO) を提案する。
学習方針の準最適性にタスクごとのバウンダリを証明し、階層モデルを使用しないよりも明確な改善を示す。
我々の理論的および実証的な結果は、各タスクを個別に解くよりも、階層を使うことの明確な利点を示している。
論文 参考訳(メタデータ) (2022-12-09T08:26:27Z) - Emergent Instabilities in Algorithmic Feedback Loops [3.4711828357576855]
教師-学生の学習シミュレーションを用いて,推薦アルゴリズムにおけるアルゴリズムの相違について検討する。
結果は、人とアルゴリズム間の相互作用から創発的な行動を説明する必要性を強調している。
論文 参考訳(メタデータ) (2022-01-18T18:58:03Z) - Scalable Personalised Item Ranking through Parametric Density Estimation [53.44830012414444]
暗黙のフィードバックから学ぶことは、一流問題の難しい性質のために困難です。
ほとんどの従来の方法は、一級問題に対処するためにペアワイズランキングアプローチとネガティブサンプラーを使用します。
本論文では,ポイントワイズと同等の収束速度を実現する学習対ランクアプローチを提案する。
論文 参考訳(メタデータ) (2021-05-11T03:38:16Z) - DEALIO: Data-Efficient Adversarial Learning for Imitation from
Observation [57.358212277226315]
観察ifoからの模倣学習において、学習エージェントは、実演者の生成した制御信号にアクセスせずに、実演行動の観察のみを用いて実演エージェントを模倣しようとする。
近年、逆模倣学習に基づく手法は、ifO問題に対する最先端のパフォーマンスをもたらすが、データ非効率でモデルなしの強化学習アルゴリズムに依存するため、サンプルの複雑さに悩まされることが多い。
この問題は、サンプルの収集が時間、エネルギー、およびリスクの面で高いコストを被る可能性がある現実世界の設定に展開することは非現実的です。
よりデータ効率の高いifOアルゴリズムを提案する。
論文 参考訳(メタデータ) (2021-03-31T23:46:32Z) - Differential Privacy and Byzantine Resilience in SGD: Do They Add Up? [6.614755043607777]
本研究では,差分プライバシ(DP)と$(alpha,f)$-ビザンチンレジリエンスを併用して,SGD(Gradient Descent)学習アルゴリズムの分散実装が実現可能であるかを検討する。
これらの手法の直接的な構成は、結果のSGDアルゴリズムがMLモデルのパラメータ数に依存することを保証していることを示す。
論文 参考訳(メタデータ) (2021-02-16T14:10:38Z) - Online Apprenticeship Learning [58.45089581278177]
見習い学習(AL)では、コスト関数にアクセスせずにマルコフ決定プロセス(MDP)が与えられます。
目標は、事前に定義されたコスト関数のセットで専門家のパフォーマンスに一致するポリシーを見つけることです。
ミラー下降型ノンレグレットアルゴリズムを2つ組み合わせることで,OAL問題を効果的に解くことができることを示す。
論文 参考訳(メタデータ) (2021-02-13T12:57:51Z) - User-Level Privacy-Preserving Federated Learning: Analysis and
Performance Optimization [77.43075255745389]
フェデレートラーニング(FL)は、データを有用なモデルにトレーニングしながら、モバイル端末(MT)からプライベートデータを保存することができる。
情報理論の観点からは、MTがアップロードした共有モデルから、好奇心の強いサーバがプライベートな情報を推測することが可能である。
サーバにアップロードする前に、共有モデルに人工ノイズを加えることで、ユーザレベルの差分プライバシー(UDP)アルゴリズムを提案する。
論文 参考訳(メタデータ) (2020-02-29T10:13:39Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。