論文の概要: Between-User Collapse Under Popularity-Biased Feedback: A Centered-Covariance Theorem and Computable Phase Boundary
- arxiv url: http://arxiv.org/abs/2608.02548v1
- Date: Mon, 03 Aug 2026 17:33:25 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-04 15:07:25.732468
- Title: Between-User Collapse Under Popularity-Biased Feedback: A Centered-Covariance Theorem and Computable Phase Boundary
- Title(参考訳): 人気バイアスフィードバックによるユーザ間の崩壊:中心的共分散理論と計算可能な位相境界
- Abstract要約: 我々は,人気度の高いBPRトレーニングが,協調フィルタリング埋め込みのユーザ間幾何学にどう影響するかを考察する。
定常アイテムによる人気バイアスのあるフィードバックの下では、$C$は安定した状態に収束する。
次に、その効果の限界について検討する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We study how popularity-biased BPR training reshapes the between-user geometry of collaborative-filtering embeddings. We work with the mean-centered user covariance $C=\tfrac1n U^\top H U$, the object that measures how distinguishable users are from one another, as opposed to the uncentered second moment used in prior work. We prove that under popularity-biased feedback with stationary items, $C$ converges to a steady state proportional to the item-noise covariance $Q$. Thus between-user spread collapses toward a noise floor. We derive a closed-form, computable phase boundary in the training hyperparameters $(α,λ_{neg},γ,d)$ separating contraction from expansion, and validate both directional predictions on MovieLens-25M. We then examine the limits of the effect. At deployment-scale regularization the predicted contraction is real and policy-driven but small, and it is not reflected in any recommendation-level metric we measured. The $α$-driven anisotropic-collapse mechanism operates only at regularization strengths that degrade the recommender. A deployment-time restoration intervention derived from the theory does not improve recommendation quality. The boundary is computable from a trained model's embeddings, item interaction counts, and training hyperparameters, so a practitioner can check whether a deployed system sits in the strong-collapse regime without simulating the feedback loop. In our experiments the boundary places deployable settings far from that regime.
- Abstract(参考訳): 我々は,人気度の高いBPRトレーニングが,協調フィルタリング埋め込みのユーザ間幾何学にどう影響するかを考察する。
我々は平均中心のユーザ共分散である$C=\tfrac1n U^\top H U$で作業する。
定常アイテムによる人気バイアスフィードバックの下では、$C$はアイテムノイズ共分散の$Q$に比例する定常状態に収束する。
これにより、ユーザ間の拡散がノイズフロアに向かって崩壊する。
トレーニングハイパーパラメータ$(α,λ_{neg},γ,d)$伸縮と伸縮を分離し,MovieLens-25M上での両方向予測を検証した。
次に、その効果の限界について検討する。
デプロイメントスケールの正規化では、予測された収縮は現実的でポリシー駆動だが、小さく、私たちが測定したレコメンデーションレベルの指標には反映されない。
α$駆動の異方性崩壊機構は、レコメンダを劣化させる正則化強度でのみ作用する。
この理論から導かれた展開時間復元の介入は、推奨品質を向上しない。
このバウンダリは、トレーニングされたモデルの埋め込み、アイテムのインタラクション数、ハイパーパラメータのトレーニングから計算可能であり、デプロイされたシステムがフィードバックループをシミュレートすることなく、強い崩壊状態にあるかどうかを確認することができる。
私たちの実験では、バウンダリは、その体制から遠く離れた配置可能な設定を配置します。
関連論文リスト
- Finite Constant Frontiers and Auditable Regret Certificates for Average-Reward Reinforcement Learning [0.9558392439655014]
定数対応比較プロトコルを導入し、MPPを通信するための明示的な有限下位証明書を導出する。
共通閉形式エンベロープは有限フロンティアで発行された係数を0.015$に改善する。
論文 参考訳(メタデータ) (2026-08-07T19:28:58Z) - Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training [51.18425726646089]
我々は、画像とビデオの拡散モデルのための統合潜在空間フレームワークであるtextscSUREを提案する。
報酬分布を学習し、信頼性を直接利用して、密集したポストトレーニングをガイドする。
textscSURE-REFLは評価手法の中で最も高いVBench品質、セマンティック、総得点を達成する。
論文 参考訳(メタデータ) (2026-08-06T14:55:42Z) - The V-fold jackknife for semiparametric inference: variance estimation, confidence intervals, and simultaneous confidence bands [2.715949869811686]
bootstrapは、その広範な適用性と最小限の分析要件のため、統計的推論のデフォルトツールである。
我々は,半パラメトリック推論の計算効率と理論的に正当化された代替手段として,$V$フォールド・ジャックナイフを開発した。
論文 参考訳(メタデータ) (2026-07-24T17:05:54Z) - Bandits for Efficient Experimentation: Adapting to Control Group, Preferences, and Context Drifts [19.395115096998108]
MED戦略の線形バージョンから着想を得たアルゴリズムであるDri-MEDを紹介する。
Dri-MEDはドリフトや嗜好構造を無視した保守的なベースラインを著しく上回ることを示す。
論文 参考訳(メタデータ) (2026-06-08T17:53:29Z) - Scaling Laws for Behavioral Foundation Models over User Event Sequences [2.924581427482972]
本稿では、共通の2部分の振る舞いモデルアーキテクチャ、特徴ベースのイベント埋め込み、デコーダのみの変換器について検討する。
約600回にわたって、実際のインタラクションデータで動作し、トレーニング用FLOPは1015ドルから1019ドルの範囲で、デプロイ関連軸が4つあります。
計算最適トレーニングは低計算時のテキストと比較してデータ量が多いが、計算量が増加するにつれて、そのD/N$比はチンチラに向かう。
論文 参考訳(メタデータ) (2026-06-03T15:59:25Z) - FAST-DIPS: Adjoint-Free Analytic Steps and Hard-Constrained Likelihood Correction for Diffusion-Prior Inverse Problems [2.9506605740700107]
トレーニングなし拡散の先行は、しばしば、繰り返し導関数や、保守的なステップサイズを持つ内部最適化/MCMCループに依存する。
本研究では、これらの内部ループをハードな測定空間実現可能性制約で置き換える訓練不要な解法を提案する。
実験はPSNR/SSIM/LPIPSと最大19.5$times$のスピードアップで、手書きのアジョイントや内部MCMCを使わずに、競争力のあるPSNR/SSIM/LPIPSを実現する。
論文 参考訳(メタデータ) (2026-03-02T08:17:26Z) - Optimal Unconstrained Self-Distillation in Ridge Regression: Strict Improvements, Precise Asymptotics, and One-Shot Tuning [61.07540493350384]
自己蒸留(英: Self-distillation, SD)とは、教師自身の予測と地道の混合で学生を訓練する過程である。
任意の予測リスクに対して、各正規化レベルにおいて、最適に混合された学生がリッジ教師に改善されることが示される。
本稿では,グリッド探索やサンプル分割,再構成なしに$star$を推定する一貫したワンショットチューニング手法を提案する。
論文 参考訳(メタデータ) (2026-02-19T17:21:15Z) - Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers [90.50039419576807]
RLVR(Reinforcement Learning with Verifiable Rewards)は、人為的なラベル付けを避けるために、自動検証に対するポリシーを訓練する。
認証ハッキングの脆弱性を軽減するため、多くのRLVRシステムはトレーニング中にバイナリ$0,1$の報酬を破棄する。
この選択にはコストがかかる:textitfalse negatives(正しい回答、FNを拒絶)とtextitfalse positives(間違った回答、FPを受け入れる)を導入する。
論文 参考訳(メタデータ) (2025-10-01T13:56:44Z) - Smoothed Normalization for Efficient Distributed Private Optimization [54.197255548244705]
フェデレートされた学習は、参加者のプライバシを備えた機械学習モデルを可能にする。
トレーニングやフィードバックのない問題に対して、差分にプライベートな分散手法は存在しない。
証明可能な収束保証付き分散アルゴリズム$alpha$-$sf NormEC$を導入する。
論文 参考訳(メタデータ) (2025-02-19T07:10:32Z) - Near-Optimal Dynamic Regret for Adversarial Linear Mixture MDPs [63.47351876442425]
本研究は,完全情報フィードバックの下で,相変わらずの相変わらずの線形混合MDPについて検討した。
本稿では,占領率に基づく手法と政策に基づく手法の利点を組み合わせた新しいアルゴリズムを提案する。
我々のアルゴリズムは$widetildemathcalO(d sqrtH3 K + sqrtHK(H + barP_K$)$ dynamic regret, ここで$d$は特徴次元である。
論文 参考訳(メタデータ) (2024-11-05T13:55:52Z) - Policy Gradient with Active Importance Sampling [55.112959067035916]
政策勾配法(PG法)はISの利点を大いに生かし、以前に収集したサンプルを効果的に再利用することができる。
しかし、ISは歴史的サンプルを再重み付けするための受動的ツールとしてRLに採用されている。
我々は、政策勾配のばらつきを減らすために、サンプルを収集する最良の行動ポリシーを模索する。
論文 参考訳(メタデータ) (2024-05-09T09:08:09Z) - Clustered Switchback Designs for Experimentation Under Spatio-temporal Interference [44.644520116360106]
我々は, 平均治療効果 (GATE) を推定し, 全単位を常に治療やコントロールに曝露した平均結果の差を推定した。
そこで我々は,単位をクラスタにグループ化し,時間ステップをブロックにグループ化する,クラスタ化されたスイッチバック設計を提案する。
良好なクラスタリングを許容するグラフに対して, トラッピングされたHorvitz-Thompson推定器が$tilde O(1/NT)$平均二乗誤差(MSE)を達成することを示す。
我々の結果は、citethu2022switchback、ugander2013graph、citetleung2022rateの結果を同時に一般化する。
論文 参考訳(メタデータ) (2023-12-25T01:00:58Z) - Ensemble linear interpolators: The role of ensembling [5.135730286836428]
補間器は不安定であり、例えば mininum $ell$ norm least square interpolator はノイズの多いデータを扱う際にテストエラーを示す。
本研究では,アンサンブルの安定性について検討し,個々の補間器のサンプル外予測リスクによって測定されたアンサンブルの非有界性能を向上する。
論文 参考訳(メタデータ) (2023-09-06T20:38:04Z) - Learning to Estimate Without Bias [57.82628598276623]
ガウスの定理は、重み付き最小二乗推定器は線形モデルにおける線形最小分散アンバイアスド推定(MVUE)であると述べている。
本稿では、バイアス制約のあるディープラーニングを用いて、この結果を非線形設定に拡張する第一歩を踏み出す。
BCEの第二の動機は、同じ未知の複数の推定値が平均化されてパフォーマンスが向上するアプリケーションにおいてである。
論文 参考訳(メタデータ) (2021-10-24T10:23:51Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。