論文の概要: Strategic Candidacy in Generative AI Arenas
- arxiv url: http://arxiv.org/abs/2603.26891v1
- Date: Fri, 27 Mar 2026 18:12:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-03-31 23:18:44.682071
- Title: Strategic Candidacy in Generative AI Arenas
- Title(参考訳): ジェネレーティブAIアリーナにおける戦略的候補
- Authors: Chris Hays, Rachel Li, Bailey Flanigan, Manish Raghavan,
- Abstract要約: そこで我々は,YouRankWeRank-YRWRと呼ばれるペア比較モデルから,新たなランキングモデルを提案する。
生産者は自身のモデルにランキングを提出し、モデル品質の統計的推定を補正するためにこれらのランキングを使用する必要がある。
このメカニズムは、プロデューサがそれぞれのユニークなモデルを正確に1度だけ提出するだけでは、そのランクを向上できないという意味で、ほぼクローンロスであることを示す。
- 参考スコア(独自算出の注目度): 5.648790815017435
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: AI arenas, which rank generative models from pairwise preferences of users, are a popular method for measuring the relative performance of models in the course of their organic use. Because rankings are computed from noisy preferences, there is a concern that model producers can exploit this randomness by submitting many models (e.g., multiple variants of essentially the same model) and thereby artificially improve the rank of their top models. This can lead to degradations in the quality, and therefore the usefulness, of the ranking. In this paper, we begin by establishing, both theoretically and in simulations calibrated to data from the platform Arena (formerly LMArena, Chatbot Arena), conditions under which producers can benefit from submitting clones when their goal is to be ranked highly. We then propose a new mechanism for ranking models from pairwise comparisons, called You-Rank-We-Rank (YRWR). It requires that producers submit rankings over their own models and uses these rankings to correct statistical estimates of model quality. We prove that this mechanism is approximately clone-robust, in the sense that a producer cannot improve their rank much by doing anything other than submitting each of their unique models exactly once. Moreover, to the extent that model producers are able to correctly rank their own models, YRWR improves overall ranking accuracy. In further simulations, we show that indeed the mechanism is approximately clone-robust and quantify improvements to ranking accuracy, even under producer misranking.
- Abstract(参考訳): 一対の好みから生成モデルをランク付けするAIアリーナは、有機的利用におけるモデルの相対的パフォーマンスを測定する一般的な方法である。
ランク付けはノイズの多い選好から計算されるため、モデル生成者が多くのモデル(例えば、本質的に同じモデルの複数の変種)を提出することで、このランダム性を利用でき、それによってトップモデルのランクを人工的に改善できるという懸念がある。
これにより、品質が低下し、従って、ランキングの有用性が低下する可能性がある。
本稿では,まず,プラットフォームアリーナ(旧LMArena,Chatbot Arena)のデータに校正された理論的・理論的両方のシミュレーションを行うことから始める。
そこで我々は、You-Rank-We-Rank (YRWR) と呼ばれるペアワイズ比較から、モデルランキングの新たなメカニズムを提案する。
生産者は自身のモデルにランキングを提出し、モデル品質の統計的推定を補正するためにこれらのランキングを使用する必要がある。
このメカニズムは、プロデューサがそれぞれのユニークなモデルを正確に1度だけ提出するだけでは、そのランクを向上できないという意味で、ほぼクローンロスであることを示す。
さらに、モデル生産者が自身のモデルを正しくランク付けできる程度に、YRWRは全体のランキング精度を向上させる。
さらなるシミュレーションでは、このメカニズムは概ねクローン・ロストであり、生産者のミスランク下であっても、ランキング精度の改善を定量化できることを示した。
関連論文リスト
- ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability [83.16850534680505]
本稿では,自動推論集約型トレーニングデータ合成フレームワークを提案する。
自己整合性データフィルタリング機構は、データ品質を保証するために設計されている。
トレーニングされた推論集約型リランカ textbfReasonRank は,BRIGHT のリーダボード上での最先端 (SOTA) のパフォーマンス40.6 を達成する。
論文 参考訳(メタデータ) (2025-08-09T17:26:18Z) - CHARM: Calibrating Reward Models With Chatbot Arena Scores [31.599659350165354]
リワードモデル(RM)は、人間の好みのプロキシとして機能し、大きな言語モデルを調整することで、人間のフィードバックからの強化学習において重要な役割を果たす。
我々は、RMにおけるモデル優先バイアスを特定し、特定のポリシーモデルからの応答に不均等に高いスコアを体系的に割り当てる。
この問題に対処するために,アリーナリーダーボードからのエロスコアを利用したCHARM(Chaatbot Arena Reward Modeling)というキャリブレーション手法を提案する。
論文 参考訳(メタデータ) (2025-04-14T09:51:09Z) - K-Sort Arena: Efficient and Reliable Benchmarking for Generative Models via K-wise Human Preferences [30.744662265421788]
モデル比較でユーザー投票を集めるArenaプラットフォームは、モデルと人間の好みをランク付けすることができる。
我々はK-Sort Arenaを紹介した。K-Sort Arenaは、画像とビデオがテキストよりも知覚的直感性が高いという重要な洞察に基づく、効率的で信頼性の高いプラットフォームである。
我々の実験では、K-Sort Arenaは広く使われているELOアルゴリズムと比較して16.3倍高速収束を示す。
論文 参考訳(メタデータ) (2024-08-26T17:58:20Z) - Investigating the Robustness of Counterfactual Learning to Rank Models: A Reproducibility Study [71.04084063541777]
ランク付けのためのカウンターファクトラーニングはIRコミュニティで広く注目を集めている。
モデルは、ユーザの振る舞いの仮定が正しく、確率推定が正確であるときに理論的に非バイアス化される。
それらの有効性は通常シミュレーションベースの実験を通じて実証的に評価されるが、これは広く利用可能な大規模で実際のクリックログが不足しているためである。
論文 参考訳(メタデータ) (2024-04-04T10:54:38Z) - Learning Rich Rankings [7.940293148084844]
文脈的反復選択(CRS)モデルを構築し、自然の多モード性とリッチネスをランキング空間にもたらす。
構造に依存したテールリスクと予測されるリスクバウンダリによるモデルの下での最大推定の理論的保証を提供する。
また,MNL選択モデルとPlackett-Luce(PL)ランキングモデルに対する最大極大推定器の予測リスクに,最初の厳密な境界を設けた。
論文 参考訳(メタデータ) (2023-12-22T21:40:57Z) - COPR: Consistency-Oriented Pre-Ranking for Online Advertising [27.28920707332434]
オンライン広告のための一貫性指向のプレグレードフレームワークを提案する。
チャンクベースのサンプリングモジュールとプラグアンドプレイのランクアライメントモジュールを使用して、ECPMでランク付けされた結果の一貫性を明示的に最適化する。
Taobaoのディスプレイ広告システムに展開すると、最大で+12.3%のCTRと+5.6%のRPMを実現している。
論文 参考訳(メタデータ) (2023-06-06T09:08:40Z) - The False Promise of Imitating Proprietary LLMs [158.65692029352584]
より弱い言語モデルを安価に改善するための新しい方法は、より強力なモデルからの出力に対してそれを微調整することである。
このアプローチは、より弱いオープンソースモデルを使用して、プロプライエタリなモデルの機能を安価に模倣することを目指している。
まず、様々なベースモデルサイズを用いてChatGPTを模倣する一連のLMを微調整する。
次に、群衆レーダと標準NLPベンチマークを用いてモデルを評価する。
論文 参考訳(メタデータ) (2023-05-25T05:00:12Z) - Interpretable Learning-to-Rank with Generalized Additive Models [78.42800966500374]
ラーニング・ツー・ランクのモデルの解釈可能性は、非常に重要でありながら、比較的過小評価されている研究分野である。
解釈可能なランキングモデルの最近の進歩は、主に既存のブラックボックスランキングモデルに対するポストホックな説明の生成に焦点を当てている。
一般化加法モデル(GAM)をランキングタスクに導入することにより,本質的に解釈可能な学習 to ランクの基盤を築いた。
論文 参考訳(メタデータ) (2020-05-06T01:51:30Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。