論文の概要: What Wins a Vote? Formatting, Length, and Lexical Diversity in the French Compar:IA LLM Arena
- arxiv url: http://arxiv.org/abs/2610.01316v1
- Date: Thu, 01 Oct 2026 08:47:35 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-03 01:19:24.011752
- Title: What Wins a Vote? Formatting, Length, and Lexical Diversity in the French Compar:IA LLM Arena
- Title(参考訳): 投票に勝つものは何か? フランス語比較:IA LLMアリーナにおけるフォーマッティング、長さ、語彙の多様性
- Abstract要約: 我々は、2026年7月のCompar:IAリリースから、137,293人の決定的なフランス語の投票に対して、スタイメメトリックなアプローチを取っている。
各戦闘において、ユーザが投票したときの反応を可視的に再構築する。
得られたランキングを、フォーマット、長さ、可読性、語彙の多様性、文構造に調整したランキングと比較する。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: LLM arenas turn pairwise human preferences into model rankings. Those preferences may reflect how an answer is presented as well as what it says. We take a stylometric approach to 137,293 decisive French-language votes from the July 2026 Compar:IA release; the primary formatting analysis includes 137,113 battles across 116 models, and the joint estimates use the 127,092 battles with all required measurements. For each battle, we reconstruct the response visible when the user voted. We then compare the raw ranking with rankings adjusted for formatting, length, readability, vocabulary variety, and sentence structure. Presentation is associated with winning, but length, bold text, and lists tend to occur together, making their individual contributions hard to separate. Across the measured features, two associations change least across specifications: bold usage (+11.0% win odds per standard deviation in the joint model) and moving-average type-token ratio (MATTR), a measure of vocabulary variety that is less sensitive to answer length (+16.8%). The bold association is substantially smaller in observed multi-turn conversations, whereas the MATTR association changes little; because users choose whether to continue, this difference is descriptive rather than causal. The full adjustment moves 36 of 116 models by at least ten ranks. Yet comparisons with external benchmarks do not show that adjusted rankings better measure capability. We therefore recommend publishing raw and adjusted rankings side by side as a transparent sensitivity analysis.
- Abstract(参考訳): LLMアリーナは、ペアワイズ人間の好みをモデルランキングに変える。
これらの好みは、回答の提示方法や、その発言を反映しているかもしれない。
我々は、2026年7月のContra:IAリリースからの137,293人の決定的なフランス語票に対するスタイル的アプローチを取り、主要なフォーマット分析には、116モデルにわたる137,113人の戦闘が含まれ、共同見積もりでは、必要なすべての測定値で127,092人の戦闘を使用する。
各戦闘において、ユーザが投票したときの反応を可視的に再構築する。
得られたランキングを、フォーマット、長さ、可読性、語彙の多様性、文構造に調整したランキングと比較する。
プレゼンテーションは勝利と結びついているが、長さ、大胆な文章、リストは一緒に起こる傾向にあり、個々の貢献を分離するのが困難である。
測定された特徴全体では、大胆な使用(関節モデルにおける標準偏差当たり+11.0%の勝率)と、解答に敏感でない語彙の品種(+16.8%)の指標である移動平均型トーケン比(MATTR)の2つの関連性が最低限に変化する。
大胆な関連性は観察されたマルチターン会話において著しく小さいが、MATTRの関連性はほとんど変化せず、ユーザーは継続するかどうかを選択するため、この違いは因果関係ではなく記述的である。
フル調整は116モデルのうち36種を少なくとも10種ずつ移動させる。
しかし、外部ベンチマークとの比較では、調整されたランキングが測定能力を改善することは示されていない。
そこで我々は、透明感度分析として、生と調整済みのランキングを並べて公開することを推奨する。
関連論文リスト
- SlopBench: How Well Can We Rank Language Models by Slop? A Multi-Domain Benchmark of Repetitive AI Writing [0.0]
SlopBench氏は、どのモデルが固く反復的な散文の読者をAIスロップと呼ぶのかを尋ねる。
電子メール,ソーシャルポスト,エッセイ,職場チャットにおいて,手書きタスク112件のモデル18件を評価した。
論文 参考訳(メタデータ) (2026-09-27T20:38:23Z) - Measuring Alignment With Reader Highlights Net of Position and Length [1.8620637029128544]
120のウェブ文書(少なくとも12の独立した読者)では、言語モデルに重点を置くランキングが38.4%と一致した隣人の19.9%に対して群衆マーク付き文を維持している。
GPT-5.4 (+0.002 [-0.081, +0.088]) と区別できない 0.182 に到達し、5以下となる。
論文 参考訳(メタデータ) (2026-07-30T06:24:38Z) - There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items [1.14219428942199]
複数選択ベンチマークは、質問と正しい答えを修正しますが、ハーネスではありません。
スコアのばらつきを報告し、そのばらつきがどの項目に該当するかを未検討のままにし、それらが次のモデルから切り離した項目であるかどうかを報告する。
12のオープンウェイト命令チューニングLDMが4つのベンチマークから同じ3,679の項目に回答する。
論文 参考訳(メタデータ) (2026-07-17T00:28:29Z) - ConsistencyAI: A Benchmark to Assess LLMs' Factual Consistency When Responding to Different Demographic Groups [0.0]
本稿では,大規模言語モデル(LLM)の現実的整合性を測定するための独立したベンチマークであるConsistencyAIを紹介する。
実験では、19のLSMを質問し、15のトピック毎に5つの事実を要求した。
回答を文埋め込み, 対人コサイン類似度を計算し, 対人コサイン類似度の重み付け平均を計算し, 事実整合性スコアを算出した。
論文 参考訳(メタデータ) (2025-10-11T23:32:02Z) - Reasons to Reject? Aligning Language Models with Judgments [72.39858230784002]
言語フィードバックを用いた大規模言語モデル(LLM)の整合性について検討する。
本稿では,不適切なコンテンツ検出と判断に基づく修正が可能なコントラスト型異種訓練(Contrastive Unlikelihood Training, CUT)を提案する。
以上の結果から,CUTは175BのDaVinci003を破り,AlpacaEvalの50.84ポイントを達成できた。
論文 参考訳(メタデータ) (2023-12-22T10:29:43Z) - Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena [76.21004582932268]
本研究では, LLM-as-a-judgeの使用状況と限界について検討し, 位置, 冗長性, 自己改善バイアスについて検討した。
次に、マルチターン質問セットであるMT-benchとクラウドソースのバトルプラットフォームであるArenaの2つのベンチマークを導入することで、LCMの判断と人間の嗜好の一致を検証する。
論文 参考訳(メタデータ) (2023-06-09T05:55:52Z) - BLASER: A Text-Free Speech-to-Speech Translation Evaluation Metric [66.73705349465207]
エンドツーエンドの音声音声翻訳(S2ST)は、一般的にテキストベースのメトリクスで評価される。
本稿では,ASRシステムへの依存を回避するために,BLASERと呼ばれるエンドツーエンドS2STのテキストフリー評価指標を提案する。
論文 参考訳(メタデータ) (2022-12-16T14:00:26Z) - NLP-CIC @ DIACR-Ita: POS and Neighbor Based Distributional Models for
Lexical Semantic Change in Diachronic Italian Corpora [62.997667081978825]
本稿では,イタリア語に対する教師なし語彙意味変化のシステムと知見について述べる。
その課題は、対象の単語が時間とともにその意味を進化させたかどうかを判断することであり、それは2つの時間固有のデータセットからの原文のみに依存する。
本研究では,各期間に対象単語を表す2つのモデルを提案し,しきい値と投票方式を用いて変化単語を予測する。
論文 参考訳(メタデータ) (2020-11-07T11:27:18Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。