論文の概要: The One-Word Census: Answer-Choice Conformity Across 44 Language Models
- arxiv url: http://arxiv.org/abs/2607.12796v1
- Date: Tue, 14 Jul 2026 14:12:05 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-15 17:08:30.167127
- Title: The One-Word Census: Answer-Choice Conformity Across 44 Language Models
- Title(参考訳): One-Word Census:44言語モデル間のAnswer-Choice Conformity
- Authors: Tapan Parikh,
- Abstract要約: 我々は31個のシングルターンプロンプトの収束を特徴付け、それぞれに有効な1ワードの回答が多数あるカテゴリを命名する。
平均$-log2$の確率は、他のすべてのモデルのプールされた答えの下で得られる。
ペルソナとコミュニティがデザインしたモデルは最も異なっており、最新のメインラインフラッグシップは最もコンフォーマリストである。
- 参考スコア(独自算出の注目度): 3.7734715043126488
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a language model must pick one answer from a large space of equally valid options, which does it pick -- and how often is it the same answer every other model picks? Asked to "pick a word -- any word," 44 models chose "serendipity" 41% of the time. We characterize this convergence with a deliberately minimal instrument: 31 single-turn prompts, each naming a category with many valid one-word answers ("Name a tree."), asked four times per model with no system prompt. Analysis is exact-match on normalized tokens -- no embeddings, no judge -- at about a dollar per model. That models converge is well documented; our contribution is the instrument itself -- the One-Word Census -- and what it reveals about the structure of the convergence. We score each model by answer-choice surprisal: the average $-\log2$ probability of its answers under the pooled answers of all other models, leave-one-out. Convergence is extreme -- in 7 of 31 categories one answer takes over 80% of all answers -- yet conformity varies more than fourfold across models, and the variation is structured. Persona- and community-tuned models are the most divergent; the newest mainline flagships are the most conformist, producing almost no answer no other model gave. Within four lineages (Claude, GPT, Qwen, Grok) conformity rises with each generation -- but reverses for the latest flagship Claude and GPT models, a possible early signal of repositioning at the top tier. Rankings are robust to roster composition (leave-one-family-out rho = 0.985). Against human category-production norms, the field is more concentrated than people in 18 of 20 shared categories. All prompts, transcripts, and code are public.
- Abstract(参考訳): 言語モデルが、同等に有効な選択肢の広いスペースから1つの答えを選択する必要がある場合、それは -- そして、他のモデルが選ぶものと同じ回答がどれくらいあるか?"pick a word -- any word"と尋ねられると、44のモデルは、その時間の41%を"serendipity"を選択した。
31個のシングルターンプロンプトをそれぞれ、有効な1ワードの回答が多数あるカテゴリ("Name a tree.")を命名し、システムプロンプトのないモデル毎に4回質問した。
分析は正規化トークン(埋め込みなし、判断なし)を1モデルあたり約1ドルで正確にマッチングする。
私たちのコントリビューションは、楽器自体、すなわちOne-Word Censusであり、収束の構造について明らかになるものなのです。
平均$-\log2$の解答確率は、他のすべてのモデルのプールされた解答の下で、一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点一点二点)。
収束は極端であり、31のカテゴリの7つのうち1つの回答は全回答の80%以上を取るが、適合性はモデルによって4倍以上に変化し、その変動は構造化されている。
最新のメインラインフラッグシップは最もコンフォーマリストであり、他のモデルが与えた回答はほとんどない。
4つの系統(Claude、GPT、Qwen、Grok)内では、世代ごとの適合性は上昇するが、最新のフラッグシップであるClaudeとGPTモデルでは逆になる。
ランク付けはロスター構成(リーブ・ワン・ファミリー・アウト・ロー=0.985)に対して堅牢である。
ヒトのカテゴリー生産基準に対して、この分野は20の共有カテゴリーの18人よりも集中している。
プロンプト、書き起こし、コードはすべて公開されています。
関連論文リスト
- No Single Best Model for Diversity: Learning a Router for Sample Diversity [69.53166985556759]
本稿では,有効な応答の集合を包括的に抽出する手法について検討する。
本稿では,各回答に割り当てられた品質スコアを計測する指標であるtextbfdiversity Cover を紹介する。
各プロンプトには、多様な回答セットを生成する際に、他のすべてのモデルよりも大幅に優れるモデルが存在する。
論文 参考訳(メタデータ) (2026-04-02T17:58:37Z) - Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models [0.0]
拡張思考モデルは、ユーザ可視の回答と並んで、第2のテキスト生成チャネル(トークンを考える)を公開する。
本研究では,MMLUおよびGPQA質問に対する12のオープンウェイト推論モデルについて,誤解を招くヒントと組み合わせて検討した。
論文 参考訳(メタデータ) (2026-03-27T13:39:05Z) - Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image [58.14192385042352]
マルチモーダル・リワードベンチ2(MMRB2)は,マルチモーダル理解と(インターリーブされた)生成に対する報酬モデルの最初のベンチマークである。
MMRB2はテキスト・ツー・イメージ、画像編集、インターリーブド・ジェネレーション、マルチモーダル推論の4つのタスクにまたがる。
21のソースタスクにわたる23のモデルとエージェントから、タスク毎に1000のエキスパートアノテートされた好みペアを提供する。
論文 参考訳(メタデータ) (2025-12-18T18:56:04Z) - Contra4: Evaluating Contrastive Cross-Modal Reasoning in Audio, Video, Image, and 3D [97.08549913899247]
Contra4は、画像、オーディオ、ビデオ、および3Dの4つのモードにまたがる、対照的な相互モーダル推論のためのデータセットである。
それぞれの例は、複数の候補モダリティのインスタンスと並んで自然言語の質問を示し、モデルがプロンプトと意味的に一致するものを選択する必要がある。
コントラ4は、人間の注釈付きキャプションとモデルの混在するラウンドトリップ一貫性フィルタを組み合わせることで、高品質な監視を確実にし、174kのトレーニング例と2.3kのサンプルを手作業で検証する。
論文 参考訳(メタデータ) (2025-06-02T03:12:13Z) - The Avengers: A Simple Recipe for Uniting Smaller Language Models to Challenge Proprietary Giants [66.6636608563034]
より小さなモデルの集合的知性を活用するシンプルなレシピであるAvengersを紹介します。
10のオープンソースモデルで、Avengersは15の多様なデータセットの平均パフォーマンスをGPT-4o、4.1、4.5を上回っている。
特に数学タスクでは GPT-4.1 を 18.21% 、コードタスクでは 7.46% で上回っている。
論文 参考訳(メタデータ) (2025-05-26T10:29:42Z) - REBUS: A Robust Evaluation Benchmark of Understanding Symbols [1.90463290938268]
GPT-4oは他の全てのモデルよりも大幅に優れ、続いてプロプライエタリなモデルも他の評価モデルよりも優れていた。
最高のモデルでさえ、最終的な精度はわずか42%で、ハードパズルでは7%に低下する。
したがって、我々のベンチマークは、マルチモーダルな大言語モデルの知識と推論における大きな欠点を特定するのに利用できる。
論文 参考訳(メタデータ) (2024-01-11T00:30:28Z) - Questioning the Survey Responses of Large Language Models [25.14481433176348]
我々は,米国国勢調査局が確立したアメリカン・コミュニティ・サーベイに基づいて,この方法論を批判的に検討する。
まず、モデルの応答は、例えば"A"という文字でラベル付けされた調査応答に対するバイアスの順序付けとラベル付けによって制御される。
第二に、ランダム化された回答順序付けによってこれらの体系的バイアスを調整するとき、ボード全体のモデルが一様ランダムなアンケート応答に向かう傾向にある。
論文 参考訳(メタデータ) (2023-06-13T17:48:27Z) - Getting MoRE out of Mixture of Language Model Reasoning Experts [71.61176122960464]
多様な特殊言語モデルを組み込んだMixture-of-Reasoning-Experts (MoRE) フレームワークを提案する。
実例,マルチホップ,数学的,コモンセンス推論など,さまざまな推論カテゴリに最適化されたプロンプトを備えたバックボーン言語モデルを特化する。
人間の研究では、専門家による予測と回答の選択プロセスが、アノテータがシステムの出力を信頼するタイミングをより正確に調整するのに役立ちます。
論文 参考訳(メタデータ) (2023-05-24T02:00:51Z) - AvgOut: A Simple Output-Probability Measure to Eliminate Dull Responses [97.50616524350123]
機能エンジニアリングなしで、どの発話やトークンが退屈であるかを動的に認識する対話モデルを構築します。
最初のモデルMinAvgOutは、各バッチの出力分布を通して、ダイバーシティスコアを直接最大化する。
第2のモデルであるラベルファインチューニング(LFT)は、多様性スコアによって連続的にスケールされたラベルをソースシーケンスにプリペイドし、多様性レベルを制御する。
3つ目のモデルであるRLは強化学習を採用し、多様性スコアを報奨信号として扱う。
論文 参考訳(メタデータ) (2020-01-15T18:32:06Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。