論文の概要: Structured Output Collapses Answer Diversity Across 44 Language Models
- arxiv url: http://arxiv.org/abs/2607.18476v1
- Date: Mon, 20 Jul 2026 19:47:16 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-22 19:05:05.236174
- Title: Structured Output Collapses Answer Diversity Across 44 Language Models
- Title(参考訳): 44言語モデル間の多様性を問う構造的アウトプットの崩壊
- Authors: Tapan Parikh,
- Abstract要約: 言語モデルが同等に有効なオプションの広いスペースから1つの回答を選択する必要がある場合、フォーマット条項 -- "Reply with only" -- が選択した回答を変更する。
One-Word Census (arXiv:2607.97):31のワイド・アンサー・スペース・カテゴリ・プロンプトで44のモデルが要求され、応答が要求された。
制約のない"Pick a word"では、モーダル解答はプールの41%から64%に上昇し、解答は52から36に減少する。
- 参考スコア(独自算出の注目度): 3.7734715043126488
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: When a language model must choose one answer from a large space of equally valid options, a format clause -- "Reply with JSON only" -- changes which answer it chooses. We re-run the One-Word Census (arXiv:2607.12796): 31 wide-answer-space category prompts asked of 44 models, now with the reply requested in JSON -- no schema enforcement, no constrained decoding, only the request. Convergence deepens sharply: on the unconstrained "Pick a word" prompt the modal answer rises from 41% to 64% of the pool and distinct answers fall from 52 to 36; mean answer-choice surprisal drops from 1.80 to 1.58 bits. The tax is progressive: six of 44 models move individually (BH-FDR q=.10), all toward the mode, led by the most distinctive models, while the conformist floor is immobile. It is a sharpener, not a re-indexer -- the plain-chat modal answer survives in 28 of 31 categories. Defaults are register-indexed: a within-run re-sample (n=20) finds JSON shifts 53% of a model's stable chat defaults, mostly back to the crowd, and installs defaults absent from chat (Claude Fable 5 answers "cerulean" for colour 0% of the time in chat, 100% in JSON). Full-battery controls reveal a register gradient: compression is significant and specific to the answer-delivery formats models are trained to speak (JSON -0.22 bits, p=.0002; XML -0.19, p=.002), absent for YAML and CSV, and reversed for an arbitrary bracket wrapper (+0.13, p=.009) -- weighing the mechanism toward tool-use post-training. Enforcing the schema at the decoder (response_format) compresses no further than the request (-0.03 bits): the collapse lives in the model's response to the register, not the decoder. Structured output is how software consumes language models, and that surface is served by a measurably more homogeneous model than the chat surface on which models are evaluated, compared, and chosen.
- Abstract(参考訳): 言語モデルが同等に有効な選択肢の広いスペースから1つの回答を選択する必要がある場合、フォーマット条項 -- "JSONのみの返信" -- が選択した回答を変更する。
One-Word Census (arXiv:2607.12796): 31のワイド・アンサー・スペースのカテゴリプロンプトで44のモデルが要求された。
非制限の"Pick a word"では、モーダルの解答はプールの41%から64%に上昇し、明確な解答は52から36に減少し、平均的な解選択は1.80から1.58ビットに減少する。
44モデルのうち6モデル(BH-FDR q=.10)は個別に移動し、最も独特なモデルによって誘導され、コンフォニストフロアは動かない。
シャープナーであり、再インデクサーではなく、31カテゴリ中28カテゴリで残っています。
in-run re-sample (n=20)は、モデルの安定したチャットデフォルトの53%をJSONシフトとして、主に群衆に返却し、デフォルトをチャットからインストールする(Claude Fable 5では、チャットの0%、JSONで100%)。
圧縮は重要であり、応答配信形式に特有である モデルが話すように訓練される (JSON -0.22 bits, p=.0002; XML -0.19, p=.002) YAMLとCSVが欠席し、任意のブラケットラッパー (+0.13, p=.009) のために逆転する。
デコーダ(response_format)でのスキーマの強制は、要求(-0.03ビット)だけを圧縮する。
構造化された出力は、ソフトウェアが言語モデルを消費する方法であり、そのサーフェスは、モデルを評価し、比較し、選択したチャットサーフェスよりも、測定可能なほど均質なモデルによって提供される。
関連論文リスト
- Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models [0.0]
2つの実験は、保持された汚染のない合成コーパス上の3つの因子全てを横断する。
実験1では,規則数Nが10から160に増加するにつれて,命令追従減衰を測定する。
実験2では, 2k-to-512k-tokenのコンテキストラグ上での精度, 虚偽の前提条件, ファクトファクトファクトファクチャリングの測定を行った。
論文 参考訳(メタデータ) (2026-07-21T16:31:35Z) - The One-Word Census: Answer-Choice Conformity Across 44 Language Models [3.7734715043126488]
我々は31個のシングルターンプロンプトの収束を特徴付け、それぞれに有効な1ワードの回答が多数あるカテゴリを命名する。
平均$-log2$の確率は、他のすべてのモデルのプールされた答えの下で得られる。
ペルソナとコミュニティがデザインしたモデルは最も異なっており、最新のメインラインフラッグシップは最もコンフォーマリストである。
論文 参考訳(メタデータ) (2026-07-14T14:12:05Z) - CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression [77.41779716950387]
本稿では,2チャンネル評価プロトコルであるCavewomanについて述べる。
我々は5つのデータセットの8つのモデルを5つの還元レベルで評価し、両方のチャネルは同じ項目で測定した。
論文 参考訳(メタデータ) (2026-06-23T02:56:48Z) - Paraphrase-Induced Output-Mode Collapse: When LLMs Break Character Under Semantically Equivalent Inputs [0.9525172018746524]
我々は、プロンプト変数の出力モード崩壊と呼ばれる、系統的な障害モードを観察する。
クローズドフォームプロンプトがベアラベルや単一の選択トークンを要求すると、コンテンツ保存プロンプトの変種がモデルを会話の散文にプッシュする。
PARACONSISTは5つの語彙、構文、意味拡張プロンプトを持つ150のベースクエリのベンチマークである。
論文 参考訳(メタデータ) (2026-05-06T09:11:10Z) - Micro Language Models Enable Instant Responses [49.192613030724424]
スマートウォッチやスマートグラスのようなエッジデバイスは、電力と計算の制約により、最小の100M-1Bパラメータ言語モデルでさえ連続的に動作できない。
マイクロ言語モデル($LMs)を導入し、デバイス上でコンテキスト的にグラウンドされた応答の最初の4-8ワードを即座に生成する。
我々は,70M-256Mクラスの既存モデルに適合するモデルを用いて,有用な言語生成を極端に大規模に維持することを示す。
論文 参考訳(メタデータ) (2026-04-21T16:31:12Z) - HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions [50.61510609116118]
HuggingR$4$は、Reasoning、Retrieval、Refinement、Reflectionを組み合わせて効率的にモデルを選択する新しいフレームワークである。
作業性率は92.03%、理性率は82.46%に達し、それぞれ26.51%、33.25%を超える。
論文 参考訳(メタデータ) (2025-11-24T03:13:45Z) - Measuring short-form factuality in large language models [50.15055025275888]
本稿では,言語モデルが短い事実探索質問に答える能力を評価するベンチマークであるSimpleQAを提案する。
SimpleQAはGPT-4応答に対して逆向きに収集される。
SimpleQAの各回答は、正しいか、間違っているか、試みられていないかのどちらかとしてランク付けされる。
論文 参考訳(メタデータ) (2024-11-07T01:58:42Z) - Answer, Assemble, Ace: Understanding How LMs Answer Multiple Choice Questions [103.20281438405111]
MCQA(Multiple-choice Question answering)は、高性能トランスフォーマー言語モデルのキーコンピテンスである。
我々は,正解を予測するための関連情報をエンコードするキー隠れ状態のローカライズに語彙予測とアクティベーションパッチ手法を用いる。
後続の層は語彙空間における予測応答記号の確率を増大させ、この確率の増加は、特異な役割を持つ注目ヘッドのスパースセットと関連していることを示す。
論文 参考訳(メタデータ) (2024-07-21T00:10:23Z) - "My Answer is C": First-Token Probabilities Do Not Match Text Answers in Instruction-Tuned Language Models [40.867655189493924]
言語生成のオープンな性質は、大規模言語モデル(LLM)の評価を困難にしている。
1つの一般的な評価手法は、応答空間を制限するためにMulti-choice Question (MCQ) を用いる。
そこで本研究では,テキストの出力を数次元で評価する。
論文 参考訳(メタデータ) (2024-02-22T12:47:33Z) - Zero-Shot Dialogue Disentanglement by Self-Supervised Entangled Response
Selection [79.37200787463917]
対話の切り離しは、スレッドへの長大かつ多人数の対話において、発話をグループ化することを目的としている。
これは談話分析や対話応答選択などの下流アプリケーションに有用である。
我々はまず,atextbfzero-shotダイアログ・ディアンタングメント・ソリューションを提案する。
論文 参考訳(メタデータ) (2021-10-25T05:15:01Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。