論文の概要: Ask a Language Model for Lottery Numbers: Concentration in Repeated Six-of-49 Outputs
- arxiv url: http://arxiv.org/abs/2610.00052v1
- Date: Fri, 04 Sep 2026 00:07:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-10-05 14:48:16.332643
- Title: Ask a Language Model for Lottery Numbers: Concentration in Repeated Six-of-49 Outputs
- Title(参考訳): ロータリー数に対する言語モデルの検討:繰り返し6-of-49出力における集中度
- Abstract要約: 1-49の6つの異なる乱数に対する要求に対して、6つの言語モデル構成を評価する。
1200人以上が4種類のイギリス製プロンプトを使用した呼び出しを試み、1,184の応答で有効なチケットが得られた。
- 参考スコア(独自算出の注目度): 0.0
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: We evaluate six language-model configurations on requests for six distinct random integers from 1-49. Across 1,200 attempted calls using four English prompt variants, 1,184 responses yielded valid tickets. Effective diversity of number frequencies ranged from 9.9 to 18.0, compared with simulated fifth-percentile thresholds of 46.6-46.7 under independent uniform six-of-49 sampling at the corresponding sample sizes. Systems produced 8-93 distinct unordered tickets, and their modal tickets accounted for 22.5-68.0% of valid responses. Two archived Polish Lotto samples provided a physical-lottery comparison, with effective diversities of 41.1 and 41.4 at smaller sample sizes. These results demonstrate substantial concentration under the tested deployment settings. They do not identify its mechanism or establish performance under other prompts, temperatures, or tool configurations.
- Abstract(参考訳): 1-49の6つの異なる乱数に対する要求に対して、6つの言語モデル構成を評価する。
1200人以上が4種類のイギリス製プロンプトを使用した呼び出しを試み、1,184の応答で有効なチケットが得られた。
有効周波数は9.9から18.0の範囲で、サンプルサイズは46.6-46.7の5分の1の閾値で、独立した6-of-49サンプリングである。
システムは8-93の異なる未注文のチケットを製造し、そのモーダルチケットは22.5-68.0%の有効応答を計上した。
2つのアーカイブされたポーランド・ロットのサンプルは、より小さなサンプルサイズで41.1と41.4の効果的な多様性を持つ物理的にロッタリーな比較を行った。
これらの結果は、テストされた配置設定下でかなり集中していることを示している。
彼らはそのメカニズムを特定したり、他のプロンプトや温度、ツールの設定でパフォーマンスを確立したりしません。
関連論文リスト
- SlopBench: How Well Can We Rank Language Models by Slop? A Multi-Domain Benchmark of Repetitive AI Writing [0.0]
SlopBench氏は、どのモデルが固く反復的な散文の読者をAIスロップと呼ぶのかを尋ねる。
電子メール,ソーシャルポスト,エッセイ,職場チャットにおいて,手書きタスク112件のモデル18件を評価した。
論文 参考訳(メタデータ) (2026-09-27T20:38:23Z) - Record Grouping Controls Evidence Weight in Language Models [6.314493350744026]
供給されたパーティションが与えられた場合、我々のプレジェネレーション表現は、グループ内のコンテンツを分離し、集約し、各グループの貢献を束縛する。
供給されたパーティションを変更すると、4つのモデルすべてで測定可能な、チェックポイントに依存した決定シフトが生成される。
論文 参考訳(メタデータ) (2026-09-08T12:59:56Z) - Marginal Fidelity Does Not Establish User Simulation in Demographic Synthetic Survey Panels: Response Contracts, Support Collapse and Conditioning Failure [51.736723807086385]
人口密着協定は、個別のシミュレーションの証拠ではなく、エスカレーション契約の証拠であり、シミュレーションされた回答者なしで得られる推定値である。
9つのアライメントされたモデルバッテリペアでは、非個人個体数のクエリの平均は6.27 MAE対12.39であり、9つの比較すべてで勝利する。
論文 参考訳(メタデータ) (2026-09-07T10:22:22Z) - Do Multimodal LLMs See Before They Read? Diagnosing Contextual Sycophancy [16.47414821115537]
外部テキストは、マルチモーダルな大言語モデルにおける矛盾する画像証拠をオーバーライドすることができる。
視覚的エビデンス,コモンセンス先行,外部テキストを独立に変化させる998ケースの診断を導入し,この障害が発生した場合,コンテキストブラインドされた視覚的目撃者を中心に情報境界を移動させることで探索する。
論文 参考訳(メタデータ) (2026-08-30T16:19:33Z) - When Big Data Becomes a Curse: Spatial Heterogeneity and the Limits of Learning from Passive Acoustic Monitoring Data [0.3277163122167433]
AIS-labeled 679-second recordings from 38 deployments, 20 Atlantic Canada station IDs, and 21 receiver positions。
AIS-Contact は200倍以上の差があり、デプロイ毎のスクリーニング分布は局所的な解釈を必要とする。
論文 参考訳(メタデータ) (2026-08-06T14:44:46Z) - ArabicNumBench: Evaluating Arabic Number Reading in Large Language Models [0.0]
東アラビア・インド数字 (0-9) と西アラビア数字 (0-9) にまたがるアラビア数字読解タスクにおける大きな言語モデルを評価する。
6つのカテゴリにまたがる210個の数字読解タスクに対して,0ショット,0ショット,0ショット,数ショット,数ショットのCoT)の4つのプロンプト戦略を用いて,10プロバイダから71個のモデルを評価した。
本評価は,59,010件の個別試験事例と,構造化出力の生成量を測定するトラック抽出手法からなる。
論文 参考訳(メタデータ) (2026-02-21T10:00:56Z) - Contra4: Evaluating Contrastive Cross-Modal Reasoning in Audio, Video, Image, and 3D [97.08549913899247]
Contra4は、画像、オーディオ、ビデオ、および3Dの4つのモードにまたがる、対照的な相互モーダル推論のためのデータセットである。
それぞれの例は、複数の候補モダリティのインスタンスと並んで自然言語の質問を示し、モデルがプロンプトと意味的に一致するものを選択する必要がある。
コントラ4は、人間の注釈付きキャプションとモデルの混在するラウンドトリップ一貫性フィルタを組み合わせることで、高品質な監視を確実にし、174kのトレーニング例と2.3kのサンプルを手作業で検証する。
論文 参考訳(メタデータ) (2025-06-02T03:12:13Z) - Large Language Monkeys: Scaling Inference Compute with Repeated Sampling [81.34900892130929]
モデルから候補解を繰り返しサンプリングする簡単な手法を用いて、推論計算をスケーリングのための別の軸として検討する。
複数のタスクやモデルにまたがって、カバレッジは4桁以上のサンプル数でスケールする。
コードや形式的証明のようなドメインでは、回答が自動的に検証されるので、カバレッジの増加は直接的にパフォーマンスの向上につながります。
論文 参考訳(メタデータ) (2024-07-31T17:57:25Z) - UniMax: Fairer and more Effective Language Sampling for Large-Scale
Multilingual Pretraining [92.3702056505905]
我々は,尾語への過剰適合を軽減しつつ,より均一なヘッド言語カバレッジを提供する新しいサンプリング手法UniMaxを提案する。
We found that UniMax are outperforming standard temperature-based sample, and the benefit persistent as scale increased。
論文 参考訳(メタデータ) (2023-04-18T17:45:50Z) - Arithmetic Sampling: Parallel Diverse Decoding for Large Language Models [65.52639709094963]
ビームサーチやガンベルトップkサンプリングのような手法は、ビームの各要素に対して異なる出力を保証できるが、並列化は容易ではない。
本稿では,大言語モデルによって暗黙的に定義された算術符号書に従ってサンプリングを行うフレームワークを提案する。
論文 参考訳(メタデータ) (2022-10-18T22:19:41Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。