論文の概要: Engine-Equal, Human-Unequal: A Reproducible Outcome Skew in Engine-Assessed Equal Chess Positions
- arxiv url: http://arxiv.org/abs/2607.25655v1
- Date: Tue, 28 Jul 2026 12:42:45 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-29 20:50:42.836441
- Title: Engine-Equal, Human-Unequal: A Reproducible Outcome Skew in Engine-Assessed Equal Chess Positions
- Title(参考訳): エンジン平等、人間不等式:エンジン評価等式における再現可能なアウトカムスキュー
- Abstract要約: ポジションは結果のスクリューを持ち、ゲームの実際の結果とプレイヤーのレーティングが予測するものの間のギャップを埋める。
これらのスキューは3つの再分割にまたがって再現される。
評価が最も自信のある場所であっても、人間の結果には十分な統計量ではない。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Among chess opening positions that a strong engine judges essentially equal (Stockfish 18 evaluation within 10 centipawns of zero, depth-stable) and that humans actually reach on Lichess (October 2025; 1,661 positions, 16.1M occurrences), human results are not balanced. Positions carry outcome skews, each the gap between its games' actual results and what the players' ratings predict, whose directions are stable properties of the naturally-reached position: some positions favour White, others Black. These skews reproduce across three re-partitions -- disjoint player-account sets (primary), time, and disjoint rating bands -- and on an out-of-sample month eight months later. On the primary split, each position's skew is measured once in each account group, and the replication slope asks how well one measurement predicts the other after removing rating and opening-family effects: one means undiminished carry-over; zero, no linear relation. We find 0.69 (family-clustered 95% CI [0.65, 0.74]), rising to 0.94 on the most-popular, best-measured positions. The slope's value depends on the position mix. Existence is the invariant claim: it survives every tighter evaluation band, search depth, calibration, and popularity cutoff we test, and replicates within blitz and rapid separately. The typical skew is small (median $|δ| \approx 0.018$, about two percentage points of White score), yet it reproduces, position by position, across disjoint accounts. At these positions the disfavoured side also thinks longer. Even where the evaluation is most confident, it is not a sufficient statistic for human outcomes. The result is observational, and the causal question is left to a pre-registered randomised companion study.
- Abstract(参考訳): 強力なエンジンが判定するチェスのオープニングポジション(ストッキングフィッシュ18の評価は10cm以内、深さ安定)のうち、人間は実際にリッシュに到達する(2025年10月、1,661位置、16.1M)ため、人間の結果はバランスが取れない。
ポジションは結果のスキューを持ち、試合の実際の結果とプレイヤーのレーティングが予測するものの間にはそれぞれのギャップがあり、その方向は自然に設定されたポジションの安定した特性である:あるポジションは白、他のポジションは黒である。
これらのスキューは3つの再分割 -- プレイヤ・アカウント・セット(初級)、タイム、そして非参加格付け・バンド -- にまたがって再現され、8ヶ月後にはアウト・オブ・サンプルで再生される。
一次スプリットでは、各位置のスキューを各アカウントグループで1回測定し、複製斜面は、評価と開家族効果を除去した後、一方の計測が他方をどれだけ良く予測するかを問う。
0.69 (家計95% CI [0.65, 0.74]) は最も人気があり、最も測定された位置で 0.94 まで上昇している。
斜面の値は、位置の混合に依存する。
より厳密な評価バンド、探索深度、キャリブレーション、そして我々がテストした人気カットオフの全てを生き残り、ブリッツ内とラピッド内を個別に複製する。
典型的なスキューは小さい(中間の$|δ| \approx 0.018$、ホワイトスコアの約2ポイント)が、不連続なアカウント間で位置ごとに再現する。
これらの位置では、不名誉な側もより長く考える。
評価が最も自信のある場所であっても、人間の結果には十分な統計量ではない。
その結果は観察的であり、因果質問は事前登録されたランダム化コンパニオン研究に残される。
関連論文リスト
- Scored vs. Generated Readouts in Behavioral Language Models: An Empirical Study of Elicitation Format [0.0]
回答トークンのスコアリングによって得られる確率と、文章の合理化後に生成された予測とを比較した。
13個のモデルドメイン細胞が4つの小売業務を網羅し、13個の細胞のうち12個で結果がより正確にランク付けされた。
論文 参考訳(メタデータ) (2026-09-09T08:37:46Z) - When Does a Laugh Begin? Structured Annotator Disagreement in Temporal Laughter Localization [0.0]
注釈者は、笑いの境界と微妙なチャックルにいつも反対する。
この不一致は、ランダムノイズではなく、構造化されていることを示す。
本稿では,全アノテータ分布に対する予測値を評価する不一致校正評価を提案する。
論文 参考訳(メタデータ) (2026-09-06T14:56:26Z) - Confident at the moment of action: belief miscalibration in LLM play under hidden information [0.0]
エージェントシステムは、モデル自身の主張する信頼に対するアクションをますますゲートし、信頼は行動の瞬間の正確性を追跡すると仮定する。
我々はこれを秘密裏に、王族の地位を秘密裏に、断片間で繰り返し移動できる秘密情報チェス変種でテストする。
このパターンを示すモデルは、その信念が持つゲームにまだ勝てる可能性があるため、結果のみの評価がそれを検出できない。
論文 参考訳(メタデータ) (2026-08-25T15:18:18Z) - CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated? [6.39120343569684]
CaliBench は FID のような学習された特徴空間ではなく、離散空間で結果をスコアする。
我々は,1つの精度のメートル法が混在する2つの軸に性能を分解する: スコラビリティ, スコア可能な結果をもたらす世代数, その試料の基準からの全変動距離のキャリブレーション。
9つのシーンと6つのイメージ・ツー・ビデオモデル(WAN-2.7, SeeDance-2.0, HappyHorse-1.0, Veo 3.1, Runway Gen-4.5, Cosmos3-Super)に適用する。
論文 参考訳(メタデータ) (2026-08-17T17:14:50Z) - Trait, Not State: The Durability of Reading Identity in Social Highlighting [1.8620637029128544]
読者の選択署名は特性か状態か?
私たちは、各読者の最初の6ヶ月のハイライトをプロファイルとして凍結します。
後者の選択では、ギャップが拡大する中で、独自のvs以外のアドバンテージも追跡しています。
論文 参考訳(メタデータ) (2026-06-11T04:59:37Z) - ChessMimic: Per-Rating Transformer Models for Human Move, Clock, and Outcome Prediction in Online Blitz Chess [0.08460698440162888]
ChessMimicは、移動、思考時間、結果予測のための3つのエンコーダのみのトランスフォーマーのシステムである。
Lichess Rated Blitzのゲームでは、ChessMimicの人間の動き予測精度はEloの各バンドでMaia-2を上回っている。
公開デモは1e4.aiで、コード、バンド単位の重み付け、C++データフィルタパイプラインコードをGitHubでリリースしています。
論文 参考訳(メタデータ) (2026-06-03T05:42:39Z) - Right Makes Might: Aligning Verified Hidden States Empowers RL Reasoning [55.264863369127774]
現在の方法では、それぞれの正しいロールアウトを単一の報酬ビットに減らし、隠れた状態間で共有される幾何学的構造を無視している。
本稿では,RLトレーニングにおけるアンカートークンにおける正ロールアウトの最終層を,トレーニングと推論の両方においてゼロオーバーヘッドで整列する補助損失関数Hidden-Alignを提案する。
8つの数学的推論ベンチマークでは、Hidden-AlignはDAPOベースラインの平均パス@1をQwen3-1.7B, 4B, 14Bで3.8, 6.2, 5.4ポイント改善し、3つのスケールで一貫したパス@kゲインを得る。
論文 参考訳(メタデータ) (2026-06-02T06:51:15Z) - Let the Results Speak: A Replication-First Paradigm for LLM Behavioral Benchmarking [22.825786049667602]
本稿では,1つのヒト・ラタのコンセンサスに有効性を確保するために,複製第一パラダイムを提案する。
楽器を4つの特性で認証する - Kランの信頼性、アーキテクチャ的に異なる審査員間のクロスインストラクトレプリケーション、以前のトレーニングコホートからの審査員による歴史的フットプリントキャリブレーション、事前登録された予測。
本研究は, 自己発達型データ駆動による情緒的伴奏で, 次元は事前に決められず, 手順は9次元に安定化する。
論文 参考訳(メタデータ) (2026-05-27T03:41:11Z) - The Evaluation Blind Spot: A Stereological Theory of Benchmark Coverage for Large Language Models [0.0]
実証的に、3つの独立したリーダーボード(Open LLM v2、拡張12ベンチマークスイート、LiveBench)は、いずれも[2.86, 4.80]のd_effを持つ。
Nemhauser (1 − 1/e) 保証付き部分モジュラーグリードアルゴリズムは、4つのベンチマークの安定なコアを見つける。
12のベンチマークと27のカテゴリの反実的な検証では、固有構造がどの評価が置き換えられないかを予測している。
論文 参考訳(メタデータ) (2026-04-15T08:56:58Z) - An External Fairness Evaluation of LinkedIn Talent Search [55.18656975953939]
LinkedInのTalent Searchランキングシステムのバイアスに対する、独立したサードパーティによる監査を行います。
我々は、性別と人種の2つの属性にまたがる潜在的なランキングバイアスに焦点を当てている。
我々の分析は、初期階級の少数派を過小評価していることを示している。
論文 参考訳(メタデータ) (2025-11-13T19:10:49Z) - Reference-Free Rating of LLM Responses via Latent Information [53.463883683503106]
本研究では,判断モデルに対して,自由テキスト応答にQuattスケールのスコアを割り当てるよう依頼する一般的な実践について検討する。
次に、内部モデル信号からスカラー評価を導出する潜在裁判官を提案し、評価する。
ペアとシングルレーティングのベンチマークの幅広いスイートの中で、潜在メソッドは標準のプロンプトにマッチするか、超えている。
論文 参考訳(メタデータ) (2025-09-29T12:15:52Z) - Decentralized and Uncoordinated Learning of Stable Matchings: A Game-Theoretic Approach [9.376820789668304]
分散的かつ非協調的な方法で、未知の嗜好と安定したマッチングを学習する問題を考察する。
本研究では, 指数重み学習アルゴリズムを安定マッチングゲームに適用することにより, 完全分散・非協調的な対数的後悔を実現することを示す。
また、任意に高い確率で安定なマッチングにグローバルに収束する、分散的で非協調的な学習アルゴリズムも導入する。
論文 参考訳(メタデータ) (2024-07-31T02:36:14Z) - Stability and Multigroup Fairness in Ranking with Uncertain Predictions [61.76378420347408]
我々の研究はランキング関数について考察している。分類タスクの個々の予測からランキング上の分布へのマップ。
ランキング関数の2つの側面、すなわち予測における摂動に対する安定性と、個人とサブグループの両方に対する公正性に焦点を当てる。
我々の研究は、不確実性に敏感なランキングが、グループと個人レベルの公正性の保証とを自然に補間していることを示している。
論文 参考訳(メタデータ) (2024-02-14T17:17:05Z) - ApproxED: Approximate exploitability descent via learned best responses [61.17702187957206]
連続的なアクションセットを持つゲームの近似的ナッシュ均衡を求める問題について検討する。
本稿では,戦略プロファイルに対するエクスプロイラビリティの近似を最小化する2つの新しい手法を提案する。
論文 参考訳(メタデータ) (2023-01-20T23:55:30Z) - Individual Calibration with Randomized Forecasting [116.2086707626651]
予測値がランダムに設定された場合,各サンプルのキャリブレーションは回帰設定で可能であることを示す。
我々は、個別の校正を強制する訓練目標を設計し、それをランダム化された回帰関数の訓練に使用する。
論文 参考訳(メタデータ) (2020-06-18T05:53:10Z) - Face Recognition: Too Bias, or Not Too Bias? [45.404162391012726]
我々は、最先端の顔認識システムにおけるバイアスの問題に対する批判的な洞察を明らかにする。
異なるサブグループにまたがる対面対の最適スコアしきい値の変動を示す。
また、人間の知覚にそのようなバイアスが存在するという仮説を支持する、人間のバイアスを測定するために、人間の評価を行う。
論文 参考訳(メタデータ) (2020-02-16T01:08:12Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。