論文の概要: Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models
- arxiv url: http://arxiv.org/abs/2605.17565v1
- Date: Sun, 17 May 2026 17:49:07 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-19 17:57:48.205789
- Title: Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models
- Title(参考訳): 一般化か記憶か?チェス訓練言語モデルの脆性試験
- Authors: Ethan Tang,
- Abstract要約: KinGPTは、(配置、最良の)ペアのみに基づいて訓練された文字レベルの言語モデルである。
LLM-Modulo が RedPajama 3B の最良の移動精度を 1.2% から 21.2% に引き上げる方法を示す。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Recent work has fine-tuned language models on chess data and reported high benchmark scores as evidence that the resulting models can understand the rules of chess, play full chess games at a professional level, or generate human-readable explanations grounded in expert knowledge. We train KinGPT, a 25M-parameter character-level language model trained only on (position, best-move) pairs, who exceeds 3B-parameter ChessGPT on a 600-puzzle mate-in-N suite and 4B-parameter C1-4B over a 20-theme puzzle benchmark. We examine several claims made in existing literature regarding chess-trained language models and assert that their impressive benchmark performance is largely explained by pattern-matching. We also demonstrate how LLM-Modulo, a verifier-in-the-loop framework, raises RedPajama 3B's best move accuracy from 1.2% to 21.2% and move generation validity from 19.3% to 95.3% on mate-in-N chess puzzles, comparable to gains achieved from ChessGPT's fine-tuning on chess-specific web corpora at a fraction of the cost. Our results illustrate how pairing a general LLM with an external verifier offers a more flexible alternative to directly training on synthetic data for well-defined domains. We open source all training/evaluation code, datasets, puzzle samples, and KinGPT model checkpoints for reproducibility.
- Abstract(参考訳): 最近の研究は、チェスデータに関する言語モデルを微調整し、その結果得られたモデルがチェスのルールを理解したり、プロのレベルでチェスの試合をプレイしたり、専門家の知識に基づく人間の読みやすい説明を生成できることを示す証拠として、高いベンチマークスコアを報告している。
InGPTは,600-puzzle mate-in-N スイートで 3B-parameter ChessGPT を,20テーマのパズルベンチマークで 4B-parameter C1-4B に対して3B-parameter ChessGPT を超越した,25M-parameter レベルの言語モデルである。
チェス学習言語モデルに関する既存の文献におけるいくつかの主張を検証し、そのベンチマーク性能はパターンマッチングによって大きく説明されていると断言する。
また、LLM-Moduloは、ChessGPTによるチェス固有のWebコーパスの微調整で得られた成果に匹敵し、RedPajama 3Bの最良の移動精度を1.2%から21.2%に引き上げ、生成効率を19.3%から95.3%に下げる方法を示した。
以上の結果から,一般LLMと外部検証器とのペアリングは,よりフレキシブルな代替手段となることが示唆された。
再現性のためのトレーニング/評価コード,データセット,パズルサンプル,KinGPTモデルチェックポイントをすべてオープンソースとして公開しています。
関連論文リスト
- Predicting Human Chess Moves: An AI Assisted Analysis of Chess Games Using Skill-group Specific n-gram Language Models [0.0]
このフレームワークはn-gram言語モデルを使用して、特定のプレイヤースキルレベル特有の動きパターンをキャプチャする。
私たちは、オープンソースのチェスプラットフォームであるLichessからのデータを使って、別々のモデルをトレーニングしました。
このフレームワークは、アーリーゲーム情報を利用する際に、スキルレベルを最大31.7%の精度で分類することができる。
論文 参考訳(メタデータ) (2025-12-01T17:02:07Z) - ChessQA: Evaluating Large Language Models for Chess Understanding [10.480398008794436]
Chessは大規模言語モデル(LLM)の推論、モデリング、抽象化機能を評価するのに理想的なテストベッドを提供する。
5つのタスクカテゴリにわたるLLMチェス理解を評価するベンチマークであるChessQAを提案する。
5つのカテゴリにまたがって永続的な弱点を見つけ、結果とカテゴリ別エラー解析を提供する。
論文 参考訳(メタデータ) (2025-10-28T00:02:52Z) - ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models [11.234477661864736]
本稿では,大規模言語モデル(LLM)の戦略的推論能力を評価するためのチェステストベッドであるChessArenaを提案する。
Chessには、長期計画、厳格なルール理解、マルチターン会話記憶など、複雑な戦略的推論機能が必要である。
素人レベルのチェスエンジンであるマイア1100に勝てるモデルはないが、任意に動きを選択するランダムプレイヤーに勝てないモデルもある。
我々の微調整されたQwen3-8Bは性能を大幅に改善し、最先端の推論モデルにアプローチしました。
論文 参考訳(メタデータ) (2025-09-29T03:24:48Z) - Explore the Reasoning Capability of LLMs in the Chess Testbed [45.12891789312405]
我々は,注釈付き戦略と戦術を統合することで,チェスにおける大規模言語モデルの推論能力を向上させることを提案する。
我々はLLaMA-3-8Bモデルを微調整し、より優れたチェスの動きを選択するタスクにおいて、最先端の商用言語モデルと比較する。
論文 参考訳(メタデータ) (2024-11-11T01:42:56Z) - How Far Are We on the Decision-Making of LLMs? Evaluating LLMs' Gaming Ability in Multi-Agent Environments [83.78240828340681]
GAMA($gamma$)-Benchは、マルチエージェント環境における大規模言語モデルのゲーム能力を評価するための新しいフレームワークである。
$gamma$-Benchは8つの古典ゲーム理論シナリオと、LSMの性能を評価するために特別に設計された動的スコアリングスキームを含んでいる。
以上の結果から, GPT-3.5は強い強靭性を示すが, 一般化性は限定的であり, Chain-of-Thoughtのような手法で拡張可能であることが示唆された。
論文 参考訳(メタデータ) (2024-03-18T14:04:47Z) - Amortized Planning with Large-Scale Transformers: A Case Study on Chess [11.227110138932442]
本稿では,AIにおける画期的な計画問題であるチェスを用いて,計画課題の性能評価を行う。
ChessBenchは、Stockfishが提供する法的行動と価値アノテーション(1500億ポイント)を備えた1000万のチェスゲームの大規模なベンチマークである。
極めて優れた近似を教師付き学習により大規模変圧器に蒸留することは可能であるが, 完全蒸留は依然として到達範囲を超えている。
論文 参考訳(メタデータ) (2024-02-07T00:36:24Z) - Text Classification via Large Language Models [63.1874290788797]
テキスト分類に関わる複雑な言語現象に対処するために、Clue And Reasoning Prompting (CARP)を導入する。
注目すべきは、CARPが5つの広く使用されているテキスト分類ベンチマークのうち4つで新しいSOTAパフォーマンスを得ることだ。
さらに重要なのは、CARPが低リソースとドメイン適応のセットアップで素晴らしい能力を提供します。
論文 参考訳(メタデータ) (2023-05-15T06:24:45Z) - CommonsenseQA 2.0: Exposing the Limits of AI through Gamification [126.85096257968414]
現代自然言語理解モデルの能力をテストするベンチマークを構築した。
本研究では,データ構築の枠組みとしてゲーミフィケーションを提案する。
論文 参考訳(メタデータ) (2022-01-14T06:49:15Z) - Learning Chess Blindfolded: Evaluating Language Models on State Tracking [69.3794549747725]
私たちはチェスのゲームのための言語モデリングのタスクを検討します。
自然言語とは異なり、チェス表記法は単純で制約のある決定論的領域を記述する。
トランスフォーマー言語モデルでは,移動シーケンスのみを訓練することで,ピースの追跡や法的動作の予測を高精度に行うことができる。
論文 参考訳(メタデータ) (2021-02-26T01:16:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。