論文の概要: Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary
- arxiv url: http://arxiv.org/abs/2608.04240v1
- Date: Tue, 04 Aug 2026 21:31:01 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.644207
- Title: Hallucinations on the Board: Tool-Augmented Evaluation of LLM Chess Commentary
- Title(参考訳): 掲示板の幻覚: LLMチェス解説のツールによる評価
- Authors: S. Ashwin Hebbar, Peiyao Sheng, Sewoong Oh, Pramod Viswanath,
- Abstract要約: ACT-Evalは、チェスの解説を原子的主張に分解する評価フレームワークである。
教育、トーナメント、クリティカルポジションにまたがる325組の位置移動ペアのベンチマークを公表する。
チェスの解説では、事実上の幻覚が広まっています。
- 参考スコア(独自算出の注目度): 31.69092001844714
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Superhuman game engines in domains like chess have made expert-level evaluations easily accessible, yet they communicate what is true without the natural-language explanations that make such expertise educationally useful to experts and non-experts alike. Large language models could, in principle, bridge this gap, but they frequently hallucinate due to limited domain-specific knowledge, and standard reference-based or LLM-as-a-judge frameworks cannot reliably detect these errors. In this work, we present ACT-Eval, an evaluation framework that decomposes chess commentary into atomic claims and routes them to engine-supported tools and expert-annotated gold references to assess factual correctness, conceptual coverage, and move-quality judgment. We release a benchmark of 325 position--move pairs spanning pedagogical, tournament, and critical positions, including 125 positions with expert-verified gold atoms and a five-class error taxonomy. Evaluating leading proprietary and open-weight models, we find that factual hallucinations remain pervasive in chess commentary: GPT-5.4 without tools produces incorrect sub-claims 22.0% of the time, while smaller open-weight models exceed 40%. Although tool augmentation substantially improves factual correctness and move-quality assessment, coverage of expert strategic and tactical ideas remains limited across all models. Human calibration shows that ACT-Eval's factual judgments fall within the observed range of inter-human agreement, while its coverage scores correlate strongly with human assessments of strategic completeness.
- Abstract(参考訳): チェスのようなドメインのスーパーヒューマンゲームエンジンは、専門家レベルの評価を容易にアクセスできるようにするが、専門家や非専門家にとって教育的に有用な自然言語の説明なしでは真実を伝える。
大規模な言語モデルは原則として、このギャップを埋めることができるが、ドメイン固有の知識が限られているため、しばしば幻覚し、標準参照ベースまたはLSM-as-a-judgeフレームワークはこれらのエラーを確実に検出できない。
本研究では,チェスの解説をアトミックなクレームに分解する評価フレームワークであるACT-Evalについて,事実的正当性,概念的包括性,移動品質判断を評価するために,エンジン支援ツールや専門家によるゴールドレファレンスにルートする。
我々は、専門家が検証した金原子125個と5クラスの誤り分類を含む、教育、トーナメント、重要なポジションにまたがる325個の位置移動ペアのベンチマークを公表した。
GPT-5.4では、ツールのないGPT-5.4では、不正なサブステートが22.0%、小さなオープンウェイトモデルでは40%を超えています。
ツールの強化は事実の正しさと移動品質の評価を大幅に改善するが、専門家の戦略的および戦術的アイデアのカバレッジは、すべてのモデルに限られている。
人間のキャリブレーションは、ACT-Evalの事実判断が観察された人間間合意の範囲内にあることを示しているが、そのカバレッジスコアは人間の戦略的完全性評価と強く相関している。
関連論文リスト
- ChessQA: Evaluating Large Language Models for Chess Understanding [10.480398008794436]
Chessは大規模言語モデル(LLM)の推論、モデリング、抽象化機能を評価するのに理想的なテストベッドを提供する。
5つのタスクカテゴリにわたるLLMチェス理解を評価するベンチマークであるChessQAを提案する。
5つのカテゴリにまたがって永続的な弱点を見つけ、結果とカテゴリ別エラー解析を提供する。
論文 参考訳(メタデータ) (2025-10-28T00:02:52Z) - Bridging the Gap between Expert and Language Models: Concept-guided Chess Commentary Generation and Evaluation [9.277840736103554]
我々は,言語による複雑な意思決定プロセスを説明する代表的タスクとして,チェスの解説に焦点をあてる。
概念誘導型Chess注釈生成法(CCC)を導入し,GPTに基づくChess注釈評価法(GCC-Eval)を用いて評価を行った。
論文 参考訳(メタデータ) (2024-10-28T07:59:34Z) - SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal [64.9938658716425]
SORRY-Benchは、安全でないユーザ要求を認識し拒否する大規模言語モデル(LLM)能力を評価するためのベンチマークである。
まず、既存の手法では、安全でないトピックの粗い分類を使い、いくつかのきめ細かいトピックを過剰に表現している。
第二に、プロンプトの言語的特徴とフォーマッティングは、様々な言語、方言など、多くの評価において暗黙的にのみ考慮されているように、しばしば見過ごされる。
論文 参考訳(メタデータ) (2024-06-20T17:56:07Z) - Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models [92.66784679667441]
プロメテウス2は、人間とGPT-4の判断を密接に反映するより強力な評価器である。
ユーザ定義評価基準でグループ化された、直接評価とペアのランキングフォーマットの両方を処理できる。
4つの直接評価ベンチマークと4つのペアのランキングベンチマークで、Prometheus 2は人間と独自のLM判事との相関と合意を最も高く評価している。
論文 参考訳(メタデータ) (2024-05-02T17:59:35Z) - MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation [60.65820977963331]
大規模言語モデル(LLM)のための新しい評価パラダイムを導入する。
このパラダイムは、しばしば推論プロセスを無視する結果指向の評価から、より包括的な評価へと重点を移す。
GSM8Kデータセットにこのパラダイムを適用し,MR-GSM8Kベンチマークを開発した。
論文 参考訳(メタデータ) (2023-12-28T15:49:43Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。