論文の概要: PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?
- arxiv url: http://arxiv.org/abs/2608.25097v1
- Date: Tue, 25 Aug 2026 19:48:42 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-27 14:15:15.424459
- Title: PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?
- Title(参考訳): PhysElite: LLMは、オリンピアードレベルの物理問題を解くのにどれくらい時間がかかるのか?
- Authors: Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang,
- Abstract要約: PhysEliteはオリンピアードレベルの物理推論のための大規模なバイリンガルベンチマークである。
各問題に対して、対応する視覚図、ステップバイステップのバイリンガルな中国語-英語の解の導出、そして最終回答を提供する。
我々は18個のオープンソースおよびクローズドソースMLLMをベンチマークし、最強モデルでさえ33.7%の正解精度しか得られないことを発見した。
- 参考スコア(独自算出の注目度): 3.7188197739781903
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Understanding how (multimodal) large language models perform on physics problems requires benchmarks that reflect the difficulty and breadth of expert-level physical reasoning. Existing physics benchmarks remain limited in the following two important ways: (1) short of high-difficulty datasets, and (2) lack of comprehensive coverage of visual forms, knowledge points, and step-by-step solution processes. As a result, model performance on current datasets may not be fully representative of their ability to solve complex physics problems. To address these issues, we present PhysElite, a large-scale bilingual multimodal benchmark for Olympiad-level physics reasoning. PhysElite contains 11,586 Olympiad-tier problems. For each problem, we provide corresponding visual diagrams, step-by-step bilingual Chinese-English solution derivations, and the final answer. We benchmark 18 open-source and closed-source MLLMs, and find that even the strongest model reaches only 33.7% answer accuracy. We additionally conduct step-level process evaluation to diagnose where models fail in the reasoning chain. Our datasets are released at https://huggingface.co/datasets/physelite/PhysElite.
- Abstract(参考訳): 物理問題において(マルチモーダルな)大きな言語モデルがどのように機能するかを理解するには、専門家レベルの物理的推論の困難さと広さを反映したベンチマークが必要である。
既存の物理ベンチマークは、(1)高次データセットの不足、(2)視覚形態、知識ポイント、ステップバイステップのソリューションプロセスの包括的カバレッジの欠如の2つの重要な方法に制限されている。
結果として、現在のデータセットのモデル性能は、複雑な物理問題を解く能力を完全には表していないかもしれない。
これらの問題に対処するため,オリンピアードレベルの物理推論のための大規模バイリンガルマルチモーダルベンチマークであるPhysEliteを提案する。
PhysEliteには11,586のオリンピアード層問題が含まれている。
各問題に対して、対応する視覚図、ステップバイステップのバイリンガルな中国語-英語の解の導出、そして最終回答を提供する。
我々は18個のオープンソースおよびクローズドソースMLLMをベンチマークし、最強モデルでさえ33.7%の正解精度しか得られないことを発見した。
さらに、モデルが推論チェーンで失敗する箇所を診断するために、ステップレベルのプロセス評価を行う。
私たちのデータセットはhttps://huggingface.co/datasets/physelite/PhysElite.orgで公開されています。
関連論文リスト
- CMPhysBench: A Benchmark for Evaluating Large Language Models in Condensed Matter Physics [71.42168240638462]
CMPhysBenchは、凝縮物質物理学における大規模言語モデルの習熟度を評価するように設計されている。
以上の結果から,最高モデルであるGrok-4でさえ,CMPhysBench上での平均SEEDスコアが36点,精度が28%であった。
論文 参考訳(メタデータ) (2025-08-25T15:32:22Z) - PhysUniBench: An Undergraduate-Level Physics Reasoning Benchmark for Multimodal Models [69.73115077227969]
大規模言語モデル(MLLM)の推論能力の評価と改善を目的とした大規模ベンチマークであるPhysUniBenchを提案する。
PhysUniBenchは、3,304の物理問題から成っている。
ベンチマークの構成には、複数のロールアウト、専門家レベルの評価、解決が容易な問題の自動フィルタリング、そして5段階の難易度グレーディングシステムを含む、厳格な多段階プロセスが含まれていた。
論文 参考訳(メタデータ) (2025-06-21T09:55:42Z) - PhysReason: A Comprehensive Benchmark towards Physics-Based Reasoning [36.193595420239845]
1200プロブレムの大規模言語モデル評価ベンチマークであるPhysReasonを提案する。
問題は平均8.1の解ステップが必要で、ハードは15.6である。
Deepseek-R1、Gemini-2.0-Flash-Thinking、o3-mini-highといったトップパフォーマンスモデルは、回答レベルの評価で60%以下を実現している。
論文 参考訳(メタデータ) (2025-02-17T17:24:14Z) - OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems [62.06169250463104]
我々はOlympiadレベルのバイリンガル・マルチモーダル・サイエンス・ベンチマークであるOlympiadBenchを紹介し、Olympiadレベルの数学と物理学のコンペティションの8,476の問題を特徴とする。
最も優れたモデルであるGPT-4Vはオリンピアドベンチで平均17.97%を獲得し、物理学ではわずか10.74%である。
GPT-4Vの分析では、幻覚、知識欠失、論理的誤信などの問題が指摘されている。
論文 参考訳(メタデータ) (2024-02-21T18:49:26Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。