論文の概要: Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark
- arxiv url: http://arxiv.org/abs/2608.04670v1
- Date: Wed, 05 Aug 2026 10:28:51 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.824915
- Title: Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark
- Title(参考訳): ProverbITベンチマークでLLMのパフォーマンスを調べる
- Authors: Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni,
- Abstract要約: 本稿では,Large Language Models (LLMs) を評価するために設計された100の多重選択質問からなる,イタリアにおける新しいベンチマークであるProverbITを紹介する。
提案手法は,Large Reasoning Models (LRMs) と従来の LLMs を含む13のフロンティアモデルを評価する。
ほぼすべてのモデルが、完了タスクを成功させることで証明の知識を実証する一方で、正しい回答なしに複数の選択形式に移行すると、性能が劇的に低下する。
- 参考スコア(独自算出の注目度): 3.899675786340556
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) have transformed computational linguistics and achieved remarkable performance across numerous natural language processing tasks, yet significant gaps persist in understanding how these systems process culturally embedded linguistic expressions. This paper introduces ProverbIT, a novel Italian benchmark comprising 100 multiple-choice questions designed to evaluate LLMs' ability to complete Italian proverbs. We assess 13 frontier models, including Large Reasoning Models (LRMs) and traditional LLMs, across three tasks: proverb completion, multiple-choice selection with correct answers, and multiple-choice selection without correct answers. Our evaluation reveals surprising results: while nearly all models demonstrate knowledge of the proverbs through successful completion tasks, performance drops dramatically when transitioning to multiple-choice formats without correct answers, with even state-of-the-art reasoning models showing substantial degradation. Through detailed Chain-of-Thought analysis of two LRMs, we uncover that models exhibit a strong bias toward selecting literal synonyms and frequently mention correct proverb endings during reasoning without successfully identifying their absence from the given options. These findings suggest that current LLMs rely heavily on memorized patterns rather than deeper semantic understanding of culturally grounded expressions, highlighting important limitations in their reasoning capabilities for figurative language comprehension.
- Abstract(参考訳): 大規模言語モデル(LLM)は、計算言語学を変革し、多くの自然言語処理タスクにおいて顕著な性能を達成したが、これらのシステムがいかに文化的に組み込み言語表現を処理するかを理解する上で大きなギャップは残る。
本稿では,LLMがイタリア語の証明を完遂する能力を評価するために設計された,100の多重選択質問からなる,新しいイタリアのベンチマークProverbITを紹介する。
提案手法は,Large Reasoning Models (LRMs) と従来の LLMs を含む13のフロンティアモデルを評価する。
ほぼ全てのモデルが完了タスクを成功させることで証明の知識を実証するが、正しい回答なしに複数の選択形式に移行すると、性能は劇的に低下し、最先端の推論モデルでさえも相当な劣化を示している。
2つのLEMのチェーン・オブ・サート解析により、モデルが同義同義語の選択に対して強いバイアスを示し、与えられた選択肢から欠落を正しく識別することなく、推論中に正しい証明終端をしばしば言及することを明らかにする。
これらの結果から,現在のLLMは,表現の深い意味的理解よりも記憶パターンに強く依存していることが示唆された。
関連論文リスト
- mSCoRe: a $M$ultilingual and Scalable Benchmark for $S$kill-based $Co$mmonsense $Re$asoning [74.97363626515236]
textbfSkill ベースの textbfCommonsense textbfReasoning (textbfmSCoRe) のための textbfMultilingual と Scalable Benchmark を提案する。
本ベンチマークでは,LLMの推論能力を体系的に評価するための3つの重要な要素を取り入れた。
本研究は,多言語多言語一般と文化的共通点に直面する場合,そのような推論強化モデルの限界を明らかにするものである。
論文 参考訳(メタデータ) (2025-08-13T18:59:02Z) - Language Matters: How Do Multilingual Input and Reasoning Paths Affect Large Reasoning Models? [59.970391602080205]
多言語トレーニングにも拘わらず、LRMはテスト時に高リソース言語での推論をデフォルトとする傾向にある。
文化的推論は、推論タスクのパフォーマンスを低下させるが、文化的なタスクに恩恵を与える一方、安全性評価は言語固有の振る舞いを示す。
論文 参考訳(メタデータ) (2025-05-23T02:46:18Z) - Do Large Language Models Excel in Complex Logical Reasoning with Formal Language? [20.53475791645822]
大規模言語モデル(LLM)は、複雑な論理的推論タスクにおいてブレークスルーのパフォーマンスを達成することが示されている。
本稿では,形式言語を用いた論理的推論問題に対して,LLMを包括的に評価することを目的とする。
論文 参考訳(メタデータ) (2025-05-22T17:57:23Z) - Can Large Language Models Identify Authorship? [16.35265384114857]
大規模言語モデル(LLM)は、推論と問題解決の特別な能力を示している。
1) LLM はゼロショット・エンド・ツー・エンドのオーサシップ検証を効果的に行うことができるか?
2) LLM は,複数の候補作家(例えば,10,20)の著者を正確に帰属させることができるか?
論文 参考訳(メタデータ) (2024-03-13T03:22:02Z) - FAC$^2$E: Better Understanding Large Language Model Capabilities by Dissociating Language and Cognition [56.76951887823882]
大規模言語モデル(LLM)は、主に様々なテキスト理解および生成タスクにおける全体的なパフォーマンスによって評価される。
FAC$2$E, FAC$2$Eについて述べる。
論文 参考訳(メタデータ) (2024-02-29T21:05:37Z) - Supervised Knowledge Makes Large Language Models Better In-context Learners [94.89301696512776]
大規模言語モデル(LLM)は、素早い工学を通して、文脈内学習能力の出現を示す。
自然言語理解と質問応答におけるLLMの一般化性と事実性の向上という課題は、まだ未解決のままである。
本研究では, LLM の信頼性を高める枠組みを提案する。1) 分布外データの一般化,2) 差別モデルによる LLM のメリットの解明,3) 生成タスクにおける幻覚の最小化。
論文 参考訳(メタデータ) (2023-12-26T07:24:46Z) - Meta-Reasoning: Semantics-Symbol Deconstruction for Large Language Models [34.22393697176282]
実世界の象徴的手法の適用性と適応性を広げるためのメタ推論を提案する。
この方法はLLMに対して、推論に依存しない意味情報を汎用的な記号表現に分解する権限を与える。
我々は、算術、記号、論理的推論といった従来の推論タスクを含む10以上のデータセットと、理論の推論のようなより複雑な対話的推論タスクに関する広範な実験を行う。
論文 参考訳(メタデータ) (2023-06-30T17:38:10Z) - Improving Factuality and Reasoning in Language Models through Multiagent
Debate [95.10641301155232]
複数の言語モデルインスタンスが共通の最終回答に到達するために、複数のラウンドで個別の応答と推論プロセスを提案し、議論する言語応答を改善するための補完的なアプローチを提案する。
以上の結果から,本手法は様々なタスクにおける数学的・戦略的推論を著しく向上させることが示唆された。
我々のアプローチは、既存のブラックボックスモデルに直接適用され、調査するすべてのタスクに対して、同じ手順とプロンプトを使用することができる。
論文 参考訳(メタデータ) (2023-05-23T17:55:11Z) - Multilingual Large Language Models Are Not (Yet) Code-Switchers [41.47534626749588]
大規模言語モデル(LLM)は、最近、幅広いタスクにおいて優れた機能を示している。
発話の中で言語を交互に行う習慣は、いまだにほとんど受け継がれていない。
LLMの現在の「多言語主義」は、本質的にはコードスイッチングテキストの習熟度を示唆していない、と我々は主張する。
論文 参考訳(メタデータ) (2023-05-23T16:50:48Z) - Interpretable Unified Language Checking [42.816372695828306]
本稿では,人間と機械生成言語の両方に対して,解釈可能で統一された言語チェック(UniLC)手法を提案する。
ファクトチェック, ステレオタイプ検出, ヘイトスピーチ検出タスクの組み合わせにより, LLM は高い性能が得られることがわかった。
論文 参考訳(メタデータ) (2023-04-07T16:47:49Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。