論文の概要: WordPolo: Evaluating Language Models Through Iterative Semantic Feedback
- arxiv url: http://arxiv.org/abs/2609.19006v1
- Date: Sat, 18 Jul 2026 14:05:43 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-28 05:09:55.592004
- Title: WordPolo: Evaluating Language Models Through Iterative Semantic Feedback
- Title(参考訳): WordPolo: 反復的セマンティックフィードバックによる言語モデルの評価
- Abstract要約: 大規模言語モデル (LLMs) と大規模推論モデル (LRMs) は、通常、データセットの精度だけで、挑戦的なベンチマークで評価される。
参加者が意味的類似性フィードバックを用いて未知のターゲット語を発見しなければならないワードフィニングタスクであるWordPoloを提案する。
モデルの成功が人間のような戦略を示す一方で、推論モデルが過度に考え直したり、考え過ごしたりすることで、どのように妨げられるかを示す。
- 参考スコア(独自算出の注目度): 15.683487315764689
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large Language Models (LLMs) and Large Reasoning Models (LRMs) are typically evaluated on challenging benchmarks through dataset accuracy alone, providing no insight into the quality or faithfulness of their reasoning processes. We present WordPolo, a word-finding task where participants must discover an unknown target word using semantic similarity feedback. Players start with zero knowledge, make guesses, and receive distance scores (1 = correct, higher = further away). Success requires interpreting scores to navigate semantic space and systematically narrow the search. This design makes iterative reasoning and adaptive search strategies both directly observable and necessary for success. We evaluate recent LLMs (GPT-4.1, Llama 4, Claude 3.5 Haiku, Qwen 3), LRMs (o4-mini, Deepseek-R1), humans, and a novel heuristic on 1,500 puzzles. Beyond solve rates (which range from 4% to 62%), we introduce progression-based metrics that reveal models often make meaningful progress, insights that accuracy alone would miss. Our analysis shows how reasoning models can be hindered by overthinking and underthinking, while successful models exhibit human-like strategies. WordPolo demonstrates the need for benchmarks that test both reasoning process and outcomes, providing holistic measurements of model capabilities. Our code and dataset can be found at https://wordpolo-demo.vercel.app/.
- Abstract(参考訳): 大規模言語モデル (LLMs) と大規模推論モデル (LRMs) は、一般的にデータセットの精度だけで挑戦的なベンチマークで評価され、推論プロセスの品質や忠実さに関する洞察を与えない。
参加者が意味的類似性フィードバックを用いて未知のターゲット語を発見しなければならないワードフィニングタスクであるWordPoloを提案する。
プレイヤーは知識をゼロにし、推測し、距離スコア(1 = 正しい、より高い、もっと遠い)を受け取る。
成功には意味空間をナビゲートし、体系的に検索を絞り込むためにスコアを解釈する必要がある。
この設計により、反復的推論と適応的な探索戦略が直接観察可能であり、成功に必要である。
我々は,最近のLLM (GPT-4.1, Llama 4, Claude 3.5 Haiku, Qwen 3), LRMs (o4-mini, Deepseek-R1), 人間, 1500のパズルに対する新しいヒューリスティックなヒューリスティックを評価した。
解答率(4%から62%)以外にも、モデルがしばしば有意義な進歩をすることを示すプログレッシションベースのメトリクスを導入しています。
我々の分析は、モデルが人間のような戦略を示すのに対して、推論モデルが過度に考え、考え過ごすことによってどのように妨げられるかを示している。
WordPoloは推論プロセスと結果の両方をテストするベンチマークの必要性を示し、モデル機能の総合的な測定を提供する。
私たちのコードとデータセットはhttps://wordpolo-demo.vercel.app/.com/で確認できます。
関連論文リスト
- Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality? [74.69723255239663]
グラウンドド・パーソナリティ・推論は、MLLMがそれぞれのビッグファイブ・格付けを、評価、推論、根拠の連鎖を通じて観察可能な証拠に固定することを要求する。
MM-OCEANは、人間の検証によるマルチエージェントパイプラインによって生成され、タイムスタンプによる行動観察、エビデンスに基づく特性分析、およびキューグラウンドMCQの7つのカテゴリがある。
この分析では、フィールド全体にわたって、正しい評価の51%が取得された手がかりに基づかず、ホリスティック・ギャラリング・レートは0-33.5%にしか達していないという顕著な偏見のギャップが明らかになった。
論文 参考訳(メタデータ) (2026-05-21T07:42:47Z) - Beyond Survival: Evaluating LLMs in Social Deduction Games with Human-Aligned Strategies [54.08697738311866]
Werewolfのようなソーシャル推論ゲームは、言語、推論、戦略を組み合わせている。
我々は,100時間以上のビデオ,32.4M発声トークン,15の規則変種を含む高品質で人間認証されたWerewolfデータセットをキュレートした。
本稿では,勝利派戦略を2段階の真理として活用する新たな戦略調整評価法を提案する。
論文 参考訳(メタデータ) (2025-10-13T13:33:30Z) - IQBench: How "Smart'' Are Vision-Language Models? A Study with Human IQ Tests [1.1142124321313052]
標準化されたビジュアルIQテストにおいてビジョン言語モデルを評価するために設計された新しいベンチマークである*IQBench*を紹介する。
我々はVLMの推論能力を評価することに集中しており、最終的な予測の精度よりも重要であると我々は主張する。
論文 参考訳(メタデータ) (2025-05-17T13:24:08Z) - VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models [121.03333569013148]
VisuLogicは、6つのカテゴリにまたがる1,000の人間認証された問題のベンチマークです。
これらの質問は、複数の視点からMLLMの視覚的推論能力を評価するために評価することができる。
ほとんどのモデルは精度が30%以下で、25%のランダムベースラインよりわずかに高く、人間によって達成された51.4%よりはるかに低い。
論文 参考訳(メタデータ) (2025-04-21T17:59:53Z) - MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs [55.20845457594977]
大規模言語モデル(LLM)は、問題解決と意思決定の能力の向上を示している。
本稿ではメタ推論技術を必要とするプロセスベースのベンチマークMR-Benを提案する。
メタ推論のパラダイムは,システム2のスロー思考に特に適しています。
論文 参考訳(メタデータ) (2024-06-20T03:50:23Z) - Ranking Large Language Models without Ground Truth [24.751931637152524]
大規模言語モデル(LLM)の評価とランキングは,これらのモデルの普及に伴って重要な問題となっている。
我々は、プロンプトのデータセットが与えられた場合、根拠となる真実や参照応答にアクセスせずにそれらをランク付けする、新しい視点を提供する。
この考え方を繰り返し適用し、LLMをランク付けする2つの方法を提案する。
論文 参考訳(メタデータ) (2024-02-21T00:49:43Z) - Don't Copy the Teacher: Data and Model Challenges in Embodied Dialogue [92.01165203498299]
後続の身体的対話命令は、自然言語交換から複雑なタスクのシーケンスを完了させるエージェントを必要とする。
本稿では,模倣学習(IL)と関連する低レベルメトリクスが,実際には誤解を招くものであり,具体的対話研究の目標と一致していないことを論じる。
論文 参考訳(メタデータ) (2022-10-10T05:51:40Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。