論文の概要: From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs
- arxiv url: http://arxiv.org/abs/2605.07268v1
- Date: Fri, 08 May 2026 05:33:58 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-11 19:43:38.822661
- Title: From 0-Order Selection to 2-Order Judgment: Combinatorial Hardening Exposes Compositional Failures in Frontier LLMs
- Title(参考訳): 0階選択から2階判断へ:コンビニアルハードニングは、フロンティアLLMの組成不良を露呈する
- Authors: Hanmeng Liu, Shichao Weng, Xiulai Liu, Zhicai Zhang, Anli Yan, Xiaozhang Liu,
- Abstract要約: 複数選択推論ベンチマークは、進行するモデルからの迅速な飽和とデータ汚染という2つの課題に直面している。
ここでは、0階選択を2階論理判断に決定的に変換する形式的なフレームワークであるLogiHardを紹介する。
- 参考スコア(独自算出の注目度): 4.478347601177043
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Multiple-choice reasoning benchmarks face dual challenges: rapid saturation from advancing models and data contamination that undermines static evaluations. Ad-hoc hardening methods (paraphrasing, perturbation) attempt to increase difficulty but sacrifice logical validity for surface complexity, falling short to challenge advanced reasoning models. We present LogiHard, a formal framework that deterministically transforms 0-order selection into 2-order logical judgment, which significantly increases the thinking overhead and reasoning steps. The framework integrates Item Response Theory (IRT) for computerized adaptive testing (CAT), enabling precise difficulty control with fewer questions than static benchmarks. We instantiate LogiHard-2k, a logical reasoning dataset constructed by cognitively ranking high-stakes examination questions via 9-dimensional analysis of model thinking traces, followed by combinatorial transformation of high-difficulty items. Evaluation across twelve state-of-the-art models reveals an accuracy degradation ranging from 31% to 56% on combinatorially hardened questions. LLMs suffer from the multi-select failure and early exit bias, which are not shared by human testees. Zero-shot transfer to MMLU demonstrates 47% accuracy degradation (89.84% to 42.86%), confirming applicability across domains with provable validity preservation. The consistent aggregate degeneration is domain-agnostic and stems not from knowledge deficits but from a combinatorial reasoning gap, reflecting a training-induced completeness-verification deficit.
- Abstract(参考訳): 複数の選択推論ベンチマークは、進行するモデルからの急激な飽和と、静的評価を損なうデータ汚染という2つの課題に直面している。
アドホック硬化法(言い換え、摂動)は、困難を増大させようとするが、表面の複雑さに対する論理的妥当性を犠牲にして、高度な推論モデルに挑戦するには不足する。
本稿では,0階選択を2階論理判断に決定的に変換する形式的フレームワークLogiHardを提案する。
このフレームワークは、CAT(Computerized Adaptive Testing)のためのIRT(Item Response Theory)を統合し、静的ベンチマークよりも少ない質問で正確な難易度制御を可能にする。
モデル思考トレースの9次元解析から,高次評価質問を認知的にランク付けして構築した論理的推論データセットLogiHard-2kのインスタンス化と,高次項目の組合せ変換を行った。
12の最先端モデルに対する評価では、組合せ的に硬化した質問に対して、精度が31%から56%まで低下していることが示されている。
LLMは、人間の受験者によって共有されない、複数選択の失敗と早期退院バイアスに悩まされる。
MMLUへのゼロショット転送は47%の精度低下(89.84%から42.86%)を示し、証明可能な妥当性を維持したドメイン間の適用性を確認する。
一貫した集合的変性はドメインに依存しず、知識不足ではなく、総合的推論のギャップから生じるものであり、訓練によって引き起こされた完全性検証の欠陥を反映している。
関連論文リスト
- Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints [0.6524460254566904]
問題複雑性の増大にともなうLarge Reasoning Models (LRM) における推論の頑健さを系統的に評価した。
我々は,9つの古典的推論タスク,ブール満足度,クリプトリズム,グラフカラーニング,河川横断,ハノイ塔,ウォータージャグ,チェッカージャンプ,スドゥーク,ルービックキューブを構築した。
非一貫性な推論トレース,制約違反,状態追跡の喪失,確実な不正確なアウトプットを伴って,50%を超える相当な精度低下を観測する。
論文 参考訳(メタデータ) (2026-04-15T00:35:22Z) - Adaptive Multi-Expert Reasoning via Difficulty-Aware Routing and Uncertainty-Guided Aggregation [0.2864713389096699]
本稿では,動的適応戦略による推論による問題複雑性に着目したフレームワークであるAdaptive Multi-Expert Reasoning (AMR)について述べる。
問題テキストに焦点を当てたアジャイルルーティングシステムは、問題の難しさと不確実性を予測し、再構成可能なサンプリングメカニズムを誘導し、生成の幅を管理する。
GSM8Kデータセットで評価すると、AMRはオリジナルのトレーニングデータのみを使用しながら75.28%の精度を達成した。
論文 参考訳(メタデータ) (2026-04-11T19:44:57Z) - Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation [3.23600523782706]
CRYSTAL (Clear Reasoning via Yielded Steps, Traceability, and Logic)は6,372インスタンスの診断ベンチマークである。
本稿では,意味的類似性マッチングによるステップレベルの精度とリコールをスコアするMatch F1と,乱れた推論連鎖をペナルティ化するOrdered Match F1の2つの相補的指標を提案する。
CPR-CurriculumはGRPOによるMatch F1の32%の改善を実現している。
論文 参考訳(メタデータ) (2026-03-13T15:48:15Z) - Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning [53.45095336430027]
暗黙的な検索と構造化された協調を組み合わせた統合フレームワークを開発する。
Humanity's Last Exam (HLE) Bio/Chem Goldでは,48.3%の精度を実現している。
SuperGPQAとTRQAの結果はドメイン間の堅牢性を確認した。
論文 参考訳(メタデータ) (2025-09-25T14:05:55Z) - Climbing the Ladder of Reasoning: What LLMs Can-and Still Can't-Solve after SFT? [59.418994222096885]
AIME24データセット上でモデル性能の詳細な解析を行う。
我々は質問を4段階(易、中、硬、極度硬)に分類する。
我々は,SFT-1Kインスタンスが最小限であるR1推論スタイルを採用する必要があることを見出した。
エクレベルの質問は、根本的に異なる課題を示します。
論文 参考訳(メタデータ) (2025-04-16T03:39:38Z) - FINEREASON: Evaluating and Improving LLMs' Deliberate Reasoning through Reflective Puzzle Solving [90.88021670297664]
FINEREASONは、大規模言語モデルの推論能力を評価するための論理パズルベンチマークである。
状態チェックと状態遷移という2つのタスクを導入し、モデルが現在の状況をどのように評価するかを総合的に評価し、次の動きを計画する。
状態チェックと遷移データに基づいてトレーニングされたモデルでは、GSM8Kで最大5.1%の精度で数学推論が向上することを示す。
論文 参考訳(メタデータ) (2025-02-27T16:23:25Z) - MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs [55.20845457594977]
大規模言語モデル(LLM)は、問題解決と意思決定の能力の向上を示している。
本稿ではメタ推論技術を必要とするプロセスベースのベンチマークMR-Benを提案する。
メタ推論のパラダイムは,システム2のスロー思考に特に適しています。
論文 参考訳(メタデータ) (2024-06-20T03:50:23Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。