論文の概要: STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation
- arxiv url: http://arxiv.org/abs/2608.04567v1
- Date: Wed, 05 Aug 2026 07:58:09 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-08-06 14:48:43.780525
- Title: STRIVE: Probing Reasoning Limits in Graded Plausibility Generation and Evaluation
- Title(参考訳): STRIVE:段階的可塑性発生における推論限界の提案と評価
- Authors: Bhiman Kumar Baghel, Anna Chrabaszcz, Tessa Warren, Michael Walsh Dickey, Haley C. Dresang, Xiang Lorraine Li,
- Abstract要約: 心理言語学者は、この知識が人間の言語処理をどのようにサポートするかを調べるために、事象到達性判断を使用する。
これらの研究は、可視性効果を分離するために、1つのイベントスロットが可視性レベルによって変化し、他の全てのイベント特徴が固定されている制御されたイベントセットを必要とする。
我々は、制御されたイベントセットの交差可否クラスを共同生成し、評価するLLMベースのフレームワークSTRIVEを紹介する。
- 参考スコア(独自算出の注目度): 4.349812300130026
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Event knowledge concerns who does what to whom. Psycholinguists use event-plausibility judgments to examine how this knowledge supports human language processing. To isolate plausibility effects, these studies require controlled event sets in which one event slot varies across plausibility levels while all other event features remain fixed. Constructing such sets manually is labor-intensive. We therefore introduce STRIVE, an LLM-based framework for jointly generating and evaluating controlled event sets crossing plausibility class (plausible vs. implausible) with intended classification difficulty (easy vs. hard). Given a verb, STRIVE constructs a shared event frame, then produces one event per condition by varying one slot while holding all others fixed. In experiments with six models across 60 verbs, GPT-5.1 produced high-quality sets only 16.7% of the time using the baseline generation prompt. Adding a global reasoning scratchpad and evaluator-guided refinement raised this rate to 75.0%. Greater reasoning effort also improved evaluator--human agreement. Nevertheless, events near the plausibility boundary remain most difficult. They elicit the greatest human disagreement, and the best evaluator reaches only 57% accuracy on the implausible-hard condition, indicating a need for human input. Overall, STRIVE offers a scalable approach to reducing manual effort by automating initial event-set generation and evaluation for psycholinguistic studies.
- Abstract(参考訳): イベント知識は誰が誰に何をするかに関するものです。
心理言語学者は、この知識が人間の言語処理をどのようにサポートするかを調べるために、事象到達性判断を使用する。
これらの研究は、可視性効果を分離するために、1つのイベントスロットが可視性レベルによって変化し、他の全てのイベント特徴が固定されている制御されたイベントセットを必要とする。
このようなセットを手作業で構築するのは、労働集約的です。
そこで,制御されたイベントセットを横断する可視性クラス(楽観的対可視的)を意図した分類困難度(易視的対難易度)で共同生成し,評価するためのLMベースのフレームワークSTRIVEを導入する。
動詞が与えられたら、STRIVEは共有イベントフレームを構築し、他の全てを固定しながら1つのスロットを変更することで条件ごとに1つのイベントを生成する。
60動詞にわたる6つのモデルを用いた実験では、GPT-5.1はベースライン生成プロンプトを使用して16.7%の時間で高品質なセットを生成した。
世界的な推理スクラッチパッドと評価官による改良により、この率は75.0%まで上昇した。
より大きな推論の努力は評価者や人間との合意も改善した。
それでも、可視性境界付近の出来事は最も困難なままである。
彼らは人間の最大の不一致を招き、最高の評価者は不確実なハード条件でわずか57%の精度で到達し、人間の入力の必要性を示している。
全体として、STRIVEは、最初のイベントセット生成と精神言語学研究の評価を自動化することで、手作業の削減にスケーラブルなアプローチを提供する。
関連論文リスト
- Bridging the Generalization Gap in Adverse Weather Segmentation: A Training Recipe Perspective [9.751481477523956]
本稿では,5つの気象条件で劣化した屋外シーンのセマンティックセグメンテーションを目的とした第8回UG2ワークショップ(CVPR 2026)トラック2について述べる。
私たちが観察する中心的な課題は、厳密な一般化ギャップです -- 検証セットでうまく機能するモデルは、テストセットでしばしば崩壊します。
アーキテクチャの複雑さよりも、慎重に設計されたトレーニングレシピが、このギャップに対処できるかどうかを検討する。
論文 参考訳(メタデータ) (2026-05-27T04:55:34Z) - Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models [60.418191092851636]
OmanicはオープンドメインのマルチホップQAリソースであり、推論プロセスを分析するための構造アノテーションとして分解されたサブクエストと中間回答を提供する。
10,296個の機械によるトレーニング例(Omanic Synth)と967個の専門家による注釈付き評価例(OmanicBench)を含む。
論文 参考訳(メタデータ) (2026-03-17T15:23:37Z) - Two-Faced Social Agents: Context Collapse in Role-Conditioned Large Language Models [0.0]
GPT-5は完全な数学の文脈崩壊を示し、最適応答に対する特異な同一性を採用した。
クロード・ソネット4.5はSATアイテムに限定的ではあるが測定可能な役割特異的なバリエーションを保持していた。
全てのモデルは、異なる役割条件の感情的嗜好を示し、認知的制約が緩和されたときに社会影響の変動が再燃することを示した。
論文 参考訳(メタデータ) (2025-11-19T16:04:49Z) - DiCoRe: Enhancing Zero-shot Event Detection via Divergent-Convergent LLM Reasoning [80.28638174802238]
DiCoReは、DreamerとGolderを使ってEDのタスクを分離する分散収束推論フレームワークである。
我々は、DiCoReがゼロショット、トランスファーラーニング、推論ベースラインを一貫して上回っていることを実証する。
論文 参考訳(メタデータ) (2025-06-05T15:16:14Z) - Uncertainty-guided Boundary Learning for Imbalanced Social Event
Detection [64.4350027428928]
本研究では,不均衡なイベント検出タスクのための不確実性誘導型クラス不均衡学習フレームワークを提案する。
我々のモデルは、ほとんど全てのクラス、特に不確実なクラスにおいて、社会イベントの表現と分類タスクを大幅に改善する。
論文 参考訳(メタデータ) (2023-10-30T03:32:04Z) - Are All Steps Equally Important? Benchmarking Essentiality Detection of
Events [92.92425231146433]
本稿では,現在のモデルが目標イベントに関連するステップイベントの本質をどの程度理解しているかについて検討する。
コミュニティガイドサイトWikiHowから収集した高品質なペア(ゴール,ステップ)コーパスをコントリビュートする。
高いアノテータ間の合意は、人間が事象の本質について一貫した理解を持っていることを証明している。
論文 参考訳(メタデータ) (2022-10-08T18:00:22Z) - PRover: Proof Generation for Interpretable Reasoning over Rules [81.40404921232192]
本稿では,ルールベース上の二項質問に応答し,対応する証明を生成するトランスフォーマーモデルを提案する。
本モデルは,効率的な制約付き学習パラダイムを用いて,証明グラフに対応するノードやエッジを予測できることを学習する。
我々は、QAと証明生成のための有望な結果を示すために、合成、手書き、人文による規則ベースの実験を行う。
論文 参考訳(メタデータ) (2020-10-06T15:47:53Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。