論文の概要: Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity
- arxiv url: http://arxiv.org/abs/2605.09042v1
- Date: Sat, 09 May 2026 16:28:50 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-05-12 23:28:50.039967
- Title: Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity
- Title(参考訳): 大規模言語モデルにおける実用的推論の評価:スカラー多様性からの証拠
- Abstract要約: 本研究は,複数のモデルおよび実験環境における直接確率測定とメタinguistic promptingの比較を行った。
その結果, 評価手法が相反する結果が得られず, 実用的行動はモデルファミリ, 促進戦略, タスク構造によって大きく異なることがわかった。
- 参考スコア(独自算出の注目度): 2.538209532048867
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Evaluating pragmatic reasoning in large language models (LLMs) remains challenging because model behavior can vary depending on evaluation methods. Previous studies suggest that prompt-based judgments may diverge from models' internal probability distributions, raising questions about whether observed performance reflects underlying competence or task-induced behavior. This study examines this issue using scalar diversity as a graded diagnostic for pragmatic inference. Following Hu & Levy (2023), this study compares direct probability measurement and metalinguistic prompting across multiple models and experimental settings. The results show that neither evaluation method consistently outperforms the other and that pragmatic behavior varies substantially across model families, prompting strategies, and task structures. Moreover, scalar diversity gradients emerge only in specific model-condition combinations, suggesting that pragmatic reasoning in LLMs reflects an interaction between internal probabilistic representations and task-induced prompting behavior rather than a stable competence captured by a single evaluation paradigm. These findings highlight the central role of evaluation design in interpreting pragmatic abilities in LLMs.
- Abstract(参考訳): 大規模言語モデル(LLM)における実用的推論の評価は,評価手法によって異なるため,依然として困難である。
従来の研究では、プロンプトに基づく判断はモデルの内部確率分布から分岐し、観察された性能が根底にある能力やタスクによって引き起こされる振る舞いを反映しているかどうかという疑問が提起されている。
本研究は,現実的推論のための段階的診断法としてスカラー多様性を用いたこの問題について検討する。
Hu & Levy (2023) に続いて、この研究は複数のモデルと実験環境における直接確率測定とメタinguistic promptingを比較した。
その結果, 評価手法が相反する結果が得られず, 実用的行動はモデルファミリ, 促進戦略, タスク構造によって大きく異なることがわかった。
さらに、スカラーの多様性勾配は、特定のモデル-条件の組み合わせでのみ現れるため、LLMにおける実践的推論は、単一の評価パラダイムによって捕捉される安定した能力よりも、内部確率表現とタスク誘発的行動との相互作用を反映していることを示唆している。
これらの知見は, LLMにおける実用能力の解釈における評価設計の中枢的な役割を浮き彫りにした。
関連論文リスト
- Modeling Pathology-Like Behavioral Patterns in Language Models Through Behavioral Fine-Tuning [0.0]
大規模言語モデルは、人間のような振る舞いをモデル化するための計算ツールとして、ますます使われている。
本稿では,構造化意思決定タスクの微調整によるモデルポリシーの修正を行う行動誘導フレームワークを提案する。
次に、この挙動最適化が生成分布の系統的変化をもたらすかどうかを検証する。
論文 参考訳(メタデータ) (2026-05-21T11:42:38Z) - Inference-Time Reasoning Selectively Reduces Implicit Social Bias in Large Language Models [0.0]
大規模言語モデル(LLM)における推論可能な推論が暗黙のバイアスに与える影響について検討する。
提案手法により,15のステレオタイプを対象とするモデルクラスに対するIAT型評価における暗黙バイアスが有意に低減されることが判明した。
この研究は、認知科学と心理学の理論が、方法論的および解釈的なフレームワークを提供することで、AI評価研究を補完する方法について強調する。
論文 参考訳(メタデータ) (2026-02-04T16:44:23Z) - Reasoning as State Transition: A Representational Analysis of Reasoning Evolution in Large Language Models [50.39102836928242]
モデルの内部状態の力学を研究するために,表現的視点を導入する。
トレーニング後、静的な初期表現品質が限られた改善しか得られないことが判明した。
論文 参考訳(メタデータ) (2026-01-31T15:23:33Z) - D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models [91.21455683212224]
大規模言語モデル(LLMs)では、次の情報の関連性確率は、次の製品の関連性確率に関連付けられる。
しかし、きめ細かいサンプリング確率がタスク要求に忠実に適合するかどうかは未解決の問題だ。
P_tokenが大きなステップ・ツー・ステップの変動を示し、P_taskとの整合性が低いDモデルと、P_tokenがより安定してP_taskに整合するEモデルである。
論文 参考訳(メタデータ) (2026-01-25T14:59:09Z) - Internal Causal Mechanisms Robustly Predict Language Model Out-of-Distribution Behaviors [61.92704516732144]
正当性予測の最も堅牢な特徴は、モデルの振舞いに特徴的な因果的役割を果たすものであることを示す。
モデル出力の正しさを予測するために因果メカニズムを利用する2つの手法を提案する。
論文 参考訳(メタデータ) (2025-05-17T00:31:39Z) - Confidence in Large Language Model Evaluation: A Bayesian Approach to Limited-Sample Challenges [13.526258635654882]
本研究では,大規模言語モデル(LLM)能力評価のためのベイズ的アプローチを提案する。
モデル機能を潜時変数として扱い、キュレートされたクエリセットを利用して識別応答を誘導する。
GPTシリーズモデルを用いた実験により,提案手法は従来の評価手法よりも優れた識別性が得られることが示された。
論文 参考訳(メタデータ) (2025-04-30T04:24:50Z) - Causality can systematically address the monsters under the bench(marks) [64.36592889550431]
ベンチマークはさまざまなバイアス、アーティファクト、リークに悩まされている。
モデルは、調査の不十分な障害モードのため、信頼できない振る舞いをする可能性がある。
因果関係はこれらの課題を体系的に解決するための 理想的な枠組みを提供します
論文 参考訳(メタデータ) (2025-02-07T17:01:37Z) - On the Reasoning Capacity of AI Models and How to Quantify It [0.0]
大規模言語モデル(LLM)は、その推論能力の基本的な性質に関する議論を激化させている。
GPQAやMMLUのようなベンチマークで高い性能を達成する一方で、これらのモデルはより複雑な推論タスクにおいて制限を示す。
本稿では,モデル行動のメカニズムを解明するために,従来の精度指標を超える新しい現象論的手法を提案する。
論文 参考訳(メタデータ) (2025-01-23T16:58:18Z) - Evaluating Interventional Reasoning Capabilities of Large Language Models [58.52919374786108]
大規模言語モデル(LLM)は意思決定タスクを自動化するために使用される。
本稿では,LPMが介入に応じてデータ生成プロセスの知識を正確に更新できるかどうかを評価する。
さまざまな因果グラフ(例えば、コンバウンディング、仲介)と変数タイプにまたがるベンチマークを作成します。
これらのベンチマークにより、LLMが事実を記憶したり、他のショートカットを見つけたりすることで、変化を正確に予測する能力を切り離すことができます。
論文 参考訳(メタデータ) (2024-04-08T14:15:56Z) - Revisiting Demonstration Selection Strategies in In-Context Learning [66.11652803887284]
大規模言語モデル(LLM)は、インコンテキスト学習(ICL)を用いて広範囲のタスクを実行するという印象的な能力を示している。
本研究ではまず,データとモデルの両方の側面から,この分散に寄与する要因を再検討し,実演の選択がデータとモデルに依存していることを確かめる。
本研究では,データとモデルに依存した実演選択手法である textbfTopK + ConE を提案する。
論文 参考訳(メタデータ) (2024-01-22T16:25:27Z) - Competence-Based Analysis of Language Models [21.43498764977656]
CALM (Competence-based Analysis of Language Models) は、特定のタスクの文脈におけるLLM能力を調べるために設計された。
我々は,勾配に基づく対向攻撃を用いた因果探究介入を行うための新しい手法を開発した。
これらの介入を用いてCALMのケーススタディを行い、様々な語彙推論タスクにおけるLCM能力の分析と比較を行う。
論文 参考訳(メタデータ) (2023-03-01T08:53:36Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。