論文の概要: It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief
- arxiv url: http://arxiv.org/abs/2607.18232v1
- Date: Mon, 20 Jul 2026 17:58:31 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-21 18:48:37.733423
- Title: It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief
- Title(参考訳): 信じることの表現に対するLLMの反応を評価する
- Authors: Kevin Du, Clara Kümpel, Michelle Wastl, Alex Warstadt,
- Abstract要約: 本稿では,モデルが文脈に従うか,事前知識に従えば,信念表現(EoB)がどう影響するかを評価する。
言語変化の影響を分離する制御されたEoB-queryペアを生成する。
我々の研究は、言語的フレーミングが文脈統合にどう影響するかという体系的なパターンを明らかにし、迅速なエンジニアリングとモデルロバストネスに影響を及ぼす。
- 参考スコア(独自算出の注目度): 14.724790683440375
- License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
- Abstract: Users frequently express their beliefs to large language models (LLMs). In some situations, the LLM should accept these contextual beliefs as true. In others, they should stick to their prior knowledge. Notably, users' expressions of belief (EoBs) can take linguistically diverse forms - using presuppositions, evidential and certainty markers, or varied tones - each of which may have a different persuasiveness over the LLMs. We introduce a typology to systematically evaluate how different EoBs affect whether models follow context versus prior knowledge. The typology is grounded in four linguistically motivated dimensions: form, evidentiality, epistemic stance, and tone, spanning 17 fine-grained types. By pairing these EoBs with world knowledge facts, we generate controlled EoB-query pairs that isolate the effect of linguistic variation. Using this benchmark, we evaluate 16 LLMs that differ in architecture (Llama3, Qwen3, Gemma3), scale (1B-30B parameters), and training stages (base vs instruct). We identify meaningful variations in response behavior across these axes, e.g., that bigger models and instruction models tend to be less context-following than smaller models and base models. We further identify specific EoBs that statistically significantly persuade LMs more consistently than others. Our work reveals systematic patterns in how linguistic framing affects LLM context integration, with implications for prompt engineering and model robustness.
- Abstract(参考訳): ユーザーはしばしば、自分の信念を大きな言語モデル(LLM)に表現する。
ある状況では、LLMはこれらの文脈的信念を真実として受け入れるべきである。
他の場合、彼らは以前の知識に固執すべきです。
特に、ユーザの信念表現(EoBs)は、前置詞、明快かつ確実なマーカー、あるいは様々な音を使って、言語学的に多様な形を取ることができ、それぞれがLLMに対して異なる説得力を持っている可能性がある。
本研究では,異なるEoBが文脈に従うか,事前知識に従うかを系統的に評価する。
タイポロジーは言語的に動機づけられた4つの次元(形態、明快さ、てんかんの姿勢、声調)に根ざしており、17種類のきめ細かい種類にまたがっている。
これらのEoBを世界知識事実と組み合わせることで、言語的変動の影響を分離する制御されたEoBクエリペアを生成する。
このベンチマークを用いて,アーキテクチャの違い (Llama3, Qwen3, Gemma3), スケール(1B-30Bパラメータ), トレーニングステージ(ベース対インストラクション) を16個評価した。
これらの軸間の応答挙動の有意義な変動を、例えば、より大きなモデルや命令モデルの方が、より小さなモデルやベースモデルよりも文脈追従性が低い傾向があると同定する。
さらに、統計学的にLMを他のものよりも確実に説得する特定のEoBを同定する。
我々の研究は、言語的フレーミングがLLMコンテキスト統合にどのように影響するかの体系的なパターンを明らかにし、迅速なエンジニアリングとモデルロバストネスに影響を及ぼす。
関連論文リスト
- Epistemic Diversity and Knowledge Collapse in Large Language Models [42.81169404715417]
大規模言語モデル(LLM)は、語彙的、意味的、スタイリスティックに同質なテキストを生成する傾向がある。
これは知識崩壊のリスクを生じさせ、同種LLMは時間とともにアクセス可能な情報範囲の縮小を仲介する。
LLM出力における実世界のクレームの変動など、疫学の多様性を測定するための新しい手法を提案する。
論文 参考訳(メタデータ) (2025-10-05T14:29:15Z) - A Comprehensive Analysis of Large Language Model Outputs: Similarity, Diversity, and Bias [1.7109513360384465]
大規模言語モデル(LLM)は、人工知能への大きな一歩である。
アウトプットの類似性、多様性、倫理的意味について疑問が残る。
論文 参考訳(メタデータ) (2025-05-14T01:21:46Z) - Disparities in LLM Reasoning Accuracy and Explanations: A Case Study on African American English [66.97110551643722]
本研究では,Large Language Models (LLMs) 推論タスクにおける方言の相違について検討する。
LLMは、AAE入力に対するより正確な応答とより単純な推論チェーンと説明を生成する。
これらの知見は、LLMの処理方法と異なる言語品種の理由の体系的差異を浮き彫りにした。
論文 参考訳(メタデータ) (2025-03-06T05:15:34Z) - Large Language Models Reflect the Ideology of their Creators [71.65505524599888]
大規模言語モデル(LLM)は、自然言語を生成するために大量のデータに基づいて訓練される。
本稿では, LLMのイデオロギー的姿勢が創造者の世界観を反映していることを示す。
論文 参考訳(メタデータ) (2024-10-24T04:02:30Z) - LLMs' Reading Comprehension Is Affected by Parametric Knowledge and Struggles with Hypothetical Statements [59.71218039095155]
言語モデルの自然言語理解(NLU)能力を評価するための主要な手段として、読解理解(RC)があげられる。
文脈がモデルの内部知識と一致している場合、モデルの回答がコンテキスト理解に由来するのか、あるいは内部情報から生じるのかを識別することは困難である。
この問題に対処するために、架空の事実や実体に基づいて、想像上のデータにRCを使うことを提案する。
論文 参考訳(メタデータ) (2024-04-09T13:08:56Z) - Simple Linguistic Inferences of Large Language Models (LLMs): Blind Spots and Blinds [59.71218039095155]
我々は,ほとんどの人間が自明に感じる単純な推論タスクにおいて,言語理解能力を評価する。
我々は, (i) 文法的に特定された含意, (ii) 不確実性のある明らかな副詞を持つ前提, (iii) 単調性含意を目標とする。
モデルはこれらの評価セットに対して中程度から低い性能を示す。
論文 参考訳(メタデータ) (2023-05-24T06:41:09Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。