Fugu-MT 論文翻訳(概要): Beyond Keywords: Evaluating Large Language Model Classification of Nuanced Ableism

論文の概要: Beyond Keywords: Evaluating Large Language Model Classification of Nuanced Ableism

arxiv url: http://arxiv.org/abs/2505.20500v1
Date: Mon, 26 May 2025 20:01:44 GMT
ステータス: 翻訳完了
システム内更新日: 2025-05-28 17:05:58.277689
Title: Beyond Keywords: Evaluating Large Language Model Classification of Nuanced Ableism
Title（参考訳）: Beyond Keywords:Nuanced Ableismの大規模言語モデル分類の評価
Authors: Naba Rizvi, Harper Strickland, Saleha Ahmedi, Aekta Kallepalli, Isha Khirwadkar, William Wu, Imani N. S. Munyaka, Nedjma Ousidhoum,
Abstract要約: 大規模言語モデル(LLM)は、r'esumのスクリーニングやコンテンツモデレーションといった意思決定タスクにますます使われています。自閉症者を対象としたニュアンス能力の同定のための4つのLSMの能力について検討した。以上の結果から, LLMは自閉症関連言語を識別できるが, 有害あるいは攻撃的な意味を欠くことが多いことが明らかとなった。
参考スコア（独自算出の注目度）: 2.0435202333125977
License: http://creativecommons.org/licenses/by/4.0/
Abstract: Large language models (LLMs) are increasingly used in decision-making tasks like r\'esum\'e screening and content moderation, giving them the power to amplify or suppress certain perspectives. While previous research has identified disability-related biases in LLMs, little is known about how they conceptualize ableism or detect it in text. We evaluate the ability of four LLMs to identify nuanced ableism directed at autistic individuals. We examine the gap between their understanding of relevant terminology and their effectiveness in recognizing ableist content in context. Our results reveal that LLMs can identify autism-related language but often miss harmful or offensive connotations. Further, we conduct a qualitative comparison of human and LLM explanations. We find that LLMs tend to rely on surface-level keyword matching, leading to context misinterpretations, in contrast to human annotators who consider context, speaker identity, and potential impact. On the other hand, both LLMs and humans agree on the annotation scheme, suggesting that a binary classification is adequate for evaluating LLM performance, which is consistent with findings from prior studies involving human annotators.
Abstract（参考訳）: 大規模言語モデル(LLM)は、r\'esum\'eスクリーニングやコンテンツモデレーションといった意思決定タスクにますます使われており、特定の視点を増幅または抑圧する力を与えている。以前の研究では、LSMの障害関連バイアスが特定されているが、能力主義を概念化したり、テキストでそれを検出したりする方法についてはほとんど分かっていない。自閉症者を対象としたニュアンス能力の同定のための4つのLSMの能力について検討した。関連用語の理解と文脈における有能な内容の認識における効果のギャップについて検討する。以上の結果から, LLMは自閉症関連言語を識別できるが, 有害あるいは攻撃的な意味を欠くことが多いことが明らかとなった。さらに、人間とLLMの説明の質的な比較を行う。 LLMは、文脈や話者のアイデンティティ、潜在的な影響を考慮に入れている人間のアノテーションとは対照的に、文脈誤解釈につながる表面レベルのキーワードマッチングに依存する傾向がある。一方、LLMと人間は、このアノテーション方式に同意し、LLMの性能を評価するのに二項分類が適していることを示唆している。

関連論文リスト

How LLMs Comprehend Temporal Meaning in Narratives: A Case Study in Cognitive Evaluation of LLMs [13.822169295436177]
本研究では,人文研究に用いられた物語において,大規模言語モデル(LLM)が言語的側面の時間的意味をどう扱うかを検討する。以上の結果から,LLMは原型性に過度に依存し,相反する側面判断を生じ,側面から派生した因果推論に苦慮することが明らかとなった。これらの結果は,LLMのプロセスの側面が人間と根本的に異なり,ロバストな物語理解が欠如していることを示唆している。
論文参考訳（メタデータ） (2025-07-18T18:28:35Z)
Psycholinguistic Word Features: a New Approach for the Evaluation of LLMs Alignment with Humans [2.7013338932521416]
我々は,LLMの代表群と人間の評価値とのアライメントを心理言語学的データセット上で評価した。その結果,グラスゴーのノルム評価において,アライメントはテキストカラーブラックの方が概ね良好であることが示唆された。これは、現在のLLMが単語に対する人間の感覚関連と一致している可能性を示唆している。
論文参考訳（メタデータ） (2025-05-29T20:56:48Z)
Probing Association Biases in LLM Moderation Over-Sensitivity [42.191744175730726]
大規模言語モデルは、コンテンツモデレーションに広く使用されるが、しばしば良心的なコメントを有毒と誤分類する。トピック・アソシエーション・アナリティクス(トピック・アソシエーション・アナリティクス)は,LLMが特定のトピックと毒性をどう関連づけるかを定量化するセマンティック・レベルのアプローチである。より高度なモデル(例えば、GPT-4 Turbo)は、全体的な偽陽性率が低いにもかかわらず、より強力なトピックステレオタイプを示す。
論文参考訳（メタデータ） (2025-05-29T18:07:48Z)
How Deep is Love in LLMs' Hearts? Exploring Semantic Size in Human-like Cognition [75.11808682808065]
本研究では,大言語モデル (LLM) が意味的サイズを理解する上で類似した傾向を示すかどうかを検討する。以上の結果から,マルチモーダルトレーニングはLLMにとって人間的な理解を深める上で不可欠であることが示唆された。最後に,LLMが実世界のWebショッピングシナリオにおいて,より大きなセマンティックサイズを持つ注目の見出しに影響されているかを検討する。
論文参考訳（メタデータ） (2025-03-01T03:35:56Z)
Is LLM an Overconfident Judge? Unveiling the Capabilities of LLMs in Detecting Offensive Language with Annotation Disagreement [22.992484902761994]
本研究では,攻撃言語検出における多言語モデル(LLM)の性能を系統的に評価する。本研究では,二項分類の精度を分析し,モデル信頼度と人的不一致度の関係を検証し,不一致サンプルがモデル決定にどう影響するかを考察する。
論文参考訳（メタデータ） (2025-02-10T07:14:26Z)
Investigating large language models for their competence in extracting grammatically sound sentences from transcribed noisy utterances [1.3597551064547497]
人間は、意味的に重要な内容と音声特有のノイズを区別する優れた認知能力を示す。本研究では,大言語モデル (LLM) が類似語理解タスクを効果的に実行できるかを検討する。
論文参考訳（メタデータ） (2024-10-07T14:55:20Z)
Hate Personified: Investigating the role of LLMs in content moderation [64.26243779985393]
ヘイト検出などの主観的タスクでは,人々が嫌悪感を知覚する場合には,多様なグループを表現できるLarge Language Model(LLM)の能力は不明確である。追加の文脈をプロンプトに含めることで、LLMの地理的プライミングに対する感受性、ペルソナ属性、数値情報を分析し、様々なグループのニーズがどの程度反映されているかを評価する。
論文参考訳（メタデータ） (2024-10-03T16:43:17Z)
A Methodology for Explainable Large Language Models with Integrated Gradients and Linguistic Analysis in Text Classification [2.556395214262035]
アルツハイマー病(AD)のような発声に影響を及ぼす神経疾患は、患者と介護者の生活に大きな影響を及ぼす。近年のLarge Language Model (LLM) アーキテクチャの進歩は、自然発声による神経疾患の代表的特徴を識別する多くのツールを開発した。本稿では,ADに代表される語彙成分を識別できるSLIME法を提案する。
論文参考訳（メタデータ） (2024-09-30T21:45:02Z)
Potential and Limitations of LLMs in Capturing Structured Semantics: A Case Study on SRL [78.80673954827773]
大きな言語モデル(LLM)は、言語理解を高め、解釈可能性を改善し、バイアスを減らすために構造化セマンティクスをキャプチャする上で重要な役割を果たす。セマンティック・ロール・ラベルリング(SRL)を,構造化意味論を抽出するLLMの能力を探るための基本課題として用いることを提案する。 LLMは実際にセマンティック構造をキャプチャすることができ、スケールアップは常にポテンシャルを反映するわけではない。エラーのかなりの重複は、LLMと訓練されていない人間の両方によって行われ、全てのエラーの約30%を占めることに私たちは驚いています。
論文参考訳（メタデータ） (2024-05-10T11:44:05Z)
The Strong Pull of Prior Knowledge in Large Language Models and Its Impact on Emotion Recognition [74.04775677110179]
In-context Learning (ICL) は、Large Language Models (LLM) を用いた自然言語処理のための強力なパラダイムとして登場した。 LLMには、感情認識において強いが矛盾する先行性があり、その予測に影響を及ぼすことが示される。以上の結果から,ICLをより大きなLCMで事前学習領域外の情動中心タスクに使用する場合,注意が必要であることが示唆された。
論文参考訳（メタデータ） (2024-03-25T19:07:32Z)
FAC$^2$E: Better Understanding Large Language Model Capabilities by Dissociating Language and Cognition [56.76951887823882]
大規模言語モデル(LLM)は、主に様々なテキスト理解および生成タスクにおける全体的なパフォーマンスによって評価される。 FAC$2$E, FAC$2$Eについて述べる。
論文参考訳（メタデータ） (2024-02-29T21:05:37Z)
Large Language Models: The Need for Nuance in Current Debates and a Pragmatic Perspective on Understanding [1.3654846342364308]
LLM(Large Language Models)は、文法的に正しい、流動的なテキストを生成する能力において、非並列である。本論文は,LLM能力の批判において再発する3点を批判的に評価する。 LLMにおける現実の理解と意図の問題に関する実践的な視点を概説する。
論文参考訳（メタデータ） (2023-10-30T15:51:04Z)
Are Large Language Models Really Robust to Word-Level Perturbations? [68.60618778027694]
本稿では,事前学習した報酬モデルを診断ツールとして活用する,新たな合理的評価手法を提案する。より長い会話は、質問を理解する能力の観点から言語モデルの包括的把握を示す。この結果から,LLMは日常言語でよく使われる単語レベルの摂動に対する脆弱性をしばしば示している。
論文参考訳（メタデータ） (2023-09-20T09:23:46Z)
Revisiting the Reliability of Psychological Scales on Large Language Models [62.57981196992073]
本研究の目的は,大規模言語モデルにパーソナリティアセスメントを適用することの信頼性を明らかにすることである。 GPT-3.5、GPT-4、Gemini-Pro、LLaMA-3.1などのモデル毎の2,500設定の分析により、様々なLCMがビッグファイブインベントリに応答して一貫性を示すことが明らかになった。
論文参考訳（メタデータ） (2023-05-31T15:03:28Z)

関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。

指定された論文の情報です。
本サイトの運営者は本サイト（すべての情報・翻訳含む）の品質を保証せず、本サイト（すべての情報・翻訳含む）を使用して発生したあらゆる結果について一切の責任を負いません。