論文の概要: The Role of Implicit and Explicit Demographic Signals in Large Language Model-based Student Assessment
- arxiv url: http://arxiv.org/abs/2609.16993v1
- Date: Tue, 15 Sep 2026 11:07:26 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-09-16 14:56:08.465913
- Title: The Role of Implicit and Explicit Demographic Signals in Large Language Model-based Student Assessment
- Title(参考訳): 大規模言語モデルに基づく学生評価における暗示的・明示的デモグラフィック信号の役割
- Abstract要約: 大規模言語モデルは現在、学生の評価において一般的なものであるが、学生の人口層が彼らの利用にどのように影響するかはほとんど分かっていない。
我々は,1)明示的な人口統計の影響,2)人口統計の詳細を直接言及する要因,および2)人口統計信号として会話履歴を使用する暗黙的な効果をテストするために制御されたプロンプトを設定した。
明示的なケースと暗黙的なケースの両方で、モデルは人口統計の手がかりを拾い上げ、スコア、フィードバック、そして回答を変えることができる。
- 参考スコア(独自算出の注目度): 24.32015609344653
- License: http://creativecommons.org/licenses/by-nc-sa/4.0/
- Abstract: Large Language Models are now common in student assessment, but we know little about how student demographics affect their use. Sometimes, considering student demographics may be necessary -- for example, to improve readability for users with lower educational levels. However, it also risks being a cause of discrimination, e.g., when assigning lower scores to students from lower socioeconomic backgrounds. We set up controlled prompts to test 1) explicit demographic effects, where we mention demographic details directly, and 2) implicit effects, where we use conversation history as a demographic signal. We test these settings in three tasks: Automated Essay Scoring, Formative Feedback, and Metalinguistic Question Answering. We test six state-of-the-art LLMs on these tasks. In both explicit and implicit cases, the models pick up on demographic cues and can change their scoring, feedback, and answers accordingly. We find that LLMs frequently adjust the readability of feedback to education levels when these are explicitly mentioned. On the other hand, implicit conditions produce unpredictable biases, such as in question answering, where responses from lower-education levels receive lower sentiment scores. Our results provide clear evidence of demographic sensitivity in LLMs for educational assessment tasks.
- Abstract(参考訳): 大規模言語モデルは現在、学生の評価において一般的なものであるが、学生の人口層が彼らの利用にどのように影響するかはほとんど分かっていない。
例えば、教育水準の低いユーザーの読みやすさを改善するためには、学生の人口統計を考える必要があることがある。
しかし、低社会経済的背景から学生に低得点を割り当てる場合には、差別の原因となるリスクも負う。
テストのための制御されたプロンプトを設定しました
1) 人口統計の詳細を直接言及する明示的な人口統計効果
2) 人口統計学的信号として会話履歴を用いた暗黙の効果について検討した。
我々はこれらの設定を3つのタスクでテストする。
これらの課題に対して6つの最先端LCMを試験する。
明示的なケースと暗黙的なケースの両方で、モデルは人口統計の手がかりを拾い上げ、スコア、フィードバック、そして回答を変えることができる。
その結果,LLM は教育水準にフィードバックの可読性を調整することがしばしばあることがわかった。
一方、暗黙の条件は、低い教育レベルの反応が低い感情スコアを受ける質問応答のような予測不可能なバイアスを生み出す。
以上の結果から,教育評価タスクにおけるLCMの人口統計学的感度の明らかな証明が得られた。
関連論文リスト
- Large Language Models in K-12 Education: Alignment with State Curriculum Standards and Student Personas [3.147897243459717]
我々は、米国史のカリキュラムのバリエーションを特定し、異なるLLMがこれらの州固有のカリキュラムの違いを反映する程度を評価する。
モデルが歴史的トピックの提示を調整できる一方で、こうした変化は国家の政治的傾向が認識されていることから生じる可能性がある。
論文 参考訳(メタデータ) (2026-06-03T13:14:33Z) - Sociodemographic Biases in Educational Counselling by Large Language Models [61.30199414932204]
本研究では,Large Language Models(LLMs)における社会デマトグラフィーバイアスについて検討する。
多様な状況下で生徒を記述した900のヴィグネットに関する質問に答える6つのLDMからの回答を評価した。
論文 参考訳(メタデータ) (2026-04-03T14:08:22Z) - DAIQ: Auditing Demographic Attribute Inference from Question in LLMs [3.1677998308405786]
大規模言語モデル(LLM)は、性別や人種などの人口特性が入力の中に明示的に存在するときに、社会的偏見を反映することが知られている。
しかし、それらのモデルが存在しない場合でも、これらのモデルは質問のフレーズだけでユーザーのアイデンティティを推測する。
本稿では,言語モデルで見過ごされた障害モードを監査するためのタスクおよびフレームワークであるDAIQを紹介する。
論文 参考訳(メタデータ) (2025-08-18T19:26:17Z) - Revisiting LLM Value Probing Strategies: Are They Robust and Expressive? [81.49470136653665]
広範に利用されている3つの探索戦略における値表現の頑健さと表現性を評価する。
人口統計学的文脈は自由テキスト生成にはほとんど影響を与えず、モデルの値は値に基づく行動の好みと弱い相関しか示さない。
論文 参考訳(メタデータ) (2025-07-17T18:56:41Z) - Does the Prompt-based Large Language Model Recognize Students' Demographics and Introduce Bias in Essay Scoring? [3.7498611358320733]
大規模言語モデル (LLM) は自動エッセイ・スコーリング (AES) で広く使われている。
本研究は,学生の属性の予測力と評価課題における評価バイアスとの関係について検討した。
論文 参考訳(メタデータ) (2025-04-30T05:36:28Z) - Embracing AI in Education: Understanding the Surge in Large Language Model Use by Secondary Students [53.20318273452059]
OpenAIのChatGPTのような大規模言語モデル(LLM)は、新しい教育の道を開いた。
学校制限にもかかわらず,中高生300人以上を対象に調査を行ったところ,学生の70%がLDMを利用していることがわかった。
我々は、対象特化モデル、パーソナライズドラーニング、AI教室など、このような問題に対処するいくつかのアイデアを提案する。
論文 参考訳(メタデータ) (2024-11-27T19:19:34Z) - Which Demographics do LLMs Default to During Annotation? [9.190535758368567]
データアノテーションに大規模言語モデル(LLM)を用いることで、2つの研究方向が開発された。
我々は,ヒトアノテータLLMのどの属性が本質的に模倣されているかを評価する。
性別、人種、年齢に関連する顕著な影響を、人口動態の促進において観察する。
論文 参考訳(メタデータ) (2024-10-11T14:02:42Z) - Sociodemographic Prompting is Not Yet an Effective Approach for Simulating Subjective Judgments with LLMs [13.744746481528711]
大規模言語モデル(LLM)は、様々な文脈で人間の反応をシミュレートするために広く使われている。
我々は,2つの主観的判断課題(丁寧さと攻撃性)において,人口差を理解する能力について,9つの人気のLCMを評価した。
ゼロショット設定では、両方のタスクのほとんどのモデルの予測は、アジアやブラックの参加者よりもホワイトの参加者のラベルとより密接に一致している。
論文 参考訳(メタデータ) (2023-11-16T10:02:24Z) - Bias Runs Deep: Implicit Reasoning Biases in Persona-Assigned LLMs [67.51906565969227]
LLMの基本的な推論タスクの実行能力に対するペルソナ代入の意図しない副作用について検討する。
本研究は,5つの社会デコグラフィーグループにまたがる24の推論データセット,4つのLDM,19の多様な個人(アジア人など)について検討した。
論文 参考訳(メタデータ) (2023-11-08T18:52:17Z) - Do LLMs exhibit human-like response biases? A case study in survey
design [66.1850490474361]
大規模言語モデル(LLM)が人間の反応バイアスをどの程度反映しているかについて検討する。
アンケート調査では, LLMが人間のような応答バイアスを示すかどうかを評価するためのデータセットとフレームワークを設計した。
9つのモデルに対する総合的な評価は、一般のオープンかつ商用のLCMは、一般的に人間のような振る舞いを反映しないことを示している。
論文 参考訳(メタデータ) (2023-11-07T15:40:43Z) - Sensitivity, Performance, Robustness: Deconstructing the Effect of
Sociodemographic Prompting [64.80538055623842]
社会デマトグラフィープロンプトは、特定の社会デマトグラフィープロファイルを持つ人間が与える答えに向けて、プロンプトベースのモデルの出力を操縦する技術である。
ソシオデマトグラフィー情報はモデル予測に影響を及ぼし、主観的NLPタスクにおけるゼロショット学習を改善するのに有用であることを示す。
論文 参考訳(メタデータ) (2023-09-13T15:42:06Z) - Towards Controllable Biases in Language Generation [87.89632038677912]
本研究では、特定の人口集団の言及を含む入力プロンプトによって生成されたテキストの社会的バイアスを誘導する手法を開発した。
1 つの人口統計学において負のバイアスを誘発し、もう1 つの人口統計学において正のバイアスを誘導し、2 つのシナリオを分析する。
論文 参考訳(メタデータ) (2020-05-01T08:25:11Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。