論文の概要: Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders
- arxiv url: http://arxiv.org/abs/2607.21774v1
- Date: Thu, 23 Jul 2026 19:42:59 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-27 20:58:56.977563
- Title: Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders
- Title(参考訳): 自然言語オートエンコーダを用いたQwen2.5-7Bにおける後期コロンビアのアイデンティティ推定
- Authors: Pablo Santiago Potes Velasco, María del Mar García Matabanchoy, Óscar Julián Pérez Ladino, Jhoan Stevan Mosquera Ortiz, Nicolás Lozano Mazuera, Gilber Alexis Corrales Gallego,
- Abstract要約: 自然言語オートエンコーダを用いて,各プロンプト毎に4つの定位四分体にまたがる20層からの残ストリームアクティベーションを音声化する。
この研究は、アクティベーションレベルの解釈可能性と、未表現のスペイン品種のバイアス評価を結びつける。
- 参考スコア(独自算出の注目度): 0.0
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Large language models may infer demographic attributes from subtle linguistic cues even when those attributes are not explicitly stated. This pilot study examines whether Qwen2.5-7B-Instruct internally represents Colombian identity, socioeconomic status, or stereotype-related information when processing Colombian-Spanish and English prompts. We use Natural Language Autoencoders (NLA) to verbalize residual-stream activations from layer 20 across four positional quartiles per prompt. Our dataset contains 30 prompts arranged as 15 matched Spanish-English pairs, spanning explicit Colombian cues, implicit Colombian cues, and neutral controls. We report descriptive rates and qualitative evidence rather than statistically powered effects, focusing on whether latent nationality or stereotype representations appear before they are verbalized in the model output. This work connects activation-level interpretability with bias evaluation for underrepresented Spanish varieties.
- Abstract(参考訳): 大規模な言語モデルは、これらの属性が明示的に述べられていなくても、微妙な言語的手がかりから人口統計学的特性を推測することができる。
このパイロット研究は、コロンビアとスペイン語と英語のプロンプトを処理する際に、Qwen2.5-7B-Instructがコロンビアのアイデンティティ、社会経済的地位、あるいはステレオタイプ関連情報を内部的に表現しているかどうかを調べる。
自然言語オートエンコーダ(NLA)を用いて,各プロンプトあたりの4つの位置の四分法にまたがる20層からの残差ストリームのアクティベーションを言語化する。
私たちのデータセットには、15組のスペイン語と英語のペアとして配置された30のプロンプトが含まれており、明示的なコロンビアのキュー、暗黙的なコロンビアのキュー、中立的なコントロールにまたがっている。
本報告では, モデル出力に言語化される前に, 潜在国籍やステレオタイプ表現が出現するかどうかに着目し, 統計的効果よりも説明率と定性的な証拠を報告する。
この研究は、アクティベーションレベルの解釈可能性と、未表現のスペイン品種のバイアス評価を結びつける。
関連論文リスト
- Nationality encoding in language model hidden states: Probing culturally differentiated representations in persona-conditioned academic text [4.0057643036291815]
本研究では, Gemma-3-4b-itが学術テキストを生成する際に, 隠れ状態の国籍識別情報を符号化するかどうかを検証した。
270のテキストのコーパスが45のプロンプトテンプレートから生成され、2×3の設計で6つのペルソナ条件が交わった。
発見は、探索手法を社会言語学的属性に拡張し、EAPと言語教育に実践的な意味を持つ。
論文 参考訳(メタデータ) (2026-04-11T10:52:05Z) - Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models [81.45743826739054]
大きな障壁は、LAION-400MのようなWebスケールデータセットにおける人口統計アノテーションの欠如である。
2億7600万以上のバウンディングボックスや、性別や人種/民族ラベルの認識、キャプションの自動生成など、完全なデータセットのための人中心アノテーションを作成します。
それらを用いて、黒人や中東と見なされる男性や個人と犯罪に関連する負のコンテンツとの不均等な結びつきなど、人口不均衡や有害な関連を明らかにする。
論文 参考訳(メタデータ) (2025-10-04T07:51:59Z) - Adapting Language Models to Indonesian Local Languages: An Empirical Study of Language Transferability on Zero-Shot Settings [1.1556013985948772]
インドネシアの低リソース言語への事前学習言語モデルの転送性を評価する。
私たちはターゲット言語を、見る、見る、見る、見る、見えない3つのカテゴリに分類します。
マルチ言語モデルは、目に見える言語で、部分的に見られる言語では適度に、目に見えない言語では劣る。
対象言語にラベル付きデータを必要としないため,MAD-Xは性能を著しく向上させることがわかった。
論文 参考訳(メタデータ) (2025-07-02T12:17:55Z) - Bias Attribution in Filipino Language Models: Extending a Bias Interpretability Metric for Application on Agglutinative Languages [8.58480189544444]
言語モデルの実装に情報理論バイアス属性スコアを適応させる。
フィリピンのモデルは、人、物、関係に関連する言葉によって偏見を向けられていることを示す。
これらの知見は、英語と非英語のモデルが、社会デマログラフ群と偏見に関連する入力をどのように処理するかの相違を示唆している。
論文 参考訳(メタデータ) (2025-06-08T18:13:18Z) - Quantifying the Dialect Gap and its Correlates Across Languages [69.18461982439031]
この研究は、明らかな相違を明らかにし、マインドフルなデータ収集を通じてそれらに対処する可能性のある経路を特定することによって、方言NLPの分野を強化する基盤となる。
論文 参考訳(メタデータ) (2023-10-23T17:42:01Z) - Disco-Bench: A Discourse-Aware Evaluation Benchmark for Language
Modelling [70.23876429382969]
本研究では,多種多様なNLPタスクに対して,文内談話特性を評価できるベンチマークを提案する。
ディスコ・ベンチは文学領域における9つの文書レベルのテストセットから構成されており、豊富な談話現象を含んでいる。
また,言語分析のために,対象モデルが談話知識を学習するかどうかを検証できる診断テストスイートを設計する。
論文 参考訳(メタデータ) (2023-07-16T15:18:25Z) - Retrieval-based Disentangled Representation Learning with Natural
Language Supervision [61.75109410513864]
本稿では,VDR(Vocabulary Disentangled Retrieval)を提案する。
提案手法では,両エンコーダモデルを用いて語彙空間におけるデータと自然言語の両方を表現する。
論文 参考訳(メタデータ) (2022-12-15T10:20:42Z) - Languages You Know Influence Those You Learn: Impact of Language
Characteristics on Multi-Lingual Text-to-Text Transfer [4.554080966463776]
マルチ言語モデル (LM) は低リソース言語での自然言語処理の実現に成功している。
このようなモデル、特にmT5は、言語間の言語的および意味的な知識をどう転送するかをよりよく理解しようとしています。
この研究の鍵となる発見は、構文、形態学、音韻学の類似性が言語間移動のよい予測因子であることである。
論文 参考訳(メタデータ) (2022-12-04T07:22:21Z) - Language Contamination Explains the Cross-lingual Capabilities of
English Pretrained Models [79.38278330678965]
一般的な英語事前学習コーパスには、かなりの量の非英語テキストが含まれていることが判明した。
これにより、大規模なデータセットで数十億の外国語トークンが生成される。
そして、これらの少数の非英語データでさえ、それらに基づいて訓練されたモデルの言語間移動を促進することを実証する。
論文 参考訳(メタデータ) (2022-04-17T23:56:54Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。