論文の概要: slang.gr as a Large-Scale Crowdsourced Resource for Non-Standard Greek
- arxiv url: http://arxiv.org/abs/2607.21255v1
- Date: Thu, 23 Jul 2026 12:27:18 GMT
- ステータス: 翻訳完了
- システム内更新日: 2026-07-24 18:26:25.410944
- Title: slang.gr as a Large-Scale Crowdsourced Resource for Non-Standard Greek
- Title(参考訳): 非標準ギリシャ語のための大規模クラウドソースリソースとしてのslang.gr
- Abstract要約: ギリシャ語非標準言語のクラウドソースレキシコンである slang.gr の大規模計算研究を初めて紹介する。
ノイズの多い人為的タグを、意味カテゴリーと社会言語メタデータの両方をキャプチャする構造化多層分類にマップする。
その結果,スラングは人的・評価的な言語に強く焦点を絞っており,形態的創造性が高く,ユーザの寿命が短くなることで形成されていることがわかった。
- 参考スコア(独自算出の注目度): 0.5735035463793009
- License: http://creativecommons.org/licenses/by/4.0/
- Abstract: Slang is a central component of everyday language, reflecting linguistic creativity, social identity, and cultural change, yet its dy- namic and non-standard nature makes it difficult to model computationally. We present the first large-scale computational study of slang.gr, a crowdsourced lexicon of Greek non-standard language, combining lexical content, user-generated tags, and interaction data. To enable the systematic analysis, we map noisy folksonomic tags to a structured multi-layer taxonomy capturing both semantic categories and sociolinguistic metadata. Using this representation, we analyze the linguistic structure of Greek slang and the behavior of its contributor community. We find that slang is strongly centered on person-related and evaluative language, exhibits high morphological creativity, and is shaped by highly skewed participation with short user lifespans and overlapping communities. Building on these signals, we introduce a community-based confidence score for definitions that integrates user roles, interaction patterns, and moderation signals. Our results show that taxonomy-based representations improve interpretability while retaining meaningful aspects of behavioral structure, enabling a more structured and interpretable analysis of confidence signals. Overall, this work establishes slang.gr as a computational resource for non-standard Greek and provides a foundation for sociolinguistic NLP, bias analysis, and the study of informal language in LLMs.
- Abstract(参考訳): スラングは日常言語の中心的な構成要素であり、言語的創造性、社会的アイデンティティ、文化的変化を反映しているが、そのダイ・ナミックで非標準的な性質は、計算的にモデル化することが困難である。
本稿では,ギリシャ語非標準言語のクラウドソース辞書であるslang.grについて,語彙内容,ユーザ生成タグ,インタラクションデータを組み合わせた,最初の大規模計算結果を示す。
体系的な分析を可能にするために、ノイズの多い人名タグを、意味カテゴリーと社会言語メタデータの両方をキャプチャーする構造化多層分類にマッピングする。
この表現を用いて,ギリシア語スラングの言語構造とコントリビュータコミュニティの行動を分析する。
その結果,スラングは人的・評価的な言語に強く焦点を絞っており,形態的創造性が高く,短いユーザ寿命と重複するコミュニティとの結びつきが強いことが判明した。
これらの信号に基づいて、ユーザの役割、インタラクションパターン、モデレーション信号を統合した定義のためのコミュニティベースの信頼スコアを導入する。
以上の結果から,分類学に基づく表現は,行動構造の意義を保ちながら解釈可能性を高め,信頼性信号のより構造化され,解釈可能な分析を可能にすることが示唆された。
全体として、この研究は非標準ギリシア語の計算資源としてslang.grを確立し、社会言語学的なNLP、バイアス分析、LLMにおける非公式言語の研究の基礎を提供する。
関連論文リスト
- Self-Supervised Lexical Representation Learning for Fast, Large-Scale Phylogenetic Inference [0.0]
本稿では,完全自己教師型コントラスト学習フレームワークを提案する。
生のIPA転写されたワードリストから直接語彙表現を学習する。
3,399品種の系統樹を推定する。
論文 参考訳(メタデータ) (2026-09-04T15:23:12Z) - Do Language Models Know Their Slang? Queer Slang Understanding in User-Generated Content [2.174476613068234]
Slang-Qは、自然に生成した英文のデータセットであり、クイア・スラング用語と参照定義とを組み合わせている。
我々はこのリソースを用いて、クエリスラングを理解して定義する能力に基づいて、言語モデルの最初の探索的評価を行う。
論文 参考訳(メタデータ) (2026-08-05T13:40:48Z) - HyperPersona: A Multi-Level Hypergraph Framework for Text-Based Automatic Personality Prediction [0.0]
テキストベースの自動パーソナリティ予測(APP)は、言語行動からパーソナリティを推測する。
ハイパーグラフ構造を通じてテキスト(文書,文,単語)の階層構造を明示的にモデル化するフレームワークであるHyperPersonaを提案する。
我々は,HyperPersonaがマルチレベル言語的手がかりを効果的に統合し,最先端のベースラインよりも優れた性能を実現していることを示す。
論文 参考訳(メタデータ) (2026-05-17T09:49:06Z) - Language, Place, and Social Media: Geographic Dialect Alignment in New Zealand [0.0]
本研究は, 言語使用が言語変化の場所識別とパターンを, ユーザインフォームド語彙, モルフォシンタクティック, セマンティック変数に基づいてどのように反映するかを考察する。
この研究には、426億の未処理語を含むコーパスの作成が含まれており、将来の研究に貴重なリソースを提供する。
論文 参考訳(メタデータ) (2026-04-17T06:37:25Z) - Beyond Training for Cultural Awareness: The Role of Dataset Linguistic Structure in Large Language Models [11.682773682018977]
文化適応のための微調整データセットの言語特性について検討する。
アラビア語、中国語、日本語のデータセットに対する軽量な言語、意味、構造的メトリクスを計算します。
語彙指向コンポーネント(PC3)が最も堅牢であり、モデルとベンチマーク間でより一貫したパフォーマンスが得られることを示す。
論文 参考訳(メタデータ) (2026-02-01T11:21:30Z) - Linguistic Structure from a Bottleneck on Sequential Information Processing [5.850665541267672]
予測情報によって制約されたコードに自然言語のような体系性が生じることを示す。
人間の言語は、音韻学、形態学、構文学、意味論のレベルにおいて、低い予測情報を持つように構成されている。
論文 参考訳(メタデータ) (2024-05-20T15:25:18Z) - From Word Models to World Models: Translating from Natural Language to
the Probabilistic Language of Thought [124.40905824051079]
言語インフォームド・シンキングのための計算フレームワークである「構成」を合理的に提案する。
我々は、自然言語から確率論的思考言語への文脈感応的なマッピングとして、言語の意味を定式化する。
LLMは、現実的に適切な言語的意味をキャプチャする文脈依存翻訳を生成することができることを示す。
認知的なモチベーションを持つシンボリックモジュールを統合するために、我々のフレームワークを拡張します。
論文 参考訳(メタデータ) (2023-06-22T05:14:00Z) - Variational Cross-Graph Reasoning and Adaptive Structured Semantics
Learning for Compositional Temporal Grounding [143.5927158318524]
テンポラルグラウンドティング(Temporal grounding)とは、クエリ文に従って、未編集のビデオから特定のセグメントを特定するタスクである。
新たに構成時間グラウンドタスクを導入し,2つの新しいデータセット分割を構築した。
ビデオや言語に内在する構造的意味論は、構成的一般化を実現する上で重要な要素である、と我々は主張する。
論文 参考訳(メタデータ) (2023-01-22T08:02:23Z) - O-Dang! The Ontology of Dangerous Speech Messages [53.15616413153125]
O-Dang!:The Ontology of Dangerous Speech Messages, a systematic and interoperable Knowledge Graph (KG)
O-Dang!は、Lingguistic Linked Open Dataコミュニティで共有されている原則に従って、イタリアのデータセットを構造化されたKGにまとめ、整理するように設計されている。
ゴールド・スタンダードとシングル・アノテータのラベルをKGにエンコードするモデルを提供する。
論文 参考訳(メタデータ) (2022-07-13T11:50:05Z) - Compositional Generalization in Grounded Language Learning via Induced
Model Sparsity [81.38804205212425]
グリッド環境における単純な言語条件のナビゲーション問題について考察する。
本研究では,オブジェクトの指示文と属性のスパース相関を助長するエージェントを設計し,それらを組み合わせて目的を導出する。
我々のエージェントは、少数のデモンストレーションから学習した場合でも、新しいプロパティの組み合わせを含む目標に対して高いレベルのパフォーマンスを維持している。
論文 参考訳(メタデータ) (2022-07-06T08:46:27Z) - Neural Abstructions: Abstractions that Support Construction for Grounded
Language Learning [69.1137074774244]
言語の相互作用を効果的に活用するには、言語基底に対する2つの最も一般的なアプローチの制限に対処する必要がある。
本稿では,ラベル条件付き生成モデルの推論手順に対する制約のセットであるニューラル・アブストラクションの考え方を紹介する。
この手法により,マインクラフトにおけるオープンエンドハウスタスクのセマンティックな変更をユーザ人口が構築できることが示される。
論文 参考訳(メタデータ) (2021-07-20T07:01:15Z) - Low-Dimensional Structure in the Space of Language Representations is
Reflected in Brain Responses [62.197912623223964]
言語モデルと翻訳モデルは,単語の埋め込み,構文的・意味的タスク,将来的な単語埋め込みとの間を円滑に介在する低次元構造を示す。
この表現埋め込みは、各特徴空間が、fMRIを用いて記録された自然言語刺激に対する人間の脳反応にどれだけうまく対応しているかを予測することができる。
これは、埋め込みが脳の自然言語表現構造の一部を捉えていることを示唆している。
論文 参考訳(メタデータ) (2021-06-09T22:59:12Z) - A Benchmark for Systematic Generalization in Grounded Language
Understanding [61.432407738682635]
人間は慣れ親しんだ部分から成り立つ不慣れな状況を記述する表現を容易に解釈する。
対照的に、現代のニューラルネットワークは、新しい構成を理解するのに苦労している。
位置言語理解における合成一般化を評価するための新しいベンチマークであるgSCANを導入する。
論文 参考訳(メタデータ) (2020-03-11T08:40:15Z)
関連論文リストは本サイト内にある論文のタイトル・アブストラクトから自動的に作成しています。
指定された論文の情報です。
本サイトの運営者は本サイト(すべての情報・翻訳含む)の品質を保証せず、本サイト(すべての情報・翻訳含む)を使用して発生したあらゆる結果について一切の責任を負いません。