غالبا ما تكون دراسات العلوم الاجتماعية الحاسوبية تحليل المحتوى في كثير من الأحيان داخل التركيبة السكانية القياسية.نظرا لأن التركيبة السكانية غير متوفرة على العديد من منصات وسائل التواصل الاجتماعي (E.G. Twitter)، فقد استنتجت الدراسات العديد من الدراسات التركيبة السكانية تلقائيا.على الرغم من العديد من الدراسات التي تقدم أداء مفهوم العرق والعرق، لا يزال تدريب النظم العملية بعيد المنال لأن هناك بعض البيانات المشروح.مجموعات البيانات الحالية صغيرة وغير دقيقة، أو تفشل في تغطية المجموعات العرقية والأعرقية الأربعة الأكثر شيوعا في الولايات المتحدة.نقدم طريقة لتحديد التقارير الذاتية عن العرق والعرق من أوصاف الملف الشخصي Twitter.على الرغم من ضجيج الإشراف الآلي، فإن مجموعات بيانات التقرير الذاتي لدينا تمكن التحسينات في أداء التصنيف على بيانات مسح التقارير الذاتية القياسية الذهبية.والنتيجة هي طريقة استنساخ لإنشاء موارد تدريبية واسعة النطاق للسباق والعرق.
Computational social science studies often contextualize content analysis within standard demographics. Since demographics are unavailable on many social media platforms (e.g. Twitter), numerous studies have inferred demographics automatically. Despite many studies presenting proof-of-concept inference of race and ethnicity, training of practical systems remains elusive since there are few annotated datasets. Existing datasets are small, inaccurate, or fail to cover the four most common racial and ethnic groups in the United States. We present a method to identify self-reports of race and ethnicity from Twitter profile descriptions. Despite the noise of automated supervision, our self-report datasets enable improvements in classification performance on gold standard self-report survey data. The result is a reproducible method for creating large-scale training resources for race and ethnicity.
References used
https://aclanthology.org/
Mapping user locations to countries can be useful for many applications such as dialect identification, author profiling, recommendation system, etc. Twitter allows users to declare their locations as free text, and these user-declared locations are
This paper investigates incorporating quality knowledge sources developed by experts for the medical domain as well as syntactic information for classification of tweets into four different health oriented categories. We claim that resources such as
In this paper we apply self-knowledge distillation to text summarization which we argue can alleviate problems with maximum-likelihood training on single reference and noisy datasets. Instead of relying on one-hot annotation labels, our student summa
User-generated texts include various types of stylistic properties, or noises. Such texts are not properly processed by existing morpheme analyzers or language models based on formal texts such as encyclopedias or news articles. In this paper, we pro
In this paper, we describe our system entry for Shared Task 8 at SMM4H-2021, which is on automatic classification of self-reported breast cancer posts on Twitter. In our system, we use a transformer-based language model fine-tuning approach to automa