على ويكيبيديا، موسوعة من الجماعة الجماعية عبر الإنترنت، ينفذ المتطوعون سياسات التحرير الموسوعة.لقد ألهمت سياسة ويكيبيديا بشأن الحفاظ على وجهة نظر محايدة البحوث الحديثة على اكتشاف التحيز، بما في ذلك كلمات الاصوات "والتحريز".بعد حتى الآن، تم إجراء القليل من العمل على تحديد البخاخ، "العبارات الموجودة بشكل مفرط دون مصدر يمكن التحقق منه.نوضح أن جمع البيانات التدريبية لهذه المهمة يتطلب بعض العناية، وبناء مجموعة بيانات عن طريق الجمع بين التعليقات التوضيحية لتحرير ويكيبيديا وتقنيات استرجاع المعلومات.نقارن العديد من النهج التي توقعت من البخار وتحقيق 0.963 F1 من خلال دمج ميزات الاقتباس في نموذج روبرتا.أخيرا، نوضح كيفية دمج نموذجنا مع البنية التحتية العامة في ويكيبيديا لإعادة مجتمع محرر ويكيبيديا.
On Wikipedia, an online crowdsourced encyclopedia, volunteers enforce the encyclopedia's editorial policies. Wikipedia's policy on maintaining a neutral point of view has inspired recent research on bias detection, including weasel words'' and hedges''. Yet to date, little work has been done on identifying puffery,'' phrases that are overly positive without a verifiable source. We demonstrate that collecting training data for this task requires some care, and construct a dataset by combining Wikipedia editorial annotations and information retrieval techniques. We compare several approaches to predicting puffery, and achieve 0.963 f1 score by incorporating citation features into a RoBERTa model. Finally, we demonstrate how to integrate our model with Wikipedia's public infrastructure to give back to the Wikipedia editor community.
المراجع المستخدمة
https://aclanthology.org/
ساهم تقدم تقنية الويب والمعلومات في النمو السريع للمكتبات الرقمية وأدوات ترجمة الآلات التلقائية والتي تقوم بسهولة بترجمة النصوص من لغة إلى أخرى. وقد زادت هذه المحتوى في الوصول إلى لغات مختلفة، مما يؤدي إلى أداء الانتحال المترجم بسهولة، يشار إليها باس
نقدم HATEBERT، نموذج BERT الذي تم تدريبه على إعادة تدريب للكشف عن اللغة المسيئة باللغة الإنجليزية.تم تدريب النموذج على RAL-E، وهي مجموعة بيانات واسعة النطاق من تعليقات Reddit باللغة الإنجليزية من المجتمعات المحظورة لكونها مسيئة أو بغيضة حيث قمنا بإتا
دقة Aqueference Coreference Coreence هي مهمة مؤسسية لتطبيقات NLP التي تنطوي على معالجة النص المتعدد. ومع ذلك، فإن شركة كوربيا الحالية لهذه المهمة نادرة وصغيرة نسبيا، بينما تعلق فقط مجموعات من المستندات المتواضعة فقط من الوثائق التي تنتمي إلى نفس المو
كان هناك طلب متزايد لتطوير أنظمة التدريب اللغوية بمساعدة الكمبيوتر (النقص)، والتي يمكن أن توفر ملاحظات حول سوء الأخطاء وتسهيل المتعلمين اللغة الثانية (L2) لتحسين إجادتها الناطقة من خلال الممارسة المتكررة. نظرا لنقص الكلام غير الأصلي لتدريب الوحدة الن
Nowadays social-psychological variables , like attitudes and motivation, gender, aptitude, etc. have been established as influential factors in the process of learning a foreign language . Therefore, this research aims at measuring the attitudes of f