ترغب بنشر مسار تعليمي؟ اضغط هنا

Dreamdrug - مجموعة بيانات NER Growdsourced للكشف عن المخدرات في أسواق Darknet

DreamDrug - A crowdsourced NER dataset for detecting drugs in darknet markets

247   0   0   0.0 ( 0 )
 تاريخ النشر 2021
  مجال البحث الذكاء الاصناعي
والبحث باللغة English
 تمت اﻹضافة من قبل Shamra Editor




اسأل ChatGPT حول البحث

نقدم Dreamdrug، مجموعة بيانات التعيد الجماعي للكشف عن ذكرات الأدوية في قوائم البند الناتجة عن المستخدم الصاخبة من أسواق Darknet.تحتوي DataSet لدينا على ما يقرب من 15000 كيانات مخطوية مشروح يدويا في أكثر من 3500 من قوائم البند كشط من منصة Darknet Market Dreammarket '' '' '' '' 'في عام 2017. نحن أيضا تدريب ونماذج خط الأساس للكشف عن هذه الكيانات، باستخدام نماذج اللغة السياقية التي تم ضبطها بشكل صحيحالإعداد وعلى مجموعة البيانات كاملة، وفحص تأثير الاحتجاج على الفورورا غير المخلفات داخل المجال.

المراجع المستخدمة
https://aclanthology.org/

قيم البحث

اقرأ أيضاً

تهدف مهمة الكشف عن الموقف إلى اكتشاف موقف سقسقة أو نص للحصول على هدف. يمكن تسمية هذه الأهداف كيانات أو جمل حرة (مطالبات). على الرغم من أن المهمة تنطوي على سبب سقسقة فيما يتعلق بهدف، إلا أننا نجد أنه من الممكن تحقيق دقة عالية على العديد من مجموعات بيا نات الكشف عن موقف تويتر المتوفرة علنا ​​دون النظر إلى الجملة المستهدفة. على وجه التحديد، حقق نموذج تصنيف Tweet بسيط أداء على مستوى بشري على مجموعة بيانات WT - WT وأكثر من دقة ثالثة في مختلف مجموعات البيانات الأخرى. نحن نبحث في وجود تحيزات في مثل هذه البيانات للعثور على الارتباطات الزائفة المحتملة لعلاقات موقد المعنويات والاختيار المعجمي المرتبط بفئة الموقف. علاوة على ذلك، نقترح مجموعة بيانات كبيرة جديدة خالية من هذه التحيزات وإظهار ملصفها على أنظمة الكشف عن الموقف الموجودة. تظهر نتائجنا التجريبية نطاقا كبيرا للبحث عن مهمة الكشف عن الموقف ويقترح العديد من الاعتبارات لإنشاء مجموعات بيانات الكشف عن الموقف في المستقبل.
في اللغة الرومانية، هناك بعض الموارد لفهم النص التلقائي، ولكن بالنسبة للكشف عن المشاعر، لا يوجد أساس معجم، لا يوجد شيء. لتغطية هذه الفجوة، استخراجت بيانات من Twitter وإنشاء بيانات DataSet الأولى التي تحتوي على تغريدات مشروحة مع خمسة أنواع من العواطف: الفرح والخوف والحزن والغضب والمحايد، بقصد استخدام مهام التعدين وتحليل الرأي. في هذه المقالة، نقدم بعض ميزات مجموعة بياناتنا الجديدة، وخلق معيارا لتحقيق أول نموذج لتعلم الآلات الإشراف للكشف عن المشاعر التلقائية في النصوص القصيرة الرومانية. نحقق في أداء أربع نماذج تعلم الآلة الكلاسيكية: بايس ساذجة متعددة الأثر، الانحدار اللوجستي، تصنيف ناقلات الدعم وتصنيف ناقلات الدعم الخطي. نحن نحقق أيضا في المزيد من الأساليب الحديثة مثل FastText، والتي تستخدم معلومات الكلمات الفرعية. أخيرا، نحن نغلق برت الرومانية لتصنيف النص وإظهار تجاربنا أن النموذج القائم على بيرت لديه أفضل أداء لمهمة الكشف عن العاطفة من التغريدات الرومانية. الكلمات المفتاحية: الكشف عن العاطفة، تويتر، الرومانية، التعلم الآلي الإشراف
مع استمرار العالم في محاربة جائحة CovID-19، فإنه يقاتل في وقت واحد من نقص الدم "- وهو طوفان من تضليل وانتشار نظريات المؤامرة المؤدية إلى تهديدات صحية وشعبة المجتمع. لمكافحة هذا المعكرية، هناك حاجة ملحة لمجموعات البيانات القياسية التي يمكن أن تساعد ال باحثين على تطوير وتقييم النماذج الموجهة نحو الكشف التلقائي عن التضليل. في حين أن هناك جهودا متزايدة لإنشاء مجموعات بيانات قياسية كافية ومفتوحة للمصدر للغة الإنجليزية، فإن الموارد القابلة للمقارنة غير متاحة تقريبا بالنسبة للألمانية، مما يترك البحث في اللغة الألمانية متخلفة بشكل كبير. في هذه الورقة، نقدم DataSet المعيار الجديد Fang-Covid يتكون من 28،056 مواد إخبارية ألمانية حقيقية و 13،186 مرتبطة بمعائق CovID-19 وكذلك بيانات عن انتشارها على Twitter. علاوة على ذلك، نقترح نموذجا قابل للتفسير القائم على السياق والاجتماعي للكشف عن الأخبار المزيفة، ومقارنة أدائه إلى النماذج والأداء الأسود الميزة لتقييم الأهمية النسبية للميزات القابلة للتفسير البشرية في التمييز بين الأخبار المزيفة من الأخبار الأصلية وبعد
يستخدم الأشخاص من المنتديات عبر الإنترنت إما أن نبحث عن معلومات أو للمساهمة به. بسبب شعبيتها المتنامية، تم إنشاء بعض المنتديات عبر الإنترنت خصيصا لتوفير الدعم والمساعدة والآراء للأشخاص الذين يعانون من مرض عقلي. الاكتئاب هو واحد من الأمراض النفسية الأ كثر شيوعا في جميع أنحاء العالم. يتواصل الأشخاص المزيد من المنتديات عبر الإنترنت للعثور على إجابات لأمراضهم النفسية. ومع ذلك، لا توجد آلية لقياس شدة الاكتئاب في كل وظيفة وإعطاء أهمية أعلى لأولئك الذين يشخصون بالاكتئاب بشدة. على الرغم من أن العديد من الأبحاث التي تستند إلى بيانات المنتدى عبر الإنترنت وتحديد الاكتئاب قد أجريت، نادرا ما يتم استكشاف شدة الاكتئاب. بالإضافة إلى ذلك، فإن غياب مجموعات البيانات سوف تنموي تطوير إجراءات تشخيصية جديدة للممارسين. من هذه الدراسة، نقدم مجموعة بيانات لدعم البحوث حول تقييم شدة الاكتئاب. النهج الحسابي لقياس عملية تلقائية، خطورة محددة من الاكتئاب هنا نهج جديد تماما. ومع ذلك، هناك حاجة إلى ذلك، هناك حاجة إلى هذا القياس الموضعي للاكتئاب في مشاركات المنتدى عبر الإنترنت لضمان موازين القياس المستخدمة في بحثنا يجتمع مع القواعد المتوقعة للبحث العلمي.
في هذه الورقة، نقدم مجموعة بيانات جديدة تستند إلى Twitter للكشف عن السيبراني وإساءة استخدام عبر الإنترنت.تضم هذه البيانات التي تضم 62،587 تغريدات، تم الحصول على هذه البيانات من تويتر باستخدام شروط استعلام محددة تهدف إلى استرداد تغريدات مع احتمالات عا لية من أشكال مختلفة من البلطجة والمحتوى المسيء، بما في ذلك الإهانة والتصيد والبهجة والسخرية والتهديد والإباحية والاستبعاد.لقد قامنا بتجنيد مجموعة من 17 ملقاة لأداء التعليق التوضيحي بحبائهم الجميلة على مجموعة بيانات كل تغريدة موضحة بمثابة ثلاثة محنوح.جميع الحناحيين لدينا هي مستخدمي التعليم العالي والمتكرر في المدرسة الثانوية.اتفاقية المشتركة بين الخصوصية لأن مجموعة البيانات التي تقاسها Krippendorff's ألفا هي 0.67.تم تأكيد التحليلات التي أجريتها في مجموعة بيانات الموضوعات الإلكترونية المشتركة التي أبلغت عن دراسات أخرى وكشفت علاقات مثيرة للاهتمام بين الطبقات.تم استخدام DataSet لتدريب عدد من نماذج التعلم العميقة المستندة إلى المحولات التي تعود إلى نتائج مثيرة للإعجاب.

الأسئلة المقترحة

التعليقات
جاري جلب التعليقات جاري جلب التعليقات
سجل دخول لتتمكن من متابعة معايير البحث التي قمت باختيارها
mircosoft-partner

هل ترغب بارسال اشعارات عن اخر التحديثات في شمرا-اكاديميا