ترغب بنشر مسار تعليمي؟ اضغط هنا

الأمهات هي الوسيلة والأكاديميين مدعين: ما هي نماذج اللغة المحددة التي تتعلم عنك؟

Stepmothers are mean and academics are pretentious: What do pretrained language models learn about you?

271   0   0   0.0 ( 0 )
 تاريخ النشر 2021
  مجال البحث الذكاء الاصناعي
والبحث باللغة English
 تمت اﻹضافة من قبل Shamra Editor




اسأل ChatGPT حول البحث

في هذه الورقة، يمكننا التحقيق في أنواع المعلومات النمطية التي يتم التقاطها عن طريق نماذج اللغة المحددة مسبقا.نقدم بيانات البيانات الأولى التي تشمل السمات النمطية لمجموعة من المجموعات الاجتماعية واقتراح طريقة لاستزاز الصور النمطية المشفرة من قبل نماذج اللغة المحددة في أزياء غير منشأة.علاوة على ذلك، نربط النمط النمطية الناشئة على مظاهرهم كعاطرات أساسية كوسيلة لدراسة آثارهم العاطفية بطريقة أكثر تعميم.لإظهار كيف يمكن استخدام أساليبنا لتحليل نوبات المشاعر والنمطية بسبب التجربة اللغوية، نستخدم ضبطها بشكل جيد على مصادر الأخبار كدراسة حالة.تعرض تجاربنا كيف تختلف المواقف تجاه مجموعات اجتماعية مختلفة عبر النماذج وكيف يمكن أن تحول العواطف والقوالب النمطية بسرعة في مرحلة ضبط الدقيقة.



المراجع المستخدمة
https://aclanthology.org/
قيم البحث

اقرأ أيضاً

أظهرت نماذج اللغة للأغراض العامة قدرات مثيرة للإعجاب، وأداء على قدم المساواة مع النهج الحديثة على مجموعة من مهام ومعايير معالجة اللغة الطبيعية المصب (NLP) عند استنتاج التعليمات من الأمثلة القليلة للغاية.هنا، نقيم المهارات متعددة اللغات في نماذج GPT و T5 في إجراء تصنيف متعدد الفئات على اللغات غير الإنجليزية دون أي تحديثات معلمة.نظهر أنه بالنظر إلى عدد قليل من الأمثلة الإنجليزية كسياق، يمكن أن تتنبأ نماذج اللغة المدربة مسبقا بعينات اختبار اللغة الإنجليزية فقط ولكن أيضا غير الإنجليزية منها.أخيرا، نجد نتائج التنبؤ القليل من الطوابق في السياق لنماذج اللغة أفضل بكثير من التنبؤ العشوائي، وهي تنافسية مقارنة بالموديلات المتبادلة الحالية من أحدث ونماذج الترجمة الحالية.
تعرض GPT-3 قدرة تعليمية ملحوظة في السياق من نماذج اللغة واسعة النطاق (LMS) المدربين على مئات البيانات بمليارات النطاق. نحن هنا تعالج بعض المشكلات المتبقية أقل إبلاغ عن ورق GPT-3، مثل LM غير الإنجليزية، وعروض النماذج المختلفة الحجم، وتأثير التحسين الف وري الذي قدم مؤخرا على التعلم في السياق. لتحقيق ذلك، نقدم Hyperclova، وهو متنقل كوري من 82B GPT-3 المدربين على كوربوس كوري مرئد من الرموز 560B. يعرض HyperClova المعزز من خلال رفيعنا الكوري الخاص بنا، ويعزز HyperClova مع تكوين التدريب لدينا أحدث أداء التعلم الصفرية في السياق وعدد قليل من الأداء في مهام المصب المختلفة في الكورية. أيضا، نعرض فوائد أداء التعلم الفوري وإظهار كيفية دمجه في خط أنابيب الهندسة السريعة. ثم نناقش إمكانية تحقيق نموذج لا يوجد رمز من خلال توفير قدرات النماذج الأولية ل AI لغير خبراء ML عن طريق إدخال ستوديو HyperClova، وهي واجهة هندسة سريعة التفاعلية. أخيرا، نوضح إمكانات أساليبنا بثلاث تطبيقات ناجحة في المنزل.
يحقق نماذج اللغة المستردة مسبقا للمحولات نتائج رائعة في العديد من معايير NLU المعروفة. ومع ذلك، في حين أن أساليب المحاكمات مريحة للغاية، فهي مكلفة من حيث الوقت والموارد. هذا يدعو إلى دراسة تأثير حجم البيانات المحدد على معرفة النماذج. نستكشف هذا التأث ير على القدرات النحوية لروبيرتا، باستخدام النماذج المدربة على الأحجام الإضافية لبيانات النص الخام. أولا، نستخدم التحقيقات الهيكلية النحوية لتحديد ما إذا كانت الطرز المحددة على مزيد من البيانات ترمز كمية أعلى من المعلومات النحوية. ثانيا، نقوم بإجراء تقييم نصلي مستهدف لتحليل تأثير حجم البيانات المحدد على أداء التعميم النحوي للنماذج. ثالثا، قارنا أداء النماذج المختلفة على ثلاثة تطبيقات المصب: وضع علامات جزء من الكلام وتحليل التبعية وإعادة صياغة الحساب. نحن نتكمل دراستنا بتحليل مفاضلة التكلفة - المنفعة للتدريب مثل هذه النماذج. تظهر تجاربنا أنه في حين أن النماذج المحددة على مزيد من البيانات ترمز المزيد من المعرفة النحوية وأداء أفضل في تطبيقات المصب، فإنها لا تقدم دائما أداء أفضل عبر الظواهر الأساسية المختلفة وتأتي بتكلفة مالية وبيئية أعلى.
تهدف نقل النمط إلى إعادة كتابة نص مصدر بأسلوب مستهدف مختلف مع الحفاظ على محتواها. نقترح نهجا جديدا لهذه المهمة التي تنفد على الموارد العامة، ودون استخدام أي بيانات متوازية (الهدف - المستهدفة (المصدر) تفوقت على النهج الموجودة غير المنشورة على مهام نقل النمط الأكثر شعبية: نقل الشكليات ومبادلة القطبية. في الممارسة العملية، نعتمد إجراء متعدد الخطوات الذي يبني على نموذج تسلسل تسلسل مسبقا عام (BART). أولا، نقوم بتعزيز قدرة النموذج على إعادة الكتابة عن طريق مزيد من الردف ما قبل التدريب على كل من مجموعة موجودة من الصيارات العامة، وكذلك على أزواج الاصطناعية التي تم إنشاؤها باستخدام مورد مجمع للأغراض العامة. ثانيا، من خلال نهج الترجمة مرة أخرى تكرارية، نقوم بتدريب نماذجين، كل منها في اتجاه نقل، حتى يتمكنوا من توفير بعضهم البعض مع أزواج توليد مزخرف، ديناميكيا في عملية التدريب. أخيرا، ندعنا نطاطنا الناتج لدينا تولد أزواجا صناعية ثابتة لاستخدامها في نظام تدريبي مشترك. إلى جانب المنهجية والنتائج الحديثة، فإن المساهمة الأساسية لهذا العمل هي انعكاس على طبيعة المهامتين التي نتعامل معها، وكيف يتم تمييز اختلافاتهم عن طريق ردهم على نهجنا.
أدت نماذج اللغة التجريدية المدربة على مليارات الرموز مؤخرا إلى نتائج غير مسبوقة على العديد من مهام NLP. يثير هذا النجاح مسألة ما إذا كان النظام، من حيث المبدأ، يمكن للنظام فهم النص الخام دون الوصول إلى شكل أساس من أشكال التأريض. نحن نحقق رسميا قدرات الأنظمة التي لا تحصى للحصول على معنى. يركز تحليلنا على دور التأكيدات ": السياقات النصية التي توفر أدلة غير مباشرة حول الدلالات الأساسية. ندرس ما إذا كانت هناك تأكيدات تمكن نظام لمحاكاة التمثيلات التي تحافظ على العلاقات الدلالية مثل التكافؤ. نجد أن التأكيدات تمكن مضاهاة دلالات للغات التي تلبي فكرة قوية من الشفافية الدلالية. ومع ذلك، بالنسبة لفئات اللغات حيث يمكن أن يتخذ نفس التعبير قيم مختلفة في سياقات مختلفة، نوضح أن المحاكاة يمكن أن تصبح غير مقابلة. أخيرا، نناقش الاختلافات بين النموذج الرسمي واللغة الطبيعية، واستكشاف كيفية تعميم نتائجنا إلى وضع مشروط وغيرها من العلاقات الدلالية. معا، تشير نتائجنا إلى أن التأكيدات في التعليمات البرمجية أو اللغة لا توفر إشارة كافية للتمثيلات الدلالية المحاكمة بالكامل. نقوم بإضفاء الطابع الرسمي على الطرق التي يبدو أن نماذج لغة غير محظورة محدودة بشكل أساسي في قدرتها على فهم ".

الأسئلة المقترحة

التعليقات
جاري جلب التعليقات جاري جلب التعليقات
سجل دخول لتتمكن من متابعة معايير البحث التي قمت باختيارها
mircosoft-partner

هل ترغب بارسال اشعارات عن اخر التحديثات في شمرا-اكاديميا