ترغب بنشر مسار تعليمي؟ اضغط هنا

الجمل الموازية التعدين مع التعلم نقل في إعداد غير منشأة

Parallel sentences mining with transfer learning in an unsupervised setting

371   0   0   0.0 ( 0 )
 تاريخ النشر 2021
  مجال البحث الذكاء الاصناعي
والبحث باللغة English
 تمت اﻹضافة من قبل Shamra Editor




اسأل ChatGPT حول البحث

تعرف نوعية وكمية الجمل الموازية كبيانات تدريبية مهمة للغاية لبناء أنظمة الترجمة الآلية العصبية (NMT).ومع ذلك، فإن هذه الموارد غير متوفرة للعديد من أزواج لغة الموارد المنخفضة.تحتاج العديد من الطرق الحالية إلى إشراف قوي غير مناسب.على الرغم من أن عدة محاولات في تطوير نماذج غير مدفوعة، إلا أنها تتجاهل اللغة الثابتة بين اللغات.في هذه الورقة، نقترح نهجا يستند إلى التعلم عن الجمل الموازية المتعلقة بالألغام في الإعداد غير المنسق. مع مساعدة من أزواج اللغة الثنائية الثنائية من الأغنياء، يمكننا الجمل الموازية دون إشراف ثنائي اللغة أزواج لغة منخفضة الموارد.تظهر التجارب أن نهجنا يحسن أداء الجمل الموازية الملغومة مقارنة بالطرق السابقة.على وجه الخصوص، نحقق نتائج ممتازة في اثنين من أزواج لغة الموارد المنخفضة في العالم الحقيقي.



المراجع المستخدمة
https://aclanthology.org/
قيم البحث

اقرأ أيضاً

في هذه الورقة، فإننا نطبق غير المدعومة غير المدعومة باعتبارها مهمة جديدة في تحريض الهيكل النحوي، والتي مفيدة لفهم الهياكل اللغوية للغات البشرية وكذلك معالجة لغات الموارد المنخفضة.نقترح اتباع نهج نقل المعرفة بأنه يسخر بشكل مسبق تسميات القطعة من نماذج التحليل غير المنصوص عليها في الحديث؛يتعلم الشبكة العصبية التسلسلية المتكررة (HRNN) من هذه الملصقات المستحثة من الفرق لتسليم ضجيج الاستدلال.تبين التجارب أن نهجنا يجسد إلى حد كبير الفجوة بين الكملات الخاضعة للإشراف وغير المدعوم.
تعمل السابقة على جيل إعادة صياغة صياغة يتم التحكم فيها بشكل كبير على بيانات إعادة صياغة مباشرة على نطاق واسع غير متوفرة بسهولة للعديد من اللغات والمجالات. في هذه الورقة، نأخذ هذا الاتجاه البحثي إلى أقصى الحدود والتحقيق فيما إذا كان من الممكن تعلم تول يد الصياغة التي يتم التحكم فيها بموجبها مع بيانات غير صلبية. نقترح نموذج إعادة صياغة غير مدهش من غير المستنير عليه بناء على التشفير التلقائي الشرطي (VAE) يمكن أن تولد نصوص في بنية نصنية محددة. خاصة، نقوم بتصميم طريقة تعليمية من مرحلتين لتدريب النموذج بفعالية باستخدام البيانات غير الموازية. يتم تدريب VAE الشرطية على إعادة بناء جملة الإدخال وفقا للإدخال المحدد والهيكل النحامي. علاوة على ذلك، لتحسين قابلية التحكم في النحوية والاتساق الدلالي لشركة VAE الشرطية المدربة مسبقا، نحن نغتنمها باستخدام أهداف التعلم السيطرة على بناء الجملة وإعادة إعمار دورة إعادة إعمار، وتوظيف Gumbel-Softmax الجمع بين أهداف التعلم الجديدة هذه. توضح نتائج التجربة أن النموذج المقترح المدرب فقط على البيانات غير الموازية قادر على توليد صیر متنوعة مع بنية نصنية محددة. بالإضافة إلى ذلك، نحن نقوم بالتحقق من صحة فعالية طريقتنا لتوليد أمثلة خصومة النحوية على مهمة تحليل المعنويات.
تأخذ مهمة نقل النمط (النمط هنا بمعنى "هنا" مع العديد من الجوانب بما في ذلك التسجيل، وهيكل الجملة، واختيار المفردات) إجراء إدخال النص وإعادة كتابةها في نمط مستهدف محدد يحافظ على المعنى، ولكن تغيير نمط نص المصدر لمطابقة ذلك من الهدف. يعتمد الكثير من ال أبحاث الموجودة في هذه المهمة على استخدام مجموعات البيانات المتوازية. في هذا العمل، نوظف نتائج مؤخرا في نمذجة اللغة المتقاطعة غير المتبادلة (XLM) والترجمة الآلية لنقل النمط أثناء التعامل مع بيانات الإدخال كما غير إجمالي. أولا، نوضح أن إضافة تضمين المحتوى "" إلى XLM والتي تلتقط مجموعة الموضوعات المحددة للإنسان يمكن أن تحسن الأداء على الطراز الأساسي. غالبا ما تعتمد تقييم نقل النمط على المقاييس المصممة للترجمة الآلية التي تلقت انتقاد مدى ملاءمتها لهذه المهمة. كمساهمة ثانية، نقترح استخدام مجموعة من الأنماط الكلاسيكية ككمل مفيد للتقييم. نقوم باختيار بعض هذه التدابير وتشمل هذه في تحليل نتائجنا.
تستند نماذج نقل النمط غير المزروعة بشكل رئيسي إلى نهج التعلم الاستقرائي، والذي يمثل النمط كمعلمات أو معلمات فك الترميز، أو معلمات تمييزية، وتطبق مباشرة هذه القواعد العامة لحالات الاختبار. ومع ذلك، فإن عدم وجود Corpus الموازي يعيق قدرة طرق التعلم الاس تقرائي هذه في هذه المهمة. نتيجة لذلك، من المحتمل أن تسبب التعبيرات النمطية غير المتناسقة الشديدة، مثل السلطة غير مهذب ". لمعالجة هذه المشكلة، نقترح نهجا تعليميا عبر جديد في هذه الورقة، بناء على تمثيل نمط السياق على علم الاسترجاع. على وجه التحديد، يتم استخدام وحدة فك ترميز تشفير الاهتمام مع إطار المسترد. أنه ينطوي على الجمل ذات الصلة أعلى K في النمط المستهدف في عملية النقل. وبهذه الطريقة، يمكننا أن نتعلم تضمين أسلوب مدرك السياق لتخفيف مشكلة عدم التناقض أعلاه. في هذه الورقة، يتم استخدام كل من وظائف استرجاع شديد (BM25) ووظائف استرجاع كثيفة (MIPS)، وتم تصميم وظيفتان موضوعيتان لتسهيل التعلم المشترك. تظهر النتائج التجريبية أن أسلوبنا تتفوق على العديد من خطوط الأساس القوية. نهج التعلم المتنقل المقترح عام وفعال لمهمة نقل النمط غير المنسق، وسوف نطبقه على الطريقة الوظيفتين الأخرى في المستقبل.
استفاد من إعادة صياغة الصياغة على نطاق واسع من التقدم الأخير في تصميم الأهداف التدريبية والبنية النموذجية. ومع ذلك، تركز الاستكشافات السابقة إلى حد كبير على الأساليب الخاضعة للإشراف، والتي تتطلب كمية كبيرة من البيانات المسمى ذات مكلفة لجمعها. لمعالجة هذا العيب، نعتمد نهجا للتعلم ونقله واقتراح خط أنابيب التدريب الذي يتيح نماذج اللغة المدربة مسبقا لتوليد أول اتصالات عالية الجودة في إعداد غير محدد. تتكون وصفة لدينا من تكيف المهام والإشراف الذاتي وخوارزمية فك التشفير الجديدة المسماة حظر ديناميكي (DB). لفرض نموذج سطح متغاضي عن الإدخال، كلما أن نموذج اللغة ينبعث رمز رمزي موجود في تسلسل المصدر، يمنع DB النموذج من إخراج الرمز المميز اللاحق للمصدر خطوة الجيل التالي. نظرا للتقييمات التلقائية والإنسانية أن نهجنا يحقق أداء حديثة من كل من زوج السؤال Quora (QQP) ومجموعات بيانات Paranmt قوية لتحويل المجال بين مجموعة بيانات التوزيعات المميزة. نحن نوضح أيضا تحويلاتنا النموذجية إلى إعادة صياغة لغات أخرى دون أي رسوم إضافية.

الأسئلة المقترحة

التعليقات
جاري جلب التعليقات جاري جلب التعليقات
سجل دخول لتتمكن من متابعة معايير البحث التي قمت باختيارها
mircosoft-partner

هل ترغب بارسال اشعارات عن اخر التحديثات في شمرا-اكاديميا