توفر تبسيط الجملة المتوازي (SS) نادرة لأوصوامل SS العصبية. نقترح طريقة غير منشأة لبناء SS Corpora من Translation Translation ثنائي اللغة واسعة النطاق، مما يخفف من الحاجة إلى SS Corporged Corge. يتم تحفيز طريقتنا عن طريق النتائج التالية: يميل نموذج ال
ترجمة الآلية العصبية عادة إلى توليد المزيد من الرموز عالية التردد وفرق مستويات التعقيد النصية موجودة بين المصدر واللغة المستهدفة ل Translation Corpus. من خلال أخذ زوج من المصدر الجمل من Corpus Translation وترجمات مراجعها في لغة الجسر، يمكننا إنشاء بيانات SS موازية زائفة واسعة النطاق. بعد ذلك، نبقي أزواج الجملة هذه مع اختلاف أعلى تعقيد كزواج من جملة SS. يمكن أن تلبي المبنى SS Corpora مع نهج غير مدفوع التوقعات بأن الأحكام المحاذاة تحافظ على نفس المعاني وأن يكون لها اختلاف في مستويات تعقيد النص. تظهر النتائج التجريبية أن أساليب SS التي تدربت بها كوربورا تحقق النتائج من أحدث النتائج وتفوق النتائج على نتائج اللغة الإنجليزية في Wikilarge.
تشبه مهمة تبسيط نص الوثيقة على مستوى المستندات إلى صعوبة تقليل التعقيد الإضافي.نقدم مجموعة بيانات مجمعة حديثا من النصوص الألمانية، التي تم جمعها من مجلة Swiss News 20 Minuten (20 دقيقة) والتي تتكون من مقالات كاملة مقررة مع ملخصات مبسطة.علاوة على ذلك،
نقدم تجارب على تبسيط النص التلقائي مع MBART MBART متعددة اللغات المسبدة مسبقا ونسخة معدلة منها أكثر صديقة للذاكرة، باستخدام كل من مجموعة البيانات الجديدة والتبسيط الموجودة Corpora.تتيح لنا تعديلات MBArt التدريب بتكلفة أقل في الذاكرة دون فقدان الكثير من الخسارة في الأداء، في الواقع، فإن MBART أصغر يحسن حتى النموذج القياسي في إعداد مع مستويات تبسيط متعددة.
نبلغ عن التجارب في تبسيط النص التلقائي (ATS) للألمانية مع مستويات تبسيط متعددة على طول الإطار الأوروبي المشترك المرجعي لغات (CEFR)، وتبسيط اللغة الألمانية القياسية إلى مستويات A1 و A2 و B1.لهذا الغرض، نحقق في استخدام تسميات المصدر وإحاطاء اللغة الألم
انية القياسية، مما يسمح لنا بتبسيط اللغة القياسية إلى مستوى CEFR محدد.نظرا لأن هذه الأساليب فعالة بشكل خاص في سيناريوهات الموارد المنخفضة، حيث يمكننا أن نتفوق على خط الأساس المحول القياسي.علاوة على ذلك، نقدم نسخ ملصقات، والتي نظهرها يمكن أن تساعد النموذج في إجراء تمييز بين الجمل التي تتطلب مزيدا من التعديلات والجمل التي يمكن نسخها كما هو.
في الآونة الأخيرة، حقق نموذج لغوي كبير مدرب مسبقا يسمى T5 (محول نقل النصوص الموحد للنصوص) أداء حديثة في العديد من مهام NLP.ومع ذلك، لم يتم العثور على أي دراسة باستخدام هذا النموذج المدرب مسبقا على تبسيط النص.لذلك في هذه الورقة، نستكشف استخدام T5 Bric
k-Tuning على تبسيط النص الجمع بين آلية يمكن التحكم فيها لتنظيم مخرجات النظام التي يمكن أن تساعد في إنشاء نص مكيفات للجماهير المستهدفة المختلفة.تبين تجاربنا أن نموذجنا يحقق نتائج رائعة مع مكاسب بين +0.69 و +1.41 عبر أحدث الولاية الحالية (بارت + الوصول).نقول أن استخدام نموذج مدرب مسبقا مثل T5، المدربين على عدة مهام مع كميات كبيرة من البيانات، يمكن أن يساعد في تحسين تبسيط النص.
يتم تقييم تبسيط النص على مستوى الجملة حاليا باستخدام المقاييس الآلية والتقييم البشري.للتقييم التلقائي، عادة ما يتم توظيف مزيج من المقاييس لتقييم الجوانب المختلفة من التبسيط.مستوى الصف Flesch-Kincaid (FKGL) هو مقياس واحد تم استخدامه بانتظام لقياس قابل
ية قراءة إخراج النظام.في هذه الورقة، نقول أن FKGL لا ينبغي استخدامها لتقييم أنظمة تبسيط النص.نحن نقدم التحليلات التجريبية على إخراج النظام الأخير الذي يظهر أن درجة FKGL يمكن التلاعب بها بسهولة لتحسين النتيجة بشكل كبير مع تأثير بسيط فقط على مقاييس آلية أخرى (بلو والساري).بدلا من استخدام FKGL، نقترح أن يتم استخدام إحصائيات المكونات، إلى جانب الآخرين، لتحليل posthoc لفهم سلوك النظام.
تصف هذه الورقة Simplener، وهو نموذج تم تطويره لمهمة تبسيط الجملة في GEM-2021.نظامنا عبارة عن بنية محولات SEQ2SEQ أحادية مونولجة تستخدم الرموز المراقبة معلقة مسبقا إلى البيانات، مما يسمح للنموذج بتشكيل التبسيط الذي تم إنشاؤه وفقا للسمات التي تريدها ال
مستخدم.بالإضافة إلى ذلك، نظهر أن البيانات التدريبية NER - بيانات التدريب قبل الاستخدام يساعد على تثبيت تأثير الرموز السيطرة وتحسين الأداء العام للنظام بشكل كبير.ونحن نوظف أيضا embeddings المسبق للحد من البيانات الخاصة بالبيانات والسماح للنموذج بإنتاج المزيد من النواتج القابلة للتعميم.
كانت التطورات في مجال تبسيط النص (TS) في المقام الأول ضمن تبسيط النحوية أو المعجمية.ومع ذلك، فقد تم تحديد التبسيط المفاهيمي سابقا كحقل آخر من TS له القدرة على تحسين فهم القراءة بشكل كبير.الخطوة الأولى للقياس التبسيط المفاهيمي هو تصنيف المفاهيم كمعقد
أو بسيط.تقترح ورقة البحث في البحث هذه تعريفا جديدا للتعقيد المفاهيمي إلى جانب نهج بسيط لتعلم الآلات التي تنفذ مهمة تصنيف ثنائية للتمييز بين المفاهيم البسيطة والمعقدة.يقترح أن تكون هذه الخطوة الأولى عند تطوير نماذج تبسيط نص جديدة تعمل على مستوى مفاهيمي.
نحن نعتبر مشكلة التعلم بتبسيط النصوص الطبية. هذا مهم لأن معظم المعلومات الأكثر موثوقية وحديثة في الطب الحيوي كثيفة مع Jargon وبالتالي لا يمكن الوصول إليها عمليا للجمهور العادي. علاوة على ذلك، لا يتجاوز التبسيط اليدوي للجسم بسرعة متزايدة من الأدب الطب
ي الطبيعي، يحفز الحاجة إلى النهج الآلي. لسوء الحظ، لا توجد موارد واسعة النطاق المتاحة لهذه المهمة. في هذا العمل، نقدم جثة جديدة من النصوص الموازية باللغة الإنجليزية تضم ملخصات تقنية ووضع جميع الأدلة المنشورة المتعلقة بالموضوعات السريرية المختلفة. بعد ذلك، نقترح مقياسا جديدا يستند إلى درجات احتمالية من نموذج لغة ملثم مسبقا على النصوص العلمية. نظهر أن هذا التدبير الآلي يتحمل أفضل بين الملخصات التقنية والوضعية من الاستدلال القائمة. نقدم وتقييم نماذج محول ترميز تشفير الأساس لتبسيطها واقتراح تكبير رواية لهذه التي تعاقب فيها بشكل صريح فك الترميز لإنتاج مصطلحات JARGON؛ نجد أن هذا يجرض التحسينات على أساس الأساس من حيث قابلية القراءة.
تحسن تبسيط النص قابلية قراءة الجمل من خلال العديد من تحويلات إعادة كتابة، مثل إعادة الصياغة المعجمية والحذف والتقشير. تعتبر أنظمة التبسيط الحالية في الغالب نماذج تسلسل التسلسل التي يتم تدريبها على نهاية إلى نهاية لأداء كل هذه العمليات في وقت واحد. وم
ع ذلك، فإن هذه الأنظمة تحد من نفسها لحذف الكلمات ويمكنها بسهولة التكيف مع متطلبات الجماهير المستهدفة المختلفة. في هذه الورقة، نقترح نهجا مختلطا هجينا رواية يرفع القواعد ذات الدوافع اللغوية لتقسيم وحذفها، والأزواج مع نموذج إعادة الصياغة العصبية لإنتاج أنماط إعادة كتابة متنوعة. نقدم طريقة جديدة لتعزيز البيانات لتحسين القدرة على إعادة صياغة نموذجنا. من خلال التقييمات التلقائية والدليلية، نوضح أن نموذجنا المقترح يحدد حالة جديدة من بين المهمة، أو إعادة صياغة أكثر من النظم الحالية، ويمكن أن تتحكم في درجة كل عملية تبسيط مطبقة على نصوص الإدخال.
إن جودة أنظمة تبسيط النص الآلي بالكامل ليست جيدة بما يكفي للاستخدام في إعدادات العالم الحقيقي؛بدلا من ذلك، يتم استخدام التبسيط البشري.في هذه الورقة، ندرس كيفية تحسين تكلفة وجودة التبسيط البشري من خلال الاستفادة من الجماعة الجماعية.نقدم نهج الانصهار ا
لجملة في الرسم البياني لزيادة التبسيط البشري ونهج إعادة النشر لكل من تحديد المبسط عالية الجودة والسماح باستهداف التبسيط بمستويات متفاوتة من البساطة.باستخدام DataSet Newsela (XU et al.، 2015) نظهر تحسينات متسقة على الخبراء في مستويات تبسيط مختلفة وتجد أن تبسيط الانصهار الجملة الإضافية تسمح بإخراج أبسط من التبسيط البشري وحدها.