عادة ما توجد اختصارات مخصصة في قنوات الاتصال غير الرسمية التي تفضل رسائل أقصر.نحن نعتبر مهمة عكس هذه الاختصارات في السياق لاستعادة الإصدارات الموسعة والموسعة من الرسائل المختصرة.ترتبط المشكلة، ولكنها متميزة من التصحيح الإملائي، باعتبارها اختصارات مخصصة متعمدة ويمكن أن تنطوي على اختلافات كبيرة من الكلمات الأصلية.كما يتم إنشاء اختصارات مخصصة بشكل منتجي على ذبابة، لذلك لا يمكن حلها فقط بواسطة بحث القاموس.نحن نولي مجموعة بيانات كبيرة ومفتوحة المصدر من اختصارات مخصصة.تستخدم هذه البيانات لدراسة استراتيجيات الاختصارات وتطوير خطين قويين للتوسع الاختصار.
Ad hoc abbreviations are commonly found in informal communication channels that favor shorter messages. We consider the task of reversing these abbreviations in context to recover normalized, expanded versions of abbreviated messages. The problem is related to, but distinct from, spelling correction, as ad hoc abbreviations are intentional and can involve more substantial differences from the original words. Ad hoc abbreviations are also productively generated on-the-fly, so they cannot be resolved solely by dictionary lookup. We generate a large, open-source data set of ad hoc abbreviations. This data is used to study abbreviation strategies and to develop two strong baselines for abbreviation expansion.
المراجع المستخدمة
https://aclanthology.org/