تقوم أنظمة الترجمة التقليدية المدربين على وثائق مكتوبة بشكل جيد للترجمة المستندة إلى النصوص ولكن ليس كذلك للتطبيقات المستندة إلى الكلام.نحن نهدف إلى تكييف نماذج الترجمة إلى الكلام عن طريق إدخال أخطاء معجمية حقيقية من أخطاء ASR والتجزئة من علامات الترقيم التلقائية في بيانات تدريب الترجمة الخاصة بنا.نقدم نهج إسقاط مقلوب تم اكتشافه تلقائيا شرائح النظام تلقائيا على النصوص البشرية ومن ثم إعادة الشرائح ترجمة الذهب إلى محاذاة النصوص الإنسانية المتوقعة.نوضح أن هذا يتغلب على عدم تطابق اختبار القطار الموجود في نهج التدريب الأخرى.يحقق نهج الإسقاط الجديد مكاسب أكثر من 1 نقطة بلو على خط أساس يتعرض للنصوص البشرية والجزء، وهذه المكاسب تعقد لكلا بيانات IWSLT وبيانات YouTube.