مقاييس التقييم التلقائية المستندة إلى المرجعية محدودة بشكل ملحوظ ل NLG بسبب عدم قدرتها على التقاط مجموعة كاملة من النواتج المحتملة.نحن ندرس بديلا للإشارة: تقييم كفاية الرسوم البيانية من جمل اللغة الإنجليزية التي تم إنشاؤها من الرسوم البيانية التمثيل المعنى التجريدي (AMR) عن طريق التحليل في عمرو ومقارنة التحليل مباشرة إلى المدخلات.نجد أن الأخطاء التي أدخلتها تحليل عمرو التلقائي تقيص بشكل كبير من فعالية هذا النهج، ولكن دراسة تحرير يدوية تشير إلى أنه نظرا لأن التحليل يحسن، فإن التقييم القائم على التحلل يحتوي على إمكانية تفوق معظم المقاييس المرجعية.