Conceptual

Automatic Evaluation Metrics for Natural Language Generation

Quantitative measures of how good machine-generated text is: n-gram overlap metrics such as BLEU, embedding-based similarity such as cosine similarity, and the limitations of automatic metrics relative to human judgement.