18  Básicos de la visualización de datos

Vamos a trabajar con un set de datos de pingüinos que se llama palmerpenguins. Pueden encontrar más información sobre este conjunto de datos en la página siguiente:

palmerpenguins dataset.

Este conjunto de datos contiene las medidas de tres especies de pingüinos de tres islas en el archipiélago Palmer de la Antartica y fueron recolectados entre 2007 y 2009 por el Dr. Kristen Gorman.

Demos un vistazo las variables que contiene.

Código
str(penguins)
'data.frame':   344 obs. of  8 variables:
 $ species    : Factor w/ 3 levels "Adelie","Chinstrap",..: 1 1 1 1 1 1 1 1 1 1 ...
 $ island     : Factor w/ 3 levels "Biscoe","Dream",..: 3 3 3 3 3 3 3 3 3 3 ...
 $ bill_len   : num  39.1 39.5 40.3 NA 36.7 39.3 38.9 39.2 34.1 42 ...
 $ bill_dep   : num  18.7 17.4 18 NA 19.3 20.6 17.8 19.6 18.1 20.2 ...
 $ flipper_len: int  181 186 195 NA 193 190 181 195 193 190 ...
 $ body_mass  : int  3750 3800 3250 NA 3450 3650 3625 4675 3475 4250 ...
 $ sex        : Factor w/ 2 levels "female","male": 2 1 1 NA 1 2 1 2 NA NA ...
 $ year       : int  2007 2007 2007 2007 2007 2007 2007 2007 2007 2007 ...

Hay variables tanto de tipo factor como numéricas. Las variables de tipo factor nos pueden servir para encontrar grupos al momento de usar ggplot con las capas de los aesthetics.

ggplot2 necesita que los datos sean de la clase data.frame o tibble. Vamos a verificar la clase que tiene la base de datos.

Código
class(penguins)
[1] "data.frame"

Como ya mencionamos, los plots nos pueden ayudar para responder algunas preguntas, por ejemplo:

18.1 Explorando la estructura de los datos

Una forma rápida de tener un vistazo a los datos es usar ggpairs() del paquete GGally.

Código
#install.packages("GGally")
library(GGally)
ggpairs(penguins, aes(colour = species), progress = FALSE) +
  theme_bw()