Código
install.packages("pacman")Instructora: Evelia Coss
Explorar datasets de biología (genes, salud, biodiversidad) para reconocer su estructura y complejidad.
Los datos biológicos son diferentes a otros tipos de datos porque:
Un dataset biológico típicamente tiene esta estructura:

Gapminder es una organización sin fines de lucro con sede en Suecia que promueve el desarrollo global mediante el uso de estadísticas que pueden ayudar a reducir mitos comunes e historias sensasionalistas sobre la salud y la economía mundial. Proporciona datasets sobre:
PIB significa Producto Interno Bruto. Es el valor total de todos los bienes y servicios que un país produce en un año específico.
Piénsalo así: Si sumamos todo lo que se fabrica, cultiva, vende y se presta como servicio en un país durante un año, eso es el PIB.
| Palabra | Significado |
|---|---|
| Producto | Bienes (cosas físicas) y servicios (actividades) |
| Interno | Dentro del territorio del país |
| Bruto | Sin restar costos o depreciación |
Resumen
| Concepto | Definición |
|---|---|
| PIB | Valor total de bienes y servicios producidos en un país en un año |
| PIB per Cápita | PIB dividido entre la población (producción por persona) |
| Relación con salud | Mayor PIB per Cápita → Mejor acceso a salud → Mayor esperanza de vida |
| En Gapminder | Indicador clave para entender desarrollo y su relación con biología humana |
| Aspecto | Relevancia |
|---|---|
| Datos reales | Información verificada de organismos internacionales (ONU, OMS) |
| Temporal | Datos a lo largo de décadas, mostrando cambios biológicos y sociales |
| Multidimensional | Múltiples variables que interactúan (salud, economía, educación) |
| Geográfico | Variabilidad entre países y regiones (biodiversidad humana) |
| Complejo | Relaciones no lineales y correlaciones interesantes |
| Accesible | Datos públicos y bien documentados |
Relevancia biológica: Estudian la dinámica de poblaciones humanas
Relevancia biológica: Reflejan la salud y supervivencia de organismos humanos
Relevancia biológica: El ambiente socioeconómico influye en la expresión de características biológicas (fenotipo)
Relevancia biológica: Afectan la biodiversidad y la supervivencia de organismos

| Pregunta | Tipo de Análisis | Complejidad | Relevancia Biológica |
|---|---|---|---|
| ¿Cuál es la esperanza de vida promedio global? | Estadística descriptiva | Baja | Supervivencia humana |
| ¿Qué país tiene la mortalidad infantil más baja? | Comparación de grupos | Baja | Salud infantil |
| ¿Existe correlación entre PIB y esperanza de vida? | Análisis de correlación | Media | Ambiente → Fenotipo |
| ¿Cómo ha evolucionado la esperanza de vida en 60 años? | Análisis temporal | Media | Cambios biológicos |
| ¿Qué regiones tienen patrones similares de desarrollo? | Análisis de agrupación | Media-Alta | Biodiversidad humana |
| ¿Podemos predecir la esperanza de vida basada en PIB y educación? | Machine Learning | Alta | Factores determinantes |
| ¿Cuál es el impacto del CO₂ en la salud poblacional? | Análisis multivariado | Alta | Ecosistema → Salud |
Instalar el paquete pacman:
install.packages("pacman")Este paquete pacman permite cargar e instalar los paquetes instalados:
pacman::p_load(
gapminder, # Datos mundiales
tidyverse) # gestión de datosgapminder %>%
str()tibble [1,704 × 6] (S3: tbl_df/tbl/data.frame)
$ country : Factor w/ 142 levels "Afghanistan",..: 1 1 1 1 1 1 1 1 1 1 ...
$ continent: Factor w/ 5 levels "Africa","Americas",..: 3 3 3 3 3 3 3 3 3 3 ...
$ year : int [1:1704] 1952 1957 1962 1967 1972 1977 1982 1987 1992 1997 ...
$ lifeExp : num [1:1704] 28.8 30.3 32 34 36.1 ...
$ pop : int [1:1704] 8425333 9240934 10267083 11537966 13079460 14880372 12881816 13867957 16317921 22227415 ...
$ gdpPercap: num [1:1704] 779 821 853 836 740 ...
Recordemos que para data frames de librerías normalmente podemos encontrar la documentación y entender cada atributo más rápido:
?gapminderEn lugar de lanzarnos de inmediato a las preguntas, conviene dar espacio a la curiosidad y explorar primero qué más puede revelarnos la información disponible. Por eso, comenzaremos revisando variables como la mortalidad infantil, la fertilidad y la población.
Podemos aplicar un filtro para quedarnos únicamente con los registros de México y, a partir de ahí, seleccionar las columnas de país, año y población.
gapminder %>%
filter(country == "Mexico") %>% # Seleccionar pais
dplyr::select(country, year, pop) %>% # seleccionar columnas
head() # observar los primeros 3 valores# A tibble: 6 × 3
country year pop
<fct> <int> <int>
1 Mexico 1952 30144317
2 Mexico 1957 35015548
3 Mexico 1962 41121485
4 Mexico 1967 47995559
5 Mexico 1972 55984294
6 Mexico 1977 63759976
Realiza estas dos actividades en parejas o equipos
¿Cuántas filas y columnas tiene el dataset de gapminder?
Pista: Usa dim() o nrow() y ncol()
¿Cuáles son los nombres de todas las columnas?
Pista: Usa colnames() o names()
Visualiza las primeras 6 filas del dataset.
Pista: Usa head()
¿Qué tipo de dato tiene cada columna?
Pista: Usa str() o glimpse()
¿Cuántos países únicos hay en el dataset?
Pista: Usa unique() o n_distinct()