28  Primer vistazo a datos biológicos

Instructora: Evelia Coss

Explorar datasets de biología (genes, salud, biodiversidad) para reconocer su estructura y complejidad.

28.0.1 ¿Por qué los datos biológicos son “especiales”? 🤔

Los datos biológicos son diferentes a otros tipos de datos porque:

  • Alta dimensionalidad: Muchas variables (genes, proteínas, características)
  • Complejidad: Relaciones no lineales entre variables
  • Variabilidad natural: Cada organismo es único
  • Contexto importante: El ambiente influye en los datos
  • Escala: Desde moléculas microscópicas hasta ecosistemas completos

28.0.2 Estructura de un Dataset Biológico 🗂️

Un dataset biológico típicamente tiene esta estructura:

Imagen creada con Gemini.

28.0.3 ¿Qué es Gapminder? 🌐

Gapminder es una organización sin fines de lucro con sede en Suecia que promueve el desarrollo global mediante el uso de estadísticas que pueden ayudar a reducir mitos comunes e historias sensasionalistas sobre la salud y la economía mundial. Proporciona datasets sobre:

  • Salud: Esperanza de vida, mortalidad infantil, enfermedades
  • Economía: PIB per cápita, ingresos
  • Demografía: Población, tasa de natalidad, tasa de mortalidad
  • Educación: Años de escolaridad, alfabetismo
  • Medio ambiente: Emisiones de CO₂, acceso a agua potable
Tip

Importancia biológica: Estos datos reflejan la salud y supervivencia de poblaciones humanas, conceptos fundamentales en biología.

Nota

PIB significa Producto Interno Bruto. Es el valor total de todos los bienes y servicios que un país produce en un año específico.

Piénsalo así: Si sumamos todo lo que se fabrica, cultiva, vende y se presta como servicio en un país durante un año, eso es el PIB.

28.0.4 Desglose de la Definición 🔍

Palabra Significado
Producto Bienes (cosas físicas) y servicios (actividades)
Interno Dentro del territorio del país
Bruto Sin restar costos o depreciación

Resumen

Concepto Definición
PIB Valor total de bienes y servicios producidos en un país en un año
PIB per Cápita PIB dividido entre la población (producción por persona)
Relación con salud Mayor PIB per Cápita → Mejor acceso a salud → Mayor esperanza de vida
En Gapminder Indicador clave para entender desarrollo y su relación con biología humana

28.0.5 ¿Por qué Gapminder es ideal para datos biológicos? 🎯

Aspecto Relevancia
Datos reales Información verificada de organismos internacionales (ONU, OMS)
Temporal Datos a lo largo de décadas, mostrando cambios biológicos y sociales
Multidimensional Múltiples variables que interactúan (salud, economía, educación)
Geográfico Variabilidad entre países y regiones (biodiversidad humana)
Complejo Relaciones no lineales y correlaciones interesantes
Accesible Datos públicos y bien documentados

28.0.6 Tipos de Datos en Gapminder 🔬

1. Datos Demográficos (Biología de Poblaciones)

  • Población total
  • Tasa de natalidad
  • Tasa de mortalidad
  • Crecimiento poblacional

Relevancia biológica: Estudian la dinámica de poblaciones humanas

2. Datos de Salud (Biología Humana)

  • Esperanza de vida
  • Mortalidad infantil
  • Prevalencia de enfermedades
  • Acceso a servicios de salud

Relevancia biológica: Reflejan la salud y supervivencia de organismos humanos

3. Datos Socioeconómicos (Ambiente)

  • PIB per cápita
  • Años de escolaridad
  • Acceso a agua potable
  • Acceso a electricidad

Relevancia biológica: El ambiente socioeconómico influye en la expresión de características biológicas (fenotipo)

4. Datos Ambientales (Ecosistema)

  • Emisiones de CO₂
  • Deforestación
  • Contaminación
  • Cambio climático

Relevancia biológica: Afectan la biodiversidad y la supervivencia de organismos

Imagen creada con Gemini.

28.1 Preguntas que Podemos Responder con Gapminder 🤔

Pregunta Tipo de Análisis Complejidad Relevancia Biológica
¿Cuál es la esperanza de vida promedio global? Estadística descriptiva Baja Supervivencia humana
¿Qué país tiene la mortalidad infantil más baja? Comparación de grupos Baja Salud infantil
¿Existe correlación entre PIB y esperanza de vida? Análisis de correlación Media Ambiente → Fenotipo
¿Cómo ha evolucionado la esperanza de vida en 60 años? Análisis temporal Media Cambios biológicos
¿Qué regiones tienen patrones similares de desarrollo? Análisis de agrupación Media-Alta Biodiversidad humana
¿Podemos predecir la esperanza de vida basada en PIB y educación? Machine Learning Alta Factores determinantes
¿Cuál es el impacto del CO₂ en la salud poblacional? Análisis multivariado Alta Ecosistema → Salud
PrecauciónPasos a seguir

El proceso que vamos a seguir para resolver algunas de estas preguntas mencionadas será:

  1. Exploración de datos
  2. Entendimiento de los datos
  3. Análisis de datos hasta encontrar los relevantes para las resolver preguntas
  4. Visualización y resumen

28.2 Instalar y cargar paquetes en R

Instalar el paquete pacman:

Código
install.packages("pacman")

Este paquete pacman permite cargar e instalar los paquetes instalados:

Código
pacman::p_load(
  gapminder,         # Datos mundiales
  tidyverse)         # gestión de datos

28.3 Exploración de datos

Código
gapminder %>% 
  str()
tibble [1,704 × 6] (S3: tbl_df/tbl/data.frame)
 $ country  : Factor w/ 142 levels "Afghanistan",..: 1 1 1 1 1 1 1 1 1 1 ...
 $ continent: Factor w/ 5 levels "Africa","Americas",..: 3 3 3 3 3 3 3 3 3 3 ...
 $ year     : int [1:1704] 1952 1957 1962 1967 1972 1977 1982 1987 1992 1997 ...
 $ lifeExp  : num [1:1704] 28.8 30.3 32 34 36.1 ...
 $ pop      : int [1:1704] 8425333 9240934 10267083 11537966 13079460 14880372 12881816 13867957 16317921 22227415 ...
 $ gdpPercap: num [1:1704] 779 821 853 836 740 ...

Recordemos que para data frames de librerías normalmente podemos encontrar la documentación y entender cada atributo más rápido:

Código
?gapminder
  • country / país: un factor que indica el nombre del país (Afganistán, Suecia, Brasil, etc.)
  • continent / continente: un factor que denota la región geográfica (África, América, Asia, Europa, Oceanía)
  • year / año: un número que representa el año de los datos (1952 a 2007, cada 5 años)
  • lifeExp / esperanza de vida: un número que indica los años de vida esperados al nacer
  • pop / población: un número que representa el total de habitantes del país
  • gdpPercap / PIB per cápita: un número que muestra la producción económica por persona en dólares USD

En lugar de lanzarnos de inmediato a las preguntas, conviene dar espacio a la curiosidad y explorar primero qué más puede revelarnos la información disponible. Por eso, comenzaremos revisando variables como la mortalidad infantil, la fertilidad y la población.

Podemos aplicar un filtro para quedarnos únicamente con los registros de México y, a partir de ahí, seleccionar las columnas de país, año y población.

Código
gapminder %>% 
  filter(country == "Mexico") %>% # Seleccionar pais
  dplyr::select(country, year, pop) %>%  # seleccionar columnas
  head() # observar los primeros 3 valores
# A tibble: 6 × 3
  country  year      pop
  <fct>   <int>    <int>
1 Mexico   1952 30144317
2 Mexico   1957 35015548
3 Mexico   1962 41121485
4 Mexico   1967 47995559
5 Mexico   1972 55984294
6 Mexico   1977 63759976

28.4 Manos a la obra

Realiza estas dos actividades en parejas o equipos

NotaActividad 1
  • Ejercicio 1.1: Dimensiones del archivo

¿Cuántas filas y columnas tiene el dataset de gapminder?

Pista: Usa dim() o nrow() y ncol()
  • Ejercicio 1.2: Nombres de columnas

¿Cuáles son los nombres de todas las columnas?

Pista: Usa colnames() o names()
  • Ejercicio 1.3: Primeras observaciones

Visualiza las primeras 6 filas del dataset.

Pista: Usa head()
  • Ejercicio 1.4: Tipos de datos

¿Qué tipo de dato tiene cada columna?

Pista: Usa str() o glimpse()
  • Ejercicio 1.5: Número de países

¿Cuántos países únicos hay en el dataset?

Pista: Usa unique() o n_distinct()