Cómo preparar los datos para el análisis estadístico (R, STATISTICA)

Base de conocimientos · 16 de julio de 2026

Los analistas con experiencia dicen medio en broma que el 80 % del tiempo del análisis es ordenar los datos, y solo el 20 % el cálculo en sí. Cuanto mejor prepare los datos, menos dolor al cargarlos en R, STATISTICA o Python - y menos riesgo de que el resultado sea erróneo por el desorden de entrada.

El principio: «datos ordenados» (tidy data)

El formato más cómodo para el análisis es el formato largo:

  • una fila = una observación (una medición),
  • una columna = una variable (fecha, estación, parámetro, valor, unidad),
  • nombres de columna coherentes, sin celdas combinadas ni encabezados «a dos pisos».

Esta disposición la cargará en cualquier herramienta sin retoques manuales (véase también formato largo frente a ancho).

Las mismas mediciones en dos disposiciones

Una hoja cómoda para anotar (fecha en el encabezado, parámetro en el encabezado: dos pisos de información):

Estación10-05 O₂10-05 pH14-06 O₂14-06 pH
ST-18,27,46,97,1
ST-27,87,65,47,3

Los mismos datos listos para el análisis: la fecha y el parámetro han bajado del encabezado a columnas, el número lleva punto decimal y la unidad viaja con el valor:

datestationparametervalueunit
2026-05-10ST-1O28.2mg/l
2026-05-10ST-1pH7.4-
2026-05-10ST-2O27.8mg/l
2026-06-14ST-1O26.9mg/l

La diferencia es práctica, no estética: añadir una tercera fecha en la primera disposición exige dos columnas nuevas y un arreglo en cada script; en la segunda, basta con añadir filas. La hoja de campo puede parecerse a la primera, pero a R o a STATISTICA exporte la segunda.

A qué prestar especial atención

  • Unidades coherentes - un parámetro = una unidad en todo el conjunto; de lo contrario las medias no tienen sentido.
  • Formato de los números - para el CSV use el punto decimal y UTF-8; la coma decimal estropea la importación en muchas herramientas.
  • Datos que faltan - márquelos de forma inequívoca (p. ej. celda vacía / NA), no con un cero
    • el cero es un valor.
  • Valores por debajo del límite de cuantificación - fije y describa una convención (es un problema frecuente en los datos ambientales); de ella dependen las estadísticas.
  • Fechas - un único formato inequívoco (mejor AAAA-MM-DD), tratado como tiempo.

Reproducibilidad

  • Mantenga los datos brutos aparte de los transformados - siempre se puede volver al origen.
  • Anote qué y cómo se ha calculado (aunque sea en una nota), para poder reproducir el análisis.
  • CSV / UTF-8 es el formato de intercambio más seguro entre programas.

En la práctica

Se cometen menos errores cuando los datos están ordenados desde el principio - en estaciones, campañas y unidades fijas. LimnoLog mantiene las mediciones en esa estructura y las exporta a Excel listas para procesar, y los análisis y gráficos más sencillos los hará en la propia aplicación - recurriendo a R o STATISTICA para la estadística más pesada solo cuando de verdad la necesite.

Verlo en la aplicación LimnoLog

Descubre las funciones de LimnoLog
Base de conocimientos