Como preparar os próprios dados para uma análise estatística (R, Python)
Os analistas experientes dizem, meio de brincadeira, que 80 % do tempo de análise é organização de dados, e só 20 % o cálculo propriamente dito. Quanto melhor você prepara os dados, menos sofre no carregamento em R, Python ou outro ambiente - e menor é o risco de que o resultado seja falso por causa de uma desordem na entrada.
O princípio: os «tidy data»
O mais cômodo para a análise é o formato longo:
- uma linha = uma observação (uma medição),
- uma coluna = uma variável (data, estação, indicador, valor, unidade),
- nomes de colunas coerentes, sem células mescladas nem cabeçalhos «de dois andares».
Uma disposição assim carrega-se em qualquer ferramenta sem retoques manuais (ver também formato longo vs largo).
A que prestar atenção especial
- Unidades coerentes - um indicador = uma unidade em todo o conjunto de dados; do contrário as médias não têm sentido algum.
- O formato dos números - para o CSV, use um ponto decimal e o UTF-8; uma vírgula decimal quebra a importação em muitas ferramentas.
- Os dados ausentes - marque-os sem ambiguidade (por ex. uma célula vazia /
NA), não com um zero - o zero é um valor. - Os valores abaixo do limite de quantificação - fixe e descreva uma convenção (é um problema comum dos dados ambientais); as estatísticas dependem disso.
- As datas - um formato único e não ambíguo (de preferência
AAAA-MM-DD), tratado como tempo.
Repetibilidade
- Mantenha os dados brutos separados dos dados transformados - você sempre pode voltar à fonte.
- Anote o que e como foi calculado (mesmo em uma nota), para que a análise seja reproduzível.
- CSV / UTF-8 é o formato mais seguro para a troca entre programas.
Na prática
O mínimo de erros ocorre quando os dados estão organizados desde o início - em estações, campanhas e unidades fixas. O LimnoLog mantém as medições nessa estrutura e as exporta para o Excel prontas para o processamento posterior, enquanto análises e gráficos mais simples fazem-se diretamente no aplicativo - reservando R ou Python às estatísticas mais pesadas só quando é realmente necessário.
← Base de conhecimento