Estatística Descritiva

Estatística Descritiva
Introdução
Como descrever dados sem esconder a sua estrutura, incerteza e limitações.
Autores
Afiliações

João O. Santos

ISPA

Cristina Mendonça

ISPA; WJCR

Vitória Melita

FP-UL

Mariona Pascual Peñas

UIB

João Raposo

ISPA

Marta Barros

FP-UL

0 Estatística Descritiva: Resumir sem Apagar a Pergunta

Uma tabela com centenas de linhas não se lê de uma vez; uma média isolada também não. A estatística descritiva cria representações mais manejáveis dos dados — números, tabelas e gráficos — para que possamos perguntar o que foi medido, como varia e que padrões merecem investigação. Não decide, por si só, se uma hipótese é verdadeira, nem corrige uma amostra enviesada ou uma medida mal definida.

Esta é uma página conceptual. Para calcular estas quantidades no R, consulte o tutorial de descritivas; para construir e adaptar gráficos, consulte Gráficos no R. Aqui interessa sobretudo escolher uma descrição que não substitua os dados por uma caricatura bem penteada.

ImportanteA Regra de Trabalho do NRB

Poderá ter aprendido que cada escala de medida traz uma receita fixa de estatísticas e gráficos; aqui preferimos começar pela pergunta, pelo processo de medição e pelos dados observados, porque a mesma receita pode ocultar assimetria, subgrupos, valores em falta ou observações influentes. As categorias tradicionais continuam úteis como vocabulário e ponto de partida, não como um piloto automático.

O Que uma Descritiva Pode — e Não Pode — Dizer

Um sumário reduz informação deliberadamente. A média da idade, por exemplo, localiza um centro aritmético, mas não mostra se há dois grupos etários, se uma idade extrema o desloca ou quantas idades estão em falta. Por isso, uma boa descrição combina normalmente: número de observações e valores em falta, localização, dispersão, e uma representação que deixe ver a distribuição ou a relação relevante.

Também importa distinguir a variável das suas observações. Contar as respostas a uma pergunta nominal pode ser apropriado; fazer a média de códigos arbitrários como 1 = azul e 2 = verde não cria uma medida de cor. A escala ajuda a delimitar operações sensatas, mas o significado dos valores, o delineamento do estudo e a finalidade da comparação continuam a decidir o que vale a pena mostrar.

As Categorias que Provavelmente Já Conhece

Frequências para Categorias

Para uma categoria \(i\), a frequência absoluta é \(n_i\), o número de observações nessa categoria, e a frequência relativa é \(f_i = n_i/n\). Percentagens são frequências relativas multiplicadas por 100. Devemos indicar o denominador: uma percentagem de respostas válidas não é necessariamente uma percentagem de todos os participantes.

Frequências acumuladas (\(N_i\) e \(F_i\)) fazem sentido quando as categorias têm uma ordem substantiva — por exemplo, níveis de concordância apresentados na ordem da escala. Para categorias nominais, uma acumulação depende apenas da ordem arbitrária escolhida para as linhas e raramente informa.

Centro e Localização

A moda é a categoria ou valor mais frequente; pode haver mais de uma. Por exemplo, se numa pequena amostra aparecem «calças largas, calças justas, calças justas, saia, calças justas», a moda é «calças justas». É um exemplo prosaico, mas ajuda a lembrar que a moda conta ocorrências: não é uma média com outro nome. É particularmente directa para dados nominais, mas uma moda numa variável contínua medida com precisão pode mudar com o arredondamento ou com os intervalos escolhidos.

A mediana é o ponto que deixa, aproximadamente, metade das observações de cada lado depois de as ordenar. Os quartis são outros pontos de corte: \(Q_1\), \(Q_2\) (a mediana) e \(Q_3\) correspondem aos quantis de .25, .50 e .75. São úteis para variáveis ordenáveis e são menos afectados por valores extremos do que a média.

A média amostral é

\[\bar{x} = \frac{1}{n}\sum_{i=1}^{n}x_i.\]

É o centro de massa dos valores quantitativos: cada valor, incluindo os extremos, contribui para ela. Essa sensibilidade não é um defeito automático; é uma propriedade a interpretar. Se uma observação extrema é erro de registo, o problema é a qualidade dos dados. Se é uma observação válida, apagá-la só para melhorar a média seria apagar precisamente parte do fenómeno.

Dispersão

A amplitude total é \(\max(x)-\min(x)\); descreve os extremos, mas por isso muda muito quando aparece apenas uma observação extrema. A amplitude interquartil (AIQ) é \(Q_3-Q_1\) e descreve a largura dos 50% centrais.

A variância amostral e o desvio-padrão amostral são, respectivamente,

\[s^2 = \frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1}, \qquad s = \sqrt{s^2}.\]

A variância fica em unidades ao quadrado; o desvio-padrão regressa às unidades da variável. O denominador \(n-1\) pertence à versão amostral habitualmente usada para estimar uma variância populacional; uma descrição de todos os valores de uma população pode usar outra convenção. Vale a pena escrever qual foi usada, em vez de tratar fórmulas semelhantes como rivais tribos académicas.

O desvio absoluto médio e o desvio absoluto mediano (por vezes ambos chamados MAD, uma ambiguidade pouco simpática) resumem distâncias absolutas a um centro. Ao reportar um deles, devemos definir o centro e a fórmula, não apenas a sigla.

Forma: Assimetria, Caudas e o Caso da Kurtose

A assimetria (skewness) resume a falta de simetria de uma distribuição. Uma cauda longa à direita costuma puxar a média para a direita da mediana; isso é uma pista para olhar para os dados, não um diagnóstico automático de erro nem uma ordem para transformar a variável.

Poderá ter aprendido que a kurtose mede simplesmente o “achatamento” ou o “pico” de uma distribuição; aqui preferimos descrevê-la como uma medida baseada no quarto momento central padronizado, ligada sobretudo ao peso das caudas e muito sensível a observações extremas, porque distribuições com a mesma kurtose podem ter picos muito diferentes. A crítica histórica e técnica à equivalência entre kurtose e “pontiagudez” é desenvolvida por Westfall (2014).

Na convenção de excesso de kurtose, subtrai-se 3 à kurtose da distribuição normal, pelo que a normal tem valor 0; noutras convenções tem valor 3. Termos como leptocúrtica, mesocúrtica e platicúrtica continuam a aparecer em manuais e resultados de software, mas só se podem interpretar depois de saber qual a definição e o estimador usados. Em amostras pequenas, um único valor extremo pode dominar a estimativa. Um gráfico e os valores originais, quando possível, são em geral mais informativos do que transformar um número de kurtose num veredicto sobre “normalidade”.

DicaPerguntas Antes de Resumir
  • Que unidade é uma observação: pessoa, ensaio, ninho, dia ou medição repetida?
  • Há valores em falta, códigos impossíveis, limites de detecção ou arredondamento?
  • Um único centro e uma única dispersão escondem grupos relevantes?
  • Que comparação responde à pergunta substantiva, e que incerteza ou variação precisa de ficar visível?

1 Estatística Descritiva Gráfica

Um gráfico é também uma descritiva, mas não é um ornamento para uma tabela. Pode revelar agrupamentos, não linearidade, assimetria, valores extremos e relações que a mesma média, desvio-padrão e correlação deixam indistintos. Matejka e Fitzmaurice (2017) mostram precisamente conjuntos com sumários numéricos iguais mas estruturas gráficas diferentes.

Poderá ter aprendido que um gráfico é uma ilustração escolhida no fim, depois das estatísticas “a sério”; aqui preferimos visualizá-lo cedo e voltar a ele ao longo da análise. Os gráficos permitem-nos comunicar muita informação, muito rapidamente, mas isso não significa que falem sozinhos: a escolha do modelo e a interpretação dos seus resultados dependem da estrutura que os números resumem.

Mostrar os Dados Antes do Sumário

Quando o número de observações o permite, pontos individuais — eventualmente com transparência, deslocamento horizontal moderado ou painéis por grupo — mostram mais do que uma barra da média. Para grupos grandes, podemos juntar pontos, quantis, caixas ou densidades, mas convém deixar claro o que cada camada representa. Uma barra alta pode ser uma média elevada, uma soma, uma contagem ou uma proporção: o eixo e a legenda devem dizê-lo explicitamente.

Não há um gráfico universalmente correcto. Há uma escolha que torna mais fácil ver a comparação que interessa sem esconder as alternativas plausíveis.

Categorias: Barras e, com Reserva, Sectores

Gráficos de barras são normalmente uma boa primeira escolha para contagens ou proporções de categorias: permitem comparar comprimentos e ordenar as categorias por uma ordem substantiva ou por frequência. Quando o comprimento codifica uma contagem ou proporção, o eixo deve normalmente começar em zero; cortar a base exagera diferenças visuais.

Um gráfico circular pode ser reconhecível, mas comparar ângulos e áreas é muitas vezes mais difícil do que comparar barras. Não é proibido: é apenas raramente a melhor opção quando há várias categorias ou diferenças pequenas.

Distribuições: Histogramas, Caixas e Densidades

Um histograma agrupa valores quantitativos em intervalos. A sua aparência depende da largura e do ponto de início dos intervalos; mudar ambos pode sugerir padrões diferentes. Por isso, não devemos declarar uma distribuição “normal” ou “bimodal” após experimentar uma única divisão em barras. Mostrar alternativas razoáveis ou os pontos subjacentes é muitas vezes esclarecedor.

Uma caixa de bigodes (boxplot) mostra tipicamente \(Q_1\), mediana e \(Q_3\); a caixa cobre a AIQ. Na convenção mais comum, os bigodes chegam ao valor observado mais distante que se encontre, no máximo, a 1.5 AIQ da caixa, e os restantes pontos são desenhados separadamente. Não são, portanto, necessariamente o mínimo e o máximo, nem os pontos marcados são automaticamente erros: são observações que merecem ser verificadas e compreendidas no contexto do estudo.

Uma curva de densidade é uma estimativa suavizada. A altura não é uma contagem e pode ser superior a 1; a área total sob a curva é 1. A suavização pode inventar ou apagar pequenos picos, sobretudo com poucos dados. É útil compará-la com um histograma, uma caixa ou pontos, não tratá-la como a silhueta exacta da população.

Relações: Pontos, Grupos e Escalas

Um diagrama de dispersão é o ponto de partida para duas variáveis quantitativas: cada ponto representa uma observação. Permite procurar curvatura, grupos, heterogeneidade da dispersão e casos influentes antes de resumir tudo por uma recta ou correlação. Cor, forma e painéis podem acrescentar uma categoria, desde que não transformem a legenda num teste de visão cromática.

Ao comparar grupos, escalas comuns facilitam a comparação entre painéis. Uma escala diferente pode ser justificada para tornar visível uma estrutura local, mas deve ser evidente; o leitor não deve descobrir a mudança depois de tirar uma conclusão. Rótulos com unidades, uma legenda que explique os símbolos e uma indicação de \(n\) tornam o gráfico verificável.

2 O Que Reter

As famílias clássicas — frequências, localização, tendência central, dispersão e forma — organizam o vocabulário da estatística descritiva. A prática do NRB não as rejeita: pede que cada número seja acompanhado pela pergunta que responde e por uma visualização adequada. A sequência produtiva é observar, descrever, comparar e só depois modelar ou testar. O software calcula uma kurtose em milissegundos; perceber se ela descreve algo relevante continua a ser trabalho científico.

3 Exercícios de Reflexão

  1. Uma amostra tem média 50, mediana 42 e desvio-padrão 30. Que distribuições ou problemas de dados ainda seriam compatíveis com estes três números? Que gráfico pediria antes de interpretar a diferença entre média e mediana?
  2. Um boxplot assinala duas observações como estando para lá de 1.5 AIQ. Explique porque é que isto não autoriza, por si só, apagá-las.
  3. Faça dois histogramas do mesmo conjunto de dados com escolhas razoavelmente diferentes de intervalos. Que conclusões permanecem estáveis? Quais dependem da escolha de visualização?

4 Referências

Matejka, J., & Fitzmaurice, G. (2017). Same stats, different graphs. Proceedings of the 2017 CHI Conference on Human Factors in Computing Systems, 1290–1294. https://doi.org/10.1145/3025453.3025912

Westfall, P. H. (2014). Kurtosis as peakedness, 1905–2014. R.I.P. The American Statistician, 68(3), 191–195. https://doi.org/10.1080/00031305.2014.917055