Distribuições e Estatística Descritiva (Numérica)

Desenho Experimental e Análise Avançada de Dados Ecológicos

João O. Santos

ISPA

2025-10-07

Previously in DEAADE…

Variáveis

  • Como o nome indicam variam (ou seja, não são constantes)

  • Se não houvesse variabilidade não precisávamos da estatística

Distribuições

  • As variáveis por vezes seguem (aproximadamente) uma distribuição (matematicamente) conhecida:
    • Normal, binomial, exponencial, logarítmica, etc…
    • Não percam os próximos episódios!

On Today’s Episode

  • Hoje é então o episódio em que falamos de distribuições

  • Depois veremos como as podemos descrever numericamente

    • Mais tarde veremos como as descrever graficamente.
    • Não percam os próximos episódios!
  • Mas antes disso…sistematizemos os usos da estatística…

Usos da Estatística

  • Sumariar e descrever dados

  • Encontrar padrões nos dados

  • Apresentar os dados de forma compreensível e apelativa

Usos da Estatística

  • Fazer previsões

  • Apoiar a tomada de decisão

  • Testar hipóteses

  • Escolher as verdades que interessam/mentir citando números

    • :warning: Não usem a estatística para o mal
    • Usem o conhecimento estatístico como vacina contra quem a usa para enganar

Distribuições

  • Se as variáveis variam, como é que variam?

  • Muitas vezes variam (aproximadamente) de acordo com uma distribuição

  • As distribuições podem servir de modelos para a realidade ou para o erro

  • Mais à frente veremos que são cruciais para inferência estatística

Uniforme

Código
ggplot() +
geom_function(fun = dunif, args = list(min = -4, max = 4)) +
scale_x_continuous(breaks = -4:4, limits = c(-4.5, 4.5)) +
theme_classic()

Normal

Código
ggplot() +
geom_function(fun = dnorm) +
scale_x_continuous(limits = c(-4, 4)) +
theme_classic()

Binomial

Código
ggplot(data.frame(counts = 1:10, prob = dbinom(1:10, 10, 0.5)),
       aes(x = counts, y = prob)) +
geom_col(fill = "lightblue") +
scale_x_continuous(breaks = 1:10) +
theme_classic()

t

Código
ggplot() +
geom_function(fun = dt, args = list(df = 1), aes(color = "df = 1")) +
geom_function(fun = dt, args = list(df = 5), aes(color = "df = 5")) +
geom_function(fun = dt, args = list(df = 10), aes(color = "df = 10")) +
geom_function(fun = dt, args = list(df = Inf), aes(color = "df = Inf")) +
scale_x_continuous(limits = c(-4, 4)) +
scale_color_manual(name = "Legenda",
                   values = c("df = 1" = "lightblue", "df = 5" = "yellow",
                              "df = 10" = "orange", "df = Inf" = "black")) +
theme_classic() + theme(legend.position = "bottom")

F

Código
ggplot() +
geom_function(fun = df, args = list(df1 = 1, df2 = 1),
              aes(color = "df1 = 1, df2 = 1")) +
geom_function(fun = df, args = list(df1 = 1, df2 = Inf),
              aes(color = "df1 = 1, df2 = Inf")) +
geom_function(fun = df, args = list(df1 = 3, df2 = Inf),
              aes(color = "df1 = 3, df2 = Inf")) +
geom_function(fun = df, args = list(df1 = 5, df2 = Inf),
              aes(color = "df1 = 5, df2 = Inf")) +
scale_x_continuous(limits = c(0, 10)) +
scale_color_manual(name = "Legenda",
                   values = c("df1 = 1, df2 = 1" = "lightblue",
                              "df1 = 1, df2 = Inf" = "yellow",
                              "df1 = 3, df2 = Inf" = "orange",
                              "df1 = 5, df2 = Inf" = "black")) +
theme_classic() + theme(legend.position = "bottom")

O JASP Resolve

O JASP Resolve

  • “+”:

Distributions:

  • Continuous:
    • Normal
    • Uniform
    • Non-central t
    • F
  • Discrete:
    • Bernouli
    • Binomial

Exercícios

  • Indique a probabilidade de obter um valor entre dois e três, numa distribuição uniforme que vai de zero a cinco

  • Indique a probabilidade de obter um valor entre quatro e cinco, na mesma distribuição

  • Repita os dois exercícios anteriores para uma distribuição normal com média de quatro e desvio padrão de um

Exercícios

  • Indique a probabilidade de obter cinco ou mais caras, no total, em dez lançamentos duma moeda justa

  • Indique a probabilidade de obter exactamente cinco caras, no total, em dez lançamentos duma moeda justa

  • Indique a probabilidade de retirar uma amostra de dez espécimes, em que cinco ou mais são mamíferos, sabendo que estão a ser retirados dum tanque com 30 espécimes de espécies diferentes, onde dez espécimes são mamífeoros

Exercícios

  • Indique a probabilidade de recolher um peixe com um comprimento superior a 15cm, duma população de peixes na qual o comprimento segue uma distribuição normal com média de 12cm desvio padrão de 1.5cm

  • Indique a probabilidade de recolher um peixe com comprimento inferior a 11cm, assumindo que vem da mesma população

Exercícios

  • Indique a probabilidade de obter um valor t superior ou igual a dois, numa distribuição t com 19 graus de liberdade
    • Grave a imagem com o nome “o_prof_diz_que_e_importante.png”
  • Indique a probabilidade de obter um valor F superior ou igual a três, numa distribuição F com um grau de liberdade do fator e 29 graus de liberdade do erro
    • Grave a imagem com o nome “tambem_e_importante.png”

Estatística Descritiva

  • A estatística descritiva, como o nome indica, ajuda-nos a descrever os dados

  • É uma forma de apresentarmos um ou mais sumários dos dados

  • Como qualquer sumário tem como objectivo facilitar a leitura, mas implica perda de informação

Tabelas de Frequências

  • Frequência absoluta: \(n_{i}\) = Total de observações com esse valor

  • Frequência relativa: \(f_{i}\) = Proporção/percentagem de observações com o valor

  • Frequência acumulada:

    • Absoluta: \(N_{i}\) = soma de \(n_{i}\) até cada célula
    • Relativa: \(F_{i}\) = soma de \(f_{i}\) até cada célula

Tendência Central

  • Se as variáveis seguem uma distribuição, qual é o seu centro?

Moda

  • O elemento mais comum (i.e., frequente):

    • Exemplo: calças largas, calças justas, calças justas, saia, calças justas, calçar largas; moda = calças justas
  • Possível para todos os tipos de variáveis

  • Mais informativa para variáveis nominais

  • bimodal: distribuição com duas modas

  • plurimodal: distribuição com mais de duas modas

Mediana

\[Me = \cases{ímpar: x_{\frac{(n+1)}{2}} \\ \\ par: \frac{x_{\frac{n}{2}} + x_{\frac{n}{2}+1}}{2}}\]

  • O valor do meio quando ordenamos todas as observações
    • Para Ns pares fazemos a média dos dois elementos do meio
    • Possível para variáveis ordinais e quantitativas
    • Mais informativa para variáveis ordinais
    • Robusta a valores extremos
    • Adequada para variáveis quantitativas com valores extremos/outliers

Média

\(M = \overline{x} = \frac{\displaystyle\sum_{i = 1}^n x_i}{N}\)

  • O centro de massa da distribuição

  • Possível apenas para variáveis quantitativas (formalmente falando)

  • Mais informativa para variáveis quantitativas

  • Muito sensível a valores extremos/outliers

Localização

  • Se as variáveis seguem uma distribuição, quais as localizações/pontos importantes?

  • Quartis, partem a distribuição em quatro partes:

    • Q1: 25% da amostra tem um valor da variável inferior a esse valor
    • Q2: 50% da amostra tem um valor da variável inferior a esse valor
    • Q3: 75% da amostra tem um valor da variável inferior a esse valor
    • Reparem que o Q2 é a mediana
  • Quantis, partem a distribuição num x número de partes (os quartis e os percentis são o tipo mais conhecido de quantil)

Dispersão

  • Se as variáveis variam, como medimos quanto variam?

  • Verão nas fórmulas que tendem a ser distâncias entre pontos da distribuição, ou médias de distâncias entre cada observação e uma medida de tendência central

Amplitude Total

\(A = max - min\)

  • Distância entre o máximo e mínimo da distribuição

  • Apenas válida para variáveis ordinais ou quantitativas, aquelas que têm ordem, podendo ter um máximo e um mínimo

Amplitude Interquartil

\(AIQ = Q3 - Q1\)

  • Distância entre o quartil um e o quartil três.

  • Apenas válida para variáveis ordinais ou quantitativas, aquelas que têm ordem, aquelas para as quais conseguimos calcular a mediana (o Q2)

Desvio Absoluto Médio/Mediano

Desvio absoluto médio:

\(MAD = \frac{\displaystyle\sum_{i=1}^n|(x_i - \overline{x})|}{N}\)

  • A média dos desvios absolutos em relação à média

  • Apenas válido (formalmente) para variáveis quantitativas, aquelas para as quais calculamos a média

Desvio absoluto mediano:

\(MAD = mediana(|x_i - \tilde{x}|)\)

  • A mediana dos desvios absolutos em relação à mediana

  • Apenas válida para variáveis ordinais ou quantitativas, aquelas que têm ordem, aquelas para as quais conseguimos calcular a mediana (o Q2)

Variância

\(S^2 = \frac{\displaystyle\sum_{i=1}^n(x_i - \overline{x})^2}{N}\)

\(S'^2 = \frac{\displaystyle\sum_{i=1}^n(x_i - \overline{x})^2}{N - 1}\)

  • A média das distâncias quadradas à média

  • Diz-nos quão distantes as observações tendem a estar da média

  • Não está na mesma unidade de medida da variável, mas sim no quadrado da sua medida, tornando-a difícil de interpretar

  • Apenas válida (formalmente) para variáveis quantitativas, aquelas para as quais calculamos a média

Desvio Padrão

\(S = \sqrt{\frac{\displaystyle\sum_{i=1}^n(x_i - \overline{x})^2}{N}}\)

\(S' = \sqrt{\frac{\displaystyle\sum_{i=1}^n(x_i - \overline{x})^2}{N - 1}}\)

  • O desvio padrão é a raiz quadrada da média das distâncias quadradas de cada observação à média

    • Ou seja, a raiz quadrada da variância
  • Diz-nos quão distantes as observações tendem a estar da média

  • Está na mesma unidade de medida da variável

  • Apenas válida (formalmente) para variáveis quantitativas, aquelas para as quais calculamos a média

Forma

  • Se as variáveis seguem uma distribuição, qual a sua forma?

Assimetria/Skewness

  • Enviesamento da distribuição (o desenho diz tudo)

  • Pode ser calculada para variáveis ordinais e quantitativas

  • Existem várias fórmulas (adequadas para diferentes tipos de variáveis)

Kurtose

  • Achatamento ou alongamento da distribuição

  • Pode ser calculada para variáveis ordinais e quantitativas

  • Existem várias fórmulas (adequadas para diferentes tipos de variáveis)

  • Leptocúrtica: kurtose positiva

  • Mesocúrtica: Kurtose = 0

  • Platicúrtica: Mais achatada, kurtose negativa

Sumário

  • Os valores das variáveis, variam ao longo duma distribuição
    • Essas distribuições podem aproximar-se de distribuições (matematicamente) conhecidas
    • Conhecendo a distribuição sabemos a probabilidade teórica de obter valores num dado intervalo da distribuição
  • A estatística descritiva ajuda-nos a organizar e resumir os dados
    • As estatísticas descritivas adequadas a cada variável dependem da sua classificação
    • As estatísticas descritivas podem ser agrupadas em “famílias”, sendo muito importantes as de tendência central e dispersão

Notas Práticas

  • Qualquer sumário perde informação, mas a ausência de sumário e organização torna a informação ininteligível

  • Ao reportarmos mais que um sumário conseguimos resumir a informação, sem ignorarmos aspectos cruciais dos dados

    • Por exemplo, reportamos medidas de tendência central, com uma medida de dispersão associada

Notas Práticas

  • A categorização das variáveis é indispensável para saber como as descrever

  • Devemo evitar ficar hiper-focados nos outputs de testes de hipóteses, sem conhecer e saber descrever os dados

Exercícios

  • Vamos experimentar recolher dados da turma e descrevê-los