Desenho Experimental e Análise Avançada de Dados Ecológicos
2025-10-07
Como o nome indicam variam (ou seja, não são constantes)
Se não houvesse variabilidade não precisávamos da estatística
Hoje é então o episódio em que falamos de distribuições
Depois veremos como as podemos descrever numericamente
Mas antes disso…sistematizemos os usos da estatística…
Sumariar e descrever dados
Encontrar padrões nos dados
Apresentar os dados de forma compreensível e apelativa
Fazer previsões
Apoiar a tomada de decisão
Testar hipóteses
Escolher as verdades que interessam/mentir citando números
Se as variáveis variam, como é que variam?
Muitas vezes variam (aproximadamente) de acordo com uma distribuição
As distribuições podem servir de modelos para a realidade ou para o erro
Mais à frente veremos que são cruciais para inferência estatística
ggplot() +
geom_function(fun = dt, args = list(df = 1), aes(color = "df = 1")) +
geom_function(fun = dt, args = list(df = 5), aes(color = "df = 5")) +
geom_function(fun = dt, args = list(df = 10), aes(color = "df = 10")) +
geom_function(fun = dt, args = list(df = Inf), aes(color = "df = Inf")) +
scale_x_continuous(limits = c(-4, 4)) +
scale_color_manual(name = "Legenda",
values = c("df = 1" = "lightblue", "df = 5" = "yellow",
"df = 10" = "orange", "df = Inf" = "black")) +
theme_classic() + theme(legend.position = "bottom")ggplot() +
geom_function(fun = df, args = list(df1 = 1, df2 = 1),
aes(color = "df1 = 1, df2 = 1")) +
geom_function(fun = df, args = list(df1 = 1, df2 = Inf),
aes(color = "df1 = 1, df2 = Inf")) +
geom_function(fun = df, args = list(df1 = 3, df2 = Inf),
aes(color = "df1 = 3, df2 = Inf")) +
geom_function(fun = df, args = list(df1 = 5, df2 = Inf),
aes(color = "df1 = 5, df2 = Inf")) +
scale_x_continuous(limits = c(0, 10)) +
scale_color_manual(name = "Legenda",
values = c("df1 = 1, df2 = 1" = "lightblue",
"df1 = 1, df2 = Inf" = "yellow",
"df1 = 3, df2 = Inf" = "orange",
"df1 = 5, df2 = Inf" = "black")) +
theme_classic() + theme(legend.position = "bottom")Distributions:
Indique a probabilidade de obter um valor entre dois e três, numa distribuição uniforme que vai de zero a cinco
Indique a probabilidade de obter um valor entre quatro e cinco, na mesma distribuição
Repita os dois exercícios anteriores para uma distribuição normal com média de quatro e desvio padrão de um
Indique a probabilidade de obter cinco ou mais caras, no total, em dez lançamentos duma moeda justa
Indique a probabilidade de obter exactamente cinco caras, no total, em dez lançamentos duma moeda justa
Indique a probabilidade de retirar uma amostra de dez espécimes, em que cinco ou mais são mamíferos, sabendo que estão a ser retirados dum tanque com 30 espécimes de espécies diferentes, onde dez espécimes são mamífeoros
Indique a probabilidade de recolher um peixe com um comprimento superior a 15cm, duma população de peixes na qual o comprimento segue uma distribuição normal com média de 12cm desvio padrão de 1.5cm
Indique a probabilidade de recolher um peixe com comprimento inferior a 11cm, assumindo que vem da mesma população
A estatística descritiva, como o nome indica, ajuda-nos a descrever os dados
É uma forma de apresentarmos um ou mais sumários dos dados
Como qualquer sumário tem como objectivo facilitar a leitura, mas implica perda de informação
Frequência absoluta: \(n_{i}\) = Total de observações com esse valor
Frequência relativa: \(f_{i}\) = Proporção/percentagem de observações com o valor
Frequência acumulada:
O elemento mais comum (i.e., frequente):
Possível para todos os tipos de variáveis
Mais informativa para variáveis nominais
bimodal: distribuição com duas modas
plurimodal: distribuição com mais de duas modas
\[Me = \cases{ímpar: x_{\frac{(n+1)}{2}} \\ \\ par: \frac{x_{\frac{n}{2}} + x_{\frac{n}{2}+1}}{2}}\]
\(M = \overline{x} = \frac{\displaystyle\sum_{i = 1}^n x_i}{N}\)
O centro de massa da distribuição
Possível apenas para variáveis quantitativas (formalmente falando)
Mais informativa para variáveis quantitativas
Muito sensível a valores extremos/outliers
Se as variáveis seguem uma distribuição, quais as localizações/pontos importantes?
Quartis, partem a distribuição em quatro partes:
Quantis, partem a distribuição num x número de partes (os quartis e os percentis são o tipo mais conhecido de quantil)
Se as variáveis variam, como medimos quanto variam?
Verão nas fórmulas que tendem a ser distâncias entre pontos da distribuição, ou médias de distâncias entre cada observação e uma medida de tendência central
\(A = max - min\)
Distância entre o máximo e mínimo da distribuição
Apenas válida para variáveis ordinais ou quantitativas, aquelas que têm ordem, podendo ter um máximo e um mínimo
\(AIQ = Q3 - Q1\)
Distância entre o quartil um e o quartil três.
Apenas válida para variáveis ordinais ou quantitativas, aquelas que têm ordem, aquelas para as quais conseguimos calcular a mediana (o Q2)
Desvio absoluto médio:
\(MAD = \frac{\displaystyle\sum_{i=1}^n|(x_i - \overline{x})|}{N}\)
A média dos desvios absolutos em relação à média
Apenas válido (formalmente) para variáveis quantitativas, aquelas para as quais calculamos a média
Desvio absoluto mediano:
\(MAD = mediana(|x_i - \tilde{x}|)\)
A mediana dos desvios absolutos em relação à mediana
Apenas válida para variáveis ordinais ou quantitativas, aquelas que têm ordem, aquelas para as quais conseguimos calcular a mediana (o Q2)
\(S^2 = \frac{\displaystyle\sum_{i=1}^n(x_i - \overline{x})^2}{N}\)
\(S'^2 = \frac{\displaystyle\sum_{i=1}^n(x_i - \overline{x})^2}{N - 1}\)
A média das distâncias quadradas à média
Diz-nos quão distantes as observações tendem a estar da média
Não está na mesma unidade de medida da variável, mas sim no quadrado da sua medida, tornando-a difícil de interpretar
Apenas válida (formalmente) para variáveis quantitativas, aquelas para as quais calculamos a média
\(S = \sqrt{\frac{\displaystyle\sum_{i=1}^n(x_i - \overline{x})^2}{N}}\)
\(S' = \sqrt{\frac{\displaystyle\sum_{i=1}^n(x_i - \overline{x})^2}{N - 1}}\)
O desvio padrão é a raiz quadrada da média das distâncias quadradas de cada observação à média
Diz-nos quão distantes as observações tendem a estar da média
Está na mesma unidade de medida da variável
Apenas válida (formalmente) para variáveis quantitativas, aquelas para as quais calculamos a média
Enviesamento da distribuição (o desenho diz tudo)
Pode ser calculada para variáveis ordinais e quantitativas
Existem várias fórmulas (adequadas para diferentes tipos de variáveis)
Achatamento ou alongamento da distribuição
Pode ser calculada para variáveis ordinais e quantitativas
Existem várias fórmulas (adequadas para diferentes tipos de variáveis)
Leptocúrtica: kurtose positiva
Mesocúrtica: Kurtose = 0
Platicúrtica: Mais achatada, kurtose negativa
Qualquer sumário perde informação, mas a ausência de sumário e organização torna a informação ininteligível
Ao reportarmos mais que um sumário conseguimos resumir a informação, sem ignorarmos aspectos cruciais dos dados
A categorização das variáveis é indispensável para saber como as descrever
Devemo evitar ficar hiper-focados nos outputs de testes de hipóteses, sem conhecer e saber descrever os dados