Estatística Robusta
0 Comecemos por uma Média
Imaginem que medimos a massa de dez peixes juvenis, em gramas:
[ 19, 20, 20, 21, 21, 22, 22, 23, 24, 80. ]
Nove valores estão entre 19 e 24. O último é 80.
Pode ser um erro de registo. Pode ser um peixe de outra população. Pode ser um animal perfeitamente legítimo que, por alguma razão, é muito maior do que os restantes. Ainda não sabemos.
A média é 25.2 g.
Esse número não está errado. É a média daqueles dez valores. Mas também é fácil ver que um único peixe teve bastante influência no resultado. Se o retirarmos, a média muda muito mais do que mudaria se retirássemos qualquer um dos peixes entre 19 e 24 g.
É aqui que começa a estatística robusta.
Não começa por perguntar:
«Qual é o teste que uso quando o Shapiro–Wilk dá significativo?»
Começa por uma pergunta mais útil:
Quanto é que a nossa conclusão depende de partes muito específicas dos dados ou de condições ideais do modelo?
Field e Wilcox (2017) usam precisamente esta motivação para introduzir métodos robustos de forma aplicada. Vale a pena ler o artigo. Esta página não procura reescrevê-lo: vamos usar a mesma pergunta geral, mas construir o nosso próprio mapa e ligá-lo à linguagem que temos usado no NRB.
Comecem por:
Field, A. P., & Wilcox, R. R. (2017). Robust statistical methods: A primer for clinical psychology and experimental psychopathology researchers. Behaviour Research and Therapy, 98, 19–38. https://doi.org/10.1016/j.brat.2017.05.013
É uma introdução aplicada e parte de testes-t, ANOVAs e regressões que muitos leitores já conhecem. Nesta página acrescentamos outras explicações, exemplos, WRS2, performance e literatura posterior.
1 Primeiro: O Que É Um Estimador?
Antes de falar em robustez precisamos de uma palavra que aparece em todo este capítulo: estimador.
Um estimador é simplesmente uma regra para transformar uma amostra num número que queremos usar para aprender alguma coisa sobre a população ou processo. A regra é o estimador. O número que obtemos depois de a aplicar aos nossos dados é a estimativa.
Já conhecemos vários:
- a média estima uma localização média.
- a mediana estima o ponto que deixa metade dos valores de cada lado.
- um declive de regressão estima quanto esperamos que (Y) mude quando (X) muda uma unidade.
- uma proporção estima a frequência de um acontecimento.
A regra importa porque regras diferentes reagem de forma diferente aos mesmos dados.
Voltemos aos peixes. A média foi 25.2 g. A mediana é 21.5 g.
Qual delas é «a correcta»?
A pergunta não tem resposta sem sabermos o que queremos estimar.
A média e a mediana não são duas tentativas de chegar ao mesmo número. Resumem os dados de maneiras diferentes. A mediana não é uma média «corrigida», e a média não é automaticamente melhor só porque aparece em mais fórmulas.
A estatística robusta acrescenta outros estimadores e outras formas de calcular a incerteza. O objectivo é evitar que uma parte pequena dos dados consiga controlar a análise mais do que é razoável para a pergunta que estamos a fazer.
2 Robustez Não É Uma Coisa Só
Há duas situações que convém separar desde já.
Na primeira, a estimativa central ainda nos parece adequada, mas não confiamos totalmente na fórmula clássica usada para calcular o erro-padrão ou o intervalo de confiança.
Na segunda, a própria estimativa está demasiado dependente de algumas observações. Aí não chega mudar apenas o erro-padrão: precisamos de um estimador diferente.
Isto dá-nos uma primeira distinção:
| Problema | O que podemos mudar? | Exemplo |
|---|---|---|
| incerteza frágil | erro-padrão/intervalo | HC3, bootstrap |
| estimativa frágil | o próprio estimador | média aparada, estimador-M |
| não sabemos quão dependente é a conclusão de uma escolha | comparar análises plausíveis | triangulação |
Mais à frente vamos combinar estas ideias. Por agora basta reter:
«Robusto» não é o nome de um teste. É uma família de estratégias para fazer com que uma análise dependa menos de condições frágeis.
3 Aparar as Caudas
Uma Média Que Não Usa Tudo
Voltemos outra vez aos dez peixes:
[ 19, 20, 20, 21, 21, 22, 22, 23, 24, 80. ]
Uma média 20% aparada (20% trimmed mean) começa por ordenar os valores. Como temos dez observações, 20% corresponde a duas observações em cada cauda.
Retiramos então:
- os dois valores mais baixos: 19 e 20.
- os dois valores mais altos: 24 e 80.
Ficamos com:
[ 20, 21, 21, 22, 22, 23. ]
A média destes seis valores é 21.5 g.
Reparem no que aconteceu. Não tivemos de decidir que o peixe de 80 g era um outlier. A regra de estimação já dizia, antes de olharmos para os resultados, que os 20% valores de cada cauda não entrariam na média aparada.
É essa uma das ideias fortes do trimming: não precisamos de construir uma máquina que primeiro procura «maus participantes» e depois decide quais deve apagar. A protecção contra as caudas faz parte do estimador. É também uma das razões pelas quais Field e Wilcox (2017) apresentam médias aparadas como uma alternativa robusta útil, em vez de tratar robustez como sinónimo de procurar e eliminar outliers.
Mas o trimming faz mais do que lidar com um único valor espectacular. Também reduz a influência de caudas pesadas e de pequenas contaminações nos dados. Numa distribuição com caudas pesadas, valores muito afastados do centro aparecem com mais frequência do que esperaríamos numa Normal.
Para aquela estimativa, sim: os valores aparados não entram no cálculo da média aparada.
Mas isso não significa que apagámos as linhas da base de dados ou que declaramos aqueles animais inválidos. Continuam a existir e podem ser inspeccionados, descritos e usados noutras análises.
O ponto importante é outro: uma média 20% aparada tem um alvo estatístico diferente da média aritmética. Não devemos descrevê-la como «a média normal depois de remover os outliers».
4 Winsorização
O nome parece mais exótico do que a ideia.
Em vez de retirarmos os valores das caudas, podemos limitá-los.
No exemplo anterior, imaginemos que estamos a trabalhar com a mesma proporção de 20%. Em vez de deixar os dois valores inferiores e os dois superiores fora, substituímos esses extremos pelos valores mais próximos que ficaram dentro da região central.
No nosso exemplo, os valores ordenados eram:
[ 19, 20, 20, 21, 21, 22, 22, 23, 24, 80.]
Com 20% de Winsorização, os dois valores de cada cauda são substituídos pelos valores-limite que ficaram imediatamente dentro dessa cauda. Ficamos, neste caso, com:
[ 20, 20, 20, 21, 21, 22, 22, 23, 23, 23.]
Continuamos com dez números. Os extremos continuam lá, mas já não podem crescer indefinidamente e dominar medidas como a variância.
A isto chamamos Winsorização.
Por que nos interessa?
Porque vários métodos baseados em médias aparadas usam variâncias winsorizadas para calcular a incerteza. Portanto um teste robusto como o teste de Yuen não é simplesmente:
«tirar 20% de cada lado e depois correr exactamente o teste-t clássico».
A média mudou e a forma de representar a variabilidade também mudou.
Se esta parte ainda parecer demasiado mecânica, retenha apenas isto por agora:
trimming altera directamente a média. A Winsorização ajuda-nos a impedir que as caudas dominem a estimativa da variabilidade.
5 Estimadores-M
O trimming toma uma decisão bastante visível: algumas observações deixam de entrar naquela estimativa.
Há outra família de métodos que prefere uma transição mais gradual.
Comecemos pela regressão linear comum. O método dos mínimos quadrados ordinários (ordinary least squares, OLS) escolhe a recta que minimiza a soma dos resíduos ao quadrado.
Isto tem uma consequência importante.
Se uma observação tem resíduo 2, contribui com (2^2 = 4).
Se outra tem resíduo 10, contribui com (10^2 = 100).
Portanto um erro cinco vezes maior passa a ter vinte e cinco vezes mais peso na quantidade que estamos a minimizar.
Na maior parte das situações isso é uma propriedade muito útil. Mas também explica por que uma observação extrema pode conseguir puxar bastante a recta.
Os estimadores-M alteram a função que estamos a minimizar. Esta é outra das famílias de métodos discutidas por Field e Wilcox (2017). Em vez de deixar o custo crescer sempre com o quadrado do resíduo, podemos fazer com que resíduos muito grandes cresçam mais devagar ou recebam menos peso.
A ideia é esta:
- resíduos pequenos comportam-se quase como no OLS.
- à medida que um resíduo se torna muito grande, a sua influência deixa de aumentar tão depressa.
- dependendo do estimador, observações muito extremas podem acabar com peso muito pequeno.
Reparem na diferença para o trimming.
No trimming há uma fronteira: certas observações das caudas entram ou não entram no estimador.
Num estimador-M, a contribuição pode ir sendo reduzida de forma gradual.
Não precisamos ainda de decorar funções de perda. O que precisamos de perceber é que a robustez pode ser conseguida alterando quanto cada observação consegue mandar no ajuste.
6 Estimativa Certa, Erro-Padrão Errado
Agora mudemos de problema.
Imaginem que ajustamos uma regressão e obtemos um declive de 2.1.
Quando olhamos para os resíduos vemos um padrão em funil: para valores baixos de (X), os resíduos são relativamente pequenos. para valores altos, a dispersão é muito maior.
Pode acontecer que o declive 2.1 continue a ser uma boa descrição da relação média, mas que o erro-padrão OLS esteja mal calibrado porque a variância não é constante.
Quando a dispersão dos erros muda ao longo dos valores previstos, ou entre partes dos dados, temos heterocedasticidade.
Nesse caso não precisamos necessariamente de mudar o declive.
Podemos manter os coeficientes OLS e recalcular os erros-padrão de uma forma que permita variâncias diferentes. HC3 é uma das opções mais usadas para isso.
Por baixo do capot, HC3 altera a matriz usada para calcular a covariância dos coeficientes. Não precisamos dessa mecânica para perceber a decisão: o declive fica igual. A incerteza à volta dele é que muda.
Esta distinção é fácil de perder:
- regressão robusta pode mudar os coeficientes.
- HC3 mantém os coeficientes e muda os erros-padrão e intervalos.
Portanto, quando alguém diz «usei métodos robustos», ainda falta perguntar:
Robustos a quê? E que parte da análise mudou?
7 Bootstrap: Fingir Que Repetimos a Amostragem
Até aqui falámos sobretudo de estimadores. Agora precisamos de outra ideia: reamostragem.
Por que haveríamos de reamostrar dados que já temos?
Porque quase toda a inferência depende de imaginar o que aconteceria se pudéssemos repetir o processo de amostragem muitas vezes.
Num mundo ideal poderíamos:
- recolher uma amostra.
- calcular a média.
- deitar a amostra fora.
- recolher outra amostra da mesma população.
- calcular outra média.
- repetir isto milhares de vezes.
No fim teríamos milhares de médias e poderíamos ver directamente a sua distribuição amostral.
Obviamente isto seria uma maneira muito cara de calcular um erro-padrão.
Fazer isto de verdade seria absurdo. O bootstrap tenta aproximar a mesma ideia usando a amostra que já temos.
8 Bootstrap Não-Paramétrico
Imaginem que escrevemos cada observação num papelinho e colocamos todos os papéis dentro de um saco.
Se temos 100 observações:
- tiramos um papel.
- registamos o valor.
- voltamos a pôr o papel no saco.
- repetimos até termos novamente 100 valores.
- calculamos a estatística que nos interessa.
Depois repetimos todo este processo muitas vezes.
O detalhe «voltamos a pôr o papel no saco» é essencial. É isso que significa amostrar com reposição. Num dado bootstrap sample, algumas observações podem aparecer várias vezes e outras podem não aparecer nenhuma.
Cada amostra bootstrap é, portanto, uma versão ligeiramente diferente dos dados originais.
Calculamos a estatística em cada uma dessas versões:
- uma média.
- uma diferença entre médias.
- um declive.
- uma correlação.
- uma média aparada.
- qualquer outro estimador para o qual o procedimento faça sentido.
Depois olhamos para a distribuição dessas milhares de estimativas.
É isso que nos permite aproximar a incerteza sem depender exclusivamente duma fórmula analítica.
Se medimos dez peixes dentro de cada tanque, não podemos reamostrar os peixes como se fossem unidades independentes se a verdadeira unidade experimental é o tanque.
Nesse caso poderíamos precisar de reamostrar tanques inteiros, preservar pares, usar um cluster bootstrap ou recorrer a outro esquema que respeite a dependência.
Reamostrar a unidade errada continua a ser pseudorreplicação.
9 Bootstrap Paramétrico
No bootstrap não-paramétrico, as novas amostras vêm dos próprios valores que observámos.
No bootstrap paramétrico fazemos outra coisa.
Primeiro ajustamos um modelo. Depois usamos esse modelo como máquina para simular novos dados.
Por exemplo, se o nosso modelo diz que os resíduos são aproximadamente Gaussianos com determinada variância, podemos:
- ajustar o modelo original.
- usar os parâmetros estimados para simular uma nova resposta.
- voltar a ajustar o modelo aos dados simulados.
- guardar o coeficiente.
- repetir milhares de vezes.
A diferença essencial é simples:
- bootstrap não-paramétrico: reamostramos observações.
- bootstrap paramétrico: simulamos observações a partir do modelo.
O segundo usa explicitamente a estrutura do modelo. Isso pode ser uma vantagem. Também significa que estamos a confiar mais nesse modelo.
Se a distribuição que escolhemos para simular estiver muito mal especificada, vamos repetir esse erro milhares de vezes com grande eficiência. O computador não se cansa, mesmo quando está a simular a coisa errada.
10 Que Intervalo Sai do Bootstrap?
Infelizmente não existe um botão universal chamado «intervalo bootstrap».
Depois de termos milhares de réplicas podemos construir intervalos de várias formas. Encontrarão, entre outros:
- intervalos baseados no erro-padrão.
- intervalos de percentis.
- basic bootstrap.
- BCa (bias-corrected and accelerated).
Não precisamos de dominar já a matemática de todos eles. Para uma primeira leitura, o importante é perceber que o bootstrap produz uma distribuição de estimativas. Ainda precisamos de decidir como transformar essa distribuição num intervalo.
Os intervalos BCa tentam corrigir dois problemas que aparecem frequentemente: viés e assimetria da distribuição bootstrap.
O «a» de accelerated está relacionado com a forma como a variabilidade do estimador muda quando diferentes observações são removidas. É aqui que o jackknife reaparece dentro de um método bootstrap mais sofisticado.
Esta é uma boa razão para não tratar «bootstrap» como o nome de uma única receita.
11 Jackknife: Uma Unidade de Cada Vez
O jackknife é mais fácil de visualizar.
Se temos (n) unidades, repetimos a análise (n) vezes:
- na primeira, retiramos a unidade 1.
- na segunda, retiramos a unidade 2.
- na terceira, retiramos a unidade 3.
- e assim sucessivamente.
Depois vemos quanto a estimativa muda.
Se retirar uma determinada unidade altera muito o resultado e retirar todas as outras quase não altera nada, aprendemos imediatamente que aquela observação tem muita influência.
O jackknife também pode ser usado para estudar viés e calcular erros-padrão de determinados estimadores.
Historicamente antecede o bootstrap e ajuda a perceber uma ideia importante: podemos aprender sobre a estabilidade de uma estimativa observando como ela muda quando perturbamos sistematicamente a amostra.
Não o confundam com cross-validation. Em ambos os casos retiramos dados, mas a pergunta é diferente. A validação cruzada preocupa-se sobretudo com desempenho preditivo fora da amostra. O jackknife nasceu como ferramenta de inferência e avaliação de influência.
12 Reamostrar Não Torna Tudo Robusto
Este ponto merece uma pausa.
Suponham que a média aritmética é dominada por um valor extremo.
Se fizermos bootstrap da média aritmética, continuamos a estudar a média aritmética. O valor extremo vai aparecer em muitas amostras bootstrap, às vezes mais do que uma vez.
O bootstrap não transforma magicamente a média num estimador robusto.
Podemos, contudo, fazer bootstrap duma média aparada.
Aí estamos a combinar duas decisões diferentes:
- usamos um estimador resistente às caudas.
- usamos reamostragem para estudar a incerteza desse estimador.
Vários métodos robustos fazem precisamente combinações deste género.
13 Onde Entra o WRS2?
O pacote WRS2 reúne implementações de muitos métodos desenvolvidos na literatura de estatística robusta.
Mair e Wilcox (2020) mostram como usar o pacote para problemas que, na estatística introdutória, reconheceríamos como:
- comparações entre dois grupos.
- ANOVAs de um ou mais factores.
- medidas repetidas.
- ANCOVA.
- correlações e regressões.
- comparações de quantis e outros parâmetros.
Mas há um cuidado importante.
Uma função robusta não é necessariamente:
«o mesmo teste de sempre, só que mais seguro».
Pode mudar:
- a média que está a ser estimada.
- a forma como a variância é calculada.
- os graus de liberdade.
- o método usado para obter o intervalo.
- ou várias destas coisas ao mesmo tempo.
É por isso que a página prática de Pressupostos e Diagnóstico mostra apenas algumas chamadas de WRS2. Aqui precisamos primeiro de perceber o que essas funções estão a fazer estatisticamente.
14 Então Devemos Sempre Usar Métodos Robustos?
É tentador responder «sim» e acabar o capítulo mais cedo.
Mas não é assim tão simples.
Métodos robustos têm vantagens importantes quando os dados têm caudas pesadas, heterocedasticidade ou observações influentes. Mas também mudam o estimando, podem ter eficiências diferentes sob condições ideais e nem todos respondem à mesma pergunta.
Neste site vamos privilegiar outra ideia: triangulação.
Podemos definir uma análise principal e uma ou mais alternativas plausíveis antes de olhar para o resultado final.
Por exemplo:
- OLS e OLS + HC3.
- OLS e regressão robusta.
- média e média 20% aparada.
- intervalo clássico e intervalo bootstrap.
- modelo completo e modelo sem observações claramente influentes.
Se todas contam aproximadamente a mesma história, aprendemos que a conclusão não depende muito daquela decisão analítica.
E se não contam? Também aprendemos alguma coisa.
A pergunta seguinte deixa de ser «qual delas dá significativo?» e passa a ser:
Que parte dos dados ou do modelo está a produzir esta diferença?
Essa é uma pergunta estatística muito mais interessante.
15 O Que Métodos Robustos Não Fazem
Podemos tornar uma análise menos dependente de caudas, heterocedasticidade ou algumas observações muito influentes.
Mas há problemas que nenhuma destas técnicas consegue reparar depois dos dados terem sido recolhidos.
Por exemplo, não corrigem automaticamente:
- pseudorreplicação.
- confundimento.
- uma unidade de análise errada.
- uma intervenção aplicada a três tanques mas analisada como se tivesse sido aplicada a trezentos peixes.
- medições sistematicamente enviesadas.
- causalidade que o delineamento não permite.
- uma estrutura de dependência que o modelo ignora.
Um método robusto pode fazer uma boa análise dos dados que temos.
Não consegue criar o delineamento que gostaríamos de ter tido.
16 Um Mapa Para Voltar Mais Tarde
Depois de tantas palavras novas, convém reorganizar o mapa.
| Se o problema é.. | Podemos pensar em.. | O que muda? |
|---|---|---|
| poucos valores extremos dominam a média | trimming | estimativa de localização |
| caudas dominam a variância | Winsorização | contribuição dos extremos |
| alguns resíduos dominam uma regressão | estimador-M | influência/pesos |
| a variância não é constante | HC3 | incerteza dos coeficientes |
| não queremos depender tanto duma fórmula analítica | bootstrap | aproximação à distribuição amostral |
| queremos ver o efeito de cada unidade | jackknife | influência/viés/EP |
| várias análises são defensáveis | triangulação | dependência da conclusão da escolha analítica |
Não é para decorar a tabela. É para poder voltar aqui quando encontrar estes nomes num artigo ou numa função de R e perguntar: afinal, o que é que está a ser tornado mais robusto?
17 Como Continuar
Se esta é a primeira vez que encontra estatística robusta, a melhor sequência é:
- releia a secção da média aparada até a diferença entre média, mediana e média aparada ficar clara.
- leia Field e Wilcox (2017).
- volte às secções de bootstrap e estimadores-M.
- depois experimente o tutorial de Pressupostos e Diagnóstico, onde estas ideias aparecem como decisões concretas em R.
Quando já estiver confortável com esta introdução, Mair e Wilcox (2020) é uma boa ponte para WRS2. Wilcox e Rousselet (2018) mostram a mesma família de ideias noutra área científica. Sladekova e Field (2025) e Sladekova, Poupa e Field (2026) actualizam a discussão sobre o lugar destes métodos na prática científica.
18 Perguntas Para Ver Se Ficou Claro
- Uma observação extrema altera muito a média, mas pouco a mediana. O que nos diz isso sobre os dois estimadores?
- Por que uma média 20% aparada não é simplesmente «a média depois de apagar outliers»?
- Qual é a diferença entre trimming e um estimador-M?
- Em que situação poderíamos manter os coeficientes OLS e mudar apenas os erros-padrão?
- O que distingue um bootstrap não-paramétrico de um bootstrap paramétrico?
- Por que reamostrar peixes individuais pode estar errado quando o tratamento foi aplicado a tanques?
- Se OLS e uma regressão robusta dão resultados bastante diferentes, qual deveria ser a próxima pergunta?
19 Referências
Field, A. P., & Wilcox, R. R. (2017). Robust statistical methods: A primer for clinical psychology and experimental psychopathology researchers. Behaviour Research and Therapy, 98, 19–38. https://doi.org/10.1016/j.brat.2017.05.013
Mair, P., & Wilcox, R. R. (2020). Robust statistical methods in R using the WRS2 package. Behavior Research Methods, 52(2), 464–488. https://doi.org/10.3758/s13428-019-01246-w
Sladekova, M., & Field, A. P. (2025). Robust statistical methods and the credibility movement of psychological science. PeerJ, 13, e20043. https://doi.org/10.7717/peerj.20043
Sladekova, M., Poupa, V., & Field, A. P. (2026). Sources of bias in general linear models: Evaluating the analytic practice in psychological research. Royal Society Open Science, 13, 250076. https://doi.org/10.1098/rsos.250076
Wilcox, R. R., & Rousselet, G. A. (2018). A guide to robust statistical methods in neuroscience. Current Protocols in Neuroscience, 82, 8.42.1–8.42.30. https://doi.org/10.1002/cpns.41