Fundamentos da Inferência
Do acaso ao valor-p, ao erro-padrão e ao t
Na Filosofia da Estatística começámos pela pergunta: o que queremos que uma inferência estatística nos permita dizer? Vimos também que um valor-p é uma probabilidade condicional sob um modelo de referência, e não a probabilidade de uma hipótese ser verdadeira.
Agora abrimos a caixa matemática da abordagem que vamos usar neste curso: inferência frequentista. Começamos por um caso em que conseguimos mapear exactamente aquilo que o acaso produziria. Depois levamos a mesma lógica até às médias, ao erro-padrão e à distribuição t.
Fisher tornou célebre esta pergunta com a experiência da senhora que provava chá. Ela afirmava conseguir distinguir se o leite ou o chá tinham sido servidos primeiro. Acertar uma vez não provaria grande coisa: mesmo alguém sem essa capacidade acertaria algumas vezes. A pergunta interessante é outra: quantas vezes teria de acertar antes de o resultado começar a parecer difícil de explicar apenas pelo acaso?
No delineamento original, Fisher apresentou oito chávenas, quatro preparadas de cada forma, e a participante sabia que havia quatro de cada tipo. A distribuição de referência é, por isso, combinatória: entre as 70 maneiras de escolher quatro chávenas em oito, apenas uma acerta nas quatro. Não são oito ensaios de Bernoulli independentes.
Vamos pedir emprestada a pergunta de Fisher, mas simplificar o delineamento para perceber primeiro a lógica. Imaginemos uma tarefa de percepção com duas alternativas. Em cada ensaio, a pessoa ouve dois intervalos: num deles há um tom muito ténue misturado com ruído; no outro há apenas ruído. A posição do tom é aleatorizada. A pessoa tem de escolher em que intervalo ouviu o tom.
Se não conseguir detectar qualquer diferença, só lhe resta adivinhar. Como o tom pode estar em qualquer um dos dois intervalos com igual probabilidade, a probabilidade de acertar é exactamente .5. Depois de 10 ensaios independentes, podemos perguntar: quantos acertos seriam ainda compatíveis com puro palpite?
Uma moeda justa é o mesmo problema matemático, mas aqui o \(50/50\) vem directamente do delineamento experimental. É isso que queremos para introduzir o modelo nulo: \(H_0:p=.5\) é conhecido à partida, não estimado a partir dos dados.
Mas a lógica não depende de ser 50/50. Suponham que alguém tenta prever o resultado exacto de um dado justo. Há seis resultados possíveis. Se reduzirmos cada tentativa a «acertou» ou «não acertou», continuamos a ter uma variável binária, mas agora
\[ P(\text{acerto}\mid H_0)=\frac{1}{6}, \qquad P(\text{erro}\mid H_0)=\frac{5}{6}. \]
O que precisamos não é de duas possibilidades igualmente prováveis. Precisamos de conseguir dizer o que esperaríamos observar se o modelo de referência fosse adequado.
0 Quanto é Suficiente para Desconfiar do Acaso?
Um Modelo em Que Sabemos Exactamente o Que o Acaso Faz
Se não existe qualquer capacidade de discriminação, cada decisão tem duas alternativas e a probabilidade de acertar é .5. Para 10 decisões independentes, o número de respostas correctas, \(X\), segue então uma distribuição binomial:
\[ X \sim \operatorname{Binomial}(10,.5). \]
Como esta distribuição é discreta, conseguimos escrever todos os resultados que o acaso pode produzir e a probabilidade de cada um. Ainda não precisamos de um erro-padrão estimado nem de uma distribuição t.
Agora já podemos tornar a pergunta precisa. Se alguém acerta 6 em 10, não perguntamos apenas se 6 é maior do que 5. Perguntamos: se essa pessoa estivesse realmente ao nível do acaso, com que frequência obteríamos 6 ou mais acertos? O limite inclui o valor observado: contamos 6, 7, 8, 9 e 10.
Sob \(H_0:p=.5\),
\[ P(X\geq x_{obs}\mid H_0) = \sum_{k=x_{obs}}^{10}{10\choose k}(.5)^{10}. \]
Isso dá, num teste direccional para desempenho acima do acaso:
- 6 ou mais acertos: \(p=.377\);
- 7 ou mais: \(p=.172\);
- 8 ou mais: \(p=.055\);
- 9 ou mais: \(p=.011\);
- 10 em 10: \(p<.001\).
Reparem no que aconteceu. Não tivemos de saber quão boa a pessoa seria se tivesse uma capacidade real. Poderia acertar 60%, 70% ou 95% das vezes. Para esta pergunta, bastou especificar com precisão o que aconteceria se não houvesse capacidade nenhuma.
É esta a lógica de uma distribuição de referência. E a probabilidade que acabámos de calcular é um valor-p: sob o modelo nulo, qual é a probabilidade de obter um resultado tão extremo ou mais extremo do que aquele que observámos? No nosso exemplo de 6 acertos,
\[ p=P(X\geq 6\mid p=.5)=0.377. \]
Não há ainda nenhuma magia em .05. Primeiro construímos o mapa do que o acaso produz e localizamos nele o resultado observado. Mais abaixo veremos como uma regra como \(\alpha=.05\) se relaciona com esta área.
Se os dados forem muito pouco compatíveis com o modelo nulo, aprendemos que alguma coisa nesse modelo não descreve bem o processo que gerou os dados. Isso não nos diz automaticamente qual é a explicação correcta.
Talvez exista realmente a capacidade que estávamos a testar. Mas também pode haver uma pista involuntária, dependência entre ensaios, uma falha no delineamento, um problema de medição ou outra explicação que produza a mesma discrepância. A estatística ajuda-nos a detectar que há algo a explicar; a ciência continua a exigir que comparemos explicações alternativas.
O Modelo Nulo Também Tem de Fazer Sentido
Uma distribuição de referência só é útil se aquilo que colocámos no modelo nulo fizer sentido para o processo e para o delineamento.
Imaginem que queremos comparar praias com orientações diferentes. Se amostrarmos muitas mais praias de uma orientação do que de outra e depois compararmos simplesmente o número total de indivíduos de uma espécie, ou o número total de espécies que encontrámos, criámos uma diferença de esforço amostral antes mesmo de olhar para qualquer efeito ecológico.
O problema não se resolve escolhendo mecanicamente \(H_0\) como «números iguais». Precisamos de tornar as quantidades comparáveis de uma forma adequada à pergunta. Para abundância, isso pode significar comparar por unidade de esforço, modelar cada praia como unidade de observação ou incluir explicitamente exposição/esforço no modelo. Para riqueza específica, simplesmente dividir o total de espécies pelo número de praias pode não chegar: quanto mais amostramos, maior é a probabilidade de encontrar espécies raras. Podemos precisar de esforço padronizado, riqueza por unidade de observação, rarefacção/curvas de acumulação ou um modelo que represente explicitamente o processo de amostragem.
A escolha exacta depende da pergunta, da unidade de observação e do processo de amostragem.
A inferência começa, portanto, antes do valor-p: começa por perguntar qual seria uma comparação justa sob este delineamento?
Uma Inferência Deliberadamente Parcial
Há aqui uma característica da estatística frequentista que vale a pena tornar explícita. O teste não precisa de uma probabilidade a priori para a hipótese que estamos a testar. Isso não significa que ignoremos conhecimento anterior. Pelo contrário: precisamos dele para formular a pergunta, escolher um delineamento informativo, decidir o que medir, construir um modelo nulo plausível e interpretar o que encontrámos.
O ponto é mais estreito. Depois de especificarmos os dados, o modelo e o procedimento de teste, o resultado inferencial não depende de quanto o investigador acreditava na hipótese antes de fazer a experiência. Outro investigador, com crenças iniciais diferentes, obtém o mesmo valor-p se usar os mesmos dados e o mesmo procedimento.
Mayo (1997) chama a esta separação uma abordagem piecemeal da testagem. O teste estatístico responde a uma pergunta local sobre uma hipótese no contexto de um modelo experimental. Ligar essa resposta a uma afirmação científica mais ampla é outro passo; avaliar se os dados e o delineamento sustentam o modelo é ainda outro.
Isto também ajuda a perceber em que sentido um resultado frequentista pode atravessar melhor mudanças de contexto. Novos investigadores não precisam de herdar as crenças a priori dos autores para reproduzir a inferência estatística. Mas podem, legitimamente, reinterpretá-la se entretanto aprendermos que o delineamento tinha um problema, que a medição não significava o que pensávamos, ou que o modelo de referência era inadequado.
Há, porém, uma condição importante: passar um teste só conta se o teste tiver sido severo. Um valor-p pequeno não transforma automaticamente uma experiência fraca em boa evidência. Se o procedimento tinha pouca capacidade para revelar os erros que nos interessam, se o delineamento tornava demasiado fácil obter o resultado, ou se a experiência foi conduzida de uma forma que abriu explicações alternativas, o resultado pode acrescentar muito pouco.
É aqui que a ideia de severidade volta a ligar estatística e epistemologia. Na formulação de Mayo (2018), uma afirmação passa um teste severo quando os dados estão de acordo com ela e o teste teria, com elevada probabilidade, produzido um resultado menos de acordo com essa afirmação se ela fosse falsa. A afirmação tem, por assim dizer, de ter corrido um risco real de falhar.
Algumas partes dessa pergunta podem ser quantificadas com probabilidades de erro, poder e avaliações de severidade. Mas a avaliação não acaba num número. Temos também de perguntar se houve boa aleatorização, medições adequadas, dependências ignoradas, selecção de resultados, decisões analíticas tomadas depois de ver os dados, confundimento ou outras formas de tornar o teste fácil de passar. Mayo (2018) descreve precisamente a severidade como uma avaliação que não se reduz ao uso mecânico de uma medida formal.
Isto não reintroduz priors pela porta do cavalo. O conhecimento anterior entra como crítica do teste e interpretação do resultado, não como uma probabilidade atribuída à hipótese dentro do cálculo. Perguntamos: este resultado teria sido difícil de obter se a explicação que estamos a defender estivesse errada? Se a resposta for «não», aprendemos pouco, mesmo que o resultado pareça estatisticamente impressionante.
O teste é local; a ciência à volta dele não é. E a força da evidência depende de quão seriamente o teste poderia ter-nos mostrado que estávamos errados.
O caso binomial é especialmente simpático porque conseguimos obter esta distribuição exactamente. O passo seguinte é perceber como fazer o mesmo quando a nossa pergunta envolve uma variável quantitativa e uma média.
1 Da Amostra à População
Da População à Amostra
Mudemos agora de uma decisão binária para uma variável quantitativa. Partimos de uma população que não conseguimos observar por inteiro e recolhemos uma amostra. A inferência tenta fazer o caminho de regresso, da amostra para a população, sem esconder a incerteza dessa passagem.
A escala Love4Taylor varia de -5 a 5 e zero representa indiferença. A pergunta é: como podemos saber se, em média, as pessoas na população apreciam a música da Taylor Swift, se só observámos uma amostra?
Na nossa amostra, a média de Love4Taylor é 0.57. Isso descreve os participantes que observámos. Ainda não responde à pergunta sobre a população.
Se repetíssemos o estudo com outra amostra, obteríamos outra média. E outra. Mesmo que nada mudasse na população, as médias das amostras não seriam todas iguais.
É aqui que começa a inferência estatística: não basta saber o valor da estimativa; precisamos de saber quanto essa estimativa varia de amostra para amostra.
Distribuições: O Mapa da Inferência
Acabámos de usar uma distribuição para mapear exactamente os resultados possíveis sob puro acaso. Já usámos também distribuições para descrever dados: onde se concentram os valores, quanto variam e que forma têm. Agora precisamos de distinguir esses papéis.
Uma distribuição amostral descreve como uma estatística — por exemplo, uma média — variaria se repetíssemos o processo de amostragem muitas vezes. Uma distribuição de referência descreve os valores que uma estatística de teste poderia assumir sob uma hipótese e sob as restantes condições do modelo. A binomial do exemplo anterior já era uma distribuição de referência.
É essa mudança de papel que permite passar de «observámos esta média» para «quão surpreendente seria obter uma discrepância desta dimensão se \(H_0\) fosse verdadeira?».
A curva acima é apenas um lembrete visual. Na inferência, o objecto decisivo não é necessariamente a distribuição dos dados originais. Muitas vezes é a distribuição de uma estatística calculada sobre amostras possíveis.
O Teorema do Limite Central
Para a média, o Teorema do Limite Central dá-nos a ponte de que precisamos. Sob condições apropriadas, à medida que o tamanho da amostra aumenta, a distribuição da média amostral devidamente normalizada aproxima-se de uma distribuição normal. A população original não tem de se tornar normal; estamos a falar da distribuição das médias que obteríamos em muitas amostras.
A dispersão dessa distribuição é o erro-padrão. Se conhecêssemos o desvio-padrão populacional,
\[ SE_{\bar X}=\frac{\sigma}{\sqrt{N}}. \]
Como normalmente não conhecemos (), usamos o desvio-padrão da amostra, (s), para o estimar:
\[ SE_{\bar X}\approx\frac{s}{\sqrt{N}}. \]
No nosso exemplo,
\[ SE_{\bar X} = \frac{1.1}{\sqrt{50}} = 0.155. \]
Este número não descreve a dispersão das pessoas. Descreve a incerteza da média enquanto estimativa. Essa distinção é fundamental.
Podemos tornar essa ideia visível. No gráfico seguinte tratamos a amostra observada como uma população empírica apenas para fins de ilustração, retiramos muitas amostras com reposição e calculamos a média de cada uma. O objectivo não é substituir a teoria pelo bootstrap, mas tornar concreta a frase «distribuição das médias que obteríamos em muitas amostras».
A largura desta distribuição é precisamente o tipo de quantidade que o erro-padrão procura representar.
A visualização da Universidade de British Columbia permite alterar a distribuição da população e o tamanho da amostra e observar directamente o que acontece às médias de muitas amostras.
Link directo para a demonstração do Teorema do Limite Central
O CLT não transforma os dados originais numa distribuição normal e não existe um número mágico, como (N=30), a partir do qual todos os problemas desaparecem. A rapidez da aproximação depende da distribuição e do processo de amostragem; dependência, caudas muito pesadas e outras violações do modelo podem continuar a importar.
Nos modelos lineares, os resultados exactos sob erros normais e os resultados assintóticos fora desse caso exigem condições mais precisas do que «a amostra é grande». Voltaremos a isso no capítulo sobre pressupostos.
Do Erro-Padrão ao t
Agora já podemos perceber por que dividimos uma estimativa pelo seu erro-padrão.
Se a hipótese nula diz que a média populacional é zero, queremos saber a que distância a média observada está de zero na escala da variabilidade que esperamos para médias amostrais:
\[ t = \frac{\bar X-\mu_0}{SE_{\bar X}}. \]
No exemplo da Taylor Swift,
\[ t = \frac{0.57-0}{0.155} = 3.65. \]
Por outras palavras: a média observada está a cerca de 3.6 erros-padrão de zero.
É esta a razão conceptual para dividir pelo erro-padrão. Uma diferença de uma unidade pode ser enorme se estimamos a média com muita precisão e banal se a estimativa varia muito de amostra para amostra.
Quando estimamos o desvio-padrão a partir da própria amostra, esta estatística segue uma distribuição t sob as condições do modelo nulo. É aqui que a lógica do valor-p reaparece numa nova distribuição de referência.
Antes de calcular qualquer área, vale a pena colocar a estatística observada na distribuição que lhe dá significado.
O zero está no centro porque, sob \(H_0\), não esperamos uma discrepância sistemática. O valor observado mostra onde os dados nos colocaram nessa distribuição de referência.
O Valor-p é uma Área, Não Uma Etiqueta
A lógica é a mesma que vimos no exemplo binomial. A diferença é que agora a distribuição de referência é contínua e a estatística observada é t.
Imaginemos que a hipótese nula é verdadeira: a população é mesmo indiferente à Taylor Swift. Mesmo assim, amostras diferentes dariam valores de t diferentes. A distribuição t descreve quão frequentes seriam esses valores se repetíssemos o estudo sob \(H_0\) e se as restantes condições do modelo fossem satisfeitas.
O nosso valor observado foi t = 3.65. Num teste bilateral, o valor-p é a área nas duas caudas correspondente a valores pelo menos tão extremos como esse:
\[ p=P\left(|T|\geq |t_{obs}|\mid H_0\right). \]
Nos nossos dados,
\[ p=<0.001. \]
Isto não é a probabilidade de \(H_0\) ser verdadeira. É uma pergunta condicional: se \(H_0\) fosse verdadeira, que proporção da distribuição de resultados possíveis seria tão extrema ou mais extrema do que o resultado que observámos?
A área é a ideia importante. O computador faz a integração por nós.
Bilateral por Omissão, Unilateral Quando Há Razão
Se resultados nas duas direcções são substantivamente possíveis, usamos por omissão um teste bilateral. Não é uma lei sem excepções. É uma escolha que mantém aberta a possibilidade de os dados nos contradizerem também na direcção oposta àquela que esperávamos.
No mesmo valor observado, a diferença mecânica é simples. Um teste unilateral usa uma cauda; um teste bilateral conta resultados igualmente extremos nas duas direcções.
A diferença não é apenas «pôr ou tirar metade do valor-p». É uma diferença na pergunta que decidimos fazer.
O bilateral é uma boa escolha por omissão quando:
- ambas as direcções são possíveis em princípio;
- um efeito na direcção oposta seria cientificamente relevante;
- queremos que uma discrepância forte na direcção inesperada conte como evidência contra \(H_0\), em vez de desaparecer sob a etiqueta «não significativo na direcção prevista».
Um teste unilateral pode fazer sentido quando a pergunta é genuinamente direccional, essa direcção foi justificada antes de ver os dados e estamos dispostos a aceitar a consequência lógica: um resultado forte na direcção oposta não é tratado pelo teste da mesma maneira.
Esta lógica não pertence apenas ao teste t de uma média. A mesma decisão pode surgir para declives, contrastes e outros coeficientes. Por isso, não faz sentido tratar a unilateralidade como um privilégio natural de meia dúzia de testes de manual.
Uma previsão direccional pode ser cientificamente interessante sem obrigar a um teste unilateral. Quando o efeito oposto também teria significado, o teste bilateral mantém essa possibilidade visível: os dados podem contrariar a expectativa na direcção que não antecipámos.
() e o Valor-p Não São a Mesma Coisa
O nível \(\alpha\) é definido antes de observar o resultado como parte da regra de decisão. O valor-p é calculado depois de observar os dados.
Com \(\alpha=.05\) num teste bilateral, dividimos essa probabilidade pelas duas caudas. Os valores críticos são
\[ \pm t_{1-\alpha/2,\,df} = \pm 2.01. \]
Este gráfico responde a «que resultados decidimos considerar suficientemente incompatíveis com \(H_0\)?». O gráfico do valor-p responde a uma pergunta diferente: «quão longe nas caudas ficou o resultado que realmente observámos?».
Podemos agora comparar dois resultados na mesma distribuição de referência: o valor observado e um valor menor, \(t=1\). Em cada painel, a área sombreada é o valor-p bilateral. As linhas verticais pontilhadas continuam a marcar os limites definidos por \(\alpha=.05\).
No primeiro caso, p < \(\alpha\): o \(|t|\) observado fica para além do valor crítico. No segundo, \(t=\) 1 produz \(p=\) 0.322, portanto \(p>\alpha\), e o valor de t fica dentro da região não crítica.
A vantagem de mostrar os dois casos é que a relação deixa de parecer uma regra puramente verbal: quanto mais longe de zero fica \(|t|\), menor é a área de cauda; quando essa área passa a ser menor do que \(\alpha\), o valor de t também passou o valor crítico.
O Que São Graus de Liberdade?
A expressão parece mais misteriosa do que a ideia básica. Pensemos primeiro na média. Se conhecemos \(N\), a média e \(N-1\) observações, a última observação já não é livre: fica determinada pelas restantes.
Por exemplo, suponham quatro valores com média 10. A soma tem de ser 40. Se já conhecemos três valores,
\[ 8,\quad 9,\quad 11,\quad ? \]
o quarto só pode ser 12. Em geral,
\[ x_N = N\bar{x} - \sum_{i=1}^{N-1}x_i. \]
Mas, se conhecermos apenas \(N-2\) valores, isso já não chega. Se soubermos apenas que os dois primeiros são 8 e 9, os dois restantes têm de somar 23, mas podem ser 11 e 12, 10 e 13, 9 e 14, e assim por diante. Há ainda mais do que uma maneira de completar os dados.
Essa é a intuição de graus de liberdade: quantas peças de informação podem variar independentemente depois de impormos as restrições criadas pelas quantidades que estimámos. Quando estimamos uma média a partir de \(N\) observações, usamos uma dessas peças de informação. Restam
\[ df=N-1. \]
A mesma ideia aparece nos desvios em relação à média. Eles têm de satisfazer
\[ \sum_{i=1}^{N}(x_i-\bar{x})=0, \]
por isso, depois de conhecermos \(N-1\) desvios, o último fica determinado.
Nos modelos lineares, a ideia reaparece de forma mais geral. Num modelo de posto completo com \(N\) observações e \(p\) parâmetros estimados, os graus de liberdade residuais são \(N-p\). No teste t de uma média estimamos um parâmetro — a média — e por isso ficamos com \(N-1\).
Porque os Graus de Liberdade Mudam a Distribuição t?
A distribuição t não tem sempre a mesma forma porque estamos também a estimar a variabilidade a partir dos próprios dados. Com poucos graus de liberdade, essa estimativa é mais incerta e a distribuição tem caudas mais pesadas. À medida que os graus de liberdade aumentam, a estimativa estabiliza e a distribuição t aproxima-se da normal.
Assim, o mesmo valor de t pode corresponder a áreas de cauda diferentes quando muda a incerteza usada para construir a distribuição de referência. Os graus de liberdade não são decoração: fazem parte da ligação entre a estatística observada e o seu valor-p.
O Que o Valor-p Não É
O valor-p não é:
- \(P(H_0\mid D)\), a probabilidade de \(H_0\) ser verdadeira dados os dados;
- a dimensão do efeito;
- a importância prática ou científica do resultado;
- a probabilidade de o resultado «ter acontecido por acaso».
É uma área numa distribuição de referência construída sob \(H_0\). Para dizer algo sobre a dimensão e a relevância do efeito precisamos de olhar também para as estimativas, a sua incerteza e a pergunta científica.
Não precisam de saber integrar para seguir esta página. Este bloco mostra o que uma tabela ou uma função como pt() nos poupa de fazer à mão.
No exemplo binomial conseguimos somar as probabilidades dos resultados que contam como «tão extremos ou mais extremos». Num teste bicaudal discreto é ainda preciso definir cuidadosamente essa regra; nem todos os testes exactos bicaudais se reduzem simplesmente a duplicar uma cauda.
Numa distribuição contínua, a soma dá lugar a uma área. Suponham que um teste produziu \(t=2.50\) com 9 graus de liberdade. A densidade t com \(\nu\) graus de liberdade é
\[ f_\nu(x)= \frac{\Gamma\left(\frac{\nu+1}{2}\right)} {\sqrt{\nu\pi}\,\Gamma\left(\frac{\nu}{2}\right)} \left(1+\frac{x^2}{\nu}\right)^{-\frac{\nu+1}{2}}. \]
Num teste bicaudal, o valor-p é a área das duas caudas para além de \(\pm2.50\):
\[ p =2\int_{2.50}^{\infty}f_9(x)\,dx \approx .03386. \]
A integral pede-nos que somemos fatias infinitamente estreitas da curva. Uma aproximação manual começaria por escolher um limite \(b\), dividir o intervalo em \(m\) partes de largura \(\Delta x=(b-2.50)/m\), calcular a altura da densidade em muitos pontos e somar rectângulos ou trapézios:
\[ \int_{2.50}^{b} f_9(x)\,dx \approx \sum_{i=1}^{m} f_9(x_i)\,\Delta x. \]
Seria ainda necessário levar \(b\) suficientemente longe para que a área restante fosse desprezável, repetir o cálculo na outra cauda e controlar o erro da aproximação. Além disso, cada altura exige avaliar potências e a função gama que normaliza a densidade. É possível fazer estas contas por aproximações e relações recorrentes, mas não é uma operação prática para repetir em cada teste.
É aqui que as tabelas históricas entram. Alguém fazia antecipadamente o trabalho matemático para vários graus de liberdade e imprimia quantis ou pontos críticos. O utilizador já não calculava a área: procurava a linha dos seus graus de liberdade e comparava a estatística observada com os valores da tabela.
Por exemplo, para 9 graus de liberdade, uma tabela de pontos críticos dá aproximadamente
\[ t_{P=.05}=2.262,\qquad t_{P=.02}=2.821. \]
Como \(2.262<2.50<2.821\), sem avaliar directamente a integral já podemos escrever
\[ .02<P<.05. \]
Hoje pt() avalia a função de distribuição t com algoritmos numéricos e devolve uma probabilidade muito mais precisa do que aquela leitura da tabela:
O exemplo binomial do início também cabe numa linha de R; para 9 ou mais acertos em 10 tentativas:
pbinom(8, size = 10, prob = .5, lower.tail = FALSE)
# 0.01074219A tabela não muda a teoria. É outra camada de abstracção entre a área de probabilidade que queremos e a aritmética necessária para a obter.
Há uma discussão pedagógica legítima sobre quanto cálculo manual os estudantes devem fazer. Alguns docentes pedem que se calculem estatísticas como \(t\) ou \(F\) à mão e depois se consultem tabelas, porque consideram que isso desenvolve intuição. É uma opção perfeitamente defensável.
Neste material escolhemos uma fronteira de abstracção diferente. Mostramos, por exemplo, como uma tabela de ANOVA pode ser construída passo a passo e como cada linha corresponde a uma comparação de modelos, porque essa decomposição ajuda a compreender o raciocínio estatístico. Mas não exigimos que os estudantes integrem manualmente a densidade t ou F para obter a área de cauda.
Isto não é uma afirmação de que esta fronteira seja a única correcta. Mesmo cursos muito orientados para cálculo manual costumam parar algures: frequentemente calculam a estatística e depois usam uma tabela que já incorpora integrais, aproximações ou outras contas mais profundas. Outros cursos vão mais longe e fazem também essa matemática. Toda a disciplina escolhe alguma coisa para abrir e alguma coisa para tratar como caixa preta. A questão pedagógica é que camada vale a pena abrir para o objectivo de aprendizagem em causa.
A Mesma Lógica Reaparece nos Modelos
No caso contínuo usámos uma média porque permite ver toda a mecânica sem demasiadas peças ao mesmo tempo. Mas a sequência não é específica de um teste t:
- definimos uma estimativa ou discrepância;
- medimos a sua incerteza;
- construímos uma estatística de teste;
- identificamos a distribuição de referência sob \(H_0\);
- localizamos a estatística observada nessa distribuição;
- calculamos uma área de cauda e, quando faz parte da regra escolhida, comparamo-la com \(\alpha\).
Nos capítulos seguintes, a estimativa pode ser um declive, um contraste, uma diferença entre modelos ou um termo de interacção. A linguagem muda; esta espinha dorsal permanece.
2 O Que Reter
Começámos por situações em que a distribuição de referência podia ser calculada exactamente. Isso deixou visível a ideia central antes de introduzir o CLT: especificamos o que esperaríamos sob um modelo nulo plausível e perguntamos quão extremo é o resultado observado nesse mapa de possibilidades. Esse modelo pode implicar \(p=.5\), \(p=1/6\) ou outra probabilidade qualquer; o valor tem de vir do processo e do delineamento, não de uma convenção.
A inferência acrescenta uma pergunta à descrição: quanto poderia variar a nossa estimativa se repetíssemos o processo que a produziu? A distribuição amostral representa essa repetição; o erro-padrão resume a variabilidade da estimativa; uma estatística como t exprime a discrepância observada nessa escala; e o valor-p é uma área numa distribuição de referência construída sob o modelo nulo.
O ponto não é decorar a sequência «calcular t, obter p». É conseguir ver a cadeia completa:
amostra → estimativa → erro-padrão → estatística de teste → distribuição de referência → área de cauda → decisão e interpretação.
Por omissão, usamos testes bilaterais quando ambas as direcções podem ensinar-nos alguma coisa. \(\alpha\) é uma regra definida antes de observar o resultado; o valor-p é a área determinada pela estatística que observámos. Nenhum deles substitui a estimativa do efeito ou o juízo científico sobre a sua importância.
Para regressão, ANOVA, ANCOVA e interacções, continue em Comparação de Modelos. Para regressar às diferenças entre Fisher, Neyman–Pearson, Bayesianismo e teste severo, volte a Filosofia da Estatística.