Delineamento da Investigação

Como construir comparações que dêem trabalho às nossas hipóteses

Delineamento
Métodos de Investigação
Psicologia
Biologia
Delineamento como construção de testes informativos: tornar explicações erradas difíceis de sustentar, preservar sensibilidade a efeitos reais e ligar hipóteses a comparações, unidades, medição e replicação.
Autores
Afiliações

João O. Santos

ISPA

Cristina Mendonça

ISPA; WJCR

Vitória Melita

FP-UL

Mariona Pascual Peñas

UIB

João Raposo

ISPA

Marta Barros

FP-UL

0 Delinear É Construir Um Teste

É tentador começar pelo fim: «isto é uma ANOVA ou uma regressão?». Ainda não. Antes de escolher uma análise, precisamos de construir uma comparação que possa ensinar-nos alguma coisa se a hipótese estiver errada e também se estiver certa.

Na Filosofia da Ciência vimos que uma hipótese ganha valor quando corre risco. Na Filosofia da Estatística, a ideia de teste severo torna isso mais preciso: um resultado favorável é informativo quando o procedimento teria tido uma boa oportunidade de mostrar um problema caso a afirmação estivesse errada de uma forma relevante (Mayo & Spanos, 2006; Mayo, 2018).

O delineamento é onde começamos a comprar essa severidade. Tentamos fazer duas coisas ao mesmo tempo:

  1. dificultar a passagem de uma explicação errada — reduzir confundimento, enviesamento, pseudorreplicação, efeitos de ordem, artefactos de medição e outras maneiras de produzir um resultado favorável sem que a hipótese seja a explicação;
  2. preservar a capacidade para detectar uma discrepância real — reduzir ruído desnecessário, medir com sensibilidade, usar réplicas genuínas e criar comparações capazes de revelar efeitos cientificamente relevantes.

Estas duas metas correspondem, de forma aproximada, às duas direcções de erro que reaparecem na estatística: uma ideia falsa parecer passar e uma ideia ou efeito real não conseguir aparecer. Não são exactamente o mesmo que erro de Tipo I e Tipo II — esses termos pertencem a procedimentos estatísticos formais — mas a analogia é útil para pensar o delineamento.

Nenhum estudo elimina todas as fragilidades. Tempo, dinheiro, acesso, bem-estar dos participantes ou animais, capacidade dos instrumentos e simples logística obrigam-nos a escolher. Por isso, além de perguntar «qual é a falha?», perguntem sempre em que direcção esta falha empurra o teste?

Uma falha que torna um efeito real mais difícil de detectar não explica, por si só, um resultado positivo que apareceu apesar dela. Mas isso não a torna uma virtude: também reduz sensibilidade, pode tornar resultados negativos pouco informativos e pode tornar a estimativa mais instável. O objectivo não é tornar a hipótese difícil de confirmar a qualquer preço. É tornar uma hipótese falsa difícil de fazer passar, sem tornar o estudo incapaz de detectar aquilo que realmente queremos aprender.

Esta página faz a ponte entre filosofia, delineamento e análise. A lógica é a mesma em psicologia, biologia, neurociência ou física; mudam as unidades. Uma pessoa pode ser substituída por um peixe, um tanque, uma parcela, uma preparação ou um aparelho. A pergunta recorrente será: que comparação criámos, que erros ela exclui e que erros ainda deixa passar?

1 Duas Maneiras de Um Delineamento Falhar

Podemos usar uma grelha simples antes de entrar nos nomes clássicos dos delineamentos.

Fragilidade Pode tornar mais fácil… Consequência principal
confundimento uma explicação errada produzir o padrão esperado apoio espúrio
enviesamento de selecção grupos diferirem antes da exposição apoio espúrio ou generalização errada
efeito de ordem não controlado posição ser confundida com condição apoio espúrio
medição enviesada o instrumento favorecer uma condição apoio espúrio
muita variabilidade irrelevante um efeito real ficar escondido menor sensibilidade
medida pouco fiável o sinal ser diluído por ruído menor sensibilidade
poucas réplicas genuínas diferenças reais serem difíceis de distinguir da variação menor sensibilidade e estimativas instáveis
controlo excessivamente heterogéneo aumentar a variância sem responder a outra pergunta menor sensibilidade

A tabela é uma heurística, não uma classificação universal. A mesma decisão pode ter consequências diferentes consoante o mecanismo e a pergunta. O ponto é obrigar-nos a perguntar como uma limitação poderia produzir o resultado que observámos.

DicaUma Regra de Diagnóstico

Quando encontrarem uma fraqueza no estudo, perguntem:

  1. Pode esta fraqueza criar um efeito quando não existe?
  2. Pode esconder um efeito que existe?
  3. Pode alterar a magnitude ou a direcção do efeito?
  4. Pode limitar apenas a generalização, sem destruir a comparação interna?

Uma crítica metodológica torna-se muito mais informativa quando especifica a direcção do erro em vez de apenas listar «limitações».

Primeiro Mostrar Que Há Um Fenómeno

Em fases iniciais de uma investigação, podemos querer sobretudo saber se existe algum fenómeno replicável que valha a pena explicar. Nessa fase, um delineamento sensível é especialmente importante: se a manipulação é fraca, a medida é ruidosa ou há poucas réplicas, um resultado negativo diz pouco.

Quando aparece um sinal, a pergunta muda. Queremos saber se a hipótese específica explica o fenómeno melhor do que alternativas plausíveis. Entram controlos mais exigentes, manipulações mais específicas, medições independentes, replicações e testes que discriminem explicações concorrentes.

Descoberta e teste não são mundos separados. Mas podem pôr pesos diferentes sobre sensibilidade e discriminação entre explicações. Um bom programa de investigação costuma precisar das duas.

2 Da Pergunta à Comparação

Método, Delineamento e Análise

Estas três coisas aparecem muitas vezes na mesma frase e depois pagamos a conta mais tarde.

  • Método é a forma de obter observações: questionário, experiência, amostragem de campo, registo fisiológico, imagem, sensor, entrevista.
  • Delineamento é a arquitectura da comparação: o que varia, em que unidade, o que se repete, o que fica junto e em que ordem.
  • Análise é a representação matemática dessa comparação e da sua incerteza quando os dados já existem.

A distinção importa porque não podemos transformar um delineamento numa coisa diferente escolhendo outro comando no R.

Um exemplo ajuda. Imaginem que medimos o bem-estar dos leitores e quantas secções deste livro já leram. Talvez a leitura do NRB destrua lentamente a alegria de viver. Ou talvez só quem já estava muito mal tenha a perseverança necessária para chegar à secção 47. A associação pode ser exactamente a mesma. A história causal não é.

Uma regressão não faz magia. Se apenas observámos duas variáveis, escrever lm() não introduz uma manipulação que nunca aconteceu. Um estudo observacional longitudinal pode ajudar-nos a estabelecer ordem temporal e a eliminar algumas histórias. Não elimina todas.

Quando o Mundo Faz a Alocação

Às vezes acontece alguma coisa fora do controlo do investigador que cria grupos muito semelhantes com exposições diferentes. Uma alteração de política, uma lotaria, uma regra administrativa, uma mudança ambiental ou outro acontecimento pode aproximar a comparação da lógica de uma experiência. Em economia estes casos são muitas vezes chamados experiências naturais (Angrist & Krueger, 2001). A ideia também é útil em psicologia, epidemiologia e biologia.

A palavra experiência pode enganar. O investigador não fez a alocação. Temos de justificar por que razão a exposição criada pelo acontecimento ficou suficientemente desligada das características anteriores das unidades. É essa hipótese de uma alocação «como se fosse aleatória» que dá força ao delineamento (Craig et al., 2017).

É fácil imaginar a versão biológica. Uma tempestade pode abrir uma clareira numa parcela e deixar uma parcela próxima quase intacta. A comparação torna-se interessante se houver boas razões para pensar que o impacto da tempestade não escolheu a parcela em função do resultado que queremos estudar. Psicologia e saúde pública encontram oportunidades semelhantes em mudanças de regras, políticas ou acesso a serviços. A natureza fez a intervenção. Nós ainda temos de fazer o trabalho de delineamento.

Empírico também é mais amplo do que experimental. Um eclipse, uma população selvagem ou uma coorte podem fornecer evidência empírica sem qualquer manipulação feita pelo investigador. A ciência dá um lugar especial à evidência empírica mesmo quando uma teoria parece simples, elegante ou bonita. Strevens (2020) chama a esta disciplina da argumentação científica a «regra de ferro».

Código
flowchart LR
    O["Observacional<br/>medimos A e C"] --> OA["estimamos associação<br/>e declaramos pressupostos"]
    N["Experiência natural<br/>o mundo cria uma exposição"] --> NA["avaliamos se a comparação<br/>se aproxima de uma alocação aleatória"]
    E["Experimental<br/>manipulamos A"] --> R["alocação aleatória<br/>quando possível"]
    R --> EA["comparamos resultados<br/>depois da manipulação"]

flowchart LR
    O["Observacional<br/>medimos A e C"] --> OA["estimamos associação<br/>e declaramos pressupostos"]
    N["Experiência natural<br/>o mundo cria uma exposição"] --> NA["avaliamos se a comparação<br/>se aproxima de uma alocação aleatória"]
    E["Experimental<br/>manipulamos A"] --> R["alocação aleatória<br/>quando possível"]
    R --> EA["comparamos resultados<br/>depois da manipulação"]

Três formas gerais de produzir uma comparação.

Uma Associação, Várias Histórias

Suponhamos que observamos uma associação entre (A) e (C). Há várias histórias possíveis.

Código
flowchart LR
    subgraph d["Efeito directo"]
      A1["A"] --> C1["C"]
    end
    subgraph r["Causalidade inversa"]
      C2["C"] --> A2["A"]
    end
    subgraph u["Causa comum"]
      U["U"] --> A3["A"]
      U --> C3["C"]
    end
    subgraph m["Mediação"]
      A4["A"] --> B4["B"] --> C4["C"]
    end

    style d fill:transparent
    style r fill:transparent
    style u fill:transparent
    style m fill:transparent

flowchart LR
    subgraph d["Efeito directo"]
      A1["A"] --> C1["C"]
    end
    subgraph r["Causalidade inversa"]
      C2["C"] --> A2["A"]
    end
    subgraph u["Causa comum"]
      U["U"] --> A3["A"]
      U --> C3["C"]
    end
    subgraph m["Mediação"]
      A4["A"] --> B4["B"] --> C4["C"]
    end

    style d fill:transparent
    style r fill:transparent
    style u fill:transparent
    style m fill:transparent

A mesma associação pode nascer de estruturas causais diferentes.

Na mediação, (A) altera (B) e (B) altera (C). Uma cadeia causal pode ter muitos passos e vários caminhos em paralelo. A moderação faz outra pergunta. Queremos saber se o efeito de (A) muda consoante uma terceira variável (Preacher, 2015).

Também pode haver ciclos ao longo do tempo. (A_t) afecta (B_{t+1}), que depois afecta (A_{t+2}). Os diagramas ajudam a tornar a hipótese visível. As setas continuam a ser hipóteses sobre o mundo (Greenland, Pearl & Robins, 1999).

O Que Já Sabemos Também Conta

Uma associação medida no mesmo momento deixa muitas histórias abertas. O resto do que sabemos também entra no raciocínio.

Imaginem que sexo cromossómico está associado a uma preferência de cor medida anos depois. A própria ordem do desenvolvimento torna biologicamente incoerente a história «preferência de cor adquirida anos depois → sexo cromossómico do embrião». Isso ainda deixa muitas explicações possíveis para a associação. Socialização, expectativas, cultura e experiências podem estar no caminho.

É assim que uma investigação observacional pode contribuir para um argumento causal. Juntamos a associação observada à ordem temporal, conhecimento substantivo, estudos anteriores, mecanismos plausíveis e comparações adicionais. Confundimento, selecção, erro de medição e causalidade inversa continuam a merecer atenção (D’Onofrio et al., 2020).

O Que Ganhamos Com Uma Experiência

Numa experiência fazemos variar deliberadamente uma condição. A manipulação acontece antes do resultado, por isso ganhamos precedência temporal para essa parte da história causal. Quando a alocação é aleatória, ganhamos também uma forma muito forte de tornar os grupos comparáveis relativamente ao que aconteceu antes da experiência.

Código
flowchart LR
    R["alocação aleatória"] --> A["manipulação de A"]
    A --> B["processo B<br/>(possível mediador)"]
    B --> C["resultado C"]
    A --> C

flowchart LR
    R["alocação aleatória"] --> A["manipulação de A"]
    A --> B["processo B<br/>(possível mediador)"]
    B --> C["resultado C"]
    A --> C

A lógica causal mínima de uma experiência aleatorizada.

Ainda há trabalho a fazer. A manipulação pode mexer em mais do que uma coisa. Podem existir desistências, incumprimento ou contaminação entre condições. A medição também pode alterar o que estamos a medir. E o efeito pode depender muito das pessoas, organismos, estímulos, aparelhos ou locais escolhidos.

Uma verificação da manipulação pergunta se a intervenção mexeu realmente no processo que pretendíamos alterar. Se uma manipulação de ansiedade não alterou ansiedade, perdeu-se uma premissa importante do teste da hipótese. Estas verificações fazem parte do controlo de validade do delineamento (Fiedler, McCaughey & Prager, 2021). Convém pensar também onde e como são medidas, porque a própria pergunta pode influenciar o participante.

Amostragem e Alocação Respondem a Perguntas Diferentes

Há duas setas que os manuais às vezes desenham demasiado depressa.

Amostragem leva-nos da população para as unidades que observámos. Alocação leva essas unidades para as condições do estudo. São problemas diferentes.

Uma amostra de conveniência pode limitar bastante a generalização e, ainda assim, permitir uma comparação interna forte se a alocação às condições tiver sido bem feita. O inverso também acontece: uma amostra enorme não salva uma comparação em que tratamento e outra diferença importante ficaram colados (Moher et al., 2010).

Por isso convém separar duas perguntas:

  • A intervenção reduz o tempo de resposta nesta população de estudantes? Aqui interessa muito quem entrou na amostra.
  • Entre as pessoas que recrutámos, a intervenção produz uma diferença face ao controlo? Aqui interessa muito como chegaram às condições.

Antes de analisar, consigam desenhar os dois caminhos: de onde vieram as unidades e como chegaram à condição que receberam.

3 Unidades e Replicação

A Hierarquia Dos Dados

Unidade Experimental e Réplica

A unidade experimental é a menor unidade que recebeu uma condição de forma independente para a pergunta em causa. O número dessas unidades dá o número de réplicas genuínas da comparação (Zimmerman et al., 2021).

Uma linha da base de dados pode ser uma réplica, uma subamostra ou uma medição repetida. O formato do ficheiro não decide isso.

  • Se a intervenção é atribuída a cada pessoa, a pessoa pode ser a unidade experimental.
  • Se a temperatura é aplicada ao tanque, o tanque é a unidade experimental mesmo que meçamos muitos peixes.
  • Se comparamos locais inteiros, os locais são as réplicas da comparação entre locais. Muitos quadrados dentro de um local descrevem melhor esse local.

A pergunta «o que representa uma linha?» ajuda. Depois pergunte que linhas partilham a mesma unidade e a que nível varia o preditor.

Subamostra e Pseudorreplicação

Uma subamostra é uma observação recolhida dentro de uma unidade que já foi amostrada ou alocada. Podem ser vários peixes no mesmo tanque, várias células do mesmo animal ou várias respostas da mesma pessoa. Essas observações ajudam a estimar a variação dentro da unidade (Lazic, 2010).

pseudorreplicação quando tratamos observações dependentes como réplicas independentes. Quarenta peixes em quatro tanques continuam a dar quatro tanques para uma pergunta sobre o tratamento aplicado ao tanque.

As subamostras continuam a ser úteis. Podemos resumir por unidade ou modelar a hierarquia. Um modelo misto reconhece agrupamento. A quantidade de unidades que receberam o tratamento continua a ser uma propriedade do delineamento (Zimmerman et al., 2021).

AvisoContar Linhas Pode Enganar

Façam um esquema como peixe → tanque → tratamento ou resposta → participante → condição. Acrescentar peixes ao mesmo tanque dá mais informação sobre esse tanque. Para comparar mais tanques, precisamos de mais tanques.

4 Estruturas de Delineamento

Formas Clássicas de Delineamento

Os nomes clássicos são atalhos para estruturas que aparecem em muitas áreas. Vale a pena conhecê-los porque ajudam a ver onde está a variação.

Entre Unidades, Dentro da Unidade e Mistos

Num factor entre unidades (between-subjects em psicologia), unidades diferentes recebem níveis diferentes. Num factor dentro da unidade (within-subjects ou medidas repetidas), a mesma unidade passa por vários níveis. Um delineamento misto combina ambos.

Código
flowchart TB
    subgraph b["Entre unidades"]
      P1["Pessoa 1"] --> A1["A"]
      P2["Pessoa 2"] --> B1["B"]
    end
    subgraph w["Dentro da unidade"]
      P3["Pessoa 3"] --> A2["A"]
      P3 --> B2["B"]
    end
    subgraph mx["Misto"]
      G1["Grupo 1"] --> P4["Pessoa"]
      G2["Grupo 2"] --> P5["Pessoa"]
      P4 --> A3["A"]
      P4 --> B3["B"]
      P5 --> A4["A"]
      P5 --> B4["B"]
    end

    style b fill:transparent
    style w fill:transparent
    style mx fill:transparent

flowchart TB
    subgraph b["Entre unidades"]
      P1["Pessoa 1"] --> A1["A"]
      P2["Pessoa 2"] --> B1["B"]
    end
    subgraph w["Dentro da unidade"]
      P3["Pessoa 3"] --> A2["A"]
      P3 --> B2["B"]
    end
    subgraph mx["Misto"]
      G1["Grupo 1"] --> P4["Pessoa"]
      G2["Grupo 2"] --> P5["Pessoa"]
      P4 --> A3["A"]
      P4 --> B3["B"]
      P5 --> A4["A"]
      P5 --> B4["B"]
    end

    style b fill:transparent
    style w fill:transparent
    style mx fill:transparent

Três estruturas frequentes. Pessoa pode ser substituída por animal, tanque, preparação ou aparelho.

Dentro da unidade, cada pessoa, animal ou preparação serve em parte como o seu próprio controlo. Isso é especialmente útil quando existe muita variação entre unidades. O preço pode aparecer em forma de fadiga, aprendizagem, habituação ou efeitos de ordem.

Entre unidades, esses efeitos de ordem desaparecem da comparação principal. Precisamos então de informação suficiente para lidar com as diferenças entre unidades.

Nos delineamentos mistos, uma variável pode variar entre unidades e outra dentro delas. Dois grupos podem receber intervenções diferentes e todos serem medidos antes e depois. Um animal pode receber um tratamento e ser observado em vários momentos. Um tanque pode receber uma temperatura e os organismos serem medidos ao longo de dias.

Onde Vale a Pena Repetir?

A pergunta geral é onde está a variação que mais importa para a nossa inferência?

Em psicologia podemos escolher entre mais participantes, mais ensaios por participante ou mais estímulos. Se as pessoas diferem muito e cada pessoa é estável, mais participantes ajudam bastante. Se os estímulos variam muito, meia dúzia de itens pode deixar o resultado preso a esses exemplos. Mais ensaios ajudam quando existe muito ruído dentro da mesma pessoa (Westfall, Judd & Kenny, 2015).

A mesma lógica aparece em ecologia. Cinquenta quadrados (quadrats) dentro da mesma pequena região descrevem essa região com detalhe. Cinco quadrados em dez regiões dizem muito mais sobre variação entre regiões. A escolha depende da pergunta. Se queremos estimar a cobertura local, concentrar medições pode ser sensato. Se queremos generalizar para a costa, precisamos de replicação ao nível da costa.

Em neurociência, mais células por animal dão informação sobre variação celular. Mais animais dão informação sobre variação entre animais. Em física, muitas leituras do mesmo sensor reduzem um tipo de incerteza e vários aparelhos ou lotes podem revelar outro.

Há sempre custos. Mais ensaios podem trazer fadiga ou habituação. Mais locais aumentam logística. Mais materiais podem alongar a experiência. O número total de linhas raramente resume esta decisão.

Delineamentos Factoriais

Um delineamento factorial cruza dois ou mais factores. Um factorial (2 ) dá-nos quatro combinações:

B1 B2
A1 A1 + B1 A1 + B2
A2 A2 + B1 A2 + B2

Isto compra-nos uma pergunta que dois estudos separados não conseguem responder da mesma maneira: a diferença entre A1 e A2 muda quando passamos de B1 para B2? Essa diferença de diferenças é a interacção.

Se A e B aparecem na nossa teoria precisamente porque admitimos que um possa mudar o efeito do outro, a interacção não é um extra para experimentar no fim. O delineamento tem de conter as quatro células e a análise deve continuar a permitir essa interacção quando perguntamos por diferenças médias de A ou de B.

Por outras palavras, podemos perguntar «há, em média, uma diferença entre A1 e A2?» sem obrigar primeiro o modelo a assumir que essa diferença é exactamente igual em B1 e B2. Mais à frente, esta será uma das razões para preferirmos testes Tipo III em modelos factoriais com interacções.

Também não precisamos de cruzar tudo com tudo. Cada factor acrescenta células, custos e interacções possíveis. O objectivo é incluir as combinações de que a teoria precisa, não construir a maior ANOVA que caiba no papel (Collins, Dziak & Li, 2009).

Bloqueio, Emparelhamento e Factores em Níveis Diferentes

Dia de recolha, lote, gaiola, local, aparelho ou experimentador podem introduzir variação previsível. Bloquear significa formar conjuntos comparáveis com base nessa fonte e randomizar condições dentro de cada conjunto. Isso pode evitar uma confusão desnecessária e melhorar a precisão (Reynolds, 2026).

No emparelhamento, juntamos unidades semelhantes numa característica relevante antes da alocação. A estratégia é útil quando essa característica prediz bem o resultado.

Num delineamento de parcelas subdivididas (split-plot), factores diferentes são manipulados em níveis diferentes. Podemos aplicar temperatura ao tanque inteiro e outra intervenção a subunidades dentro do tanque. Cada factor tem a sua unidade experimental. A análise precisa de respeitar essas duas escalas de randomização (Reynolds, 2026).

Ordem, Contrabalançamento e Quadrados Latinos

Quando a mesma unidade passa por várias condições, a ordem pode entrar na comparação. Se toda a gente fizer A → B → C → D, condição e posição ficam coladas uma à outra.

Com poucas condições podemos usar todas as ordens. O número de ordens cresce muito depressa. Um quadrado latino reduz o problema e coloca cada condição uma vez em cada posição.

Sequência 1.ª 2.ª 3.ª 4.ª
1 A B C D
2 B C D A
3 C D A B
4 D A B C

Este quadrado equilibra a posição. Alguns efeitos de transporte dependem do par de condições consecutivas e precisam de contrabalançamento adicional (Reese, 1997).

O objectivo aqui é perceber que a ordem faz parte do delineamento. Randomização, bloqueio e contrabalançamento resolvem problemas diferentes.

5 Medição e Evidência

Medir Também É Delinear

Uma variável não aparece pronta no mundo com o nome da coluna que vai ter no ficheiro. Temos de decidir o que conta como uma observação e que comparação essa observação permite.

Se chamamos «crescimento» à diferença de massa entre dois momentos, precisamos de confiar na balança, nos momentos escolhidos e na ideia de que essa diferença representa o processo que nos interessa. Se chamamos «ansiedade» a uma pontuação, há outra cadeia de decisões. E se contamos indivíduos, registamos uma proporção ou medimos um tempo, mudam também os modelos que fazem sentido.

Stevens (1946) distinguiu quatro famílias que continuam a aparecer em muitos manuais:

  • Nominal: categorias sem ordem, como espécie ou grupo de tratamento.
  • Ordinal: categorias ordenadas, como uma classificação de severidade.
  • Intervalo: diferenças interpretáveis com um zero convencional, como temperatura Celsius.
  • Razão: diferenças e razões interpretáveis, como duração ou massa.

É uma orientação, não uma máquina que escolhe automaticamente o teste estatístico. A validade da medida, a sensibilidade, a distribuição produzida pelo procedimento e a pergunta científica continuam a importar.

Voltar à Severidade

Chegados à medição, podemos recuperar a pergunta que abriu o capítulo: se a hipótese estivesse errada de uma maneira relevante, este estudo teria uma boa oportunidade de o mostrar?

Se a teoria prevê que privação de sono reduz atenção, horário, expectativas, motivação e fadiga geral podem imitar esse resultado. Em biologia, qualidade da água ou densidade podem imitar um efeito de temperatura. Um bom delineamento antecipa essas explicações e cria comparações que as separem.

Mas o outro lado também conta: uma medida ruidosa, uma manipulação fraca ou poucas réplicas podem tornar um efeito real difícil de detectar. Nesse caso, um resultado negativo não constitui um teste exigente da ausência do fenómeno.

Antes de tudo isto precisamos ainda de hipóteses que valham a pena testar. McGuire (1997) reúne estratégias para gerar hipóteses e procurar limites, moderadores e explicações alternativas. Gerar uma ideia é o início; o delineamento decide se conseguimos pô-la realmente à prova.

A Mesma Lógica Em Áreas Diferentes

Os nomes mudam e a pergunta estrutural mantém-se.

  • Psicologia. A condição varia entre pessoas ou dentro da pessoa? Os estímulos também são uma amostra? A ordem cria aprendizagem?
  • Biologia e ecologia. O tratamento varia por organismo, tanque, local ou parcela? Quantos quadrados estão dentro de cada região?
  • Neurociência. O tratamento pode variar por animal enquanto células, eléctrodos e ensaios se repetem dentro dele. Dez mil neurónios em três animais continuam a vir de três animais para a comparação ao nível do animal (Lazic, 2010).
  • Física. Um eclipse pode testar uma previsão sem ser manipulado. Noutras experiências podemos variar campos, materiais, energia ou geometria e controlar directamente a ordem da intervenção e da medição.

Cada delineamento dá controlo sobre algumas coisas e deixa outras abertas. As perguntas úteis são que explicações concorrentes conseguimos separar com esta estrutura, que erros continuam capazes de produzir um falso sinal e que efeitos reais podemos não conseguir detectar?

6 Antes da Análise

Antes de Abrir o R

Se conseguirem responder a estas perguntas, a escolha da análise fica muito menos misteriosa.

  1. Qual é a comparação? Estamos a descrever, prever ou a tentar aprender o que aconteceria se mudássemos alguma coisa?
  2. De onde vêm as unidades? Que população queremos representar e como foi feita a amostragem?
  3. Onde varia a condição? Pessoa, peixe, tanque, local, estímulo? É aí que devemos começar a procurar a réplica.
  4. O que se repete ou agrupa? Há várias medições da mesma unidade, subamostras, unidades aninhadas ou factores cruzados?
  5. Que histórias rivais continuam abertas? Confundimento, causalidade inversa, ordem, aprendizagem, fadiga, mediação ou moderação?
  6. O que medimos realmente? A medida é válida para a pergunta? A própria medição pode alterar o processo?
  7. Que padrão poria a hipótese em dificuldades? E o delineamento tinha uma oportunidade razoável de o produzir se a hipótese estivesse errada?
  8. Em que direcção empurram as limitações? Podem criar um falso sinal, esconder um sinal real, alterar a magnitude, ou sobretudo limitar a generalização?
  9. Onde está a variabilidade? Que parte é sinal da pergunta científica e que parte é ruído, heterogeneidade ou dependência que a análise terá de representar?
  10. Há uma interacção na teoria? Se sim, o delineamento e o tamanho da amostra foram pensados para essa pergunta, ou apenas para efeitos principais?

Só depois chegamos à análise. A estatística representa a incerteza de uma comparação que o delineamento já criou; não cria réplicas, randomização ou generalização retroactivamente.

Para medidas repetidas e agrupamentos, vejam o tutorial prático e o capítulo teórico. Para os modelos que representam estas comparações, continuem em Comparação de Modelos.

7 Síntese

Um bom delineamento cria uma comparação em que uma explicação errada tem oportunidades reais de falhar e em que um efeito cientificamente relevante continua a ter oportunidade de aparecer. Para avaliar isso, precisamos de saber qual é a unidade experimental, onde ocorre a variação, o que se repete, como as unidades chegaram ao estudo, o que medimos e que explicações concorrentes continuam abertas.

É aqui que delineamento encontra estatística. Parte da variabilidade vem do fenómeno que queremos estudar; parte vem de pessoas, organismos, estímulos, locais, aparelhos, momentos e erro de medição. A Estatística Descritiva ajuda-nos a vê-la, a Filosofia da Estatística explica que erros queremos controlar e Fundamentos da Inferência mostra como a variabilidade amostral entra matematicamente na inferência.

A análise pode representar a incerteza da estrutura que criámos. Não pode criar retroactivamente randomização, replicação, sensibilidade ou generalização que o delineamento nunca teve.

8 Exercícios

  1. Para Que Lado Falha? Escolha três limitações de um estudo — por exemplo, medida ruidosa, confundimento e amostra pequena. Para cada uma, explique se pode criar um falso sinal, esconder um efeito real, alterar a magnitude ou sobretudo limitar a generalização. Diga também se essa limitação poderia explicar um resultado favorável observado.

  2. Observacional ou experimental? Um estudo mede horas de sono e atenção na mesma manhã. Liste quatro histórias compatíveis com a associação. Proponha depois uma experiência que esclareça uma delas.

  3. Experiência natural. Imagine que uma regra administrativa muda num lado de uma fronteira municipal e fica igual no outro. Que condições teriam de ser plausíveis para tratar essa diferença como uma experiência natural?

  4. Desenhe as setas. Represente (A C), (C A), uma causa comum (U), e (A B C). Diga que observação adicional ajudaria em cada caso.

  5. Mediação ou moderação? Para «temperatura altera metabolismo, que altera crescimento», identifique o mediador. Depois proponha uma variável que possa alterar a força do efeito da temperatura.

  6. Factorial ou duas experiências? Quer testar salinidade e temperatura, cada uma em dois níveis. Explique o que um (2 ) permite perguntar sobre a interacção.

  7. Misto. Dois grupos recebem treinos diferentes e todos são avaliados antes, depois e um mês mais tarde. Identifique o factor entre pessoas, o factor repetido e a interacção de maior interesse.

  8. Quadrado latino. Quatro condições A–D são aplicadas à mesma unidade. Explique o que o quadrado latino desta página equilibra e dê um exemplo de efeito de transporte que pode continuar por resolver.

  9. Onde repetir? Compare três decisões. Muitas medições na mesma pessoa, muitas pessoas com poucas medições, ou muitos estímulos. Faça a mesma comparação para muitos quadrados na mesma região e poucos quadrados em muitas regiões.

  10. Unidade experimental. Desenhe peixe → tanque → tratamento para 30 peixes em seis tanques. Identifique a unidade experimental, a réplica e a subamostra.

  11. Verificação da manipulação. Imagine uma manipulação de ansiedade. Proponha uma forma simples de confirmar que ela alterou ansiedade e pense onde colocaria essa verificação no procedimento.

9 Referências

Angrist, J. D., & Krueger, A. B. (2001). Instrumental variables and the search for identification: From supply and demand to natural experiments. https://doi.org/10.1257/jep.15.4.69

Collins, L. M., Dziak, J. J., & Li, R. (2009). Design of experiments with multiple independent variables. https://pmc.ncbi.nlm.nih.gov/articles/PMC2796056/

Craig, P., Katikireddi, S. V., Leyland, A., & Popham, F. (2017). Natural experiments: An overview of methods, approaches, and contributions to public health intervention research. https://doi.org/10.1146/annurev-publhealth-031816-044327

D’Onofrio, B. M., Lahey, B. B., Turkheimer, E., & Lichtenstein, P. (2020). Accounting for confounding in observational studies. https://doi.org/10.1146/annurev-clinpsy-032816-045030

Davies, G. M., & Gray, A. (2015). Don’t let spurious accusations of pseudoreplication limit our ability to learn from natural experiments. https://doi.org/10.1002/ece3.1782

Fiedler, K., McCaughey, L., & Prager, J. (2021). Quo vadis, methodology? The key role of manipulation checks for validity control and quality of science. https://doi.org/10.1177/1745691620970602

Greenland, S., Pearl, J., & Robins, J. M. (1999). Causal diagrams for epidemiologic research. https://pubmed.ncbi.nlm.nih.gov/9888278/

Hernán, M. A., & Robins, J. M. (2020). Causal inference: What if. https://miguelhernan.org/whatifbook

Lazic, S. E. (2010). The problem of pseudoreplication in neuroscientific studies. https://doi.org/10.1186/1471-2202-11-5

Lewis, C. (1989). Pairs of Latin squares to counterbalance sequential effects and pairing of conditions and stimuli. https://doi.org/10.1177/154193128903301812

Mayo, D. G., & Spanos, A. (2006). Severe testing as a basic concept in a Neyman–Pearson philosophy of induction. https://doi.org/10.1093/bjps/axl003

McGuire, W. J. (1997). Creative hypothesis generating in psychology. https://doi.org/10.1146/annurev.psych.48.1.1

Moher, D., Hopewell, S., Schulz, K. F., Montori, V., Gøtzsche, P. C., Devereaux, P. J., Elbourne, D., Egger, M., & Altman, D. G. (2010). CONSORT 2010 explanation and elaboration: Updated guidelines for reporting parallel group randomised trials. https://doi.org/10.1136/bmj.c869

Preacher, K. J. (2015). Advances in mediation analysis: A survey and synthesis of new developments. https://doi.org/10.1146/annurev-psych-010814-015258

Reese, H. W. (1997). Counterbalancing and other uses of repeated-measures Latin-square designs. https://doi.org/10.1006/jecp.1996.2333

Reynolds, P. S. (2026). Experimental designs for preclinical neuroscience experiments: Part 2—Blocking and blocked designs. https://doi.org/10.1523/ENEURO.0006-26.2026

Stevens, S. S. (1946). On the theory of scales of measurement. https://doi.org/10.1126/science.103.2684.677

Strevens, M. (2020). The knowledge machine. https://books.google.com/books?id=ISXWDwAAQBAJ

Westfall, J., Judd, C. M., & Kenny, D. A. (2015). Replicating studies in which samples of participants respond to samples of stimuli. https://doi.org/10.1177/1745691614564879

Yarkoni, T. (2022). The generalizability crisis. https://doi.org/10.1017/S0140525X20001685

Zimmerman, K. D., Espeland, M. A., & Langefeld, C. D. (2021). A practical solution to pseudoreplication bias in single-cell studies. https://doi.org/10.1038/s41467-021-21038-1