Base de conhecimento/Teste de anúncios/Poder estatístico em testes de anúncios: o que é e por que seus testes precisam de mais
Teste de anúnciosArmadilhas Estatísticas

Poder estatístico em testes de anúncios: o que é e por que seus testes precisam de mais

O poder estatístico é a probabilidade de o teste detectar diferença real. A maioria dos testes de anúncios tem poder baixo — muitos vencedores não são reais.

Pela equipe de pesquisa da Wreltik

Poder estatístico em testes de anúncios: o que é e por que seus testes precisam de mais

O poder estatístico é a probabilidade de seu teste detectar uma diferença real entre variantes quando essa diferença real existe. Um teste com 80% de poder captará uma diferença real 80% das vezes e a perderá 20% das vezes. A maioria dos testes de anúncios tem poder muito abaixo de 50%. Isso significa que a maioria dos testes de anúncios tem mais probabilidade de perder um vencedor real do que de encontrá-lo.

Por que o poder importa

Um teste de baixo poder produz dois tipos de erro:

  • Falsos negativos: existe uma diferença real (um anúncio é genuinamente melhor), mas o teste não a detecta. Você continua rodando o anúncio mais fraco.
  • Falsos positivos: o teste declara um vencedor, mas o "vencedor" é na verdade ruído. Você escala um anúncio que não é realmente melhor.

Testes de baixo poder são enviesados para falsos positivos quando você testa várias variantes e escolhe a melhor — a maldição do vencedor descrita no nosso artigo sobre teste A/B. Quanto mais variantes você testa com baixo poder, mais inflado fica o desempenho aparente da variante "vencedora".

O que determina o poder

Três fatores:

  1. Tamanho da amostra. Mais dados = mais poder. Esse é o fator que mais está sob seu controle.
  2. Magnitude do efeito. Diferenças maiores entre variantes são mais fáceis de detectar. Diferenças sutis exigem mais poder.
  3. Variabilidade. Dados mais variáveis = menos poder. Métricas de alta variância, como taxa de conversão, exigem amostras maiores do que métricas de baixa variância.

Um mínimo prático

Para a maioria das métricas de anúncio, você precisa de pelo menos 100 conversões por variante para ter poder razoável de detectar uma diferença relativa de 20%. Nas taxas de conversão típicas de DTC, isso significa um gasto significativo por variante — frequentemente US$ 500–US$ 2.000, dependendo do seu CPA.

Se você não pode pagar esse nível de gasto por teste, ou teste menos variantes (mais orçamento por variante) ou teste diferenças maiores (hooks em vez de cores de botão). Testar cinco variantes com US$ 100 cada produz cinco conjuntos de resultados em que você não pode confiar. Testar duas variantes com US$ 250 cada é melhor — ainda com poder insuficiente, mas pelo menos direcionalmente mais confiável.

A correção prática para orçamentos pequenos

Aceite que você não vai atingir significância estatística. Use testes para orientação direcional em vez de decisões conclusivas. Se uma variante está superando em 40% com gasto baixo, ela provavelmente é a vencedora real, mesmo que o resultado não seja estatisticamente significativo. Se a diferença é de 10%, provavelmente é ruído. Escale o vencedor direcional com cautela, com um plano de reavaliação à medida que mais dados se acumulam.