Base de conhecimento/Teste de anúncios/Testes A/B de anúncios no Meta: como desenhar testes em que você pode confiar
Teste de anúnciosMetodologia

Testes A/B de anúncios no Meta: como desenhar testes em que você pode confiar

As ferramentas de teste A/B do Meta dão números, mas não dizem se eles significam algo. Como desenhar testes de anúncios que geram decisões, não ruído.

Pela equipe de pesquisa da Wreltik

Testes A/B de anúncios no Meta: como desenhar testes em que você pode confiar

O Meta oferece um botão de teste A/B. Ele apresenta uma pontuação de confiança. Ele aponta um vencedor. O que ele não oferece é qualquer garantia de que o vencedor seja real.

O problema não são as ferramentas do Meta — elas funcionam como foram projetadas. O problema é que a maioria dos testes é pequena demais, curta demais ou confusa demais para produzir conclusões confiáveis. Veja como resolver isso.

O problema da entrega divergente

Braun e Schwartz publicaram um artigo em 2024 identificando o que chamaram de "entrega divergente" — um fator de confusão fundamental nos testes A/B de plataformas. Quando você roda duas variantes de anúncio no leilão do Meta, o algoritmo não as mostra para a mesma combinação de usuários. Ele otimiza a entrega de cada variante de forma independente, o que significa que os dois anúncios podem alcançar públicos significativamente diferentes.

Como resultado, o que parece desempenho do criativo pode ser, na verdade, composição de público. O anúncio "vencedor" não tinha um criativo melhor — ele foi exibido para pessoas com maior probabilidade de converter, independentemente do que viam.

Não existe correção perfeita para isso, mas você pode reduzir o dano:

  • Rode testes com orçamentos maiores para que ambas as variantes tenham mídia suficiente para alcançar públicos amplos
  • Reserve um público de validação que só veja o vencedor depois que o teste terminar
  • Não declare um vencedor com base em diferenças pequenas. Uma diferença de 10% com US$ 200 de gasto é ruído. A mesma diferença com US$ 2.000 de gasto pode ser sinal.

Dimensionamento de orçamento com sentido estatístico

A maioria dos testes tem poder estatístico insuficiente. Você não resolve isso com mais variantes — isso piora o problema, porque você divide o mesmo orçamento pequeno entre mais anúncios.

Uma heurística aproximada: se seu custo médio por conversão é US$ 20, você precisa de pelo menos 100 conversões por variante para ter um sinal significativo. Isso dá no mínimo US$ 2.000 por variante. Se você testar quatro variantes, são US$ 8.000.

A maioria das marcas roda testes de quatro variantes com US$ 500 no total — US$ 125 por variante. A matemática diz que esses resultados são, em grande parte, ruído. O teste parece rigoroso porque o Meta oferece um painel bonito. O painel não muda o tamanho da amostra.

Se você não pode pagar por testes com poder estatístico adequado, teste menos coisas. Duas variantes com US$ 500 cada é melhor do que quatro variantes com US$ 250 cada. Você declarará menos "vencedores", mas os que declarar serão reais.

Duração: quanto tempo é suficiente

A fase de aprendizado do Meta leva cerca de 50 eventos de otimização por conjunto de anúncios. Se você otimiza para conversões e obtém 10 por dia, são 5 dias apenas para sair da fase de aprendizado. Encerrar um teste antes da fase de aprendizado terminar significa comparar anúncios que ainda estavam sendo otimizados — um deles pode estar mais adiantado na curva de aprendizado que o outro.

A duração mínima do teste deve cobrir:

  • A fase de aprendizado (50 conversões)
  • Pelo menos um ciclo semanal completo (o comportamento do usuário varia conforme o dia da semana)
  • Tempo suficiente após a fase de aprendizado para gerar seus dados de comparação

Para a maioria das contas que gastam menos de US$ 500/dia, isso significa no mínimo 7 a 10 dias por teste. Testes mais curtos produzem, no melhor dos casos, sinais direcionais.

Significância estatística vs. significância prática

O Meta informa quando uma variante atinge significância estatística. Isso indica que a diferença provavelmente não é zero. Não indica que a diferença importa.

Um intervalo de confiança de 95% em um aumento de 0,3% no CTR significa que você pode estar confiante de que o anúncio é ligeiramente melhor — numa magnitude que não vai mudar o seu negócio. Isso é significância estatística sem significância prática.

Antes do teste, defina o que "significativo" significa. Não "estatisticamente significativo" — realmente significativo. "Pelo menos 20% de melhora no custo por conversão" ou "pelo menos 15% de aumento no CTR". Se o vencedor não ultrapassar essa barra, o teste não encontrou um vencedor. Encontrou ruído que você consegue quantificar com precisão.

Testar uma variável por vez

O erro de teste mais comum: mudar o hook, o corpo, o CTA e a miniatura tudo de uma vez, declarar uma variante melhor e agir como se você soubesse o motivo.

Você não sabe. Você sabe que uma combinação funcionou melhor que outra combinação. Você não sabe qual elemento gerou a diferença. Então seu próximo teste é um palpite, e seu aprendizado não se acumula.

Teste uma variável por vez. Hook contra hook. Corpo contra corpo. CTA contra CTA. Sim, isso significa mais testes. Também significa que cada teste ensina algo que você pode usar no próximo. Em seis meses, o time que isola variáveis aprende coisas. O time que testa combinações tem opiniões fortes vagamente conectadas à realidade.