Por que os resultados do seu teste A/B estão mentindo para você
O teste A/B é o padrão ouro para criativos de anúncio — até deixar de ser. Armadilhas comuns que tornam resultados enganosos e como desenhar testes confiáveis.
Por que os resultados do seu teste A/B estão mentindo para você
O segredo sujo do teste de criativos de anúncio é que a maioria dos "vencedores" não é vencedora. São ruído que parecia sinal porque o teste foi desenhado para encontrar um vencedor, não para encontrar a verdade.
A armadilha do orçamento baixo
Você testa dois anúncios com US$ 50 cada. O anúncio A obtém 2,1% de CTR. O anúncio B obtém 1,6%. Você declara A o vencedor e escala.
Com US$ 50 de gasto, a diferença entre 2,1% e 1,6% é provavelmente um punhado de cliques. Um clique extra — de alguém que clicou por acidente, ou que converteria de qualquer forma — vira o resultado. Você não está avaliando o desempenho do anúncio. Está avaliando a sorte.
Com gasto mínimo, você precisa de diferenças grandes para ter confiança. Uma diferença de 2x na taxa de conversão com US$ 50 de gasto: provavelmente real. Uma diferença de 30%: pode ser qualquer uma das duas. Uma diferença de 10%: você está chutando.
A correção é chata, mas necessária: ou gaste mais no teste, ou teste menos coisas para que cada teste receba orçamento suficiente para significar algo.
O problema do "três anúncios, um vencedor"
Testar três anúncios, escolher o vencedor e reportar os números dele como o desempenho esperado. Isso se chama a maldição do vencedor.
Se você testa variantes suficientes, o acaso garante que uma delas parecerá boa — mesmo que todas sejam igualmente medíocres. Quanto menor sua amostra e quanto mais variantes você testa, mais inflados serão os números do seu vencedor.
Uma regra prática: se você testa N variantes, desconte o desempenho do vencedor em cerca de 10–20% para cada dobra de N. Quatro variantes? O vencedor provavelmente é 10–20% pior do que parece. Oito variantes? 20–40% pior. Isso não é preciso, mas é direcionalmente honesto. A maioria das pessoas faz o oposto — aceita os números do vencedor pelo valor de face e os projeta para frente.
A fadiga criativa não é considerada
O teste rodou por três dias e seu vencedor arrasou. Então você o escala para o orçamento inteiro.
Semana um: ainda bom. Semana dois: o desempenho começa a escorregar. Semana três: o "vencedor" está entregando resultados piores do que o anúncio que ele derrotou. O que aconteceu?
O teste avaliou a resposta a um estímulo novo. A novidade em si impulsiona a atenção — o cérebro está programado para notar coisas novas. Depois que o anúncio foi visto algumas vezes pelo seu público-alvo, o prêmio da novidade evapora. O criativo subjacente importa, mas o impulso da novidade se foi.
Testar em janelas mais longas ajuda. Reservar uma parte do seu público fora do teste inicial também ajuda, para que você possa avaliar o vencedor contra um grupo novo depois. Nenhuma das duas resolve o problema por completo, mas ambas reduzem o tamanho da mentira.
Efeitos de plataforma são ignorados
Seu teste rodou no Meta. O vencedor foi movido para o TikTok. Ele fracassa. Não porque seja ruim — porque as plataformas são ambientes diferentes, com expectativas de usuário diferentes e algoritmos de otimização diferentes.
O teste de criativos precisa acontecer na plataforma em que o anúncio vai rodar. Extrapolação entre plataformas é adivinhação fantasiada de estratégia.
Como é um teste honesto
-
Defina o que você está avaliando antes de rodar o teste. Não "qual anúncio é melhor" — melhor em quê? CTR? Taxa de conversão? ROAS? Escolha uma e mantenha-se nela. Se você escolher a métrica depois de ver os resultados, você está fazendo cherry-picking.
-
Rode até ter dados suficientes, não até perder a paciência. Se seu orçamento significa que você precisa de três semanas para obter resultados estatisticamente significativos, espere as três semanas. Encerrar cedo porque você está curioso é o atalho mais caro do teste.
-
Reserve um conjunto de validação. Escale o vencedor para 30% do seu público primeiro. Se ele se sustentar por duas semanas, leve-o a 70%. Isso custa alguns dias. É mais barato do que escalar um falso vencedor para 100% do seu orçamento.
-
Acompanhe se seus vencedores de fato vencem. A maioria dos times nunca volta para verificar se os anúncios que "venceram" o teste de fato tiveram desempenho superior em escala. Se você não avalia a precisão do seu processo de teste, nunca vai melhorá-lo.