Por qué los resultados de tus tests A/B te mienten
El testeo A/B es el estándar de oro para creatividades — hasta que no lo es. Errores que vuelven engañosos los resultados y cómo diseñar tests confiables.
Por qué los resultados de tus tests A/B te mienten
El secreto sucio del testeo de creatividades es que la mayoría de los "ganadores" no lo son. Son ruido que parecía señal porque el test fue diseñado para encontrar un ganador, no para encontrar la verdad.
La trampa del presupuesto bajo
Testeás dos anuncios a US$50 cada uno. El anuncio A consigue un CTR del 2,1%. El anuncio B, del 1,6%. Declarás a A ganador y lo escalás.
Con US$50 de inversión, la diferencia entre 2,1% y 1,6% probablemente sea un puñado de clics. Un clic extra — de alguien que hizo clic por accidente, o que habría convertido igual — da vuelta el resultado. No estás evaluando el rendimiento del anuncio. Estás evaluando suerte.
Con inversión mínima, necesitás diferencias grandes para estar seguro. Una diferencia de 2x en tasa de conversión con US$50 de inversión: probablemente real. Una diferencia del 30%: puede ir para cualquiera de los dos lados. Una diferencia del 10%: estás adivinando.
La solución es aburrida pero necesaria: o gastás más en el test, o testeás menos cosas para que cada test reciba suficiente presupuesto como para significar algo.
El problema de "tres anuncios, un ganador"
Testear tres anuncios, elegir al ganador y reportar sus números como el rendimiento esperado. Esto se llama la maldición del ganador.
Si testeas suficientes variantes, la casualidad garantiza que una de ellas va a verse bien — aunque todas sean igual de mediocres. Cuanto más chica tu muestra y cuantas más variantes testees, más inflados van a estar los números de tu ganador.
Una regla práctica: si testeas N variantes, descontá el rendimiento del ganador en aproximadamente un 10–20% por cada duplicación de N. ¿Cuatro variantes? El ganador probablemente sea 10–20% peor de lo que parece. ¿Ocho variantes? 20–40% peor. Esto no es preciso, pero es direccionalmente honesto. La mayoría hace lo contrario — toma los números del ganador al pie de la letra y los proyecta hacia adelante.
La fatiga creativa no está contemplada
El test corrió durante tres días y tu ganador arrasó. Así que lo escalás a todo tu presupuesto.
Semana uno: todavía bien. Semana dos: el rendimiento empieza a resbalar. Semana tres: el "ganador" está entregando peores resultados que el anuncio al que le ganó. ¿Qué pasó?
El test capturó la respuesta a un estímulo novedoso. La novedad en sí impulsa la atención — el cerebro está cableado para notar cosas nuevas. Una vez que tu audiencia objetivo vio el anuncio unas cuantas veces, la prima de novedad se evapora. La creatividad de fondo importa, pero el impulso de lo nuevo se fue.
Testear con ventanas más largas ayuda. También ayuda reservar una parte de tu audiencia fuera del test inicial para poder evaluar al ganador contra un grupo fresco más adelante. Ninguna de las dos resuelve el problema por completo, pero ambas reducen el tamaño de la mentira.
Los efectos de plataforma se ignoran
Tu test corrió en Meta. El ganador se muda a TikTok. Fracasa. No porque sea malo — porque las plataformas son entornos distintos con expectativas de usuario distintas y algoritmos de optimización distintos.
El testeo creativo tiene que ocurrir en la plataforma donde el anuncio va a correr. La extrapolación entre plataformas es adivinanza disfrazada de estrategia.
Cómo se ve un testeo honesto
-
Definí qué estás evaluando antes de correr el test. No "cuál anuncio es mejor" — ¿mejor en qué? ¿CTR? ¿Tasa de conversión? ¿ROAS? Elegí una y mantenete. Si elegís la métrica después de ver los resultados, estás cherry-picking.
-
Corré hasta tener suficientes datos, no hasta que te canses de esperar. Si tu presupuesto implica que necesitás tres semanas para resultados estadísticamente significativos, esperá las tres semanas. Terminar antes porque tenés curiosidad es el atajo más caro del testeo.
-
Reservá un set de validación. Escalá al ganador al 30% de tu audiencia primero. Si se mantiene dos semanas, llevalo al 70%. Esto cuesta unos días. Es más barato que escalar un falso ganador al 100% de tu presupuesto.
-
Seguí el rastro de si tus ganadores realmente ganan. La mayoría de los equipos nunca vuelve a chequear si los anuncios que "ganaron" el test realmente rindieron mejor a escala. Si no verificás la precisión de tu proceso de testeo, nunca lo vas a mejorar.