Testeos A/B en Meta: cómo diseñar pruebas en las que puedas confiar
Las herramientas de testeo A/B de Meta te dan números, pero no te dicen si esos números significan algo. Cómo diseñar tests que produzcan decisiones y no ruido.
Testeos A/B en Meta: cómo diseñar pruebas en las que puedas confiar
Meta te da un botón de test A/B. Te da un nivel de confianza. Te da un ganador. Lo que no te da es ninguna garantía de que ese ganador sea real.
El problema no son las herramientas de Meta — funcionan como fueron diseñadas. El problema es que la mayoría de los diseños de tests son demasiado chicos, demasiado cortos o demasiado confundidos como para producir conclusiones confiables. Acá te mostramos cómo corregirlo.
El problema de la entrega divergente
Braun y Schwartz publicaron un paper en 2024 identificando lo que llamaron "entrega divergente" (divergent delivery): un factor de confusión fundamental en los tests A/B de plataforma. Cuando corrés dos variantes de un anuncio en la subasta de Meta, el algoritmo no se las muestra al mismo mix de usuarios. Optimiza la entrega de forma independiente para cada variante, lo que significa que los dos anuncios pueden llegar a audiencias significativamente distintas.
Como resultado, lo que parece rendimiento de la creatividad puede ser en realidad composición de la audiencia. El anuncio "ganador" no tenía mejor creatividad: se le mostró a personas con más probabilidad de convertir sin importar lo que vieran.
No existe una solución perfecta para esto, pero podés reducir el daño:
- Corré los tests con presupuestos más grandes para que ambas variantes tengan suficiente inversión y alcancen audiencias amplias
- Reservá una audiencia de validación que solo vea al ganador después de que termine el test
- No declares un ganador basándote en diferencias chicas. Una brecha del 10% con US$200 de inversión es ruido. La misma brecha con US$2.000 de inversión puede ser señal.
Tamaño de presupuesto con sentido estadístico
La mayoría de los tests no tienen suficiente poder. No podés arreglarlo agregando más variantes — eso lo empeora, porque estás dividiendo el mismo presupuesto chico entre más anuncios.
Una heurística aproximada: si tu costo promedio por conversión es de US$20, necesitás al menos 100 conversiones por variante para tener una señal significativa. Eso son US$2.000 por variante, como mínimo. Si estás testeando cuatro variantes, son US$8.000.
La mayoría de las marcas corren tests de cuatro variantes con US$500 en total — US$125 por variante. Las matemáticas dicen que esos resultados son mayormente ruido. El test parece riguroso porque Meta te da un panel lindo. El panel no cambia el tamaño de la muestra.
Si no podés pagar tests con poder suficiente, testeá menos cosas. Dos variantes a US$500 cada una es mejor que cuatro variantes a US$250 cada una. Vas a declarar menos "ganadores", pero los que consigas van a ser reales.
Duración: cuánto es suficiente
La fase de aprendizaje de Meta toma aproximadamente 50 eventos de optimización por conjunto de anuncios. Si optimizás por conversiones y obtenés 10 por día, son 5 días solo para salir de la fase de aprendizaje. Terminar un test antes de que la fase de aprendizaje se complete significa que estás comparando anuncios que todavía se estaban optimizando — uno puede haber estado más avanzado en la curva de aprendizaje que el otro.
La duración mínima del test debería cubrir:
- La fase de aprendizaje (50 conversiones)
- Al menos un ciclo semanal completo (el comportamiento de los usuarios varía según el día de la semana)
- Tiempo suficiente después de la fase de aprendizaje para generar tus datos de comparación
Para la mayoría de las cuentas que gastan menos de US$500 por día, eso significa un mínimo de 7 a 10 días por test. Los tests más cortos producen como mucho señales direccionales.
Significancia estadística vs. significancia práctica
Meta reporta cuándo una variante alcanza la significancia estadística. Eso te dice que la diferencia probablemente no es cero. No te dice que la diferencia importe.
Un intervalo de confianza del 95% sobre un aumento del 0,3% en CTR significa que podés estar seguro de que el anuncio es apenas mejor — por una cantidad que no va a cambiar tu negocio. Eso es significancia estadística sin significancia práctica.
Antes del test, definí qué es "significativo" para vos. No "estadísticamente significativo" — realmente significativo. "Al menos una mejora del 20% en el costo por conversión" o "al menos un aumento del 15% en CTR". Si el ganador no supera esa vara, el test no encontró un ganador. Encontró ruido que podés cuantificar con precisión.
Testear una variable por vez
El error de testeo más común: cambiar el hook (gancho), el cuerpo, el CTA y la miniatura todo a la vez, y después declarar que una variante es mejor actuando como si supieras por qué.
No lo sabés. Sabés que una combinación funcionó mejor que otra combinación. No sabés qué elemento generó la diferencia. Así que tu próximo test es una apuesta, y tu aprendizaje no se acumula.
Testeá una variable por vez. Hook contra hook. Cuerpo contra cuerpo. CTA contra CTA. Sí, esto significa más tests. También significa que cada test te enseña algo que podés usar en el siguiente. En seis meses, el equipo que aísla variables aprende cosas. El equipo que testea combinaciones tiene opiniones firmes débilmente conectadas con la realidad.