Poder estadístico en el testeo de anuncios: qué es y por qué tus tests lo necesitan
El poder estadístico es la probabilidad de que tu test detecte una diferencia real. La mayoría de los tests de anuncios no lo tienen. Cómo corregirlo.
Poder estadístico en el testeo de anuncios: qué es y por qué tus tests lo necesitan
El poder estadístico es la probabilidad de que tu test detecte una diferencia real entre variantes cuando esa diferencia existe. Un test con 80% de poder detectará una diferencia real el 80% de las veces y la va a errar el 20%. La mayoría de los tests de anuncios tienen un poder muy por debajo del 50%. Esto significa que la mayoría de los tests de anuncios tienen más chances de errar a un ganador real que de encontrarlo.
Por qué importa el poder
Un test de bajo poder produce dos tipos de errores:
- Falsos negativos: existe una diferencia real (un anuncio es genuinamente mejor), pero el test no la detecta. Seguís corriendo el anuncio más débil.
- Falsos positivos: el test declara un ganador, pero el "ganador" es en realidad ruido. Escalás un anuncio que en realidad no es mejor.
Los tests de bajo poder están sesgados hacia los falsos positivos cuando testeas varias variantes y elegís la mejor — la maldición del ganador que describimos en nuestro artículo sobre tests A/B. Cuantas más variantes testees con bajo poder, más inflado aparece el rendimiento de la variante "ganadora".
Qué determina el poder
Tres factores:
- Tamaño de muestra. Más datos = más poder. Es el factor que más controlás.
- Tamaño del efecto. Las diferencias grandes entre variantes son más fáciles de detectar. Las diferencias sutiles requieren más poder.
- Variabilidad. Datos más variables = menos poder. Las métricas de alta varianza como la tasa de conversión requieren muestras más grandes que las métricas de baja varianza.
Un mínimo práctico
Para la mayoría de las métricas de anuncios, necesitás al menos 100 conversiones por variante para tener un poder razonable que detecte una diferencia relativa del 20%. Con tasas de conversión típicas de DTC (directo al consumidor), esto significa una inversión significativa por variante — a menudo US$500–US$2.000 según tu CPA.
Si no podés costear ese nivel de inversión por test, testeá menos variantes (más presupuesto por variante) o testeá diferencias más grandes (hooks en vez de colores de botón). Testear cinco variantes a US$100 cada una produce cinco conjuntos de resultados en los que no podés confiar. Testear dos variantes a US$250 cada una es mejor — todavía con poder insuficiente, pero al menos direccionalmente más confiable.
La solución práctica para presupuestos chicos
Aceptá que no vas a alcanzar la significancia estadística. Usá los tests como guía direccional, no como decisiones concluyentes. Si una variante está superando a la otra por un 40% con inversión baja, probablemente sea la verdadera ganadora aunque el resultado no sea estadísticamente significativo. Si la diferencia es del 10%, probablemente sea ruido. Escalá al ganador direccional con cautela, con un plan para reevaluar a medida que se acumulen más datos.