Pruebas A/B sin hacer el ridículo: hipótesis, muestras, significancia y paciencia

Por Santos Jaimes · ·

Cambiar el botón, mirar los resultados a las dos horas y declarar victoria no es una prueba A/B: es astrología con gráficos. Aquí aprendes a experimentar como un adulto (y a no creerte tus propias mentiras estadísticas).

¿Cómo se formula una hipótesis de optimización basada en datos?

La regla de oro: empieza siempre por una hipótesis, no por "probemos a ver qué pasa". Cuando alguien te pida una prueba, pregúntale: "¿Cuál es tu hipótesis?". Esa pregunta obliga a pensar.[1]

Una hipótesis expresa qué crees que va a pasar al hacer un cambio y por qué. Comunica a todo el equipo qué estás evaluando, incluso a quienes no comparten tu entusiasmo.[2]

La estructura

Cambiar [lo que quieres cambiar] por [lo que pondrías en su lugar]
aumentará [la métrica de conversión]
porque [el problema que resuelve, según tus datos].

Las dos primeras partes vienen del modelo LIFT: cambiar una debilidad detectada en algo que puedes probar.[3][4] El "porque" es lo que convierte una corazonada en una hipótesis basada en datos.[2]

De dónde salen los datos

  • Analítica: páginas con mucho tráfico y mucha salida, pasos del embudo con gran abandono.
  • Investigación cualitativa: encuestas, grabaciones, pruebas de usabilidad, preguntas a soporte.
  • Un análisis heurístico de la página con los seis factores LIFT (propuesta de valor, relevancia, claridad, urgencia, ansiedad y distracción).[3]

De buena a gran hipótesis

  • Que se pueda probar. "A nuestros visitantes les gustan los titulares rojos" no se puede probar. "Cambiar el titular de negro a rojo aumentará los registros del formulario" sí. Si terminas la prueba y no sabes si era verdad o mentira, no era una hipótesis.[3]
  • Que resuelva un problema de conversión detectado, no un capricho.[3]
  • Que te enseñe algo del cliente, más allá del resultado puntual. Las mejores pruebas te dan aprendizajes que cambian tu marketing.[3]
  • Que diga qué métrica decide y, si aplica, para qué segmento.[2]
🍝 La hipótesis de Little Italy Kitchen

Dato: los turistas en móvil convierten al 1% contra el 3% de los locales, y las grabaciones muestran errores en el campo de teléfono.

Hipótesis: "Cambiar el campo de teléfono obligatorio con formato de EE. UU. por un campo opcional que acepte números internacionales aumentará la tasa de reservas completadas de visitantes extranjeros en móvil, porque elimina el error que hoy bloquea el formulario."

¿Qué significan la significación estadística, el nivel de confianza y la potencia estadística en un experimento?

Respira. Esto es más fácil de lo que parece.

La hipótesis nula: "aquí no pasó nada"

Toda prueba parte de suponer que no hay diferencia real entre A y B, y que cualquier diferencia que veas es casualidad. La prueba intenta demostrar que esa suposición es poco probable.[5]

ConceptoEn cristiano
Significación estadísticaEl resultado es lo bastante improbable como para atribuirlo a la pura suerte. Rechazas la hipótesis nula.[5]
Nivel de confianzaQué tan exigente eres. Al 95%, el resultado debería repetirse 19 de cada 20 veces. Dicho al revés: aceptas un 5% de probabilidad de ver un "ganador" que en realidad no lo es (eso es el nivel alfa: 0.05).[3][5]
Potencia estadísticaLa probabilidad de detectar un efecto si de verdad existe. Lo habitual es buscar 80%. Una prueba con poca potencia puede decirte "no hay diferencia" cuando sí la había: simplemente no juntaste suficiente gente para verla.[2]
Efecto mínimo detectable (MDE)La mejora más pequeña que quieres poder detectar. Mientras más pequeña, más gente necesitas.[2]
Intervalo de confianzaEl rango donde probablemente está el valor real. "16.5% de mejora" en realidad suele ser "entre 6% y 28%".[3]

🤔 Significativo no es lo mismo que válido. Muchas empresas acumulan durante un año pruebas "ganadoras" con 95% de significancia que prometen +25% de ingresos, y doce meses después su conversión sigue igual. Las mejoras eran imaginarias.[6] Una prueba mal diseñada, detenida antes de tiempo o con datos sucios puede dar un resultado "significativo" que es pura basura.

¿Y siempre hay que exigir 95%? No es una ley divina. Hay empresas que se conforman con 80% para probar más rápido y otras que piden 95% y además hacen una prueba de confirmación. Un umbral bajo te deja ir más rápido con más errores; uno alto te da más certeza pero más lento. Lo importante es decidirlo antes de empezar.[3]

¿Cómo se calcula el tamaño de muestra necesario para una prueba A/B?

El tamaño de muestra es cuánta gente necesitas en cada versión para que el resultado sea confiable. Si es muy pequeño, tus resultados no representan a tus visitantes reales.[2] Depende de cuatro cosas:[2]

  1. Tu tasa de conversión actual (la línea base).
  2. El efecto mínimo que quieres detectar (MDE). Mira el efecto que lograron pruebas anteriores para no soñar.
  3. El nivel de confianza (normalmente 95%).
  4. La potencia (normalmente 80%).

La fórmula rápida (para no depender de la calculadora)

Para 95% de confianza y 80% de potencia, una aproximación clásica por cada versión es:

n ≈ 16 × p × (1 − p) ÷ δ²

p = tasa de conversión actual
δ = diferencia absoluta que quieres detectar

En la práctica, usa una calculadora de tamaño de muestra online.[2][10] Pero la fórmula te deja hacer cuentas en una servilleta para saber si una prueba tiene sentido antes de montarla.

🍝 Little Italy Kitchen hace cuentas

Su página de reservas convierte al 3%. Quieren detectar una mejora relativa del 20% (de 3% a 3.6%, o sea, δ = 0.006).

n ≈ 16 × 0.03 × 0.97 ÷ 0.006² ≈ 12,900 visitas por versión

Con dos versiones, necesitan unas 26,000 visitas a esa página. Reciben 4,000 por semana: la prueba necesita alrededor de 6–7 semanas. Si quisieran detectar una mejora de solo el 5%, necesitarían 16 veces más gente: más de un año. Conclusión: con poco tráfico, prueba cambios grandes y audaces, no el tono del gris del botón.

Reglas de bolsillo

  • Como referencia práctica, se suelen necesitar entre 100 y 400 conversiones por variante, aunque hay pruebas que necesitan diez veces más.[3]
  • Mientras más variantes, más tiempo: pasar de 4 a 8 retadores duplica la duración.[3]
  • Solo haz pruebas A/B en páginas con tráfico suficiente.[7]
  • Si tienes datos históricos, técnicas de reducción de varianza como CUPED te permiten detectar efectos pequeños con menos muestra.[8]

¿Cómo se determina la duración adecuada de una prueba A/B?

La duración sale de una división muy simple, y luego se ajusta con sentido común:

Duración (días) = Tamaño de muestra total ÷ Visitas diarias a la página probada

Los ajustes obligatorios

  • Mínimo 10 días que incluyan dos fines de semana, para neutralizar las diferencias entre días de la semana.[3] El comportamiento de fin de semana es distinto al de entre semana, y hasta la hora del día cambia el tipo de visitante.[5]
  • Semanas completas: si tu prueba dura 9 días, tienes dos lunes y un domingo. Redondea a semanas enteras.
  • Ciclo de decisión: si tus clientes tardan más de uno o dos días en decidirse, deja la prueba el tiempo suficiente para capturar esas conversiones retrasadas.[3] Al principio la conversión puede parecer baja simplemente porque las conversiones tardías todavía no han llegado.[5]
  • Fija la duración antes de empezar, junto con el umbral de significancia.[3]

⏳ Tampoco la estires para siempre. Cada prueba tiene un costo: tiempo, esfuerzo y el costo de oportunidad de no estar probando otra cosa.[5] Y mientras más dura, más se contamina: la gente borra cookies, cambian las campañas, cambia la temporada.

¿Por qué detener una prueba antes de tiempo puede producir conclusiones incorrectas?

Esta es la regla de oro de las pruebas A/B: no tomes decisiones por mirar los resultados antes de que la prueba termine. Si miras demasiado pronto y paras en cuanto ves un resultado "significativo", disparas la probabilidad de un falso positivo.[2]

Por qué pasa

Con pocos datos, las tasas de conversión bailan como borracho en boda. Si el primer visitante de la versión B compra, B tiene un 100% de conversión. Sacar conclusiones ahí es como decidir que una moneda nunca cae en cruz porque salió cara tres veces.[5] Y si miras los resultados todos los días, tarde o temprano el azar te va a mostrar un "ganador" pasajero. Si paras justo ahí, te comiste el error.

Lo que pasa en la vida real

  • Lanzas el "ganador" (+5%) y a los pocos meses la métrica cae un 12%. Era un falso positivo.[2]
  • Matas a un "perdedor" en la primera semana... que habría terminado ganando. Los resultados tempranos a menudo no se parecen al resultado final.[3]
  • Abandonas una prueba porque las variantes parecen iguales, cuando a veces se separan más tarde.[3]
  • El efecto novedad: algo nuevo llama la atención al principio y luego se desinfla.[8]

El consejo más sano: después de lanzar la prueba, tómate unos días sin mirar los resultados. No va a terminar antes porque la mires.[3]

✅ ¿Y si necesito poder parar antes? Existe una forma legítima: las pruebas secuenciales, diseñadas para hacer revisiones intermedias con estadística corregida. Permiten cortar antes una prueba que está dañando métricas clave o lanzar antes una que claramente gana, pero hay que planearlas así desde el principio, no improvisarlas.[8]

¿Cómo se controla el efecto de la estacionalidad y de las variaciones del tráfico durante un experimento?

La mejor defensa ya viene incluida en una prueba A/B bien hecha: el control y las variantes corren al mismo tiempo, con visitantes repartidos al azar.[3] Si es Navidad, es Navidad para las dos versiones. Por eso una prueba A/B le gana por goleada a comparar "antes y después", donde la temporada, la competencia o un comentario en redes pueden cambiar tu conversión sin que lo sepas.[3]

Pero la estacionalidad igual te afecta

Aunque A y B la sufran por igual, la temporada cambia el tamaño del efecto. En una tienda, el mismo rediseño ganó un 12.7% en diciembre y un 30.6% en enero: con alta urgencia (época de regalos), los cambios de diseño importan menos.[3] Y una promoción por tiempo limitado a mitad de prueba puede distorsionar todos los resultados.[3]

Cómo protegerte

  • Reparto aleatorio y homogéneo: cada versión debe recibir el mismo tipo de visitantes. Nunca mandes un canal de tráfico a A y otro a B.[3]
  • Semanas completas para neutralizar el ciclo semanal.
  • Evita lanzar pruebas en picos atípicos (Black Friday, San Valentín), salvo que quieras optimizar precisamente para ese pico. También puedes tratar los festivos como anomalías y excluirlos.[5]
  • Anota todo: campañas, promociones, menciones en prensa, caídas del servidor.
  • Vuelve a probar los ganadores importantes en otra época del año. Tu público cambia con el tiempo.[5]
  • Compara periodos alineados por día de la semana, no por fecha de calendario.[4]
🍝 Little Italy Kitchen

En Denver, el verano trae turistas y el invierno trae esquiadores de paso. Una prueba lanzada en julio solo dice cómo se comportan los turistas de verano. El restaurante repite en febrero las pruebas importantes antes de dar un cambio por definitivo, y nunca prueba nada la semana del Great American Beer Festival, cuando la ciudad se llena de gente que no es su público habitual.

¿Cuándo conviene realizar pruebas multivariantes en lugar de pruebas A/B?

En una prueba A/B (o A/B/n) comparas páginas completas: control contra uno o varios retadores. En una prueba multivariante (MVT) cambias varios elementos a la vez dentro de la misma página y pruebas todas las combinaciones posibles.[3]

3 titulares × 3 imágenes × 3 botones = 27 combinaciones

Ahí está el problema: cada elemento extra multiplica las combinaciones, y cada combinación necesita su propia muestra.[3]

Usa A/B cuando...

  • Tienes tráfico moderado o bajo.
  • Quieres probar cambios grandes, audaces, de concepto.
  • Necesitas una respuesta clara y rápida.
  • Es tu opción principal la mayoría de las veces.[3]

Usa MVT cuando...

  • Tienes muchísimo tráfico.[8]
  • Quieres afinar varios elementos pequeños de una página que ya funciona.
  • Te interesa cómo interactúan los elementos entre sí.[8][9]

Cuidado con las interacciones

A veces dos cambios funcionan genial por separado y fatal juntos. En un caso real, mirando cada elemento por separado parecía que ganaba el titular nuevo y el diseño original de logos. Pero al mirar las combinaciones, el efecto grande venía de cambiar el titular sin tocar los logos.[5] Muchos métodos multivariantes populares (los "fraccionales", como Taguchi) suponen cosas sobre las combinaciones que no prueban. Si usas uno, confirma siempre la combinación ganadora con una prueba A/B de seguimiento.[3]

¿Cómo se evalúa si un cambio mejora la conversión sin perjudicar el valor medio de los pedidos?

Puedes subir la conversión y bajar los ingresos al mismo tiempo. Si tu cambio hace que la gente compre más seguido pero cosas más baratas, puedes estar celebrando una pérdida. Por eso:

1. Mide la métrica que une las dos cosas

Ingresos por visitante (RPV) = Tasa de conversión × Valor medio del pedido

Si vendes productos con precios muy distintos, el ingreso (o mejor, el beneficio) por visitante suele ser más útil que la tasa de conversión sola.[5] En un caso documentado, una tienda de arte subió las compras un 28% y los ingresos por visitante un 42%: esa segunda cifra es la que paga las facturas.[3]

2. Define métricas de protección (guardrails)

Antes de la prueba, elige métricas que no pueden empeorar aunque la principal mejore. Si tu negocio tiene transacciones, la de protección suele ser los ingresos.[2] El AOV es el candidato perfecto. Decide de antemano cuánto empeoramiento aceptas (por ejemplo, "no más de un 2% de caída en el AOV").

3. Usa la lógica de no inferioridad

Una prueba de no inferioridad no busca demostrar que algo es mejor, sino que no es peor más allá de un margen aceptable.[2] Es justo lo que necesitas para el AOV: demostrar que no se cayó.

4. Ojo con los ballenatos

Las métricas de dinero tienen mucha varianza: un cliente que compra por 2,000 dólares puede mover todo el promedio. Una técnica útil es poner un tope (capping) a los valores extremos para medir mejor el efecto en el cliente típico, y analizar esos casos extremos aparte.[8]

5. Mide varias metas a la vez

Mientras mejoras las conversiones grandes, podrías estar bajando registros o suscripciones que te dan dinero a largo plazo. Vigila más de una meta.[6]

🍝 Little Italy Kitchen

Probaron quitar el paso de "¿Quieres añadir postre o vino?" del checkout para hacerlo más corto. La conversión subió un 6%... pero el ticket medio cayó de 38 a 33 dólares. Ingresos por visitante: bajaron. Volvieron a poner el paso, pero como una sola línea con el tiramisú y una casilla. Conversión +4%, ticket medio igual. Ahora sí.

¿Cómo se interpretan resultados estadísticamente significativos pero comercialmente irrelevantes?

"Significativo" en estadística solo quiere decir que tienes suficiente confianza en que la diferencia existe. No quiere decir que la diferencia sea grande ni importante. Con una muestra suficientemente grande, hasta diferencias minúsculas salen significativas.[5]

Que un botón suba la conversión de 3.00% a 3.02% "con 99% de confianza" es estadísticamente precioso y comercialmente inútil.

Cómo decidir

  1. Traduce el efecto a dinero. ¿Cuánto vale al año esa mejora? Si son 300 dólares, no compensa ni la reunión para decidirlo.
  2. Mira el intervalo, no solo el número. Un "+16.5%" puede ser en realidad "entre +6% y +28%". Si el intervalo va de −0.7% a +21%, todavía no está demostrado.[3]
  3. Compara con el costo de implementarlo y mantenerlo. Hay cambios que ganan por poco pero complican tu código para siempre.
  4. Piensa en el costo de oportunidad. Cada prueba ocupa tiempo y tráfico. Si tienes oportunidades más grandes, atiende esas primero.[5]
  5. Define antes de empezar el efecto mínimo que te importa (el MDE). Si el resultado es menor, es un empate práctico.

¿Y si no hay diferencia significativa?

No tires la idea a la basura todavía. Puede que la hipótesis fuera correcta pero la ejecución mala; puede que no haya diferencia en el total pero sí en un segmento (móvil, nuevos visitantes); o puede que simplemente prefieras una versión por otras razones y está bien quedarte con ella.[6] Y recuerda que una prueba "fallida" también te enseñó algo.[2]

Bibliografía

Los números de página corresponden a la numeración del archivo PDF. En el libro de Rob Hope se cita el número de consejo.

  1. Web Analytics 2.0: The Art of Online Accountability & Science of Customer Centricity (Avinash Kaushik. Sybex, 2010; archivo Web analytics 2.0 the art of online accountability science of customer centricity (Avinash Kaushik).pdf). p. 240 (numeración del PDF).
  2. Practical A/B Testing: Creating Experimentation-Driven Products (Leemay Nassery. The Pragmatic Programmers, 2023; archivo Practical AB Testing Creating Experimentation-Driven Products (Leemay Nassery).pdf). pp. 36, 40–42, 46, 47, 54–58, 68–70 (numeración del PDF).
  3. You Should Test That! Conversion Optimization for More Leads, Sales and Profit (Chris Goward. Sybex, 2013; archivo You Should Test That Conversion Optimization for More Leads, Sales and Profit or The Art and Science of Optimized Marketing (Chris Goward).pdf). pp. 54–56, 59–63, 139–142, 253, 287, 288, 297, 318–320, 326, 331–335 (numeración del PDF).
  4. Google Analytics Breakthrough: From Zero to Business Impact (Feras Alhlou, Shiraz Asif y Eric Fettman. Wiley, 2016; archivo Google analytics breakthrough _ from zero to business impact.pdf). pp. 60, 588 (numeración del PDF).
  5. Landing Page Optimization: The Definitive Guide to Testing and Tuning for Conversions (Tim Ash. Wiley/Sybex, 2008; archivo Landing Page Optimization The Definitive Guide to Testing and Tuning for Conversions (Tim Ash).pdf). pp. 58, 78, 209–213, 314, 319–324 (numeración del PDF).
  6. Google Analytics Integrations (Daniel Waisberg. Wiley, 2015; archivo Google Analytics Integrations.pdf). pp. 31, 181–183 (numeración del PDF).
  7. Landing Page Hot Tips (Rob Hope; archivo Landing Page Hot Tips. Strengthen your Landing Pages with 100 design, development and conversion tips (Rob Hope).pdf). Consejo n.º 57.
  8. Next-Level A/B Testing (Leemay Nassery. The Pragmatic Programmers, 2025; archivo Next-Level AB Testing (Leemay Nassery).pdf). pp. 73–77, 121–123, 132–134 (numeración del PDF).
  9. A/B Testing (Tutorials Point, 2016; archivo AB Testing (Tutorials Point).pdf). p. 27 (numeración del PDF).
  10. Evan Miller — Sample Size Calculator. evanmiller.org/ab-testing/sample-size.html.

La guía de conversión, capítulo a capítulo

Los 7 artículos de esta sección, de los conceptos básicos a lo más técnico. Puedes leerlos en orden o saltar al que te haga falta.

  1. Guía de la tasa de conversión
  2. Por qué tu web no convierte
  3. Confianza y psicología de la conversión
  4. Analítica de conversiones
  5. Pruebas A/B (estás aquí)
  6. Fricción, UX y checkout
  7. El dinero del CRO: ROI, CAC, AOV y LTV

Agregar comentario

* Información requerida
1000
Arrastrar y soltar imágenes (max 3)
What is the opposite word of weak?
Imagen captcha

Comentarios

Sin comentarios aún. ¡Sé el primero!