Por favor, espere...
projx digital
projx digital
Tiempo de lectura 28 minuto
01.10.2020

El sorprendente poder de los experimentos en línea

En 2012, un empleado de Microsoft que trabajaba en Bing tuvo una idea sobre cómo cambiar la forma en que el motor de búsqueda mostraba los titulares de los anuncios. Desarrollarla no requería mucho esfuerzo (a un ingeniero le tomaría unos días), pero era una de los cientos de ideas propuestas, y los gestores del programa la enviaron al final de la lista de prioridades. Así, la idea quedó estancada durante más de seis meses, hasta que un ingeniero que se dio cuenta de que el coste de escribir el código sería bajo lanzó un sencillo experimento controlado en línea (una prueba A/B) para medir su impacto. En cuestión de horas, el nuevo tipo de titular estaba generando ingresos anormalmente altos y activó una alerta de ''demasiado bueno para ser cierto''. Estas alertas suelen indicar la existencia de un error, pero no en esta ocasión. Un análisis reveló que el cambio había aumentado los ingresos un sorprendente 12 por ciento sin afectar a las métricas clave de experiencia de usuario; en términos anuales, esto se tradujo en más de 100 millones de dólares solo en Estados Unidos. Esta fue la idea más rentable en la historia de Bing, pero su valor no se apreció lo suficiente hasta que se probó.

¡Qué lástima! Este ejemplo pone de relieve lo difícil que puede ser evaluar el potencial de las nuevas ideas. Igual de importante, demuestra la ventaja de realizar muchas pruebas a bajo coste y en paralelo. Esta es una realidad que muchas empresas están empezando a reconocer. 

Hoy en día, Microsoft y muchas otras empresas líderes (incluidas Amazon, Booking.com, Facebook y Google) realizan cada una más de 10.000 experimentos controlados en línea al año, muchos de los cuales involucran a millones de usuarios. Las startups y las empresas no nativas digitales como Walmart, Hertz y Singapore Airlines también realizan estos estudios con regularidad, pero a menor escala. Estas organizaciones se han dado cuenta de que un enfoque de ''experimentar con todo'' produce rendimientos sorprendentemente grandes. Por ejemplo, lleva a Bing a identificar docenas de cambios relacionados con los ingresos cada mes, que en conjunto aumentan los ingresos entre un 10 y un 25 por ciento cada año. Junto con cientos de otros cambios que mejoran la satisfacción del usuario, estas mejoras son la razón principal por la que Bing se ha vuelto rentable y ha aumentado su cuota de búsquedas en ordenadores personales en Estados Unidos del 8 por ciento cuando se lanzó en 2009 al 23 por ciento.     

En una época en la que la web es vital para casi todos los negocios, la experimentación cuidadosa en línea debería formar parte de los procedimientos operativos estándar. Si una empresa desarrolla la infraestructura de software y las capacidades organizativas para utilizarla, puede identificar no solo ideas para sitios web, sino también posibles modelos de negocio, estrategias, productos, servicios y campañas de marketing; y de forma bastante barata. Los experimentos controlados pueden transformar la toma de decisiones de una reacción instintiva a un proceso científico y basado en la evidencia. Sin ellos, muchas innovaciones revolucionarias nunca surgirían, y muchas malas ideas se aplicarían solo para fracasar y desperdiciar recursos.  

Sin embargo, hemos aprendido que la mayoría de las organizaciones, incluidas las grandes empresas digitales, son desordenadas en su enfoque experimental, no saben cómo aplicar pruebas científicas cuidadosas o experimentan demasiado poco. 

Juntos, hemos dedicado más de 35 años a trabajar y aplicar experimentos y a asesorar a empresas de una amplia gama de industrias sobre este tema. En estas páginas compartiremos las lecciones que hemos recopilado sobre cómo diseñarlos e implementarlos, garantizar su precisión, interpretar sus resultados y abordar los desafíos que pueden plantear. Aunque nos centraremos en el tipo más simple de experimento controlado, la prueba A/B, nuestras conclusiones y recomendaciones también son aplicables a diseños experimentales más complejos. 

"APRECIAR EL VALOR DE LAS PRUEBAS A/B"

En una prueba A/B, el experimentador prepara dos experiencias: el grupo de control ''A'' suele ser el sistema existente y se considera el ''campeón''; el grupo de tratamiento ''B'' es una modificación que intenta arreglar algo, el ''retador''. Los usuarios se asignan aleatoriamente a los grupos y se calculan y comparan las métricas clave. (Por el contrario, las pruebas A/B/C y A/B/C/D de una sola variable y las pruebas multivariantes evalúan más de un tratamiento o cambios en diferentes variables simultáneamente). Esta configuración puede ser una nueva funcionalidad en el entorno en línea, un cambio en la interfaz de usuario (como una nueva vista de esquema), un cambio de back-end (como una mejora en un algoritmo que recomienda libros en Amazon) o un modelo de negocio diferente (como una oferta o envío gratuito). Sea cual sea la parte de las operaciones que más les importe a las empresas (ya sea ventas, uso repetido, tasas de clics o el tiempo que los usuarios pasan en un sitio), pueden utilizar las pruebas A/B en línea para aprender a optimizarla.

Cualquier empresa con al menos unos pocos miles de usuarios activos diarios puede implementar estas pruebas. La capacidad de recopilar automáticamente enormes volúmenes de datos sobre las interacciones de los usuarios en sitios web y aplicaciones y de acceder a grandes muestras de clientes para realizar experimentos simultáneos brinda a las empresas una oportunidad única de evaluar muchas ideas rápidamente, con una precisión extraordinaria y a un coste insignificante por experimento incremental. Esto permite a las organizaciones iterar rápidamente, fallar rápido y recuperarse. 

Algunas empresas tecnológicas líderes, reconociendo estas ventajas, dedican grupos enteros a construir, gestionar y mejorar una infraestructura de experimentación utilizada por muchos equipos de producto. Esta capacidad puede ser una ventaja competitiva significativa, siempre y cuando sepa cómo utilizarla. Estos son los puntos que los gestores deben comprender:

Pequeños cambios pueden tener grandes efectos. La gente suele pensar que cuanto mayor sea la inversión, mayor será el impacto que verán. Pero las cosas raramente funcionan así en el mundo en línea, donde el éxito depende más de acertar con muchos pequeños cambios. Aunque el mundo empresarial celebra las grandes ideas disruptivas, en realidad la mayor parte del progreso proviene de implementar cientos o miles de pequeñas mejoras. 

Considere el siguiente ejemplo, de nuevo de Microsoft. (Aunque la mayoría de los ejemplos de este artículo provienen de Microsoft, donde Ron dirigió los esfuerzos de experimentación, también incluyen lecciones de muchas otras empresas). En 2008, un empleado en el Reino Unido hizo una sugerencia aparentemente trivial: cuando un usuario hiciera clic en el enlace de Hotmail en la página de inicio de MSN, abrir automáticamente una nueva pestaña para lanzar Hotmail en lugar de abrirlo en la misma pestaña (en navegadores antiguos, abrir una nueva ventana). Se realizó una prueba con unos 900.000 usuarios del Reino Unido, y los resultados fueron bastante alentadores: la interacción entre los usuarios que abrieron Hotmail aumentó un impresionante 8,9 por ciento medido por los clics en la página de inicio de MSN. (La mayoría de los cambios de interacción tienen un efecto inferior al 1 por ciento). Aun así, la idea era controvertida porque en aquella época muchos sitios abrían enlaces en pestañas nuevas, por lo que el cambio solo se implementó en el Reino Unido.  

El experimento se repitió en junio de 2010 en Estados Unidos con 2,7 millones de usuarios, con resultados similares, por lo que el cambio se implementó a nivel mundial. Microsoft entonces exploró si abrir los resultados en una nueva pestaña para las personas que iniciaban una búsqueda en MSN, para ver cómo funcionaría esta idea en otros lugares. En un experimento en EE. UU. con más de 12 millones de usuarios, los clics por usuario aumentaron un 5 por ciento. Abrir enlaces en nuevas pestañas es una de las mejores formas que Microsoft ha introducido nunca para aumentar la interacción de los usuarios, y lo único que se necesita es cambiar unas pocas líneas de código. Hoy en día, muchos sitios web, incluidos Facebook.com y Twitter.com, utilizan esta técnica. 

La experiencia de Microsoft no es particularmente única. Por ejemplo, los experimentos de Amazon mostraron que mover las opciones de tarjeta de crédito desde su página de inicio a la página del carrito de compras incrementó sus beneficios anuales en millones de dólares. Está claro que las pequeñas inversiones producen grandes rendimientos. Por el contrario, las grandes inversiones o bien tienen rendimientos muy pequeños o no tienen ninguno. Activar la integración de redes sociales en Bing (para que el contenido de Facebook y Twitter abriera un tercer panel en la página de resultados de búsqueda) le costó a Microsoft más de 25 millones de dólares y solo produjo pequeños aumentos en la interacción y los ingresos.

Los experimentos pueden guiar las decisiones de inversión. Las pruebas en línea pueden ayudar a los gestores a comprender qué inversión en una mejora potencial es la adecuada. Esta fue una decisión a la que Microsoft recurrió al buscar formas de reducir el tiempo de visualización de los resultados de búsqueda de Bing. Por supuesto, más rápido es mejor, pero ¿puede medirse cuantitativamente el valor de una mejora? ¿Se necesitan tres, 10 o 50 personas para trabajar en esta mejora? Para responder a estas preguntas, la empresa realizó una serie de pruebas A/B en las que se añadieron retrasos artificiales para estudiar los efectos de diferencias mínimas en la velocidad de carga. Los datos mostraron que cada diferencia de 100 milisegundos en el rendimiento tenía un impacto del 0,6 por ciento en los ingresos. Dado que los ingresos anuales de Bing superan los 3.000 millones de dólares, una aceleración de 100 milisegundos vale 18 millones de dólares en ingresos incrementales anuales, suficiente para financiar un equipo considerable. 

La prueba también permitió a Bing tomar decisiones importantes, en particular sobre características que podrían mejorar la relevancia de los resultados de búsqueda pero ralentizar el tiempo de respuesta del software. Bing quería evitar una situación en la que muchas pequeñas funcionalidades causaran acumulativamente una caída significativa en el rendimiento. Por lo tanto, la introducción de funciones individuales que ralentizaban el tiempo de respuesta en más de unos pocos milisegundos se aplazó hasta que el equipo pudiera mejorar su propio rendimiento o el de otra unidad. 

"CONSTRUIR UNA CAPACIDAD A GRAN ESCALA"

Hace más de 100 años, el dueño de grandes almacenes John Wanamaker dijo lo que se ha convertido en una máxima del marketing: ''La mitad del dinero que gasto en publicidad se desperdicia; el problema es que no sé qué mitad''. Hemos observado una situación similar con las nuevas ideas: la mayoría fracasan en los experimentos, e incluso los expertos a menudo se equivocan al predecir cuáles darán buenos resultados. En Google y Bing, entre el 10 y el 20 por ciento de los experimentos producen resultados positivos. En Microsoft en su conjunto, un tercio ha resultado positivo, un tercio neutral y un tercio negativo. Todo esto demuestra que las empresas tienen que besar muchos sapos (es decir, realizar muchos experimentos) antes de encontrar un príncipe.

Experimentar con todo es fundamental para asegurarse de que los cambios no retrocedan o tengan efectos no deseados. En Bing, alrededor del 80 por ciento de los cambios propuestos se implementan inicialmente como experimentos controlados. (No se incluyen algunas correcciones de errores de bajo riesgo y cambios a nivel de máquina, como las actualizaciones del sistema operativo). 

Se necesita una infraestructura para probar científicamente casi todas las ideas: instrumentación (para registrar clics, movimientos del ratón y tiempos de eventos), canalizaciones de datos y científicos de datos. Algunas herramientas y servicios de terceros facilitan la experimentación, pero si desea escalar, necesita integrar la capacidad profundamente en sus procesos. Esto reducirá el coste y aumentará la fiabilidad de cada experimento. Por el contrario, la falta de infraestructura mantendrá los costes marginales altos y puede desalentar a los altos directivos de querer más experimentos. 

Microsoft ofrece un ejemplo de una infraestructura de prueba no trivial, pero, por supuesto, una empresa más pequeña o menos dependiente de la experimentación puede arreglárselas con menos. El equipo de Análisis y Experimentación de Microsoft puede ayudar a realizar cientos de experimentos controlados en un día determinado, en una variedad de productos que incluyen Bing, Cortana, Exchange, MSN, Office, Skype, Windows y Xbox. Cada experimento introduce a cientos de miles, a veces decenas de millones, de usuarios a una nueva funcionalidad o cambio. El equipo realiza rigurosos análisis estadísticos en todas estas pruebas y produce cuadros de mando que monitorizan automáticamente cientos de miles de métricas y señalan cambios significativos. 

"Los mejores científicos de datos juran por la ley de Twyman: cualquier cifra que parezca interesante o diferente suele estar equivocada."

El personal de experimentación de una empresa puede organizarse de tres maneras:

El modelo centralizado. En este enfoque, un equipo de científicos de datos sirve a toda la empresa. La ventaja es que pueden centrarse en proyectos a largo plazo, como la construcción de mejores herramientas de experimentación y el desarrollo de algoritmos estadísticos más avanzados. Un problema central es que las unidades de negocio que recurren al grupo pueden tener diferentes prioridades, lo que puede dar lugar a desacuerdos sobre el reparto de recursos y costes. Otra cuestión es que los científicos de datos pueden sentirse aislados al tratar con las empresas y pueden no alinearse plenamente con los objetivos y el conocimiento del dominio de la unidad, lo que puede dificultarles conectar los puntos y compartir sus perspectivas sobre un tema. Además, los científicos de datos pueden no tener la credibilidad para persuadir a la alta dirección de que invierta en las herramientas necesarias o para convencer a los gestores corporativos e internos de que confíen en los resultados del experimento.

El modelo descentralizado. Otro enfoque es distribuir a los científicos de datos entre las diferentes unidades de negocio. La ventaja de este modelo es que los científicos de datos pueden especializarse en cada área de negocio. La principal desventaja es que no ofrece un camino profesional claro para estos profesionales, que además se pierden la retroalimentación y la orientación de los compañeros que les ayudan a crecer. Los experimentos en unidades individuales también pueden no tener la masa suficiente para justificar la creación de las herramientas necesarias.

El modelo del centro de excelencia. Una tercera opción es tener científicos de datos en una función central y otros en las unidades de negocio. (Microsoft utiliza este enfoque). Un centro de excelencia se centra más en el diseño, la implementación y el análisis de los experimentos controlados. Al establecer una plataforma de experimentación y herramientas relacionadas para toda la empresa, reduce significativamente el tiempo y los recursos necesarios para estas tareas. También difunde las mejores prácticas de prueba en toda la organización a través de clases, trabajo de laboratorio y conferencias. Los principales inconvenientes son que no está claro qué corresponde por separado al centro de excelencia y a los equipos de producto, quién paga la contratación de más científicos de datos cuando varias unidades escalan sus experimentos, y quién es responsable de invertir en alertas y controles que señalen resultados poco fiables. 

No hay un modelo correcto o incorrecto. Las pequeñas empresas suelen empezar con el modelo centralizado o utilizan una herramienta de terceros, y después de crecer, transitan a uno de los otros modelos. En las empresas que operan en múltiples áreas de negocio, los gestores que ven las pruebas como una prioridad pueden no querer esperar a que los líderes corporativos desarrollen un enfoque organizativo coordinado. En tales casos, un modelo descentralizado puede tener sentido, al menos inicialmente. Si la experimentación en línea es una prioridad corporativa, una empresa puede querer desarrollar experiencia y establecer estándares en una unidad central antes de implementarla en las unidades de negocio.

"DEFINIR CÓMO ES EL ÉXITO"

Cada grupo de negocio necesita establecer una métrica de evaluación adecuada (y normalmente múltiple) alineada con sus objetivos estratégicos para los experimentos. Esto puede sonar sencillo, pero identificar qué métricas a corto plazo predicen mejor los resultados a largo plazo no es fácil. La mayoría de las empresas se equivocan en esto. Acertar (es decir, llegar a un criterio de evaluación global, u OEC) requiere una comprensión cuidadosa y, por lo general, extensas entrevistas dentro de la empresa. Tiene que haber una estrecha colaboración entre los altos directivos que entienden la estrategia y los científicos de datos que comprenden las métricas y las concesiones. Tampoco es un ejercicio único: recomendamos que el OEC se adapte anualmente.

Como muestra la experiencia de Bing, no se llega directamente a un OEC. Los objetivos clave a largo plazo son aumentar las consultas del motor de búsqueda y los ingresos publicitarios. Curiosamente, reducir la relevancia de los resultados de búsqueda llevaría a los usuarios a hacer más consultas (aumentando así la tasa de consultas) y a hacer clic en más anuncios (aumentando así los ingresos). Estas ganancias tienden a ser efímeras, sin embargo, porque las personas finalmente cambian a otros motores de búsqueda. En las discusiones sobre OEC, los ejecutivos y científicos de datos de Bing decidieron que querían minimizar las consultas de los usuarios por tarea o sesión y maximizar el número de tareas o sesiones que los usuarios llevan a cabo.  

También es importante desglosar un OEC en sus componentes y hacer un seguimiento de esos componentes, porque a menudo proporcionan información sobre por qué una idea tuvo éxito. Por ejemplo, si los clics son esenciales para la integridad del OEC, es importante medir qué partes de una página reciben clics. Mirar diferentes métricas es fundamental, porque ayuda a los equipos a descubrir si un experimento tuvo un efecto imprevisto en otra área. Por ejemplo, un equipo que cambia las consultas de búsqueda relacionadas mostradas (digamos, una búsqueda de ''Harry Potter'' podría mostrar consultas de libros, películas, los repartos de esas películas y temas similares de Harry Potter) puede no darse cuenta de que ha alterado la distribución de las consultas (al aumentar las búsquedas de consultas relacionadas), lo que puede afectar los ingresos positiva o negativamente. 

El proceso de construir y adaptar el OEC y de comprender los objetivos y los efectos se vuelve más fácil con el tiempo. Al realizar experimentos, depurar los resultados (que discutiremos en breve) e interpretarlos, las empresas no solo obtienen una valiosa experiencia sobre qué métricas funcionan mejor para ciertos tipos de pruebas, sino que también desarrollan nuevas métricas. A lo largo de los años, Bing ha creado más de 6.000 métricas que los experimentadores pueden utilizar, agrupadas en plantillas basadas en las áreas que cubren las pruebas (búsquedas web, búsquedas de imágenes, búsquedas de vídeos, cambios en la publicidad, etc.). 

"EVITAR LOS DATOS DE BAJA CALIDAD"

Si la gente no confía en los resultados de sus experimentos, no importa lo bueno que sea su criterio de evaluación. ¡Obtener números es fácil; obtener números en los que se pueda confiar es difícil! Debe dedicar tiempo y recursos a validar el sistema de experimentación y a las comprobaciones y salvaguardas automatizadas. Un método es realizar pruebas A/A cuidadosas, es decir, probar algo contra sí mismo para asegurarse de que el sistema no encuentre correctamente una diferencia estadísticamente significativa en casi el 95 por ciento de los casos. Este sencillo enfoque ha permitido a Microsoft detectar cientos de experimentos no válidos y aplicaciones incorrectas de fórmulas (como usar una fórmula que asume que todas las métricas son independientes cuando no lo son).

Hemos aprendido que los mejores científicos de datos son escépticos y juran por la ley de Twyman: cualquier cifra que parezca interesante o diferente suele estar equivocada. Los resultados sorprendentes deben repetirse, tanto para demostrar su validez como para aliviar las dudas de la gente. Por ejemplo, en 2013 Bing realizó una serie de experimentos con los colores de varios textos en la página de resultados de búsqueda, incluidos títulos, enlaces y leyendas de imágenes. Aunque los cambios de color eran imperceptibles (véase el diagrama de la izquierda), los resultados fueron inesperadamente positivos: los usuarios que vieron azules y verdes ligeramente más oscuros en los títulos y un negro ligeramente más claro en las leyendas tuvieron más éxito en sus búsquedas, y los que encontraron lo que querían lo hicieron en un tiempo significativamente menor. 

Debido a que las diferencias de color son raramente perceptibles, los resultados fueron comprensiblemente recibidos con escepticismo por algunas disciplinas, incluidos los expertos en diseño. (Como muchas otras empresas, Microsoft se basó durante mucho tiempo en diseñadores expertos, en lugar de en el comportamiento de los usuarios reales, para determinar su modelo y colores de estilo corporativo). Por lo tanto, el experimento se repitió de forma más exhaustiva con 32 millones de usuarios, y los resultados fueron similares. El análisis mostró que, cuando se ofreciera a todos los usuarios, los cambios de color podrían aumentar los ingresos en más de 10 millones de dólares al año. 

Si desea que los resultados sean fiables, debe asegurarse de que se utilizan datos de alta calidad. Pueden ser necesarias medidas como excluir valores atípicos, detectar errores de recogida y similares. Esta cuestión es especialmente importante en el mundo en línea por muchas razones. Tomemos los bots de internet. Más de la mitad de las solicitudes a Bing provienen de bots. Estos datos pueden distorsionar los resultados o añadir ''ruido'', dificultando la determinación de la significancia estadística. Otra cuestión es la prevalencia de indicadores de datos atípicos. Por ejemplo, Amazon descubrió que ciertos usuarios individuales hacían pedidos de libros lo suficientemente grandes como para sesgar una prueba A/B entera; resultó que eran cuentas de bibliotecas. 

Los gestores también deben tener cuidado cuando algunos segmentos experimentan efectos mayores o menores que otros (un fenómeno que algunos estadísticos llaman ''efectos heterogéneos del tratamiento''). En algunos casos, un único segmento bueno o malo puede sesgar la media lo suficiente como para invalidar los resultados generales. Esto ocurrió en uno de los experimentos de Microsoft: un segmento compuesto por usuarios de Internet Explorer 7 no podía hacer clic en los resultados de búsqueda de Bing debido a un error de JavaScript, y los resultados generales, por lo demás positivos, resultaron negativos. Una plataforma de experimentación debe detectar estos segmentos inusuales; si no lo hace, los experimentadores que buscan un efecto promedio pueden descartar una buena idea como mala. 

Los resultados también pueden verse afectados cuando las empresas reutilizan las poblaciones de control y tratamiento de un experimento al siguiente. Esta práctica provoca ''efectos de arrastre'', en los que las experiencias de las personas en un experimento cambian su comportamiento futuro. Para evitarlo, las empresas necesitan ''rotar'' a los usuarios entre experimentos. 

Otra comprobación general que realiza la plataforma de experimentación de Microsoft es verificar que los porcentajes de usuarios en los grupos de control y tratamiento en el experimento real coincidan con la división prevista. Cuando no coinciden, suele surgir una ''discrepancia en la proporción de la muestra'', que normalmente invalida los resultados. Por ejemplo, una proporción de 50,2/49,8 (821.588 frente a 815.482 usuarios) se desvía tanto de la proporción esperada de 50/50 que la probabilidad de que ocurriera por casualidad es menor de una entre 500.000. Estas discrepancias ocurren con regularidad (a menudo semanalmente), y los equipos deben ser diligentes en entender por qué y resolverlas.

"EVITAR LAS SUPOSICIONES SOBRE LA CAUSALIDAD"

Debido al entusiasmo en torno al Big Data, algunos gestores creen erróneamente que la causalidad no es importante. Creen que todo lo que necesitan hacer es establecer correlaciones y la causalidad se inferirá. ¡Falso!

Los dos ejemplos siguientes explican por qué y también ponen de relieve las deficiencias de los experimentos sin un grupo de control. En el primer ejemplo, dos equipos realizaron estudios observacionales separados de dos funciones avanzadas en Microsoft Office. Ambos concluyeron que la nueva función que estaban evaluando reducía el abandono. De hecho, casi cualquier función avanzada mostrará tal correlación, porque quienes prueban una función avanzada suelen ser usuarios intensivos, y también tienen una baja tasa de abandono. Por lo tanto, aunque una nueva función avanzada pueda asociarse con una baja tasa de abandono, no necesariamente la causa. Los usuarios de Office que reciben mensajes de error también tienen una baja tasa de abandono, porque tienden a ser también usuarios intensivos. ¿Significa esto que mostrar a los usuarios más mensajes de error reducirá el abandono? La verdad es que no.   

El segundo ejemplo se refiere a la investigación de Yahoo para evaluar si los anuncios gráficos mostrados en sus propios sitios aumentaban las búsquedas del nombre de la marca o de palabras clave relacionadas. La parte observacional del estudio estimó que los anuncios aumentaban las búsquedas en un 871 por ciento, llegando al 1.198 por ciento. Sin embargo, cuando Yahoo realizó un experimento controlado, el aumento fue de solo el 5,4 por ciento. Sin un grupo de control, la empresa podría haber concluido que los anuncios tenían un efecto increíble y no haberse dado cuenta de que el aumento de las búsquedas se debía a otras variables durante el periodo de observación.

"Algunos gestores piensan erróneamente que todo lo que necesitan hacer es establecer correlaciones y la causalidad se inferirá. ¡Falso!"

Está claro que la investigación observacional no puede establecer la causalidad. Esto es bien sabido en medicina; por eso la Administración de Alimentos y Medicamentos de EE. UU. exige a las empresas que realicen ensayos clínicos aleatorios para demostrar que sus medicamentos son seguros y eficaces.  
Incluir demasiadas variables en las pruebas también dificulta la inferencia de la causalidad. Estas pruebas producen resultados difíciles de desentrañar e interpretar. Lo ideal es que un experimento sea lo suficientemente simple como para que la relación causa-efecto pueda entenderse fácilmente. Otra desventaja de los diseños complejos es que hacen que los experimentos sean mucho más vulnerables a los errores. Si hay un 10 por ciento de probabilidad de que una prueba de una nueva función desencadene un problema catastrófico que requiera su cancelación, un cambio que incluya siete nuevas funciones tiene más de un 50 por ciento de probabilidad de tener un error fatal.  

Pero ¿qué pasa si se puede determinar que una cosa causa otra, pero no se sabe por qué? ¿Debería intentar comprender el mecanismo subyacente? La respuesta corta es ''sí''. 

Entre 1500 y 1800, unos 2 millones de marineros murieron de escorbuto. Hoy sabemos que el escorbuto está causado por una deficiencia de vitamina C en la dieta; los marineros no podían llevar suficientes provisiones de fruta en los largos viajes. En 1747, el cirujano de la Royal Navy Dr. James Lind decidió realizar un ensayo para probar seis posibles remedios. En un viaje, dio a algunos marineros naranjas y limones, y a otros remedios alternativos como vinagre. El experimento demostró que los cítricos podían prevenir el escorbuto, aunque nadie sabía por qué. Lind pensó erróneamente que la acidez de la fruta era el agente curativo e intentó preparar un remedio más estable calentando el zumo de cítricos para convertirlo en un concentrado, destruyendo así la vitamina C. Pasaron 50 años hasta que, cuando se añadió zumo de limón sin calentar a las raciones diarias de los marineros, la Royal Navy finalmente libró a su tripulación del azote del escorbuto. Si Lind hubiera realizado un experimento controlado con zumo de limón calentado y sin calentar, probablemente el tratamiento se habría descubierto mucho antes y se habrían salvado muchas vidas. 

Así que debemos señalar que para aprovechar el conocimiento del ''qué'', no siempre es necesario tener el conocimiento del ''por qué'' y el ''cómo''. Esto es especialmente cierto cuando se trata del comportamiento de los usuarios, cuyas motivaciones son difíciles de predecir. Algunas de las innovaciones revolucionarias de Bing se han realizado sin una teoría subyacente. Por ejemplo, aunque Bing pudo mejorar la experiencia de usuario con cambios imperceptibles en los colores del texto, no existen teorías claras sobre el color que nos ayuden a entender por qué. Aquí, la evidencia ocupó el lugar de la teoría.

EL MUNDO EN LÍNEA se percibe a menudo como turbulento y lleno de trampas, pero los experimentos controlados pueden ayudarnos a navegarlo. Cuando las respuestas no son lo suficientemente claras, o cuando las personas tienen opiniones opuestas, o cuando el valor de una idea es incierto, pueden señalarnos la dirección correcta.

Hace unos años, Bing intentaba decidir si ampliar los anuncios para que los anunciantes pudieran añadir enlaces que apuntaran a páginas de destino específicas. (Por ejemplo, un prestamista podría añadir enlaces como ''comparar tasas de interés'' y ''sobre la empresa'' en lugar de un único enlace a la página de inicio). La desventaja era que los anuncios más grandes ocuparían naturalmente más espacio en la pantalla y aumentarían tanto la insatisfacción del usuario como la pérdida de clientes. Las opiniones sobre la idea estaban divididas. Por tanto, el equipo de Bing aumentó el tamaño de los anuncios manteniendo fija la superficie total de pantalla asignada a ellos; esto significaba mostrar menos anuncios. Los resultados mostraron que menos anuncios pero más grandes producían una mejora importante. Los ingresos aumentaron en más de 50 millones de dólares anuales, sin perjudicar los elementos clave de la experiencia de usuario. 

Si realmente quiere entender el valor de un experimento, observe la diferencia entre su resultado esperado y su resultado real. Si pensó que algo iba a suceder y sucedió, no aprendió mucho. Si pensó que algo iba a suceder y no sucedió, aprendió algo importante. Si pensó que algo insignificante iba a suceder y los resultados fueron una gran sorpresa y dieron lugar a una innovación revolucionaria, aprendió algo extremadamente valioso. 

Su empresa puede combinar el poder del software con el rigor científico de los experimentos controlados para construir un laboratorio de aprendizaje. Las ganancias que cosechará (en forma de ahorro de costes, nuevos ingresos y mejora de la experiencia de usuario) pueden ser enormes. Si quiere una ventaja competitiva, su empresa debe desarrollar una capacidad de experimentación y volverse competente en la ciencia de realizar pruebas en línea.

EN RESUMEN
LA NECESIDAD;Al construir sitios web y aplicaciones, muchas empresas deciden todo, desde las características de los nuevos productos hasta la apariencia y las campañas de marketing, basándose en opiniones subjetivas en lugar de datos sólidos.

LA SOLUCIÓN; Las empresas deben realizar experimentos controlados en línea para medir el valor de sus ideas. Las posibles mejoras deben probarse rigurosamente, porque las grandes inversiones pueden no rentabilizarse, mientras que algunos pequeños cambios pueden producir grandes rendimientos y otros pueden causar daños sorprendentes.

IMPLEMENTACIÓN; Los líderes deben saber cómo diseñar y ejecutar correctamente pruebas A/B y otros experimentos controlados, garantizar su precisión, interpretar sus resultados y evitar sus trampas ocultas. 

projx digital
projx digital
projx digital