
Data Science es la disciplina que usa datos para responder preguntas que no se pueden contestar mirando un informe. Un informe te dice qué pasó; un modelo de data science estima qué va a pasar o por qué está pasando. Esa es toda la diferencia, y no hace falta saber programar para entenderla ni para decidir cuándo la necesitas.
Te lo explico sin fórmulas, con las tres preguntas que sí resuelve y las que no.
Qué es Data Science en una frase que se entienda
Data Science es el uso de métodos estadísticos y computacionales para extraer conocimiento de los datos. En la práctica, es buscar patrones en datos históricos y usarlos para estimar algo que no sabes.
El ejemplo más doméstico es el corrector del móvil: ha visto millones de frases, ha aprendido qué palabra suele seguir a cuál, y con eso predice la siguiente. No entiende lo que escribes. Reconoce patrones.
Un modelo de negocio funciona igual. Ha visto miles de clientes que se dieron de baja y miles que no, ha aprendido qué comportamientos preceden a una baja, y te dice qué clientes actuales se parecen a los que se fueron.
En qué se diferencia de la analítica de siempre
Es la confusión más común, y la frontera es sencilla: la analítica mira hacia atrás, la ciencia de datos mira hacia delante.
La analítica digital responde preguntas sobre lo que ya ocurrió: cuánta gente entró, de dónde vino, qué compró. Son hechos, están en los datos, solo hay que ordenarlos bien. De eso va montar un plan de medición.
La ciencia de datos responde preguntas cuya respuesta no está en los datos: qué clientes van a comprar el mes que viene, cuánto stock vas a necesitar, qué usuarios están a punto de irse. La respuesta hay que estimarla, y viene con un margen de error.
Entre medias está el business analytics, que es aplicar ambas cosas a decisiones concretas de negocio.
Las tres preguntas que sí resuelve
¿Qué va a pasar? (predicción)
Estimar un valor futuro a partir del histórico: ventas del próximo trimestre, visitas de la semana que viene, probabilidad de que un cliente se dé de baja.
Necesita histórico suficiente y que el futuro se parezca razonablemente al pasado. Un modelo entrenado antes de un cambio de mercado sirve para poco.
¿A qué grupo pertenece esto? (clasificación)
Meter cada caso en una categoría: este correo es spam o no, este lead es bueno o malo, esta transacción es sospechosa o normal.
Es lo que más valor da con menos esfuerzo, porque suele automatizar una decisión que alguien está tomando a mano cien veces al día.
¿Qué grupos hay aquí dentro? (segmentación)
Encontrar agrupaciones que no habías definido tú. En lugar de decidir que tus clientes son «premium» y «básicos», dejas que el modelo mire los comportamientos y te diga que en realidad hay cinco grupos, y uno de ellos no lo habías visto nunca.
Es la más interesante para marketing y la que más sorpresas da, porque cuestiona la segmentación que dabas por buena.
Un ejemplo completo, sin código
Problema: una empresa con suscripción mensual pierde el 6% de clientes cada mes y no sabe quiénes se van hasta que ya se han ido.
Qué se hace: se cogen los últimos dos años de clientes y, para cada uno, se anota qué hacía en los 30 días previos: cuántas veces entró, si abrió los correos, si contactó con soporte, cuánto tiempo llevaba. Y si se dio de baja o no.
Con eso, el modelo aprende qué combinación de señales precede a una baja. Después se aplica a los clientes actuales y devuelve, para cada uno, una probabilidad.
Resultado: una lista ordenada de a quién llamar esta semana. No es una bola de cristal: si el modelo acierta 7 de cada 10, el equipo de retención deja de llamar al azar y empieza a llamar con criterio. Eso ya es un cambio grande.
Qué necesitas antes de empezar
La respuesta corta es: datos ordenados. La larga:
- Histórico. Sin pasado no hay patrón que aprender. Como regla, un año de datos y unos cientos de casos del evento que quieres predecir.
- Datos consistentes. Si el criterio de «cliente activo» cambió a mitad de año, el modelo aprenderá ese cambio en lugar del comportamiento real.
- Una decisión que dependa del resultado. Si nadie va a hacer nada distinto con la predicción, no la hagas. Es el filtro que más proyectos debería parar y menos para.
- Alguien que interprete. Un modelo devuelve números; convertirlos en una acción sigue siendo trabajo humano.
Lo que no puede hacer
No explica causas. Un modelo puede decirte que los clientes que abren pocos correos se dan más de baja. Eso no significa que abrir correos evite la baja: puede que ambas cosas sean síntoma de haber perdido el interés. Correlación no es causa, y esta confusión cuesta mucho dinero.
No arregla datos malos. Es la regla más vieja del oficio: basura entra, basura sale. Si tu medición está rota, el modelo aprenderá tus errores con mucha precisión.
No predice lo que no ha visto nunca. Ningún modelo entrenado con datos de 2019 anticipó 2020.
Preguntas frecuentes
¿Data Science y Machine Learning son lo mismo?
No. Data Science es la disciplina completa: entender el problema, preparar los datos, modelar e interpretar. El machine learning es una de las técnicas que usa, la de que un algoritmo aprenda patrones solo. Se puede hacer ciencia de datos con estadística clásica y sin machine learning.
¿Necesito un data scientist en mi empresa?
Solo si tienes preguntas de futuro con decisiones asociadas y datos para responderlas. Si lo que necesitas es saber qué pasó y por qué no cuadran tus informes, lo que necesitas es un analista, que además es más barato y da resultados antes.
¿Cuánto tarda un proyecto de este tipo?
Entre 4 y 12 semanas para un primer modelo útil, y la mayor parte de ese tiempo no se va en modelar: se va en localizar, limpiar y cruzar los datos. Es la parte que nadie enseña en los cursos y la que se lleva el 70% del proyecto.
¿Sirve para una empresa pequeña?
Sirve si tiene volumen de datos, no si tiene mucho personal. Un ecommerce pequeño con tres años de pedidos tiene material de sobra para predecir demanda o segmentar clientes.
Conclusión
Data Science es responder con datos preguntas cuya respuesta todavía no existe: qué va a pasar, a qué grupo pertenece esto, qué patrones hay ahí dentro. No es magia ni requiere entenderlo por dentro para decidir cuándo usarlo.
La pregunta que filtra bien es siempre la misma: ¿qué haría distinto si tuviera esa respuesta? Si no hay respuesta a eso, el proyecto sobra por muy bonito que sea el modelo.
¿Tienes una pregunta de negocio y no sabes si da para un proyecto de Data Science? Escríbeme y lo vemos juntos.