noticias / Open Source y Tendencias

Análisis de datos para legos: evita los 5 errores más comunes

Análisis de datos para legos: evita los 5 errores más comunes

El análisis de datos es una de las herramientas empresariales que más ha cambiado y se ha desarrollado en lo que llevamos de siglo XXI. El puesto de analista de datos, que hace diez años apenas se oía, a día de hoy es uno de los perfiles profesionales cuya demanda más ha crecido en empresas de todo tipo, tanto grandes como no tan grandes. De hecho, ¿no os pasa que resulta raro acabar un día sin haber oído o leído las palabras «big data», «data scientist», «machine learning» o «inteligencia artificial»?

En este artículo vamos a poner los pies en el suelo aclarando (para legos) qué son y qué no son algunos conceptos, y con ello descubrirás los errores más comunes en el análisis de datos para que puedas ponerles solución en tu empresa o proyecto.

Para ello, entrevistamos a una experta en análisis de datos, Cristina Campos, data scientist y divulgadora científica. Cristina es licenciada en Física, con especialización en Astrofísica, por la Universidad de La Laguna y fue becada por el Instituto Astrofísico de Canarias para estudiar las nebulosas planetarias. Al terminar la carrera, ganó la beca para ocupar el puesto de astrofísica residente del IAC, quedando en primer puesto, donde trabajó para el programa Sunrise de la NASA. Tras esta etapa, se especializó en matemática estocástica e inteligencia artificial estudiando Finanzas en la UOC, Inteligencia Artificial en la Universidad de Stanford y el máster de Matemáticas para instrumentos financieros de la UAB, y trabajó haciendo predicciones bursátiles en el sector bancario. Hoy en día, Cristina Campos se centra en la IA, el análisis de datos y su visualización en la empresa Dainso, de la que es cofundadora.

Después de hablar con Cristina, te das cuenta de que es una apasionada de la ciencia y que transmite sus conocimientos con habilidad para entusiasmar.

Big data: ¿por dónde empiezo para ordenar este caos?

Lo primero, tenemos que matizar qué es el big data. Simplificando, es exactamente el mismo trabajo de análisis de datos; la diferencia radica en que el big data es una ingente cantidad de datos, cuyo manejo requiere recursos computacionales y de programación que no están al alcance de todos por su dificultad y potencia. La buena noticia es que la mayoría de las empresas no tiene big data: tienen, como mucho, large data, que es otro nivel. Pero la ciencia que hay detrás de su estructuración y aprovechamiento es la misma independientemente de su tamaño: el análisis de datos.

El análisis de datos para saber y comprender lo que ya ha ocurrido en el pasado, es decir, un modelo descriptivo, es lo que suelen querer las empresas y está lejos de verse afectado por lo que llamaríamos caos. En cambio, si hablamos del análisis de datos para generar predicciones a partir de lo que ha sucedido en el pasado, el modelo predictivo es diferente; ahí aumentan las posibilidades de variables imprevistas. No obstante, conseguir un 70% u 80% de fiabilidad en tu predicción ya supone mucho ganado en la toma de decisiones empresariales, mucho más que lanzar una moneda al aire. Se aplican, por ejemplo, técnicas de machine learning y matemáticas estocásticas, en las que se tienen en cuenta movimientos aleatorios (se usa mucho, por ejemplo, en el mundo financiero).

Al final, ¿lo vamos a dejar todo en manos de las máquinas? ¿Dónde queda la capacidad humana de aprender e intuir para decidir ante el machine learning o las simulaciones predictivas basadas en el análisis de datos?

El machine learning es precisamente una imitación del funcionamiento del cerebro humano: imita nuestras conexiones neuronales para aprender de lo que ya ha pasado y, basándose en ello, predice. El análisis de datos y los modelos predictivos no son más que una herramienta; por ejemplo, un comercial experimentado puede saber qué venderá más de su catálogo de productos, pero, si el catálogo es grande, le falta información. La automatización de los datos y del análisis le ayudará a que no se le pasen por alto oportunidades de venta.

El poder del análisis de datos es grande y está científicamente probado, pero nosotros, los legos, podemos crearnos falsas expectativas... ¿Cuáles son los errores más comunes que cometen las empresas al manejar sus datos?

  • El primer error es el uso de programas que no fueron diseñados para el análisis de datos y que, a día de hoy, tienen una presentación rudimentaria de los datos; además, la recogida de datos es manual, con la cantidad de errores que eso implica.
  • El segundo error es cómo estructuran los datos: no todos los datos son relevantes y pueden introducir ruido según lo que queramos medir. Así pues, el resultado es que no obtenemos la información que necesitamos.
  • En tercer lugar, no tener objetivos realistas con relación a qué podemos obtener del análisis de datos. Sobre todo en cuanto a modelos predictivos, a veces se esperan resultados que no son posibles. Expectativas alimentadas por la creencia de que la inteligencia artificial es sobrehumana, y no lo es, en absoluto.
  • Otra dificultad añadida es la dispersión de los datos: si no se usa un software que integre todos los datos y que esté diseñado para que estos datos estén sincronizados en todos los procesos, como es un ERP, la disgregación de la información juega en nuestra contra.
  • En quinto y último lugar, la falta de objetividad. Si alguien tiene mucho interés en encontrar un resultado a través de los datos, lo encontrará. Es muy importante basar la elección, la estructuración y la combinación de los datos en criterios objetivos, además de realizar un modelado correcto, para acercarnos lo máximo posible al conocimiento de la realidad. Por eso es muy bueno que agentes externos a la organización revisen el trabajo de análisis de datos.

Dainso (empresa especializada en análisis de datos de la que eres cofundadora), junto con NaN-tic, habéis creado una herramienta para la automatización de los cuadros de mando. Los famosos dashboards que tanto gustan a los CEO. ¿Qué importancia le darías a que la información llegue al receptor de manera visual?

Es súper importante por una razón muy sencilla: en su día a día, una persona dedicada a dirigir un negocio tiene que concentrar sus esfuerzos en muchas direcciones y no puede pasarse el día mirando número a número. Por eso, el dashboard tiene que ser una herramienta que le ayude y que, en cuanto se abra, le dé a primera vista la información más importante para que pueda tomar las decisiones a tiempo, antes de que las cosas puedan empeorar. Es muy importante poder anticiparse. Que la información se presente visualmente le ahorra muchas horas.

¿Es posible que las empresas estén trabajando con herramientas que en realidad no conocen? IA, Data Science, Machine Learning, Gemelos Virtuales... El acceso a la información que tenemos a través de internet y las formaciones exprés (rápidas y a presión) ¿pueden estar creando el espejismo de que siempre sabemos lo que estamos haciendo, cuando quizá no lo sabemos en momentos importantes?

El sector financiero, como el médico, el educativo y tantos otros, ha cambiado mucho desde la época de nuestros padres hasta hoy. Ahora todo es muy rápido: alguien puede hacer un seminario intensivo de dos semanas de programación o de data science, pero las personas que dedicamos nuestros años universitarios a las matemáticas, las ingenierías, la física, etc., aprendemos a pensar para solucionar problemas, y en el mundo del análisis de datos y de los modelos predictivos no hay atajos: requiere tiempo.

Hasta aquí la entrevista a Cristina Campos, que ha sido tan amable de contestar nuestras preguntas.

Si quieres conducir tu empresa con auténtica inteligencia, cuenta con equipos especializados que te escuchen y te respondan honestamente para aplicar sus conocimientos y recursos al servicio de tu empresa.