El aprendizaje automatico no es una tecnologia: es una familia de cuatro. Lo que las separa no es la potencia del modelo, sino que clase de datos exige cada una para funcionar. Y esa diferencia decide, antes que cualquier otra cosa, si un proyecto de este tipo es viable en su empresa o no pasa de la presentacion.
Lo explicamos con los datos que una empresa colombiana realmente tiene: inspecciones de EPP, matrices de peligros, reportes de actos inseguros, certificados de formacion y registros de ausentismo.
1. Aprendizaje supervisado
Aprende de ejemplos ya resueltos
El modelo recibe entradas y la respuesta correcta de cada una. Ajusta sus parametros comparando lo que predice contra lo que deberia haber predicho, y repite hasta reducir el error.
Se divide en dos tareas: clasificacion, cuando la respuesta es una categoria (apto / no apto), y regresion, cuando es un numero continuo (cuantos dias faltara un trabajador).
Algoritmos habituales: regresion lineal y logistica, arboles de decision, Random Forest, maquinas de vectores de soporte y redes neuronales.
Predecir que equipos van a fallar la proxima inspeccion a partir del historial de inspecciones anteriores. Requiere que esas inspecciones esten registradas con su dictamen, no en una carpeta de fotos.
2. Aprendizaje no supervisado
Encuentra estructura donde nadie la ha senalado
Aqui no hay respuestas correctas. El algoritmo recibe los datos crudos y busca por su cuenta agrupamientos, correlaciones o puntos que no encajan.
Tres usos principales:
- Agrupamiento: juntar lo que se parece sin decirle en que se tiene que parecer (K-Means, DBSCAN, jerarquico).
- Reduccion de dimensionalidad: comprimir muchas variables en pocas sin perder lo importante (PCA, autoencoders).
- Deteccion de anomalias: senalar lo que se sale de lo normal.
Agrupar reportes de actos y condiciones inseguras para descubrir que tres areas distintas estan reportando el mismo problema con palabras diferentes. Es el uso mas realista para una empresa que apenas empieza: no exige etiquetar nada.
3. Aprendizaje por refuerzo
Aprende actuando, no mirando datos
Un agente toma decisiones dentro de un entorno y recibe recompensa o castigo segun el resultado. No parte de un historico: parte de un simulador donde puede equivocarse millones de veces sin consecuencias.
Sus elementos son agente, entorno, estado, accion y recompensa. Algoritmos: Q-Learning, Deep Q-Networks, PPO, Actor-Critic.
Optimizacion de rutas y de secuencias de montaje. Es el menos aplicable de los cuatro a la gestion de SST, y conviene desconfiar de quien lo ofrezca para eso: aprender por ensayo y error no es aceptable cuando el error lo paga una persona.
4. Aprendizaje semisupervisado
Pocas etiquetas, muchos datos
Combina un conjunto pequeno de datos etiquetados con un volumen grande sin etiquetar. El modelo aprende la estructura con los pocos ejemplos resueltos y la propaga al resto.
Resuelve el cuello de botella real de casi todos los proyectos: etiquetar a mano es caro y lento. Algoritmos: autoentrenamiento, GAN semisupervisadas, metodos basados en grafos.
Clasificar miles de reportes de incidente cuando un profesional solo ha podido revisar doscientos. Suele ser la opcion mas sensata para una empresa mediana con historico acumulado y poco tiempo de especialista.
Las cuatro, lado a lado
| Paradigma | Datos de entrada | Objetivo | Coste de preparacion |
|---|---|---|---|
| Supervisado | Entradas con su respuesta conocida | Predecir la respuesta de un caso nuevo | Alto: hay que etiquetar |
| No supervisado | Entradas sin etiquetar | Descubrir estructura o anomalias | Bajo: datos crudos |
| Por refuerzo | Respuesta del entorno a cada accion | Maximizar la recompensa acumulada | Alto: exige simulador |
| Semisupervisado | ~10 % etiquetado, ~90 % sin etiquetar | Equilibrar coste y precision | Medio |
Lo que ningun proveedor le va a decir
Los cuatro metodos comparten una condicion previa que decide el proyecto antes de empezar: necesitan datos registrados de forma consistente. Una empresa que lleva sus inspecciones en una carpeta de fotos de WhatsApp no tiene un problema de inteligencia artificial. Tiene un problema de registro, y ningun modelo lo resuelve.
El orden correcto es siempre el mismo: primero registrar bien, despues analizar. Quien le ofrezca lo segundo sin lo primero le esta vendiendo una demostracion.
Y una regla que en seguridad no es negociable
Un modelo que no encuentra informacion sobre algo no puede devolver un cero. "No hay dato" y "el resultado es cero" son cosas distintas, y confundirlas en seguridad industrial significa dar por cumplido lo que nadie verifico. En nuestras plataformas lo que no se sabe viaja marcado como no conocido, con su motivo, y nunca como una cifra. Es la diferencia entre una herramienta que ayuda a decidir y una que fabrica tranquilidad falsa.
Entonces, por donde empezar
Si su empresa esta considerando analitica aplicada a la seguridad, el camino util rara vez es el modelo mas sofisticado:
- Si no tiene historico digital: no empiece por un modelo. Empiece por registrar las inspecciones y la formacion de manera que generen datos comparables.
- Si ya tiene historico sin clasificar: el aprendizaje no supervisado le dara hallazgos sin pedirle trabajo previo.
- Si tiene historico y un especialista disponible: el semisupervisado es el mejor equilibrio entre lo que cuesta y lo que devuelve.
- Si busca predecir algo concreto y tiene los ejemplos resueltos: ahi si, supervisado.
En IntegraPro trabajamos la capa de abajo: que el dato exista, sea fiable y este asociado a un equipo, a una persona y a una fecha. Sin eso, lo de arriba no se sostiene.
Hablemos de sus datos, no de la moda
Si quiere saber si su operacion esta en condiciones de aprovechar analitica -- o que le falta para estarlo -- escribanos y lo revisamos con usted.
chat Escribir por WhatsApp Ver mas recursos