Qué resolvemos ·¿Cómo construyo algo que después camine solo?
Forge · Construir
¿Su modelo sigue funcionando igual de bien que el primer día?
El modelo sigue respondiendo. Nadie puede demostrar que responda igual de bien.
La medición, el umbral y el criterio de apagado instalados y entregados operando a su equipo. No nos quedamos mirando el tablero.
IA en Producción: Vigilancia de ModelosEnviar esta página a quien decide
Qué recibe
- El banco de casos de referencia congelado y el informe de línea base.
- El tablero de vigilancia montado en sus propias herramientas.
- Los umbrales con su acción asociada y el manual de operación.
- El criterio de apagado escrito y firmado por el dueño nombrado.
La prueba que viene al caso
- 700 agentes automatizados en producción con su medición, sobre 250 000 incidentes.
- Dirección de operaciones sobre 60 000 servidores con medición propia.
- Ocho años bajo supervisión regulatoria, donde había que probar y no afirmar que algo funcionaba.
Cómo lo resolvemos
El método, no la promesa.
- Se define qué significa «funcionando» en métricas que el negocio reconoce, no solo el equipo técnico.
- Se construye el banco de casos de referencia con su gente y se congela. Sin congelarlo no hay comparación posible.
- Se monta la medición de deriva en tres capas: entrada, comportamiento y resultado de negocio.
- Se fijan umbrales con acción asociada: quién se entera, qué hace y en cuánto tiempo.
- Se traspasa con una prueba real: se induce una degradación y su equipo tiene que detectarla solo.
Para usar hoy, sin contratar nada
Cómo detectar degradación silenciosa sin instalar nada. Es el modo de falla característico de estos sistemas, que siguen respondiendo mientras empeoran y se vigila con dos cosas que puede armar esta semana.
- Congele un banco de veinte casos con su respuesta correcta. Sáquelos de casos reales ya resueltos. Guárdelos aparte y no los cambie nunca: ese es el punto.
- Córralos una vez al mes y cuente los aciertos. El número solo importa comparado consigo mismo. Si baja dos meses seguidos, tiene deriva.
- Anote la versión del modelo cada vez. La mayoría de las caídas de calidad coinciden con un cambio de versión que el proveedor no anunció.
- Vigile también la entrada, no solo la salida. Si el tipo de casos que llegan cambió, el sistema puede estar respondiendo igual de bien a un problema que ya no es el suyo.
Conteste esto antes de necesitarlo. ¿En qué condiciones este sistema deja de decidir y vuelve una persona? Si no está escrito, no existe y el día que haga falta se va a decidir a las tres de la mañana.
Le suena si
- Su sistema lleva meses en producción y solo tiene las métricas del proveedor.
- Hubo una queja de calidad que las métricas disponibles no alcanzaron a explicar.
- El proveedor cambió de versión y usted se enteró después.
Antes de contratar
Se instala y se traspasa: la firma no opera la vigilancia, no compromete guardia y no responde por las decisiones que el sistema tome después del traspaso.
Lo que se compra acá es saber qué medir. La diferencia entre una métrica que avisa y una que decora se aprende operando sistemas que no podían fallar y se comprueba en la prueba de traspaso: si su equipo no detecta la degradación inducida, el trabajo no está aceptado.
Si su sistema empezara a equivocarse hoy, ¿en cuánto tiempo se enterarían y cómo?
Si el problema es otro
El proceso ya depende del agente y nadie recuerda cómo se hacía a mano.
Continuidad Operativa con Agentes de IA
El agente ya no solo responde: ejecuta. Nadie definió hasta dónde puede llegar solo.
Guardarraíles para Agentes
El piloto funcionó, todos aplaudieron y ocho meses después sigue siendo un piloto.
Del Caso de Uso a Producción
