Agentes que Mejoran Mientras Duermes: Los Ciclos de Auto-Mejora Explicados
La mayoría de las implementaciones de IA se degradan lentamente: los modelos permanecen fijos, los casos límite se acumulan y nadie lo nota hasta que los clientes se quejan. Nosotros construimos agentes sobre la premisa contraria — cada ciclo debe dejar el sistema más inteligente que lo encontró.
El ciclo
Cada agente ejecuta planificar → actuar → observar → mejorar, y añade cada ciclo a un registro append-only:
{"cycle": 3, "plan": ["serve workload", "apply lesson: expand KB coverage"],
"observations": {"ok": true}, "lesson": "", "token_cost": 110}
El paso de mejorar escribe una lección cuando algo sale mal; el plan del siguiente ciclo lee primero las lecciones anteriores. Las lecciones persisten entre reinicios.
Medir la mejora, no las sensaciones
Como los registros son estructurados, la calidad no es una sensación — son tres números que nuestro arnés de evaluación calcula cada noche por proyecto:
| Métrica | Umbral |
|---|---|
| Tasa de resolución | ≥ 80% |
| Tasa de traspaso a humanos | ≤ 20% |
| Tasa de aplicación de lecciones | en tendencia al alza |
Cuando un umbral salta, el reporte lo señala antes de que un cliente tenga que hacerlo.
Por qué esto se multiplica
La automatización tradicional tiene una curva plana de costo de mejora: un humano debe notar, diagnosticar, parchar y redesplegar. Los agentes nativos de ciclo colapsan eso en observar → lección → aplicada-en-el-siguiente-ciclo. Con el paso de las semanas, la brecha entre un bot estático y uno que se auto-mejora deja de ser incremental — se vuelve categorial.
Esa multiplicación es el producto. Todo lo demás es plomería.