Reserva un conjunto de prueba
Define las etiquetas y pide a una persona con conocimiento que clasifique registros representativos. Resuelve desacuerdos antes de usarlos como referencia. Reserva ejemplos que no utilices para ajustar instrucciones.
Cuenta los errores relevantes
La exactitud global puede ocultar fallos en una categoría pequeña pero importante. Cuenta errores por etiqueta y trabajo manual restante. Incluye diferencias de idioma y canal presentes en tus datos.
Publica por etapas
Empieza con sugerencias y automatiza después una acción reversible. Define cuándo detener el flujo si aumentan fallos o revisiones. Guarda identificadores y nombre del modelo para comparar futuras evaluaciones.