¿Qué parte de tu producto necesita IA?
Elige una tarea para la IA, compara el resultado con el proceso actual y limita sus permisos antes de poner un agente en producción.

en este artículo
"Vamos a poner IA en atención al cliente" todavía no describe un proyecto. Puede significar clasificar un mensaje, encontrar un pedido o responder al cliente. Cada tarea necesita datos distintos y tolera errores distintos.
Piensa en una operación de soporte donde alguien lee un mensaje, busca la compra y deriva el caso. Puedes probar la clasificación sin dar al modelo permiso para modificar la compra. Ese alcance permite averiguar si la IA mejora el trabajo antes de ampliar su responsabilidad.
Preferimos empezar por la etapa más pequeña que tenga valor por sí sola. Si clasificar mensajes no ayuda a nadie a terminar un caso, una buena demostración no justifica la integración.
Elige una tarea con un resultado comprobable
Una primera versión podría sugerir una categoría y mostrar el fragmento del mensaje que sostiene la elección. La persona de soporte acepta o corrige la sugerencia. La aplicación registra ambas decisiones.
Antes de desarrollar, reúne una muestra de mensajes que tengas autorización para usar. Retira los datos innecesarios. Incluye solicitudes habituales, mensajes ambiguos y casos que deben llegar directamente a una persona. Reserva algunos ejemplos para evaluar cambios futuros sin usarlos para ajustar el prompt.
Pide a alguien que conozca la operación que clasifique los mismos casos. Si dos personas discrepan, quizá falte una regla de atención. Cambiar de modelo no resuelve una categoría que el equipo no sabe definir.
Un flujo fijo puede ser suficiente
Anthropic distingue los flujos con pasos definidos en código de los agentes que eligen sus siguientes pasos. Esa diferencia ayuda a decidir cuánta libertad requiere la tarea.
En el ejemplo de soporte, la secuencia puede ser fija. Recibir el mensaje, solicitar la clasificación, validar la salida y mostrar la sugerencia. El código decide el orden. El modelo interpreta el texto.
Un agente cobra sentido cuando los pasos siguientes dependen de descubrimientos intermedios. Aun así, describe qué acciones puede ejecutar y cuándo debe parar. "Resolver la atención" es demasiado amplio para convertirse en un permiso.
Compara el costo del caso completo
Medir solo el porcentaje de categorías correctas deja trabajo fuera. Una clasificación equivocada puede pasar por dos equipos antes de volver al inicio. Una sugerencia correcta también puede tardar tanto que nadie la espere.
Durante el piloto, mide el tiempo hasta la derivación correcta, las correcciones del equipo y los casos sin respuesta útil. Suma el costo de las llamadas y el tiempo humano de revisión. Compara con el proceso actual usando casos de dificultad parecida.
No tomes la confianza declarada por el modelo como prueba de acierto. Define motivos observables para la revisión humana, como una categoría ausente, datos insuficientes o una solicitud fuera del alcance.
Fija el criterio de continuidad antes del piloto. Por ejemplo, conservar la sugerencia solo si reduce el tiempo de clasificación sin aumentar las derivaciones equivocadas. Los límites numéricos dependen de la operación y requieren una medición inicial.
Los permisos van en el código
Un mensaje del cliente puede contener instrucciones para ignorar reglas. La aplicación debe tratarlo como contenido recibido. Ese texto no puede conceder acceso a herramientas ni a datos de otro cliente.
En el piloto de clasificación, el modelo no necesita credenciales para editar pedidos. Si una versión futura ejecuta acciones, cada llamada debe pasar por la autorización del servidor. Limita los recursos accesibles y registra la acción con su resultado.
Define también un máximo de intentos y una duración límite. Al alcanzarlos, deriva el caso con el contexto disponible. Un caso atrapado en intentos automáticos sigue esperando atención.
Prepara la operación para desactivar la sugerencia
Mantén una forma de trabajar cuando el modelo no esté disponible. Registra la versión del prompt y del modelo usada en cada evaluación, sin conservar datos personales innecesarios. Antes de cambiarla, vuelve a ejecutar los casos reservados para evaluar.
El primer resultado útil puede ser modesto. Una sugerencia que evita buscar la cola correcta ya merece una medición. Amplía la autonomía cuando los registros indiquen qué siguiente etapa conviene automatizar.