Producto
Tus agentes repiten errores que ya se pagaron. Uno rompe producción hoy; mañana su colega la rompe igual. CommonTrace convierte esa experiencia en lecciones y mide si cambian el comportamiento.
Sin una capa de aprendizaje
Los agentes de soporte, ventas, RR. HH., marketing y código acumulan cada uno tareas, decisiones, aciertos, fallos y comentarios. Nada de eso llega a los demás. La experiencia queda aislada y los mismos errores se repiten, un agente cada vez. La memoria en bruto no lo resuelve sola: guarda episodios que nunca se transfieren y reglas que nunca se activan en el momento en que el agente actúa.
Qué hace el protocolo
Cinco pasos entre la experiencia en bruto de un agente y una lección aplicada en la siguiente decisión. Funciona junto a los agentes que ya tienes.
- Capturar la experiencia, sesiones, trazas, resultados y comentarios de los agentes que ya están en producción.
- Estructurar el contexto, qué se intentaba, cuál era el estado y qué ocurrió realmente.
- Extraer la lección, destilar el fallo repetido en algo lo bastante general como para aplicarse donde no se ha visto.
- Guardar conocimiento reutilizable, validado, aprobado y disponible para todos los agentes de la flota.
- Reinyectar la lección adecuada, en el momento de la decisión, el único momento en que cambia algo.
La experiencia se vuelve lecciones, las lecciones conocimiento compartido, y ese conocimiento se acumula: incorporación más rápida de agentes nuevos, mejores decisiones, menos errores repetidos, menos frustración de los usuarios. Con el tiempo eso es una ventaja defendible, porque se construye con trabajo que tu flota ya pagó y que nadie más tiene.
En producción
Medido en la flota de un cliente con agentes de código, marketing y soporte. Ambas cifras son antes y después de desplegar CommonTrace, y confirmadas por el cliente.
Antes y después, en el mismo flujo de soporte.
Tras el despliegue en el agente de marketing de cara al cliente, que dejó de repetir los errores que ahuyentaban a los clientes.
En el benchmark de aprendizaje
Medido en una versión anterior del agente de un cliente. La pregunta no es si el agente recuerda lo que vio, sino si se comporta correctamente en casos que no ha visto.
Sin ninguna pista durante el aprendizaje. La memoria en bruto obtuvo la primera cifra; las lecciones destiladas, la segunda.
Metodología: son resultados iniciales, publicados con permiso. Las sondas de generalización usaron particiones P1/P5 filtradas que cubren unas 32 tareas con 5 a 8 intentos cada una, y solo el nivel 0 cubrió el benchmark completo. Las cifras de tokens y llamadas provienen de una ejecución P5 emparejada de ocho intentos con carga idéntica. Aquí mejor aprendizaje y menor coste de ejecución fueron juntos, pero una ejecución es una ejecución.
Cómo funciona un despliegue
Parte de las trazas que ya tienes, en un solo flujo de producción, y mide si las lecciones compartidas mejoran las decisiones posteriores.
A qué nos conectamos
- Sesiones y trazas de agentes
- Comentarios y resultados
- Memoria existente
- Datos de observabilidad
- Registros de fallos y escalados
Qué hace CommonTrace
- Encuentra patrones de fallo repetidos
- Extrae lecciones candidatas
- Valida y aprueba las lecciones
- Las inyecta en las decisiones pertinentes
- Compara el rendimiento con una referencia
Qué medimos
- Tasa de errores repetidos
- Tasa de éxito o de resolución
- Tasa de escalado a humanos
- Frustración de los usuarios
- Coste en tokens e inferencia
Encaja mejor con: flotas de agentes en producción, flujos repetitivos, resultados medibles y agentes de cara al cliente donde un comportamiento inconsistente genera frustración o fuga.
Empieza con un piloto de aprendizaje de flota de 30 días.
Un flujo. Una flota. Impacto medido.
- Sin reemplazar infraestructura.
- Se parte de tus trazas históricas.
- Apruebas las lecciones antes de desplegarlas.
- Comparación con una referencia existente.