Qué se publica
Una versión congela:- El prompt y tus variables.
- El objetivo, los datos que tiene que conseguir y las indicaciones.
- Los motivos de derivación.
- El proveedor y el modelo.
- Las herramientas de eltick, las HTTP del agente y las propias que usa.
- Las fuentes de conocimiento elegidas.
Casos de prueba
Los casos se arman en Probar y versiones › Casos de prueba. Hay dos tipos:- Una respuesta: una conversación fija y lo que tiene que pasar cuando el agente responde al último mensaje del cliente.
- Conversación simulada: la IA hace de cliente y charla con el agente de principio a fin. Sirve para probar recorridos completos, como un alta o un reclamo.
Los chequeos de texto no distinguen mayúsculas ni tildes. Los criterios en palabras los evalúa el mismo modelo del agente, con tu API key.
Un buen conjunto de casos cubre:
- Los recorridos principales: un alta completa, una consulta de deuda, un reclamo técnico.
- Lo que nunca tiene que pasar: dar precios sin cobertura, pedir datos que no corresponden, derivar cuando no hace falta.
- Casos borde: una dirección que no se encuentra, una localidad fuera de zona, un cliente que no responde lo que se le pregunta.
Conversación simulada
En una simulación completas:
El cliente simulado usa el mismo proveedor y modelo del agente, con tu API key. Escribe un mensaje por vez según quién es y qué quiere. La conversación termina cuando:
- el agente cumple el objetivo o deriva a una persona,
- el cliente simulado da por terminada la charla (porque ya logró lo que quería o no tiene nada más para decir),
- o se llega al máximo de respuestas.
Repetir un caso
La IA no responde siempre igual. En Repetir puedes correr un caso hasta 5 veces: el resultado muestra qué porcentaje de las veces pasó y puedes ver cada corrida. Por defecto, el caso pasa solo si pasaron todas; en Tiene que pasar puedes bajarlo hasta el 50 %. Cada caso puede usar hasta 20 respuestas del agente en total: repeticiones × máximo de respuestas. Por ejemplo, 4 repeticiones de una simulación de 5 respuestas.Herramientas simuladas
En Herramientas simuladas eliges una herramienta HTTP o una herramienta propia y escribes lo que devuelve (JSON o texto). En el caso no se ejecuta: el agente recibe esa respuesta. Si marcas Falla, recibe un error con ese motivo. Sirve para probar qué hace el agente con cada resultado de tus sistemas (un cliente con deuda, una dirección sin cobertura, un sistema caído) sin depender de datos reales. Las herramientas de eltick (buscar en tu información, productos, guardar datos) no se simulan. Las simulaciones solo existen en los casos: nunca afectan a las conversaciones reales.Canal y datos de prueba
Cada caso corre en el canal que elijas (WhatsApp o Instagram). En Datos de prueba cargas valores para las variables{var.clave} del prompt; si la clave es uno de los datos a conseguir, el agente lo toma como ya conseguido.
Crear un caso desde una conversación
En el Registro del agente, cada respuesta a un cliente real tiene el botón Crear caso. Arma un caso de una respuesta con los últimos 20 mensajes de esa conversación hasta ese momento (y los datos de la conversación como datos de prueba) y abre el editor en Probar y versiones. Agrega lo que tiene que pasar y guárdalo. Es la forma más rápida de convertir un error que viste en una conversación real en un caso que se prueba en cada cambio.Correr los casos
Toca Correr para correrlos todos con el borrador, o corre uno solo desde su detalle. Cada caso muestra la conversación (con los mensajes del cliente simulado y las herramientas que usó), cómo terminó y qué chequeos fallaron. Si lo repetiste, eliges qué corrida ver. En los casos (y en el chat de prueba), las herramientas que piden confirmación del cliente y las HTTP conPOST no se ejecutan: se simulan con una respuesta genérica, salvo que les pongas una respuesta en Herramientas simuladas. Las demás se ejecutan de verdad contra tus sistemas.
Publicar
En Probar y versiones, toca Publicar:- Guarda los cambios antes: se publica lo guardado.
- eltick corre los casos obligatorios con el borrador.
- Si alguno falla, no se publica y te dice cuál.
- Si pasan, se crea la versión nueva (v1, v2, v3…) y empieza a atender en el próximo mensaje.
Prueba A/B
Para saber si una versión nueva funciona mejor, no hace falta publicarla para todos. En la lista de versiones, toca Probar con el 20% en la versión que quieres comparar: esa versión atiende una parte de las conversaciones y la publicada, el resto.- Cada conversación queda siempre con la misma versión, aunque el cliente escriba varias veces.
- Puedes cambiar el porcentaje (10, 20, 30 o 50%) mientras dura la prueba.
- Arriba de la lista ves las dos versiones lado a lado: conversaciones, objetivo cumplido, derivadas y errores de los últimos 30 días.
- Espera a tener al menos 30 conversaciones en la prueba antes de sacar conclusiones.
Volver atrás
En la lista de versiones, toca Restaurar en una versión anterior: el borrador vuelve a quedar como esa versión. No se publica sola: revísala, corre los casos y publícala como una versión nueva.Chat de prueba
Además de los casos, en Probar y versiones › Chat de prueba puedes escribirle al agente como si fueras un cliente, con el borrador y sin guardar. En Datos de prueba cargas valores para{var.clave} y para los datos a conseguir (te sugiere sus claves). Cada respuesta muestra qué fuentes y herramientas usó, cuánto tardó y cuántos tokens gastó. Todo lo que pruebes queda en el Registro marcado como prueba.
