Ver todas las comprobaciones
Monitorización de IA

Monitorización de regresiones de chatbot IA

Tu función de IA puede romperse sin un solo error en los logs — un cambio de modelo, una edición del prompt, una clave caducada, una respuesta truncada. Relvato envía el mismo prompt en cada ejecución y te avisa en cuanto la respuesta empeora.

Fija un prompt constante y las reglas que definen una regresión: frases obligatorias, presupuestos de longitud y latencia, y una referencia dorada opcional.
Cómo funciona

El mismo prompt en cada ejecución — así el desvío se vuelve visible

Relvato convierte la salida impredecible de una IA en una comprobación determinista, sin aserciones frágiles.

01

Fija un prompt constante

Apunta Relvato a tu endpoint de IA — un chatbot, una respuesta RAG, un agente, cualquier endpoint JSON — y dale una pregunta que hará en cada ejecución. Mantener el prompt constante es lo que hace visible una regresión: la app cambió, la respuesta no tenía por qué.

02

Comprueba lo esencial

Reglas deterministas deciden si pasa o falla: el endpoint responde (2xx), la respuesta no está vacía, sigue conteniendo cada frase obligatoria, no contiene ninguna frase prohibida y se mantiene dentro de un presupuesto de longitud y latencia.

03

Puntúa frente a una respuesta dorada

Opcionalmente pega una respuesta “dorada” aprobada. Relvato AI evalúa cuánto conserva su significado cada respuesta (0–100), detectando el desvío de calidad que las palabras clave no ven. La puntuación solo aconseja — nunca decide si pasa o falla.

04

Alerta y correlaciona

Una regresión lanza una alerta y se alinea en la línea de tiempo con el despliegue, el cambio de modelo o la edición del prompt cercanos — así sabes dónde mirar primero, no solo que algo se rompió.

Qué detecta

Las formas silenciosas en que una IA regresa

Un healthcheck 200-OK no ve ninguna de estas. Una comprobación de salida con prompt fijo las ve todas.

Endpoint caído o 4xx/5xx

Una clave de API rota, un límite de peticiones, un token caducado o una ruta movida — la función devuelve un error o nada.

Respuesta vacía o truncada

El modelo devuelve en blanco, un esbozo o una respuesta cortada — a menudo tras un cambio de max-tokens o de streaming.

Desaparece un dato obligatorio

La respuesta deja de mencionar tu plazo de devolución, horario, precios o política — un cambio de RAG o de prompt lo eliminó sin avisar.

Empieza a decir lo que no debe

Se cuela una frase prohibida — “lo siento, no puedo ayudar”, un competidor alucinado, un system prompt filtrado, un bucle de disculpas.

Desvío de calidad frente a la dorada

La respuesta aún pasa las reglas de palabras clave pero ha derivado en significado o utilidad — el juez semántico detecta la caída antes que tus clientes.

Lenta o degradada

La latencia supera tu presupuesto o la respuesta se encoge — una rebaja de modelo o un fallo del proveedor que una página de estado no te mostrará.

Funciona con el resto de Relvato

Un solo lugar para cada tipo de regresión

La comprobación de salida de IA forma parte de la misma monitorización que vigila tus páginas, tu checkout y tu disponibilidad.

Preguntas, respondidas

Regresiones de chatbot IA — Preguntas frecuentes

¿Qué es una regresión de chatbot IA?

Es cuando una función de IA que funcionaba empieza a dar peores respuestas — errores, respuestas vacías o truncadas, un dato perdido, una frase prohibida o una caída de calidad — normalmente tras un cambio de modelo, un cambio de prompt o RAG, una edición de configuración o un problema del proveedor. Como no hay ninguna excepción en los logs, es fácil desplegarlo y no enterarse hasta que se quejan los clientes.

¿Cómo lo detecta Relvato sin tests frágiles?

Envía el mismo prompt fijo a tu endpoint en cada ejecución y comprueba la respuesta con reglas deterministas: accesible, no vacía, con las frases obligatorias, sin las prohibidas y dentro de un presupuesto de longitud y latencia. Esas reglas — no la IA — deciden si pasa o falla, así que los resultados son estables y repetibles.

¿Decide la IA si mi función ha pasado?

No. Las aserciones deterministas deciden pasa/falla. El juez semántico opcional (Relvato AI) solo puntúa cuánto se acerca la respuesta a tu referencia dorada aprobada y aconseja sobre el desvío de calidad — nunca decide el resultado.

¿Funciona con cualquier backend de IA?

Sí. Apúntalo a cualquier endpoint HTTP que devuelva texto o JSON — una llamada a OpenAI o Anthropic tras tu propia API, una Supabase Edge Function, un RAG o agente propio, el backend de un widget de chatbot. Configura una ruta de respuesta para extraer el texto de un JSON cuando haga falta.

¿Me consumirá tokens?

Llama a tu propia función de IA, así que una ejecución cuesta lo que te cueste esa función — lo mismo que un usuario real haciendo una pregunta. Tú controlas con qué frecuencia se ejecuta (por horario, en cada despliegue o por eventos de cambio), y es opcional por diseño.

¿Puedo monitorizar un pipeline RAG o un agente, no solo un chatbot?

Sí. Cualquier cosa que reciba un prompt y devuelva texto funciona — un chatbot de soporte, un endpoint de respuesta RAG, un resumidor, un clasificador, el mensaje final de un agente. El enfoque de prompt fijo más aserciones es el mismo sea cual sea lo que hay detrás del endpoint.

Publica funciones de IA sin regresiones silenciosas

Entérate en cuanto cambia la respuesta de tu IA

Añade la comprobación de salida de IA en minutos — un prompt fijo, unas cuantas reglas y una respuesta dorada opcional.