Fachada de la Société de Fromagerie de Vercel, edificio con coche aparcado
Fachada de la Société de Fromagerie de Vercel, edificio con coche aparcado — imagen de archivo de El Forum, ajena al asunto de esta pieza; pendiente de sustituciónEl Forum · Fototeca de El Forum · OWN_WORK

Qué cambia en la ruta /v1/responses

Vercel ha activado en su AI Gateway el soporte para el modo WebSocket de la Responses API de OpenAI, según confirma su changelog oficial. La ruta técnica, GET /v1/responses tanto en la documentación de Vercel como en la de OpenAI, pasa a admitir conexiones persistentes en lugar del esquema habitual de peticiones sueltas.

La diferencia con el modelo anterior está en qué viaja en cada turno. Hasta ahora, cada llamada a la API debía incluir el contexto acumulado de la conversación. Con el modo WebSocket, el cliente envía solo los nuevos input items junto al previous_response_id, el identificador de la respuesta anterior, sin reenviar el historial completo.

El intercambio se produce mediante eventos response.create emitidos sobre esa conexión persistente, según describen tanto el changelog de Vercel como la guía técnica de OpenAI.

El ahorro se concentra en flujos con muchas llamadas a herramientas

OpenAI atribuye a este esquema una mejora de hasta el 40% en el tiempo de ejecución end-to-end en despliegues agenticos con 20 o más tool calls, entendidas como las llamadas que un agente hace a funciones o herramientas externas durante una tarea. Es una cifra reportada por la propia OpenAI y trasladada por Vercel en su changelog, no un dato verificado por terceros.

El matiz importa porque el beneficio no es uniforme: aplica a conversaciones largas y con múltiples pasos, donde el peso del contexto reenviado en cada turno es mayor. En interacciones cortas o de una sola llamada, la reducción de payload tiene menos margen para traducirse en tiempo ganado.

El dato sitúa el caso de uso con más nitidez: no es una mejora genérica de la API, sino una optimización pensada para agentes que encadenan decisiones y acciones de forma sostenida.

Compatibilidad con retención cero de datos

La función es compatible con store=false, el parámetro que evita que OpenAI conserve las respuestas generadas, y con Zero Data Retention (ZDR), el modo que impide cualquier almacenamiento de los datos de la solicitud. Esta compatibilidad importa para organizaciones con requisitos de cumplimiento normativo o cláusulas contractuales que exigen no persistir información de las interacciones.

Que el modo WebSocket no obligue a renunciar a estas garantías despeja una duda razonable: mantener una conexión abierta durante minutos no implica, según lo documentado, ceder en las políticas de retención que ya aplicaban al modelo tradicional de peticiones.

Un límite de una hora por conexión

OpenAI establece un tope de 60 minutos de duración por conexión WebSocket, según su guía oficial. Superado ese margen, la conexión debe renovarse, lo que en la práctica marca el techo temporal para sesiones agenticas continuas que quieran aprovechar este modo sin interrupciones.

El material disponible no incluye cifras de precio ni de inversión asociadas al anuncio, por lo que el impacto en el coste efectivo de estos despliegues queda pendiente de las tarifas que Vercel y OpenAI apliquen sobre el uso de la Gateway y la API respectivamente.