Fachada de la Société de Fromagerie de Vercel, edificio con coche aparcado
Fachada de la Société de Fromagerie de Vercel, edificio con coche aparcadoPmau · Wikimedia Commons · CC-BY-SA

Disponibilidad regional y cumplimiento de residencia de datos

Vercel ha habilitado su AI Gateway para que los modelos Kimi K3 y Kimi K3 Fast puedan ejecutarse utilizando proveedores de inferencia con sede en Estados Unidos, concretamente Baseten y Fireworks. Esto permite a las organizaciones con restricciones legales o políticas sobre la ubicación de procesamiento de datos cumplir con requisitos de residencia de datos ejecutando el modelo físicamente dentro del territorio estadounidense.

El acceso a esta variante regional se configura mediante el parámetro 'inferenceRegion' con el valor geográfico 'us', que fuerza que toda la inferencia se realice en centros de datos estadounidenses. Esta opción está orientada a clientes que por regulación o por internal governance deben controlar dónde se almacenan y procesan sus datos, especialmente en sectores como finanzas o salud.

La disponibilidad de estos proveedores estadounidenses en AI Gateway añade un nivel adicional de control sobre la localización física de los datos, una demanda que crece en paralelo a la consolidación de regulaciones internacionales y locales sobre protección y privacidad de datos. La gestión estricta de la residencia de datos contribuye a mitigar riesgos legales y reputacionales.

El coste de utilizar esta variante regional se sitúa aproximadamente un 10% por encima de la versión estándar, reflejando probablemente el mayor coste operativo intrínseco a mantener infraestructura localizada y compliant en Estados Unidos. Esta diferencia puede convertirse en un factor relevante para clientes que deben balancear coste y cumplimiento.

Las cifras del anuncio, comparadasElaboración propia a partir de los datos del expediente$/Mtokens
3precio por tokens de entrada en AI Gateway15precio por tokens de salida en AI Gateway3precio por lectura de caché en AI Gateway
Ver los datos en tabla
Las cifras del anuncio, comparadas
Concepto$/Mtokens
precio por tokens de entrada en AI Gateway3
precio por tokens de salida en AI Gateway15
precio por lectura de caché en AI Gateway3

Fuente: Vercel

Zero Data Retention (ZDR) para protección de datos

El lanzamiento incluye soporte para Zero Data Retention (ZDR), que busca garantizar que ningún dato de entrada o salida del modelo sea retenido tras la sesión de inferencia. Esta funcionalidad puede activarse desde el panel de AI Gateway o mediante el parámetro 'zeroDataRetention: true' en la configuración.

ZDR responde a demandas de privacidad y cumplimiento normativo, ya que permite a las organizaciones que gestionan información sensible evitar cualquier almacenamiento persistente de datos, reduciendo la superficie de riesgo en caso de brechas o auditorías.

Esta característica es especialmente relevante cuando se manejan datos personales, financieros o de salud, donde la retención automática podría vulnerar políticas internas o regulaciones como HIPAA o GDPR. Poder parametrizar este comportamiento en la plataforma facilita la adaptación del servicio a distintos niveles de requisitos legales.

El soporte de ZDR para ambos modelos, Kimi K3 y Kimi K3 Fast, implica que las operaciones se diseñan desde la base para respetar la privacidad sin sacrificar la capacidad computacional ni la calidad de la inferencia.

Características técnicas, latencia y capacidad

Kimi K3 ofrece un contexto máximo de 1 millón de tokens y una salida máxima de 131.000 tokens, cifras que denotan una capacidad amplia para manejar textos largos o tareas complejas de generación y comprensión.

La ficha oficial del modelo indica una latencia de 4,8 segundos y un throughput de 38 tokens por segundo para el proveedor listado. Estos indicadores son clave para evaluar el rendimiento en producción y compararlo con otras ofertas del mercado.

Kimi K3 Fast es una variante que incrementa el coste por token aproximadamente en un 50% respecto al modelo base, a cambio de una menor latencia. Este trade-off es especialmente relevante para aplicaciones que requieren respuestas rápidas y toleran mayor coste operativo.

La configuración permite usar la opción 'speed' para priorizar Kimi K3 Fast sobre el modelo base. En caso de indisponibilidad del nivel rápido, la ejecución cae automáticamente a velocidad estándar, manteniendo la continuidad del servicio.

Modelo de costos y gestión multi-proveedor

La ficha de Kimi K3 en AI Gateway detalla una tarifa de $3 por millón de tokens de entrada, $15 por millón de tokens de salida y $0,3 por millón para lectura de caché. No se incluye coste para escritura de caché, lo que implica que puede ser un servicio gratuito o incluido como parte del modelo.

El sobrecoste regional en EE. UU. se agrega a estas tarifas base, reflejando los costos adicionales asociados con infraestructuras y requisitos regulatorios locales.

AI Gateway está diseñado para enrutar solicitudes entre múltiples proveedores para obtener failover (cambio automático en caso de fallo), mayor disponibilidad y aumentar la capacidad escalable, evitando la dependencia de un solo proveedor de inferencia.

Este enfoque multiproveedor aporta resiliencia y flexibilidad operativa, requisitos críticos para clientes empresariales que dependen de servicios ininterrumpidos y con alta calidad.