Transparencia
Kog AI publica motor de inferencia que alcanza 3,000 tokens/seg en GPUs AMD y Nvidia
Afirmaciones verificadas
El documento oficial de Kog afirma que su motor usa un persistent kernel para acelerar la generación de tokens.
Estado: Verificada (fuente primaria)
El modelo usado en la demo es Laneformer de 2B parámetros.
Estado: Verificada (fuente primaria)
El motor logra hasta 3.5x más rápido en GPU AMD MI300X en comparación con otras soluciones.
Estado: Verificada (fuente primaria)
El rendimiento anunciado en AMD MI300X es de 3.000 o más tokens por segundo en un nodo 8× MI300X.
Estado: Verificada (fuente primaria)
El rendimiento anunciado en NVIDIA H200 es de 2.100 tokens por segundo en un nodo 8× H200.
Estado: Verificada (fuente primaria)
Kog lanzó una tech preview de su Kog Inference Engine el 28 de mayo de 2026.
Estado: Verificada (fuente primaria)
Se muestran 3,000 tokens por segundo en una demo con 8× AMD MI300X y 2,100 en 8× Nvidia H200.
Estado: Verificada (fuente primaria)