Liquid AI lanza LFM2.5-DSpark, acelera inferencia hasta 3,2 veces en GPU
Liquid AI ha anunciado la disponibilidad de LFM2.5-DSpark, una actualización de su familia de modelos que mejora el throughput en GPU y dispositivos, usando speculate decoding.
Consola Fire TV de Amazon junto a su mando a distancia con botones — imagen de archivo de El Forum, ajena al asunto de esta pieza; pendiente de sustituciónEl Forum · Fototeca de El Forum · OWN_WORK
Liquid AI presenta LFM2.5-DSpark con speculate decoding para acelerar inferencia
Liquid AI anunció el lanzamiento de LFM2.5-DSpark, su actualización de la familia LFM2.5, que incorpora speculate decoding para acelerar la inferencia de sus modelos. Según el comunicado, el aumento en eficiencia alcanzó hasta 3,2 veces en GPU y 2,87 veces en dispositivos on-device, basado en mediciones con diferentes modelos y configuración de cargas de trabajo.
Mediciones verificadas muestran mejoras de rendimiento en diferentes entornos
Las mejoras en throughput se avalan con ejemplos específicos: en un modelo LFM2.5-8B-A1B en H100, pasaron de 428 a 1.362 tokens por segundo. En un modelo LFM2.5-1.2B-Instruct en MacBook Pro M4 Max, pasaron de 136 a 389 tokens por segundo. Los tests se realizaron con batch size 1 y temperatura 0, en cinco datasets diferentes, garantizando la consistencia de los resultados.