← Volver al artículo

Transparencia

Kog AI publica motor de inferencia que alcanza 3,000 tokens/seg en GPUs AMD y Nvidia

Afirmaciones verificadas

  • El documento oficial de Kog afirma que su motor usa un persistent kernel para acelerar la generación de tokens.

    Estado: Verificada (fuente primaria)

  • El modelo usado en la demo es Laneformer de 2B parámetros.

    Estado: Verificada (fuente primaria)

  • El motor logra hasta 3.5x más rápido en GPU AMD MI300X en comparación con otras soluciones.

    Estado: Verificada (fuente primaria)

  • El rendimiento anunciado en AMD MI300X es de 3.000 o más tokens por segundo en un nodo 8× MI300X.

    Estado: Verificada (fuente primaria)

  • El rendimiento anunciado en NVIDIA H200 es de 2.100 tokens por segundo en un nodo 8× H200.

    Estado: Verificada (fuente primaria)

  • Kog lanzó una tech preview de su Kog Inference Engine el 28 de mayo de 2026.

    Estado: Verificada (fuente primaria)

  • Se muestran 3,000 tokens por segundo en una demo con 8× AMD MI300X y 2,100 en 8× Nvidia H200.

    Estado: Verificada (fuente primaria)