
Cuatro modelos para diferentes niveles de generación sonora
Stable Audio 3.0 trae cuatro variantes que cubren necesidades distintas, tanto en tamaño como en capacidad. Los modelos Small SFX y Small cuentan con 459 millones de parámetros y pueden generar audios de hasta dos minutos de duración, adecuados para efectos y piezas cortas.
Medium y Large, con 1.4 y 2.7 mil millones de parámetros respectivamente, permiten composiciones mucho más largas, hasta 6 minutos y 20 segundos. Esto abre la puerta a música con desarrollo complejo y variado en un solo pase.
La diversidad en el catálogo facilita que usuarios y desarrolladores elijan el modelo que se adapta a su caso, ya sea experimentar con sonidos o generar piezas completas.
Así, Stable Audio 3.0 puede servir tanto a creadores individuales como a productoras que buscan calidad y duración superior.
Acceso abierto excepto para el modelo más avanzado
Tres de los cuatro modelos se distribuyen como open weights, lo que significa que sus pesos están públicamente disponibles para desarrolladores y empresas que quieran integrarlos o construir sobre ellos.
El modelo Large queda reservado para clientes empresariales y se ofrece exclusivamente mediante acceso vía API. Esto permite a Stability AI controlar su uso y monetizar su mayor capacidad sin perder control sobre el código.
Este esquema de distribución refleja una estrategia combinada: fomentar la innovación y el ecosistema general con modelos abiertos, y mantener una oferta premium bajo control comercial.
La coexistencia de ambos modelos de acceso es clave para que Stability AI consolide su posición en segmentos diversos del mercado de audio generado por IA.
Dataset robusto y tiempos de inferencia competitivos
Stable Audio 3.0 fue entrenado con 1.278.902 grabaciones licenciadas, asegurando gran diversidad y calidad sonora.
El material procede de bancos de sonidos como AudioSparx (806.284 clips) y Freesound (472.618 clips), lo que también indica un esfuerzo por cumplir normativas de licencias.
Los tiempos de inferencia son de 1.31 segundos para el modelo Medium y 1.80 para Large en hardware especializado H200, lo que pone énfasis en la eficiencia y viabilidad para producción en tiempo real o casi real.
Estos valores evidencian un salto cualitativo respecto a versiones previas y posicionan a Stable Audio 3.0 con capacidad técnica para uso profesional.
Implicaciones para la industria de generación de audio
Al abrir la mayoría de sus modelos, Stability AI contribuye a dinamizar el mercado de audio generado por IA, fomentando nuevos desarrollos y aplicaciones creativas.
El acceso restringido al modelo más grande actúa como mecanismo para controlar calidad y acceso comercial, además de proteger la propiedad intelectual estratégica.
La combinación de formatos abre puertas a un amplio espectro de usuarios, desde artistas experimentales hasta empresas especializadas en producción multimedia.
Establece un referente en cómo balancear apertura y negocio en tecnologías de IA que manejan contenido creativo complejo.