Actualizado el
Modal: opiniones y análisis
Despliega funciones de Python con GPU y las llamas como endpoint desde tu producto.
Enlace de afiliado · sin coste extra para ti
Modal convierte una función de Python en un endpoint con GPU detrás sin ficheros de configuración ni contenedor que construir a mano, y cobra por segundo de ejecución. Su argumento fuerte es el arranque en frío, que es lo que hace viable bajar a cero entre picos en vez de pagar una máquina parada. A cambio no ofrece autoalojamiento y no trae servidor de inferencia gestionado, así que la capa que sirve el modelo la escribes y la mantienes tú.
Ideal para: Equipos de Python que sirven modelos con tráfico irregular y no quieren pagar GPU paradas.
Qué dice internet
Lo que más se repite entre quien la usa es el arranque en frío: Modal saca contenedores con GPU en segundos y eso es lo que la separa de alquilar máquina fija. La forma de trabajar también gusta, se decora una función de Python y queda desplegada, sin ficheros de configuración. Las pegas son de encaje, no de calidad, no hay opción de alojarla tú, el trabajo de servir el modelo lo pones tú porque no trae un servidor de inferencia gestionado, y el salto del plan de entrada al siguiente son 250 dólares al mes de cuota antes del cómputo.
Lo que la red repite a favor
- El arranque en frío es su argumento central y quien la ha comparado con otras plataformas lo confirma, contenedores con GPU en marcha en segundos en vez del minuto largo que costaba antes
- Se despliega decorando una función de Python, sin ficheros de configuración ni contenedor que construir a mano, y la documentación se cita como de las buenas del sector
- Cobra por segundo de ejecución y baja a cero cuando no hay tráfico, así que el pico de una campaña no obliga a pagar la máquina las veinticuatro horas
- El plan de entrada no cobra cuota, solo el cómputo, y trae 30 dólares mensuales de crédito incluido para probar sin abrir presupuesto
Lo que la red repite en contra
- No hay forma de alojarla en tu propia infraestructura, que es la diferencia que marcan quienes la comparan con alternativas de código abierto
- No trae un servidor de inferencia gestionado, así que el código que sirve el modelo y su mantenimiento corren de tu cuenta, a diferencia de las plataformas especializadas en servir modelos
- El salto del plan de entrada al siguiente son 250 dólares al mes de cuota antes del cómputo, y lo que se compra con ese salto son límites de concurrencia y funciones de equipo
- Los propios ingenieros de Modal reconocen que su técnica de instantáneas de memoria falla cuando se usan varias GPU, así que la ventaja de arranque no cubre todos los casos
- No tiene máquinas propias: alquila capacidad a terceros y su consejero delegado ha reconocido públicamente que conseguir GPU suficientes es su cuello de botella y le ha subido el coste
Fuentes del barrido: Precios oficiales · Comunidades · Comunidades · Reseñas · Prensa · Documentación
A favor / En contra
A favor
- Arranque en frío de segundos, que es lo que permite bajar a cero de verdad
- Se despliega decorando una función de Python, sin configuración aparte
- Cobra por segundo de ejecución y el plan de entrada no lleva cuota
En contra
- No se puede alojar en infraestructura propia
- Sin servidor de inferencia gestionado: el código que sirve el modelo es tuyo
- El siguiente plan salta a 250 dólares al mes de cuota antes del cómputo
TLDR: Modal ejecuta código Python en máquinas con GPU sin que tengas que provisionar nada: decoras una función, la despliegas y queda accesible como endpoint desde tu producto. Cobra por segundo de ejecución y baja a cero cuando no entra tráfico, que es donde recupera la diferencia frente a alquilar una GPU por horas. Su plan de entrada no lleva cuota, solo cómputo. Lo que no hace es servirte el modelo: esa capa la escribes tú, y no hay forma de alojar la plataforma en tu propia infraestructura.
Qué es Modal y cómo funciona
Modal es una plataforma de cómputo sin servidor pensada para cargas de Python que necesitan GPU. La idea de producto cabe en una frase: escribes una función normal, le pones un decorador que declara qué hardware quiere, y la plataforma construye la imagen, la programa en una máquina y te devuelve logs en directo. No hay YAML que mantener ni contenedor que empaquetar a mano.
Para el caso que interesa a este segmento, llamar a un modelo desde tu propio producto, la pieza clave son las funciones web. El mismo decorador que ejecuta una tarea por lotes puede exponer la función como endpoint HTTP con URL persistente, así que el modelo que has cargado en memoria queda a una petición de distancia de tu backend. Es el mismo camino que recorren las plataformas especializadas en servir modelos, con una diferencia de reparto de trabajo que conviene entender antes de elegir.
Esa diferencia es que Modal no trae un servidor de inferencia gestionado. Te da la máquina, el arranque y el escalado, y espera que tú traigas el código que carga el modelo y responde. Quien ya tiene ese código lo agradece, porque no hay abstracción que pelear. Quien esperaba desplegar un modelo del catálogo con dos clics se encuentra con un trabajo de ingeniería que otras plataformas del segmento sí resuelven.
La otra decisión estructural es que Modal no tiene máquinas propias. Alquila capacidad en bloque a proveedores de infraestructura, trece de ellos según su último cierre de financiación, y su consejero delegado ha dicho en público que asegurar GPU suficientes es el freno de la empresa. No es un defecto del producto, pero sí explica por qué la disponibilidad de un modelo de tarjeta concreto puede variar.
Cómo es usarlo en el día a día
La primera sesión es corta. Se instala el paquete, se define la función con su imagen y su GPU, y modal deploy devuelve una URL. Lo que sorprende a quien viene de gestionar servidores es que no hay un paso de construcción de contenedor que esperar cada vez, porque la plataforma reconstruye solo lo que ha cambiado.
El arranque en frío es el argumento del que más se habla y donde la ingeniería de la casa se nota. Sacar un contenedor con GPU en segundos, en vez del minuto largo que costaba hace un par de años, es lo que convierte el escalado a cero en algo utilizable en producción y no en una promesa de la página de marketing. En Hacker News hay gente que se pasó por eso mismo cuando los proveedores grandes todavía no ofrecían GPU sin servidor.
Conviene conocer el límite de esa ventaja. Los propios ingenieros de Modal han admitido en los comentarios de su artículo técnico que la instantánea de memoria, que es la técnica que sostiene los arranques rápidos, falla cuando el trabajo usa varias GPU. Si tu modelo necesita repartirse entre tarjetas, cuenta con arranques normales.
El escalado a cero es el comportamiento por defecto y no hay que pedirlo, aunque se puede fijar un mínimo de contenedores calientes y una ventana de apagado si prefieres pagar por latencia estable. Ese par de ajustes es, en la práctica, la decisión económica más importante que vas a tomar en la plataforma.
La cara menos agradable es operativa. El registro público de incidencias recoge cortes reales, entre ellos un fallo de almacén de datos en mayo de 2026 que dejó servicios caídos más de dos horas. Es información que la plataforma publica con honradez, y es la que hay que mirar antes de poner encima algo que no puede caerse.
Precio y planes
El plan de entrada no cobra cuota: la web lo publica como cero dólares más cómputo al mes, con treinta dólares de crédito incluido cada mes. El siguiente nivel salta a doscientos cincuenta dólares al mes más cómputo, y lo que compras con ese salto son límites de concurrencia más altos, asientos ilimitados, dominios propios y reversión de despliegues. El tercer nivel es a medida.
El cómputo se factura por segundo de ejecución, con tarifas publicadas por tipo de tarjeta. Eso significa que la factura sigue al tráfico en lugar de a la hora de reloj, y es la razón por la que el pago por uso gana con tráfico irregular. La cuenta se invierte cuando la carga es alta y constante: llega un punto en el que una máquina reservada sale más barata que pagar cada segundo, exactamente el mismo cruce que hay que calcular con Baseten.
Un aviso sobre el salto de plan. Pasar de la entrada al nivel de equipo no es un ajuste fino de precio, son doscientos cincuenta dólares mensuales antes de haber ejecutado nada. Si lo que te empuja a subir es un límite de concurrencia y no el número de personas, mide primero cuántos contenedores necesitas de verdad en pico.
Para quién es (y para quién no)
Modal es para equipos que escriben Python y ya saben cómo servir su modelo, con tráfico que sube y baja. Ahí el escalado a cero y el cobro por segundo son dinero real, no una comodidad.
No es para quien quiere desplegar un modelo del catálogo sin escribir la capa de servicio. Para eso, Baseten está construido justo alrededor de ese problema y su ficha detalla el reparto. Tampoco es para quien solo necesita llamar a modelos ajenos por API sin desplegar nada, terreno de AIML API. Y si tu requisito es alojar la plataforma en tu propia infraestructura, Modal queda descartado de entrada, porque no ofrece esa opción.
Un matiz para equipos con exigencias de cumplimiento: la plataforma corre sobre proveedores de terceros, así que la conversación sobre dónde vive el dato hay que tenerla antes de construir, no después.
Alternativas a Modal
El reparto es por dónde quieres poner la frontera. Si prefieres que la plataforma gestione el servidor de inferencia, Baseten. Si no quieres desplegar nada y te vale llamar a modelos alojados por otros, AIML API. Si el caso es un chatbot sobre tus documentos y no una API, FastGPT resuelve otro problema distinto. Están en alternativas a Modal, y el mapa completo en las mejores IA de código.
Preguntas frecuentes
¿Sirve para servir un modelo en producción o solo para tareas por lotes?
Sirve para las dos cosas. Los decoradores de función web convierten una función de Python en un endpoint HTTP con URL persistente, que es lo que necesitas para llamarla desde tu backend.
¿Cuánto tarda en arrancar cuando no hay tráfico?
Segundos para un contenedor con GPU típico, que es la mejora que la casa ha documentado en detalle. Con modelos grandes repartidos en varias tarjetas, la técnica que sostiene ese arranque rápido no se aplica y hay que contar con más.
¿El plan de entrada es gratis del todo?
La cuota es cero y hay treinta dólares de crédito mensual incluido, pero el cómputo se paga aparte por segundo de ejecución. Gratis del todo no es: es sin cuota fija.
¿Puedo alojarlo en mi propia infraestructura?
No. Es una plataforma gestionada y no ofrece versión autoalojada, que es la diferencia que marcan quienes la comparan con opciones de código abierto.
¿Cuándo deja de compensar frente a alquilar una GPU por horas?
Cuando la carga es alta y predecible. Con tráfico irregular el cobro por segundo casi siempre gana, y con una máquina ocupada la mayor parte del día la ecuación se invierte. Calcula el punto de cruce con tus propios números antes de construirlo todo encima.