Ejecutar modelos de IA en una GPU en casa: los números reales de una RTX 5070 Ti
Las dos herramientas de este sitio corren en una computadora que tengo en casa. Esto es lo que medí: velocidad, consumo, dónde está de verdad el cuello de botella y cuándo no compensa alojarlo uno mismo.
2026-08-20 作者 William Hsu
Hardware y modelo
- GPU NVIDIA GeForce RTX 5070 Ti, 16 GB de VRAM
- RAM del sistema 62 GB
- Modelo MiniMax H3, cuantizado a int8, con un LoRA turbo que baja el muestreo a 4 pasos
- Entorno ComfyUI sobre Windows; la web funciona en un contenedor Docker de la misma máquina
La razón para no alquilar una GPU en la nube es sencilla. Una hora de alquiler cuesta más o menos lo que esta máquina gasta en electricidad durante todo un día, y además las fotos tendrían que viajar al ordenador de otro. La tarjeta ya está comprada; una imagen más solo cuesta electricidad.
Dónde se van los 40 segundos
Animar fotos antiguas tarda 42–45 segundos por clip y age-me 39–42 segundos por imagen. Muestreé el consumo de la GPU cada 0,7 segundos durante una ejecución, y el resultado son dos picos con un valle en medio.
- Primera parte: codificar la foto y la instrucción de texto en algo que el modelo pueda leer. Casi 20 segundos, la etapa más larga, y aun así la tarjeta va a la mitad de potencia
- Parte central: el muestreo propiamente dicho. Solo 4 pasos, y es la parte más corta
- Última parte: decodificar el resultado en fotogramas, que vuelve a llevar la tarjeta a plena carga
Bajar el muestreo de 6 pasos a 4 ahorró menos de lo que uno esperaría. Pasar de 60–80 segundos a 42–45 fue la suma de tres cambios (un codificador de texto más pequeño, menos pasos de muestreo y quitar un decodificador de audio que no se usaba), y la mayor parte vino de las etapas de codificación y decodificación.
Consumo y lo que cuesta
Medido: 28–32 W en reposo, 144 W de media generando, 276 W de pico (el techo de la tarjeta son 300 W).
La tarjeta gasta unos 2 Wh por imagen; multiplicando por 1,8 para la CPU, la placa y las pérdidas de la fuente, la máquina entera son unos 4 Wh. A los 3,5–5,8 dólares taiwaneses por kWh que cuesta la luz en Taiwán, una imagen sale por entre 0,014 y 0,023 NT$.
Ahí no está el gasto. Dejar la máquina encendida todo el día consume 90–120 W en reposo para el conjunto, es decir 2,2–2,9 kWh al día, o entre 320 y 430 NT$ al mes. Un mes de electricidad en espera equivale a quince o veinte mil imágenes generadas.
Por eso el límite gratuito es generoso: la tarjeta está encendida de todas formas.
El cuello de botella es mover el modelo, no calcular
Meter un modelo de 30 GB en 16 GB de memoria de video es para lo que sirve la cuantización int8. Aun cuantizado, cargar el modelo sigue siendo el paso más lento de toda la cadena. La primera imagen tras un rato inactivo tarda varias veces más que las siguientes, porque el modelo se había descargado de la memoria y hay que volver a cargarlo.
El que espera ese costo es el primer usuario que llega. Por eso el texto de progreso dice directamente «la primera tarda más», en vez de dejar a alguien mirando un porcentaje que no se mueve.
La cola
Las dos herramientas comparten una GPU y, por tanto, una cola. Ponerlas en colas separadas haría que ambas peleasen por la misma memoria de video, lo que las vuelve más lentas a las dos.
La posición en pantalla se lee de la cola real, no es una animación con temporizador.
Cuándo alojarlo uno mismo es mala idea
Si necesitas unos miles de imágenes al día, una sola tarjeta no da abasto y alquilar sale más barato. Alojarlo en casa encaja cuando el volumen es moderado pero no quieres que los archivos salgan de tu infraestructura. Este sitio es el segundo caso: lo que la gente sube suele ser una foto de su propia familia.