Rodar modelos de IA numa GPU em casa: os números reais de uma RTX 5070 Ti
As duas ferramentas deste site rodam num computador na minha casa. Isto foi o que eu medi: velocidade, consumo, onde está de fato o gargalo e quando hospedar em casa não compensa.
2026-08-20 作者 William Hsu
Hardware e modelo
- GPU NVIDIA GeForce RTX 5070 Ti, 16 GB de memória de vídeo (VRAM)
- RAM do sistema 62 GB
- Modelo MiniMax H3, quantizado para INT8, com um LoRA turbo que reduz a amostragem para 4 passos
- Ambiente ComfyUI no Windows; o site em si roda num contêiner Docker na mesma máquina
O motivo de não alugar uma GPU na nuvem é simples. Uma hora de aluguel custa mais ou menos o que esta máquina gasta de energia num dia inteiro, e as fotos ainda teriam de viajar até o computador de outra pessoa. A placa já está comprada; mais uma imagem custa só eletricidade.
Para onde vão os 40 segundos
Animar fotos antigas leva 42–45 segundos por clipe e o age-me 39–42 segundos por imagem. Amostrei o consumo da GPU a cada 0,7 segundos durante uma execução, e o gráfico mostra dois picos com um vale no meio.
- Primeira parte: codificar a foto e a instrução de texto em algo que o modelo consiga ler. Quase 20 segundos, a etapa mais longa de todas, e mesmo assim a placa roda a cerca de metade da potência
- Parte do meio: a amostragem em si. Só 4 passos, e é a parte mais curta
- Última parte: decodificar o resultado de volta em quadros, o que leva a placa de novo à carga máxima
Baixar a amostragem de 6 para 4 passos economizou menos do que se imagina. Sair de 60–80 segundos para 42–45 foi a soma de três mudanças (um codificador de texto menor, menos passos de amostragem e a remoção de um decodificador de áudio que nunca era usado), e a maior parte veio das etapas de codificação e decodificação.
Consumo e quanto custa
Medido: 28–32 W ocioso, 144 W em média durante a geração, 276 W de pico (o teto da placa é 300 W).
A placa gasta cerca de 2 Wh por imagem; multiplicando por 1,8 para CPU, placa-mãe e perdas da fonte, a máquina inteira dá uns 4 Wh. Aos 3,5–5,8 dólares taiwaneses por kWh, uma imagem custa entre 0,014 e 0,023 NT$.
O gasto não está aí. Deixar a máquina ligada o dia todo consome 90–120 W ociosos no conjunto, ou seja 2,2–2,9 kWh por dia, entre 320 e 430 NT$ por mês. Um mês de energia em espera equivale a quinze ou vinte mil imagens geradas.
É por isso que a cota gratuita é generosa: a placa está ligada de qualquer jeito.
O gargalo é mover o modelo, não calcular
Colocar um modelo de 30 GB em 16 GB de memória de vídeo é para isso que serve a quantização int8. Mesmo quantizado, carregar o modelo continua sendo o passo mais lento de toda a cadeia. A primeira imagem depois de um tempo ocioso demora várias vezes mais que as seguintes, porque o modelo foi despejado e precisa voltar.
Quem paga por isso é quem chega primeiro. Por isso o texto de progresso avisa claramente que “a primeira é mais lenta”, em vez de deixar alguém encarando uma porcentagem parada.
A fila
As duas ferramentas dividem uma GPU e, portanto, uma fila. Usar filas separadas faria os dois lados disputarem a mesma memória de vídeo, o que deixa ambos mais lentos.
A posição na tela é lida da fila real, não é uma animação de cronômetro.
Quando hospedar em casa é a resposta errada
Se você precisa de alguns milhares de imagens por dia, uma placa não dá conta e alugar sai mais barato. Hospedar em casa serve para quando o volume é modesto mas você não quer que os arquivos saiam do prédio. Este site é o segundo caso: o que as pessoas enviam costuma ser uma foto da própria família.