← 網誌 · De 80 a 43 segundos por video: todos los cambios probados, con sus mediciones

De 80 a 43 segundos por video: todos los cambios probados, con sus mediciones

La optimización entera, escrita tal cual: qué medir primero, dónde estaba de verdad el cuello de botella, los tres cambios hechos, lo que ahorró cada uno y qué ideas razonables se descartaron a propósito.

2026-08-20 作者 William Hsu

這篇講什麼
  1. Medir primero, cambiar después
  2. El cuello de botella es un modelo de 30 GB entrando en una tarjeta de 16 GB
  3. Cambio uno: un codificador de texto más pequeño
  4. Cambio dos: del muestreo de 6 pasos a 4
  5. Cambio tres: quitar un decodificador de audio que nadie usaba
  6. Resultado
  7. Una confirmación accidental
  8. Lo que no se hizo
  9. Mirando atrás

Medir primero, cambiar después

El modelo permite ajustar el número de pasos de muestreo, y el instinto dice que bajándolo todo va más rápido. Las mediciones dijeron otra cosa.

ComfyUI informa del progreso nodo a nodo por WebSocket mientras trabaja, así que registré el tiempo de cada etapa de un clip de tres segundos:

EtapaTiempo
Leer la fotografía (codificadores de texto e imagen)unos 17,7 s
Muestreo (el paso que de verdad la anima)unos 11 s
Decodificación VAE (revelar el resultado en fotogramas)unos 11,4 s
El restomover los pesos del modelo a la tarjeta
Tiempo por etapa de generación
Medición nodo a nodo: el muestreo es solo una cuarta parte

El muestreo es alrededor de un cuarto del total, así que recortar pasos solo puede ahorrar hasta cierto punto.

El cuello de botella es un modelo de 30 GB entrando en una tarjeta de 16 GB

La tarjeta es una RTX 5070 Ti con 16 GB de memoria de video. El codificador de texto más el modelo principal pasan de 30 GB por sí solos, no caben, y por eso cada ejecución transmite los pesos a la tarjeta.

El tiempo se va en mover datos, no en calcular. Los tres cambios siguientes empujan en la misma dirección: hacer más pequeño lo que hay que mover.

Cambio uno: un codificador de texto más pequeño

Cambiar 25,3 GB por una versión cuantizada de 14,6 GB significa mover más de 10 GB menos cada vez. De los tres cambios, este fue el que más rindió.

En teoría cuantizar cuesta calidad. Hice la comparación antes/después con la misma semilla aleatoria —misma foto, mismo movimiento, misma semilla— y puestos uno al lado del otro los resultados son indistinguibles. Fijar la semilla es imprescindible: sin ella dos ejecuciones ya difieren de por sí y la comparación no significa nada.

Cambio dos: del muestreo de 6 pasos a 4

Parece un atajo, pero el LoRA de aceleración que uso está diseñado precisamente para 4 pasos. Ejecutar 6 no mejora nada, solo tarda más. Ese parámetro venía heredado de otra configuración y no encajaba con este modelo.

Cambio tres: quitar un decodificador de audio que nadie usaba

El flujo de trabajo de serie del modelo incluye un nodo de decodificación de audio. Nuestro resultado es un clip en bucle sin sonido, así que el resultado de todo ese cálculo no lo leía nadie.

Heredar el flujo de trabajo de otro deja este tipo de restos. La forma de encontrarlos es medir nodo a nodo y preguntar de cada nodo costoso: ¿su salida se usa realmente?

Resultado

Un clip pasó de 60–80 segundos (137 en el peor caso) a 42–45 segundos estables.

Antes y después
Los tres cambios juntos: un 40% menos de media y el peor caso desaparecido

La varianza también se hundió: el caso de 137 segundos dejó de ocurrir. Para quien lo usa, la diferencia es «43 segundos siempre» frente a «60 de media, pero de vez en cuando 137».

Una confirmación accidental

Probando otra cosa, una repetición con los mismos parámetros tardó solo 17,2 segundos, porque ComfyUI había cacheado la codificación anterior y se saltó esos 17,7 segundos enteros. Encaja exactamente con la tabla de arriba.

Lo que no se hizo

Mirando atrás

Tres cosas que vale la pena recordar. Sin medir nodo a nodo habría gastado el esfuerzo en los pasos de muestreo, que son un cuarto del tiempo. Cuando falta memoria de video, el cuello de botella es el movimiento de datos, y la optimización tiene que apuntar a que lo que se mueve sea más pequeño. Y una comparación antes/después obliga a fijar la semilla aleatoria, o no sabrás si la diferencia de calidad vino del cambio o del azar.

這篇文章寫的是本站實際的實作與量測。工具本身在老照片動起來與變老變年輕,都可以直接試。

← 上一篇一張靜態照片怎麼變成 6 秒循環影片:實作細節與踩過的坑

看其他文章