집에서 GPU로 AI 모델 돌리기: RTX 5070 Ti 실측 수치와 대가
이 사이트의 두 도구는 모두 집에 있는 컴퓨터 한 대에서 돌아갑니다. 아래는 제가 직접 측정한 값입니다. 속도, 전력, 병목이 어디인지, 그리고 어떤 경우에 자체 운영이 오히려 손해인지.
2026-08-20 作者 William Hsu
하드웨어와 모델
- GPU NVIDIA GeForce RTX 5070 Ti, VRAM 16GB
- 시스템 메모리 62GB
- 모델 MiniMax H3, INT8 양자화, turbo LoRA로 샘플링을 4스텝으로
- 실행 환경 ComfyUI는 윈도우에서, 사이트 자체는 같은 기계의 도커 컨테이너에서
클라우드 GPU를 빌리지 않은 이유는 단순합니다. 한 시간 빌리는 값이 이 기계를 하루 종일 켜두는 전기요금과 비슷하고, 게다가 사진을 남의 기계로 보내야 합니다. 카드는 이미 샀으니 한 장 더 만든다고 드는 건 전기뿐입니다.
40초는 어디에 쓰이나
오래된 사진 움직이기는 한 편에 42~45초, age-me는 한 장에 39~42초입니다. 생성하는 동안 0.7초마다 GPU 전력을 기록해 보면 두 개의 봉우리가 골짜기를 사이에 둔 모양이 나옵니다.
- 앞부분: 사진과 텍스트 지시문을 모델이 읽을 수 있는 형태로 바꾸는 구간. 20초 가까이 걸리는 가장 긴 구간인데도 카드는 절반 정도의 출력만 냅니다
- 중간: 실제 샘플링. 겨우 4스텝이고 가장 짧습니다
- 뒷부분: 결과를 화면으로 되돌리는 디코딩. 여기서 다시 한 번 최대 부하까지 올라갑니다
샘플링을 6스텝에서 4스텝으로 줄여서 아낀 시간은 생각보다 적었습니다. 한 장 60~80초에서 42~45초가 된 것은 세 가지 변경의 합(작은 텍스트 인코더로 교체, 샘플링 단계 축소, 쓰지도 않는 오디오 디코딩 제거)이고, 크게 기여한 쪽은 인코딩과 디코딩 구간입니다.
전력과 전기요금
실측: 유휴 28~32W, 생성 중 평균 144W, 최대 276W(카드 상한은 300W).
GPU는 한 장에 약 2Wh. CPU와 메인보드, 전원 손실을 1.8배로 잡으면 기계 전체가 약 4Wh입니다. 대만 전력의 kWh당 3.5~5.8 대만달러로 계산하면 한 장의 전기요금은 0.014~0.023 대만달러입니다.
실제 비용은 거기서 생기지 않습니다. 기계를 하루 종일 켜두면 전체 유휴 전력이 90~120W, 하루 2.2~2.9kWh, 한 달에 320~430 대만달러입니다. 한 달치 대기 전력은 1만 5천~2만 장을 생성하는 전력에 해당합니다.
그래서 무료 한도를 넉넉하게 줍니다. 어차피 카드는 켜져 있으니까요.
병목은 계산이 아니라 모델을 옮기는 일
원래 30GB인 모델을 16GB VRAM에 넣는 것이 INT8 양자화의 역할입니다. 양자화를 해도 모델을 올리는 일은 여전히 전체 흐름에서 가장 느린 단일 단계입니다. 한동안 쉬었다가 만드는 첫 장이 뒤이은 장들보다 몇 배 느린 이유는, 모델이 밀려나 있어서 다시 옮겨와야 하기 때문입니다.
가장 먼저 요청한 사용자가 가장 오래 기다리게 됩니다. 그래서 진행 문구에 "첫 장은 더 느립니다"라고 아예 적어두고, 움직이지 않는 퍼센트를 멍하니 보게 두지 않습니다.
대기열
두 도구가 같은 그래픽카드를 공유하므로 대기열도 하나입니다. 따로 줄을 세우면 같은 VRAM을 두고 다투게 되어 결국 양쪽 다 느려집니다.
화면에 보이는 순번은 실제 대기열에서 읽은 값이지 타이머 애니메이션이 아닙니다.
자체 운영이 답이 아닐 때
하루에 수천 장이 필요하다면 카드 한 장으로는 감당이 안 되고 빌리는 편이 쌉니다. 자체 운영은 양은 많지 않지만 파일을 밖으로 내보내고 싶지 않은 경우에 맞습니다. 이 사이트는 후자입니다. 사람들이 올리는 것은 대개 자기 가족 사진이니까요.