클라우드 서비스 대신 내 PC에서 직접 이미지 생성 AI나 대화형 AI(언어 모델)를 돌려 보려는 사람이 늘고 있습니다. 이때 그래픽카드를 고르는 기준은 게임과 조금 다릅니다. 게임에서는 코어 성능이 먼저지만, 로컬 AI에서는 VRAM 용량이 가장 먼저입니다.
왜 VRAM이 가장 중요할까
AI 모델을 실행하려면 모델의 가중치(학습된 숫자들)를 통째로 VRAM에 올려야 빠르게 계산할 수 있습니다. 모델이 VRAM보다 크면 아예 실행되지 않거나, 일부를 시스템 메모리로 넘겨 속도가 크게 느려집니다. 그래서 코어 성능이 조금 낮더라도 VRAM이 큰 카드가 더 큰 모델을 돌릴 수 있습니다.
언어 모델에 필요한 VRAM 계산하기

언어 모델은 보통 파라미터 수(예: 8B는 80억 개)로 크기를 표시합니다. 필요한 메모리는 대략 파라미터 수 × 파라미터 하나의 크기로 계산합니다.
- 원래 정밀도(FP16): 파라미터당 2바이트 → 8B 모델은 약 16GB
- 8비트 양자화: 파라미터당 약 1바이트 → 8B 모델은 약 8GB
- 4비트 양자화: 파라미터당 약 0.5바이트 → 8B 모델은 약 4~5GB
양자화는 숫자를 더 적은 비트로 줄여 저장하는 방법으로, 품질이 약간 떨어지는 대신 필요한 메모리가 크게 줄어듭니다. 여기에 대화 길이(문맥)가 길어질수록 추가 메모리가 필요하므로, 계산값보다 1~2GB 정도 여유를 두는 것이 좋습니다.
| 모델 크기 | 4비트 양자화 기준 대략 | 어울리는 VRAM |
|---|---|---|
| 7~8B | 약 5GB | 8GB 이상 |
| 12~14B | 약 8~9GB | 12GB 이상 |
| 30B 안팎 | 약 17~20GB | 24GB 이상 |
| 70B 안팎 | 약 40GB | 소비자용 카드 1장으로는 어려움 |
표의 값은 계산에 따른 대략적인 기준이며, 실행 프로그램과 설정에 따라 달라집니다.
이미지 생성 AI는
이미지 생성 모델도 모델 크기와 만들 이미지 해상도에 따라 필요한 VRAM이 달라집니다. 가벼운 모델은 8GB에서도 설정을 조정하면 돌아가지만, 최신 대형 모델을 여유 있게 쓰려면 12GB에서 16GB 이상이 편합니다. 한 번에 여러 장을 만들거나 해상도를 높이면 VRAM 사용량이 빠르게 늘어납니다.
그래픽카드 고르는 기준

- 입문: RTX 5060 Ti 16GB처럼 가격 대비 VRAM이 큰 카드가 유리합니다. 같은 이름의 8GB 제품과 헷갈리지 않게 주의하세요. 차이는 RTX 5060 Ti 8GB와 16GB 차이에서 설명했습니다.
- 본격 활용: 16GB 이상인 RTX 5070 Ti, RTX 5080이 무난합니다.
- 큰 모델까지: 32GB인 RTX 5090이 소비자용 중 가장 큽니다.
로컬 AI 프로그램 대부분이 엔비디아 CUDA를 기본으로 지원하는 이유는 CUDA란 무엇인가에서, 텐서 코어가 AI 계산에서 하는 역할은 텐서 코어와 RT 코어란에서 볼 수 있습니다.