로컬 AI 사양(VRAM) 계산기
모델 파라미터 크기(Billion)와 양자화(Quantization) 비트, 컨텍스트 길이에 따른 최소/권장 VRAM과 최적의 소비자용 GPU 및 Mac 통합 메모리 사양을 즉시 산출합니다.
성능 손실 1% 미만, 용량 70% 절약. 가장 대중적인 로컬 LLM 표준 포맷입니다.
파라미터당 바이트
원작 가중치에 가장 근접하면서도 VRAM을 대폭 아끼는 골든 밸런스입니다.
파라미터당 바이트
FP16 대비 손실이 사실상 전무하며, VRAM을 절반 수준으로 절약합니다.
파라미터당 바이트
양자화가 적용되지 않은 순정 가중치. 개발 및 정밀 연구용으로 활용됩니다.
파라미터당 바이트
VRAM이 부족하여 대형 모델(70B 등)을 일반 PC에서 억지로 구동할 때 적합합니다.
파라미터당 바이트
* 컨텍스트가 길어질수록 KV 캐시 메모리 사용량이 증가합니다.
* 파인튜닝 시 그래디언트 및 옵티마이저 추가 VRAM이 반영됩니다.
Llama 3.3 70B
추천 GPU & Mac 호환성 진단
현재 사양 기준8B Q5/Q4 모델 최적 가성비
14B 및 8B 무손실 FP16 여유
고속 연산 + 16GB VRAM 조합
초고속 토큰 생성 속도
32B Q5 / 70B Q3 구동 가능
단일 카드 최고 속도 및 24GB
32B 고정밀 / 70B Q4 구동
70B 4-bit/5-bit 쾌적 구동
단일 슬롯 48GB 기업용
실 가용 VRAM 약 11~12GB (8B 쾌적)
실 가용 VRAM 약 18GB (14B 쾌적)
실 가용 VRAM 약 27GB (32B 쾌적)
70B 4-bit 여유 있게 구동
70B FP16 / 671B 초경량 구동
하드웨어 구매 가이드 Tip
• 8B 이하: 12GB VRAM(RTX 3060 등)으로 쾌적 실행 가능
• 14B~32B: 16GB~24GB VRAM(RTX 4070Ti S / 3090 / 4090) 권장
• 70B 이상: RTX 3090 Dual(48GB) 또는 Mac Studio(64GB+) 권장
로컬 PC에서 내 전용 AI 챗봇을 10분 만에 구축하는 방법
Ollama와 Open-WebUI를 활용해 GPU 자원을 100% 활용하고, 보안 걱정 없는 나만의 고성능 로컬 AI 환경을 세팅해보세요.