Mục lục
1. VRAM là nút thắt số một khi chạy AI
Khi chạy AI, model phải được nạp trọn vào bộ nhớ của card đồ họa — gọi là VRAM. CPU nhiều nhân, RAM dồi dào đến mấy cũng không cứu được nếu VRAM không đủ chỗ cho model: chương trình hoặc báo lỗi ngay khi khởi động, hoặc chạy chậm tới mức vô dụng vì phải đẩy dữ liệu qua lại giữa GPU và RAM.
Vì thế câu hỏi đúng khi đi thuê GPU không phải "bao nhiêu core, bao nhiêu RAM" mà là: tác vụ của tôi cần bao nhiêu VRAM?
Lưu ý: con số VRAM trong bài tính cho model đã tối ưu (định dạng quantized phổ biến trên cộng đồng). Chạy bản gốc full precision cần gấp 2–4 lần.
2. Bảng đối chiếu: VRAM nào chạy được gì
Đây là phần đáng giá nhất của bài — đối chiếu trước khi ký hợp đồng thuê bất cứ GPU nào:
| VRAM | Chạy tốt | Đừng cố chạy |
|---|---|---|
| 1–2 GB | Tăng tốc encode video, OCR nhận dạng chữ, model nhận diện ảnh nhỏ (YOLO bản gọn), giả lập Android, remote desktop có đồ họa | Stable Diffusion, mọi LLM chat |
| 4 GB | Embedding cho hệ tìm kiếm/RAG, model ngôn ngữ nhỏ (SLM 1–3B đã quantize), Whisper bản small chuyển giọng nói thành chữ | Sinh ảnh chất lượng cao, LLM 7B trở lên |
| 8 GB | Stable Diffusion 1.5 (ảnh 512px), LLM 7B quantized chạy chat nội bộ, fine-tune LoRA model nhỏ | SDXL nặng, LLM 13B+ |
| 16 GB | SDXL, LLM 13B quantized, Whisper large, phục vụ nhiều người dùng đồng thời ở mức vừa | Training model từ đầu, LLM 70B |
| 24 GB trở lên | LLM 30–70B quantized, training/fine-tune nghiêm túc, sản phẩm AI thương mại có tải thật | — |
Quy tắc nhớ nhanh: chat với AI cỡ nhỏ bắt đầu từ 8GB, sinh ảnh bắt đầu từ 8GB, làm sản phẩm thật bắt đầu từ 16GB. Dưới các mốc đó vẫn có rất nhiều việc AI hữu ích — nhưng là những việc khác (dòng 1–2GB và 4GB trong bảng).
3. VPS GPU hay máy chủ GPU riêng?
Ứng với bảng trên, hạ tầng GPU tại Việt Nam chia làm hai lớp rõ rệt — và chọn nhầm lớp là cách phí tiền nhanh nhất:
Lớp 1 — VPS GPU (GPU chia sẻ, VRAM 1–4GB). Như VPS GPU tại Cloudzone: từ 450.000đ/tháng, kèm CUDA và NVIDIA driver cài sẵn, quyền root, VRAM 1GB ở gói niêm yết (2–4GB cấp theo yêu cầu). Đúng việc của nó: encode video, OCR, embedding cho RAG, chạy SLM gọn nhẹ, môi trường dev/test trước khi lên máy lớn. Chi phí thấp, bật tắt nhanh, không phải cam kết dài.
Lớp 2 — máy chủ vật lý có GPU riêng. Khi bài toán là Stable Diffusion, LLM 7B trở lên hay bất cứ thứ gì "production", bạn cần card chuyên dụng VRAM 8–24GB+ không chia sẻ với ai — tức là thuê máy chủ vật lý có GPU. Đắt hơn, nhưng đây là lớp duy nhất chạy nổi các tác vụ đó; cố nhét vào VPS GPU chỉ tốn tiền lẫn thời gian của chính bạn.
Còn phân vân giữa thuê và tự mua card? Đội Cloudzone đã có bài phân tích riêng: máy chủ GPU nên thuê hay mua cho dự án AI, và nếu chưa chắc bài toán của mình có cần GPU không, đọc CPU hay GPU cho AI trước đã.
4. Ba lỗi thuê GPU phí tiền hay gặp
- Thuê theo RAM thay vì VRAM. Gói 32GB RAM nghe "khủng" nhưng model AI không nạp vào RAM — nó nạp vào VRAM. Đọc kỹ dòng VRAM trước, mọi thông số khác tính sau.
- Thuê máy lớn để... học. Giai đoạn vọc thử notebook, chạy demo cho sếp xem — VPS GPU nhỏ hoặc thậm chí Google Colab miễn phí là đủ. Lên máy 16–24GB khi đã có bài toán và dữ liệu thật.
- Quên chi phí ngoài GPU. Model lớn kéo theo ổ cứng lớn (checkpoint vài chục GB), băng thông tải dữ liệu, và điện — thuê ngoài data center thì các khoản này nằm sẵn trong giá, tự dựng thì cộng thêm. Đội Cloudzone từng bóc kỹ trong bài chi phí ẩn khi triển khai AI.
5. Câu hỏi thường gặp
Stable Diffusion cần tối thiểu bao nhiêu VRAM?
Bản 1.5 chạy được từ 6–8GB VRAM cho ảnh 512px; SDXL nên có 16GB. Dưới mức đó sinh được ảnh nhưng chậm và hay tràn bộ nhớ.
LLM 7B như Llama, Mistral cần GPU thế nào?
Bản quantized 4-bit cần khoảng 6–8GB VRAM để chat mượt. Bản đầy đủ cần ~16GB. Model 13B nhân đôi các con số này.
VPS GPU 1GB VRAM thì làm được gì với AI?
Nhiều hơn bạn nghĩ, miễn đúng việc: OCR hóa đơn, embedding cho hệ tìm kiếm nội bộ, nhận diện ảnh model gọn, tăng tốc xử lý video — những tác vụ doanh nghiệp dùng hằng ngày. Chỉ là đừng kỳ vọng nó chat như ChatGPT.
Tôi muốn thử trước khi thuê máy lớn thì làm sao?
Bắt đầu bằng VPS GPU nhỏ để dựng pipeline, đo thử nhu cầu VRAM thật của model bằng chính dữ liệu của bạn, rồi mới quyết cỡ máy chủ GPU. Cloudzone hỗ trợ nâng cấp mà không phải làm lại từ đầu.
Chưa chắc bài toán của bạn rơi vào dòng nào trong bảng? Xem các gói VPS GPU hoặc gọi Cloudzone mô tả tác vụ — chúng tôi nói thẳng gói nào đủ, gói nào thừa.