Mục lục1. Đếm người dùng cùng lúc, không đếm tổng nhân viên2. VRAM được chia ra sao khi nhiều người hỏi cùng lúc2.1 Trọng số mô hình2.2 Bộ nhớ ngữ cảnh cho từng người3. Chọn cấu hình theo quy mô đội ngũ3.1 Mức 1: bắt đầu với VPS GPU3.2 Mức 2: chuyển lên máy chủ GPU riêng3.3 Mức 3: tách hạ tầng riêng cho dữ liệu nhạy cảm4. Lộ trình triển khai gợi ý5. Câu hỏi thường gặp5.1 VPS GPU 4GB chạy được chatbot tiếng Việt không?5.2 Có cần GPU cho phần tìm kiếm tài liệu không?5.3 Khi nào nên chuyển từ VPS GPU lên máy chủ GPU riêng?5.4 Dữ liệu nội bộ có ra khỏi máy chủ không?
1. Đếm người dùng cùng lúc, không đếm tổng nhân viên
Sai lầm hay gặp khi lên kế hoạch chatbot nội bộ VPS GPU là lấy tổng số nhân viên làm căn cứ. Một công ty 200 người không có nghĩa là 200 câu hỏi gửi vào trong cùng một giây. Phần lớn thời gian, người dùng đang đọc câu trả lời, gõ câu hỏi tiếp theo hoặc làm việc khác.
Con số cần đo là số yêu cầu mà mô hình đang xử lý song song. Cách ước lượng đơn giản:
- Lấy số người có quyền dùng chatbot.
- Nhân với tỷ lệ người mở chatbot trong giờ cao điểm, ví dụ 20%.
- Nhân tiếp với tỷ lệ người đang chờ câu trả lời tại cùng một thời điểm, ví dụ 1/4, vì mỗi lượt trả lời chỉ mất vài giây.
Với 200 nhân viên, phép tính trên cho ra khoảng 10 yêu cầu đồng thời. Đây là tỷ lệ giả định để minh hoạ cách tính. Sau tuần chạy thử đầu tiên, bạn nên thay bằng số đo thật từ nhật ký của chatbot.
2. VRAM được chia ra sao khi nhiều người hỏi cùng lúc
Bộ nhớ GPU (VRAM) của một chatbot bị chia cho hai phần. Phần đầu là trọng số mô hình, nạp một lần và cố định. Phần sau là bộ nhớ ngữ cảnh cho từng cuộc hội thoại đang chạy, thường gọi là KV cache.
2.1 Trọng số mô hình
Kích thước trọng số phụ thuộc số tham số và mức lượng tử hoá, tức là nén trọng số xuống 4 hoặc 8 bit. Quy tắc gần đúng: mô hình nén 4 bit cần khoảng 0,5-0,7GB VRAM cho mỗi tỷ tham số. Một mô hình 3 tỷ tham số nén 4 bit vì vậy chiếm khoảng 2GB, còn mô hình 7-8 tỷ tham số chiếm khoảng 4-5GB.
2.2 Bộ nhớ ngữ cảnh cho từng người
Mỗi yêu cầu đang xử lý giữ riêng một vùng bộ nhớ, tỷ lệ với độ dài ngữ cảnh. Chatbot nội bộ thường ghép thêm đoạn trích từ tài liệu công ty vào câu hỏi, nên ngữ cảnh dài hơn chat thông thường.
Vì vậy cùng một mô hình, 3 người dùng có thể chạy êm nhưng 15 người thì bắt đầu xếp hàng. Khi VRAM hết chỗ, phần mềm phục vụ mô hình bắt yêu cầu mới phải chờ, và người dùng thấy chatbot đứng hình vài giây.
3. Chọn cấu hình theo quy mô đội ngũ
Dựa trên hai phần trên, có thể chia thành ba mức. Bảng dưới là hướng chọn, không phải cam kết hiệu năng; con số thật phụ thuộc mô hình và độ dài tài liệu bạn đưa vào.
| Quy mô | Yêu cầu đồng thời | Mô hình phù hợp | Hạ tầng gợi ý |
| Nhóm thử nghiệm, phòng ban nhỏ | 1-3 | Mô hình nhỏ 1-3 tỷ tham số, nén 4 bit | VPS GPU, VRAM 1-4GB |
| Công ty vài chục đến vài trăm người | 5-20 | Mô hình 7-14 tỷ tham số | Máy chủ vật lý có GPU, VRAM 16-32GB |
| Nhiều phòng ban, dữ liệu nhạy cảm | Trên 20 | Nhiều mô hình hoặc nhiều bản sao | Nhiều máy chủ GPU trong hạ tầng riêng |
3.1 Mức 1: bắt đầu với VPS GPU
VPS GPU của Cloudzone có VRAM 1-4GB, chạy trên hạ tầng siêu hội tụ HCI với uptime 99,99% theo SLA, giá từ 450.000đ/tháng (chưa gồm VAT). Mức này hợp để dựng bản chạy thử: nạp một mô hình nhỏ, nối với kho tài liệu của một phòng ban, rồi đo mỗi ngày có bao nhiêu câu hỏi và giờ nào đông.
Điểm cần biết trước: GPU trên VPS là GPU chia sẻ, nên hiệu năng thay đổi theo mức dùng chung trên cùng máy chủ. Bù lại, máy khởi tạo trong vài phút, có quyền root, cài được CUDA và driver NVIDIA. Bạn cũng tự tạo snapshot trước mỗi lần đổi mô hình qua sPortal.
3.2 Mức 2: chuyển lên máy chủ GPU riêng
Khi số người dùng cùng lúc vượt vài người, hoặc bạn cần mô hình 7 tỷ tham số trở lên để trả lời tiếng Việt mạch lạc hơn, 4GB VRAM sẽ chật. Máy chủ vật lý có GPU cho trọn một GPU NVIDIA Data Center với VRAM 16-32GB dành riêng 100%, đi cùng 2 CPU Xeon Gold hoặc Platinum (56-104 nhân) và 128GB RAM ECC.
Phần VRAM còn dư sau khi nạp mô hình chính là chỗ cho bộ nhớ ngữ cảnh của nhiều người cùng lúc. Thời gian bàn giao 24-48 giờ tuỳ tình trạng GPU, nên hãy đặt trước khi mở chatbot cho toàn công ty.
3.3 Mức 3: tách hạ tầng riêng cho dữ liệu nhạy cảm
Chatbot nội bộ đọc tài liệu nhân sự, hợp đồng, báo giá. Nếu công ty cần tách bạch hạ tầng với khách hàng khác, Private Cloud cho phép gom máy chủ GPU và máy chủ ứng dụng vào một vùng mạng riêng.
4. Lộ trình triển khai gợi ý
- Tuần 1-2: dựng bản thử trên VPS GPU cho một phòng ban 10-20 người.
- Ghi nhật ký số câu hỏi mỗi giờ, thời gian trả lời và độ dài ngữ cảnh trung bình.
- Tính lại số yêu cầu đồng thời bằng số đo thật, bỏ tỷ lệ giả định.
- Nếu thời gian trả lời tăng rõ trong giờ cao điểm, chuyển mô hình sang máy chủ GPU riêng.
- Giữ VPS GPU làm môi trường thử mô hình mới trước khi đưa vào dùng chung.
Muốn đi sâu hơn về cách chọn VRAM theo từng loại mô hình, bạn có thể đọc thêm bài Thuê GPU chạy AI: cần bao nhiêu VRAM.
5. Câu hỏi thường gặp
5.1 VPS GPU 4GB chạy được chatbot tiếng Việt không?
Được, với mô hình nhỏ đã nén 4 bit và số người hỏi cùng lúc ít. Chất lượng câu trả lời phụ thuộc nhiều vào kho tài liệu bạn nối vào. Nên coi đây là môi trường chạy thử để đo nhu cầu.
5.2 Có cần GPU cho phần tìm kiếm tài liệu không?
Mô hình tạo vector cho tài liệu thường nhỏ hơn nhiều so với mô hình trả lời. Nó có thể chạy chung GPU, hoặc chạy trên CPU nếu lượng tài liệu không lớn.
5.3 Khi nào nên chuyển từ VPS GPU lên máy chủ GPU riêng?
Khi thời gian trả lời trong giờ cao điểm tăng rõ so với giờ vắng, hoặc khi mô hình bạn cần không vừa 4GB VRAM. Số đo từ nhật ký tuần chạy thử sẽ cho câu trả lời sát thực tế hơn mọi ước lượng.
5.4 Dữ liệu nội bộ có ra khỏi máy chủ không?
Mô hình chạy trên máy chủ bạn thuê, nên câu hỏi và tài liệu không phải gửi sang dịch vụ AI bên ngoài. Bạn vẫn cần phân quyền ai được hỏi về tài liệu nào.