Chọn phần cứng cho local LLM không bắt đầu từ số nhân CPU mà từ kích thước model, context, số người dùng và mức độ chấp nhận chờ đợi. RAM chứa model và tiến trình; VRAM quyết định phần lớn tốc độ khi GPU được dùng; SSD ảnh hưởng thời gian tải model.
Tóm tắt nhanh
Nếu bạn đang tìm cách phần cứng chạy local LLM, điểm mấu chốt là lập bảng ngân sách tài nguyên theo workload thay vì chạy theo thông số marketing. Hãy coi đây là một bài toán vận hành có điều kiện, không phải một lệnh thần kỳ. Khi có thay đổi phần cứng, model, dữ liệu hoặc số người dùng, bạn cần đo lại các giả định quan trọng.
Cách tiếp cận thực tế
Trong môi trường self-host, một lỗi thường nằm ở ranh giới giữa nhiều lớp. Vì vậy, hãy xác định input, trạng thái mong đợi và bằng chứng quan sát được trước khi sửa. Các bước dưới đây ưu tiên thay đổi nhỏ, có thể kiểm tra và có đường quay lại.
- Ghi lại model mục tiêu và quantization dự kiến.
- Ước lượng bộ nhớ cho trọng số, context, cache và overhead runtime; chừa khoảng trống cho hệ điều hành.
- Đánh giá GPU theo VRAM thực tế, băng thông và driver, không chỉ theo tên chip.
- Dùng SSD đủ nhanh và có dung lượng cho nhiều phiên bản model, log và backup.
- Nếu có nhiều người dùng, tính tổng tải đồng thời thay vì chỉ benchmark một request.
Ví dụ kiểm tra
Các lệnh dưới đây là khung kiểm tra, không phải cấu hình áp dụng nguyên xi cho mọi máy. Thay placeholder bằng giá trị đã được kiểm tra; không đưa credential thật vào shell history hoặc bài viết.
free -h
lsblk -o NAME,SIZE,TYPE,FSTYPE,MOUNTPOINT
nvidia-smi # chỉ chạy nếu máy có NVIDIA
df -h /var/lib/ollamaSau khi chạy, lưu timestamp, model/version, thông số tài nguyên và kết quả. Việc ghi chép này giúp phân biệt lỗi tái hiện được với hiện tượng nhất thời và tạo dữ liệu cho lần rollback sau.
Lỗi thường gặp và cách xử lý
- Mua GPU có VRAM vừa đủ khiến context hoặc batch nhỏ đã hết bộ nhớ.: dừng thay đổi lan rộng, thu log liên quan, kiểm tra quyền và tài nguyên, sau đó thử lại với phạm vi nhỏ hơn.
- Dùng ổ đĩa gần đầy làm pull, cập nhật và snapshot thất bại.: dừng thay đổi lan rộng, thu log liên quan, kiểm tra quyền và tài nguyên, sau đó thử lại với phạm vi nhỏ hơn.
- Bỏ qua nhiệt độ, nguồn điện, tiếng ồn và khả năng thay thế linh kiện.: dừng thay đổi lan rộng, thu log liên quan, kiểm tra quyền và tài nguyên, sau đó thử lại với phạm vi nhỏ hơn.
Một hệ thống AI self-host tốt không phải là hệ thống không bao giờ lỗi; đó là hệ thống cho phép phát hiện, giới hạn ảnh hưởng và phục hồi có kiểm soát.
Góc nhìn SEO/AEO và vận hành
Với chủ đề phần cứng chạy local LLM, câu trả lời tốt cần nêu rõ điều kiện áp dụng và cách xác minh. Đừng chỉ đưa một lệnh hoặc một con số benchmark. Hãy công bố môi trường, phiên bản, giới hạn và cách người đọc có thể tự kiểm tra trên máy của họ.
Checklist trước khi đưa vào dùng thật
- Model và quantization đã được chốt cho bài test.
- RAM/VRAM còn dư khi context tăng.
- Ổ đĩa có vùng trống cho ít nhất một bản model dự phòng.
- Đã kiểm tra driver, nguồn và nhiệt độ trong thời gian chạy liên tục.
Câu hỏi thường gặp
RAM có thay thế được VRAM không?
Một phần model có thể chạy hoặc offload qua RAM nhưng thường chậm hơn GPU và không phải runtime nào cũng phân bổ giống nhau.
SSD NVMe có bắt buộc không?
Không, nhưng SSD nhanh giúp tải model và khởi động dịch vụ dễ chịu hơn HDD.
Nên mua phần cứng trước hay chọn model trước?
Chọn workload và model mục tiêu trước, sau đó dùng yêu cầu bộ nhớ để lọc phần cứng.
Tài liệu tham khảo chính thống
Các liên kết dưới đây là điểm bắt đầu để đối chiếu phiên bản, tham số và giới hạn trước khi áp dụng vào môi trường thật.
Kết luận
Chọn phần cứng chạy local LLM: CPU, RAM, GPU, VRAM và SSD nên được triển khai như một bước trong chuỗi, không phải một cấu hình độc lập. Hãy lưu lại kết quả kiểm tra, pin những phiên bản quan trọng và chỉ mở rộng khi đã có giới hạn tài nguyên cùng phương án khôi phục. Ở tập tiếp theo, serial sẽ tiếp tục từ nền tảng này để đi sâu hơn vào vận hành AI self-host.