AI Self-host 25 Thg 08 2026 · 4 phút đọc Cài Ollama trên Linux và chạy model local đầu tiên Ollama cung cấp một cách đơn giản để tải và chạy model local trên Linux. Phần khó không nằm ở lệnh pull, mà ở việc kiểm tra service, vị trí lưu model, quyền truy cập, driver và khả năng quan sát sau khi model chạy. Đọc tiếp
AI Self-host 24 Thg 08 2026 · 4 phút đọc Docker cho AI local: image, volume, network và giới hạn tài nguyên Docker giúp đóng gói Ollama, Open WebUI và các service phụ thành những thành phần có thể tái tạo. Giá trị lớn nhất không phải câu lệnh ngắn, mà là khả năng tách image, volume, network và giới hạn tài nguyên để hệ thống không chiếm hết máy. Đọc tiếp
AI Self-host 23 Thg 08 2026 · 4 phút đọc Chuẩn bị Ubuntu cho AI self-host: user, SSH, storage và swap Một máy Ubuntu sạch giúp AI self-host dễ bảo trì hơn một máy đã tích tụ nhiều dịch vụ. Mục tiêu của bước chuẩn bị không phải chạy ngay model, mà tạo nền tảng có user riêng, SSH có kiểm soát, storage rõ ràng và cơ chế xử lý khi RAM thiếu. Đọc tiếp
AI Self-host 22 Thg 08 2026 · 4 phút đọc Chạy LLM bằng CPU hay GPU? Cách tính VRAM và kỳ vọng tốc độ CPU và GPU đều có thể chạy local LLM, nhưng chúng phù hợp với hai kiểu đánh đổi khác nhau. CPU dễ triển khai và tận dụng máy sẵn có; GPU thường cho thông lượng và độ trễ tốt hơn khi model nằm vừa trong VRAM. Đọc tiếp
AI Self-host 21 Thg 08 2026 · 4 phút đọc Chọn phần cứng chạy local LLM: CPU, RAM, GPU, VRAM và SSD Chọn phần cứng cho local LLM không bắt đầu từ số nhân CPU mà từ kích thước model, context, số người dùng và mức độ chấp nhận chờ đợi. RAM chứa model và tiến trình; VRAM quyết định phần lớn tốc độ khi GPU được dùng; SSD ảnh hưởng thời gian tải model. Đọc tiếp
AI Self-host 20 Thg 08 2026 · 5 phút đọc AI self-host là gì? Kiến trúc local LLM cho người dùng kỹ thuật AI self-host là cách tự vận hành lớp suy luận AI trên hạ tầng do bạn kiểm soát, thay vì gửi toàn bộ prompt tới một dịch vụ cloud. Mô hình này không đồng nghĩa mọi thứ đều chạy offline tuyệt đối: người vận hành vẫn phải quản lý model, dữ liệu, cập nhật, bảo mật và trải nghiệm người dùng. Đọc tiếp