AI Self-host 10 Thg 09 2026 · 4 phút đọc Trợ lý code local với Ollama: đọc repository mà không gửi code lên cloud Trợ lý code local có thể đọc repository mà không gửi mã nguồn lên cloud, nhưng “local” không tự động có nghĩa an toàn. File secret, log, dependency cache và prompt history vẫn có thể bị đọc, ghi hoặc backup sai. Đọc tiếp
AI Self-host 9 Thg 09 2026 · 4 phút đọc Prompt template cho local LLM: system prompt, citation và guardrail Prompt template là hợp đồng giữa dữ liệu truy xuất và model. System prompt định nghĩa vai trò, citation quy định cách dẫn nguồn, còn guardrail đặt ranh giới khi dữ liệu thiếu hoặc yêu cầu vượt quyền. Template tốt phải ngắn, rõ và kiểm thử được. Đọc tiếp
AI Self-host 8 Thg 09 2026 · 4 phút đọc Chunking tài liệu cho RAG: kích thước đoạn, overlap và lỗi thường gặp Chunking quyết định đơn vị thông tin mà RAG có thể truy xuất. Chunk quá nhỏ mất ngữ cảnh; quá lớn làm nhiễu và chiếm context. Overlap giúp giữ mạch ở ranh giới nhưng cũng làm tăng số vector và chi phí embedding. Đọc tiếp
AI Self-host 7 Thg 09 2026 · 4 phút đọc Xây pipeline nạp tài liệu vào RAG: PDF, Markdown, HTML và metadata Pipeline nạp dữ liệu RAG cần biến nhiều định dạng thành một biểu diễn thống nhất trước khi embedding. PDF, Markdown và HTML có cấu trúc khác nhau; nếu bỏ qua tiêu đề, trang, URL và document ID, hệ thống có thể trả đúng đoạn nhưng không thể giải thích nguồn. Đọc tiếp
AI Self-host 6 Thg 09 2026 · 4 phút đọc Cài Qdrant bằng Docker cho vector database local Qdrant là vector database phù hợp cho lab và nhiều hệ thống RAG local. Khi cài bằng Docker, phần quan trọng là volume, port, authentication, collection schema và backup; chạy container thành công chưa đồng nghĩa dữ liệu đã an toàn. Đọc tiếp
AI Self-host 5 Thg 09 2026 · 4 phút đọc RAG là gì? Từ tài liệu Markdown đến câu trả lời có trích nguồn RAG là pipeline đưa những đoạn tài liệu liên quan vào prompt trước khi model trả lời. Một hệ thống RAG đáng tin không chỉ “tìm vài đoạn text”, mà phải giữ nguồn, metadata, giới hạn context và quy tắc nói rõ khi không tìm thấy bằng chứng. Đọc tiếp
AI Self-host 4 Thg 09 2026 · 4 phút đọc Embedding là gì và vì sao RAG cần một model embedding riêng Embedding biến văn bản thành vector số để hệ thống so sánh mức độ gần nhau về ngữ nghĩa. RAG cần model embedding riêng vì model sinh văn bản và model biểu diễn vector là hai nhiệm vụ khác nhau; dùng sai model hoặc sai số chiều có thể làm truy xuất kém. Đọc tiếp
AI Self-host 3 Thg 09 2026 · 4 phút đọc Dùng local LLM với ứng dụng web: OpenAI-compatible API và proxy Ứng dụng web có thể dùng local LLM mà không phải viết lại toàn bộ lớp gọi model. Một adapter OpenAI-compatible hoặc proxy giúp chuẩn hóa endpoint, nhưng compatibility chỉ có ý nghĩa khi bạn kiểm thử các trường messages, streaming, tool call và error format thực tế. Đọc tiếp
AI Self-host 2 Thg 09 2026 · 4 phút đọc Gọi Ollama qua API: endpoint, streaming, model và xử lý lỗi Ollama có HTTP API local cho các thao tác sinh nội dung và quản lý model. Khi gọi API, hãy coi streaming là giao thức có trạng thái, model name là input cần xác thực, còn lỗi mạng, timeout và model loading là các trường hợp bình thường cần xử lý. Đọc tiếp
AI Self-host 1 Thg 09 2026 · 4 phút đọc Bảo vệ giao diện AI self-host: tài khoản, MFA, rate limit và session Một giao diện AI public cần được xem như ứng dụng web có dữ liệu nhạy cảm, không phải trang demo. Tài khoản, MFA, session, rate limit và audit log phải được thiết kế cùng nhau để giảm nguy cơ chiếm quyền và lạm dụng tài nguyên. Đọc tiếp
AI Self-host 31 Thg 08 2026 · 4 phút đọc Đưa Open WebUI ra Internet an toàn bằng Nginx và HTTPS Đưa Open WebUI ra Internet không chỉ là thêm một bản ghi DNS. Reverse proxy, HTTPS, giới hạn port, header và session phải cùng tạo thành một biên bảo vệ; nếu không, giao diện chat có thể trở thành cửa ngõ vào cả máy chủ. Đọc tiếp
AI Self-host 30 Thg 08 2026 · 4 phút đọc Open WebUI và Ollama: dựng giao diện chat AI self-hosted Open WebUI cung cấp lớp giao diện và quản lý hội thoại phía trên Ollama. Triển khai tốt cần giữ ranh giới: Ollama phục vụ model, Open WebUI quản lý trải nghiệm và dữ liệu ứng dụng, còn reverse proxy xử lý truy cập từ bên ngoài. Đọc tiếp
AI Self-host 29 Thg 08 2026 · 4 phút đọc Đo hiệu năng local LLM: tok/s, latency, RAM và VRAM bằng cách thực tế Benchmark local LLM cần đo cả trải nghiệm người dùng và sức khỏe máy. Tokens/second chỉ phản ánh một phần; latency request đầu tiên, thời gian nạp model, RAM, VRAM và độ ổn định mới giúp quyết định triển khai. Đọc tiếp
AI Self-host 28 Thg 08 2026 · 4 phút đọc Quantization là gì? Chọn Q4, Q5, Q8 hay model nguyên bản Quantization giảm độ chính xác biểu diễn trọng số để model chiếm ít bộ nhớ hơn. Q4, Q5 và Q8 không phải thang điểm chất lượng tuyệt đối; lựa chọn đúng phụ thuộc model, workload, VRAM và mức suy giảm mà bạn chấp nhận. Đọc tiếp
AI Self-host 27 Thg 08 2026 · 4 phút đọc Context window, token và bộ nhớ: vì sao local LLM trả lời không đủ ý Context window là lượng token mà model và runtime có thể xử lý trong một lượt. Khi câu trả lời bị cụt, bỏ sót phần cuối tài liệu hoặc quên yêu cầu đầu vào, nguyên nhân có thể là context quá nhỏ, prompt quá dài, RAG trả quá nhiều đoạn hoặc giới hạn output. Đọc tiếp
AI Self-host 26 Thg 08 2026 · 4 phút đọc Quản lý model Ollama: pull, list, remove, export và cập nhật Quản lý model Ollama là quản lý artifact: biết model nào đang có, chiếm bao nhiêu dung lượng, được cập nhật lúc nào và có thể khôi phục về phiên bản nào. Một kho model không có quy ước đặt tên nhanh chóng trở thành chi phí vận hành. Đọc tiếp
AI Self-host 25 Thg 08 2026 · 4 phút đọc Cài Ollama trên Linux và chạy model local đầu tiên Ollama cung cấp một cách đơn giản để tải và chạy model local trên Linux. Phần khó không nằm ở lệnh pull, mà ở việc kiểm tra service, vị trí lưu model, quyền truy cập, driver và khả năng quan sát sau khi model chạy. Đọc tiếp
AI Self-host 24 Thg 08 2026 · 4 phút đọc Docker cho AI local: image, volume, network và giới hạn tài nguyên Docker giúp đóng gói Ollama, Open WebUI và các service phụ thành những thành phần có thể tái tạo. Giá trị lớn nhất không phải câu lệnh ngắn, mà là khả năng tách image, volume, network và giới hạn tài nguyên để hệ thống không chiếm hết máy. Đọc tiếp