AI Self-host 4 Thg 09 2026 · 4 phút đọc Embedding là gì và vì sao RAG cần một model embedding riêng Embedding biến văn bản thành vector số để hệ thống so sánh mức độ gần nhau về ngữ nghĩa. RAG cần model embedding riêng vì model sinh văn bản và model biểu diễn vector là hai nhiệm vụ khác nhau; dùng sai model hoặc sai số chiều có thể làm truy xuất kém. Đọc tiếp
AI Self-host 3 Thg 09 2026 · 4 phút đọc Dùng local LLM với ứng dụng web: OpenAI-compatible API và proxy Ứng dụng web có thể dùng local LLM mà không phải viết lại toàn bộ lớp gọi model. Một adapter OpenAI-compatible hoặc proxy giúp chuẩn hóa endpoint, nhưng compatibility chỉ có ý nghĩa khi bạn kiểm thử các trường messages, streaming, tool call và error format thực tế. Đọc tiếp
AI Self-host 2 Thg 09 2026 · 4 phút đọc Gọi Ollama qua API: endpoint, streaming, model và xử lý lỗi Ollama có HTTP API local cho các thao tác sinh nội dung và quản lý model. Khi gọi API, hãy coi streaming là giao thức có trạng thái, model name là input cần xác thực, còn lỗi mạng, timeout và model loading là các trường hợp bình thường cần xử lý. Đọc tiếp
AI Self-host 1 Thg 09 2026 · 4 phút đọc Bảo vệ giao diện AI self-host: tài khoản, MFA, rate limit và session Một giao diện AI public cần được xem như ứng dụng web có dữ liệu nhạy cảm, không phải trang demo. Tài khoản, MFA, session, rate limit và audit log phải được thiết kế cùng nhau để giảm nguy cơ chiếm quyền và lạm dụng tài nguyên. Đọc tiếp
AI Self-host 31 Thg 08 2026 · 4 phút đọc Đưa Open WebUI ra Internet an toàn bằng Nginx và HTTPS Đưa Open WebUI ra Internet không chỉ là thêm một bản ghi DNS. Reverse proxy, HTTPS, giới hạn port, header và session phải cùng tạo thành một biên bảo vệ; nếu không, giao diện chat có thể trở thành cửa ngõ vào cả máy chủ. Đọc tiếp
AI Self-host 30 Thg 08 2026 · 4 phút đọc Open WebUI và Ollama: dựng giao diện chat AI self-hosted Open WebUI cung cấp lớp giao diện và quản lý hội thoại phía trên Ollama. Triển khai tốt cần giữ ranh giới: Ollama phục vụ model, Open WebUI quản lý trải nghiệm và dữ liệu ứng dụng, còn reverse proxy xử lý truy cập từ bên ngoài. Đọc tiếp
AI Self-host 29 Thg 08 2026 · 4 phút đọc Đo hiệu năng local LLM: tok/s, latency, RAM và VRAM bằng cách thực tế Benchmark local LLM cần đo cả trải nghiệm người dùng và sức khỏe máy. Tokens/second chỉ phản ánh một phần; latency request đầu tiên, thời gian nạp model, RAM, VRAM và độ ổn định mới giúp quyết định triển khai. Đọc tiếp
AI Self-host 28 Thg 08 2026 · 4 phút đọc Quantization là gì? Chọn Q4, Q5, Q8 hay model nguyên bản Quantization giảm độ chính xác biểu diễn trọng số để model chiếm ít bộ nhớ hơn. Q4, Q5 và Q8 không phải thang điểm chất lượng tuyệt đối; lựa chọn đúng phụ thuộc model, workload, VRAM và mức suy giảm mà bạn chấp nhận. Đọc tiếp
AI Self-host 27 Thg 08 2026 · 4 phút đọc Context window, token và bộ nhớ: vì sao local LLM trả lời không đủ ý Context window là lượng token mà model và runtime có thể xử lý trong một lượt. Khi câu trả lời bị cụt, bỏ sót phần cuối tài liệu hoặc quên yêu cầu đầu vào, nguyên nhân có thể là context quá nhỏ, prompt quá dài, RAG trả quá nhiều đoạn hoặc giới hạn output. Đọc tiếp
AI Self-host 26 Thg 08 2026 · 4 phút đọc Quản lý model Ollama: pull, list, remove, export và cập nhật Quản lý model Ollama là quản lý artifact: biết model nào đang có, chiếm bao nhiêu dung lượng, được cập nhật lúc nào và có thể khôi phục về phiên bản nào. Một kho model không có quy ước đặt tên nhanh chóng trở thành chi phí vận hành. Đọc tiếp
AI Self-host 25 Thg 08 2026 · 4 phút đọc Cài Ollama trên Linux và chạy model local đầu tiên Ollama cung cấp một cách đơn giản để tải và chạy model local trên Linux. Phần khó không nằm ở lệnh pull, mà ở việc kiểm tra service, vị trí lưu model, quyền truy cập, driver và khả năng quan sát sau khi model chạy. Đọc tiếp
AI Self-host 24 Thg 08 2026 · 4 phút đọc Docker cho AI local: image, volume, network và giới hạn tài nguyên Docker giúp đóng gói Ollama, Open WebUI và các service phụ thành những thành phần có thể tái tạo. Giá trị lớn nhất không phải câu lệnh ngắn, mà là khả năng tách image, volume, network và giới hạn tài nguyên để hệ thống không chiếm hết máy. Đọc tiếp
AI Self-host 23 Thg 08 2026 · 4 phút đọc Chuẩn bị Ubuntu cho AI self-host: user, SSH, storage và swap Một máy Ubuntu sạch giúp AI self-host dễ bảo trì hơn một máy đã tích tụ nhiều dịch vụ. Mục tiêu của bước chuẩn bị không phải chạy ngay model, mà tạo nền tảng có user riêng, SSH có kiểm soát, storage rõ ràng và cơ chế xử lý khi RAM thiếu. Đọc tiếp
AI Self-host 22 Thg 08 2026 · 4 phút đọc Chạy LLM bằng CPU hay GPU? Cách tính VRAM và kỳ vọng tốc độ CPU và GPU đều có thể chạy local LLM, nhưng chúng phù hợp với hai kiểu đánh đổi khác nhau. CPU dễ triển khai và tận dụng máy sẵn có; GPU thường cho thông lượng và độ trễ tốt hơn khi model nằm vừa trong VRAM. Đọc tiếp
AI Self-host 21 Thg 08 2026 · 4 phút đọc Chọn phần cứng chạy local LLM: CPU, RAM, GPU, VRAM và SSD Chọn phần cứng cho local LLM không bắt đầu từ số nhân CPU mà từ kích thước model, context, số người dùng và mức độ chấp nhận chờ đợi. RAM chứa model và tiến trình; VRAM quyết định phần lớn tốc độ khi GPU được dùng; SSD ảnh hưởng thời gian tải model. Đọc tiếp
AI Self-host 20 Thg 08 2026 · 5 phút đọc AI self-host là gì? Kiến trúc local LLM cho người dùng kỹ thuật AI self-host là cách tự vận hành lớp suy luận AI trên hạ tầng do bạn kiểm soát, thay vì gửi toàn bộ prompt tới một dịch vụ cloud. Mô hình này không đồng nghĩa mọi thứ đều chạy offline tuyệt đối: người vận hành vẫn phải quản lý model, dữ liệu, cập nhật, bảo mật và trải nghiệm người dùng. Đọc tiếp