6/6
Bài 0625 phút đọcCo ban

6. llama.cpp — Self-host hiệu quả model AI

Tự host model AI cục bộ với llama.cpp — tiết kiệm chi phí, đảm bảo riêng tư.

Tại sao phải trả tiền API mỗi lần gọi? Với llama.cpp, bạn có thể self-host các model GGUF (Llama 3, Mistral, Qwen…) ngay trên máy tính hoặc VPS. Hermes Agent hỗ trợ kết nối trực tiếp đến llama.cpp server.
llama.cpp là inference engine C++ giúp chạy các LLM định lượng (GGUF format) cực kỳ hiệu quả trên CPU hoặc GPU. Mô hình 7B có thểạy trên laptop với 8GB RAM.
example.py

Sau khi llama.cpp server chạy, vào Hermes Dashboard → Connections → thêm OpenAI-compatible endpoint `http://localhost:8080/v1`. Giờ bạn có thể dùng local model làm worker agent, tiết kiệm 100% chi phí API cho các tác vụ đơn giản.
Thực hành

Đến lượt bạn xây dựng

Cài llama.cpp, tün Qwen 2.5 7B hoặc một model GGUF bất kỳ, và kết nối nó vào Hermes Agent làm worker model. So sánh chất ợng phản hồi với API model trên cùng câu hỏi.