Tối ưu hóa mô hình AI quy mô lớn: Cách Cloudflare vận hành Kimi và GLM hiệu quả
Cloudflare chia sẻ ba kỹ thuật tối ưu hóa quan trọng giúp vận hành các mô hình AI lớn như Kimi và GLM với hiệu suất cao, tiết kiệm chi phí mà không làm giảm độ chính...
- Giọng nữ Bắc
Việc triển khai các mô hình ngôn ngữ lớn (LLM) với ngữ cảnh dài như Kimi K-series của Moonshot hay GLM của Z.ai trên nền tảng Workers AI đặt ra thách thức lớn về giới hạn bộ nhớ GPU. Để giải quyết vấn đề này, Cloudflare đã áp dụng ba kỹ thuật tối ưu hóa cốt lõi nhằm duy trì tốc độ xử lý nhanh và khả năng phục vụ quy mô lớn.
Table Of Content
Quantizing (Lượng tử hóa) KV Cache
Trong quá trình suy luận (inference), mô hình lưu trữ các khóa (K) và giá trị (V) vào cấu trúc gọi là KV cache. Thông thường, dữ liệu này được lưu ở định dạng 16-bit (BF16). Cloudflare đã chuyển sang sử dụng định dạng 8-bit (FP8), giúp giảm một nửa dung lượng bộ nhớ cần thiết. Với mô hình Kimi K2.6, thay đổi này cho phép tăng khả năng lưu trữ ngữ cảnh từ 686.000 token lên khoảng 1,37 triệu token mà không làm ảnh hưởng đến độ chính xác của mô hình.
Nén trọng số mô hình (Model Weights)
Bên cạnh KV cache, trọng số mô hình cũng chiếm dụng tài nguyên GPU đáng kể. Đối với GLM 5.2, Cloudflare thực hiện nén trọng số từ định dạng 8-bit xuống 4-bit (INT4). Kết quả là kích thước checkpoint giảm từ 705 GB xuống 421 GB (khoảng 40%). Việc nén này không chỉ giải phóng bộ nhớ mà còn cải thiện tốc độ decode đáng kể, đặc biệt là khi số lượng yêu cầu đồng thời thấp, giúp giảm độ trễ cho người dùng cuối.
Bảo vệ tính toàn vẹn của KV Cache
Khi nhiều yêu cầu cùng chia sẻ một bộ nhớ GPU, việc quản lý dữ liệu trở nên phức tạp. Để đảm bảo an toàn, Cloudflare đã triển khai lớp kiểm tra tính toàn vẹn cho KV cache. Mỗi trang bộ nhớ được gán một thẻ (tag) định danh. Trước khi thực hiện thao tác đọc, hệ thống sẽ đối chiếu các ánh xạ này. Nếu phát hiện sai lệch, yêu cầu sẽ bị hủy bỏ thay vì trả về dữ liệu lỗi. Cơ chế này tiêu tốn chưa đến 1% tài nguyên hệ thống, đảm bảo sự cân bằng giữa hiệu suất và độ tin cậy.
Tất cả các thử nghiệm và lưu lượng thực tế của Cloudflare đều được thực hiện thông qua SGLang, một framework mã nguồn mở dành cho việc phục vụ suy luận AI. Cloudflare cũng đang tiếp tục hợp tác với cộng đồng SGLang để đóng góp các bản vá và tính năng mới, hướng tới việc tối ưu hóa hơn nữa cho các kiến trúc GPU hiện đại như NVIDIA Blackwell.
Nguồn tham khảo: Cloudflare Blog

No Comment! Be the first one.