Xây dựng hạ tầng Git cho kỷ nguyên phát triển phần mềm bằng AI Agents
GitHub đang tái cấu trúc hạ tầng Git để đáp ứng nhu cầu khổng lồ từ các AI agents, nơi hàng triệu commit được thực hiện mỗi ngày mà không làm gián đoạn trải nghiệm của người...
Sự trỗi dậy của các AI agents trong phát triển phần mềm đang thúc đẩy một cuộc chuyển dịch kiến trúc quan trọng tại GitHub. Khi các lập trình viên và AI agents cùng làm việc trên các kho lưu trữ (repository) với hàng triệu commit mỗi ngày, hạ tầng Git truyền thống bắt đầu bộc lộ những giới hạn về khả năng mở rộng.
Thách thức từ quy mô “Agent-scale”
Dữ liệu từ tháng 8/2026 cho thấy sự bùng nổ về hoạt động trên GitHub: tổng lưu lượng Git đã tăng gấp đôi so với năm trước, đạt hơn 473 tỷ sự kiện mỗi tháng. Đặc biệt, số lượng commit từ cả con người và AI agents đã chạm mốc 7,38 tỷ trong tháng 9. Điều này tạo ra những áp lực chưa từng có:
- Nút thắt cổ chai về độ trễ: Các AI agents thường thực hiện commit liên tục sau mỗi hành động. Tốc độ của chúng bị giới hạn bởi độ trễ của mỗi lệnh push, vốn là yếu tố mà con người trước đây khó nhận ra.
- Áp lực ghi (write throughput): Số lượng push tăng 4,9 lần so với năm ngoái. Hàng ngàn agents làm việc trên các nhánh riêng biệt cùng lúc tạo ra áp lực ghi liên tục lên một điểm duy nhất trong kiến trúc cũ.
- Cạnh tranh tại các reference: Các quy trình như trunk-based development và merge queue dồn mọi thay đổi vào một reference duy nhất, gây ra tình trạng tranh chấp tài nguyên.
- Hiệu ứng fan-out: Mỗi lần push kéo theo hàng ngàn lượt đọc từ CI và các công cụ quét mã, đòi hỏi khả năng xử lý đọc phải cực kỳ hiệu quả.
Tái cấu trúc: Tách biệt lưu trữ và tính toán
Kiến trúc hiện tại của GitHub dựa trên Spokes, nơi mỗi repository được lưu trữ trên các fileserver cục bộ. Mặc dù hiệu quả trong nhiều năm, nhưng việc kết hợp giữa lưu trữ bền vững (durability) và khả năng mở rộng (scale) khiến việc thêm replica để tăng tốc độ đọc lại làm chậm tốc độ ghi. Để giải quyết vấn đề này, GitHub đang chuyển đổi sang mô hình mới:
- Tối thiểu hóa sự phối hợp (Coordination): Chỉ những phần thực sự cần sự đồng thuận (như cập nhật reference) mới được đưa vào luồng chính. Các tác vụ như quét bảo mật hay kiểm tra đối tượng được đẩy ra xử lý song song.
- Tách biệt lưu trữ và tính toán: Dữ liệu gốc sẽ nằm trên Azure Blob Storage để đảm bảo độ bền vững. Lớp tính toán (compute layer) sẽ sử dụng các worker nhẹ để cache dữ liệu, cho phép mở rộng khả năng đọc mà không ảnh hưởng đến tốc độ ghi.
- Dời tác vụ bảo trì: Các công việc như nén dữ liệu (compaction) và dọn dẹp (garbage collection) sẽ được thực hiện bởi các worker riêng biệt, không còn nằm trên cùng host xử lý yêu cầu Git của người dùng.
Kết quả thử nghiệm nội bộ cho thấy kiến trúc mới mang lại hiệu suất ghi cao gấp 35 lần, đồng thời cho phép khả năng đọc tự động mở rộng theo nhu cầu thực tế. Đây là nền tảng để GitHub tiếp tục phục vụ các dự án mã nguồn mở và doanh nghiệp trong kỷ nguyên tự động hóa.
Nguồn tham khảo: GitHub Blog



No Comment! Be the first one.