Bảo mật thông tin nhạy cảm: Khi tốc độ phát triển phần mềm tăng tốc nhờ AI
Với việc AI tham gia vào 1/3 số lượng pull request trên GitHub, việc bảo vệ các thông tin nhạy cảm (secrets) cần phải được tự động hóa và mở rộng quy mô tương ứng để bắt kịp tốc độ phát triển phần...
- Giọng nữ Bắc
Hiện nay, cứ ba pull request trên GitHub thì có một yêu cầu liên quan đến các tác nhân AI. Chỉ một năm trước, con số này còn chưa đến 1/10. Nếu đà tăng trưởng này tiếp tục, trong hai năm tới, phần lớn mã nguồn trên GitHub có thể được viết bởi AI mà không cần sự can thiệp hay kiểm duyệt chi tiết từ con người.
Table Of Content
Khi các lập trình viên và AI đẩy nhanh tốc độ viết code, trách nhiệm của chúng ta là đảm bảo các biện pháp bảo mật cũng phải tiến hóa tương ứng. Điều này đồng nghĩa với việc ngăn chặn các vụ rò rỉ trước khi chúng xảy ra và giảm bớt sự phụ thuộc vào nỗ lực thủ công khi xử lý các sự cố bảo mật.
Lập trình viên không bất cẩn, họ chỉ đang bị quá tải
Dữ liệu từ quý 2/2024 đến quý 2/2026 cho thấy số lượng các push code tăng 2,84 lần, trong khi số lượng push chứa thông tin nhạy cảm (credentials) tăng 2,59 lần. Điều này chứng minh rằng các lập trình viên không hề trở nên bất cẩn hơn; thực tế, họ đang hiểu rõ rủi ro hơn bao giờ hết. Tỷ lệ các cảnh báo bảo mật bị bỏ qua (overridden) đã giảm đều đặn từ 6,63% xuống còn 3,93% trong cùng kỳ.
Vấn đề nằm ở chỗ: nếu tốc độ phát triển tăng gấp đôi, số lượng rủi ro cũng tăng gấp đôi. Trong khi đó, thời gian trung bình để thu hồi một thông tin nhạy cảm bị lộ vẫn kéo dài khoảng 40 ngày. Việc chỉ yêu cầu lập trình viên “cẩn thận hơn” là không đủ để giải quyết bài toán này.
Ngăn chặn rò rỉ bằng sức mạnh tính toán
GitHub đang tập trung vào việc kết nối các hệ thống phát hiện với các cơ chế phản ứng tự động. Thông qua chương trình đối tác, GitHub phối hợp với các đơn vị phát hành token (như OpenAI, Google Cloud, Slack, Hugging Face…) để thu hồi ngay lập tức các thông tin bị lộ. Tuy nhiên, hiệu quả nhất vẫn là cơ chế push protection – ngăn chặn thông tin nhạy cảm ngay trước khi nó được đẩy lên lịch sử repository.
Hiện tại, push protection đã chặn được khoảng 30% các thông tin nhạy cảm mới. Để cải thiện con số này, GitHub đã phát triển một mô hình phân loại (classifier) mới dựa trên công nghệ ModernBERT.
Đột phá với mô hình phát hiện dưới 2ms
Thách thức lớn nhất trong bảo mật là giải quyết “bài toán bốn thân”: độ chính xác, độ trễ, lưu lượng và chi phí. Mô hình mới của GitHub có khả năng đánh giá các thông tin nhạy cảm trong ngữ cảnh cụ thể mà không cần tạo ra code hay văn bản dư thừa. Điểm nổi bật là:
- Tốc độ: Đánh giá các thông tin tiềm năng trong chưa đầy 2 mili giây.
- Khả năng mở rộng: Đủ hiệu quả để chạy trên lộ trình quan trọng (critical path) của quá trình phát triển.
- Đa nền tảng: Được tích hợp vào GitHub Enterprise Server 3.23 và lệnh
/security-reviewtrong Copilot CLI.
Trong tương lai, mục tiêu của GitHub là xây dựng một hệ sinh thái nơi các lập trình viên có thể tin tưởng giao phó nhiều công việc hơn cho AI mà không cần giám sát thủ công từng bước, đồng thời đảm bảo rằng nguồn lực bảo mật không cần phải tăng trưởng tuyến tính theo khối lượng code được tạo ra.
Nguồn tham khảo: GitHub Blog

No Comment! Be the first one.