Một mẫu lỗ hổng lặp lại trên các AI coding agent từ Anthropic, Google và OpenAI cho phép kẻ tấn công thực thi mã từ xa (remote code execution), đánh cắp thông tin xác thực API và xâm phạm chuỗi cung ứng phần mềm mà không cần bất kỳ quyền truy cập đặc quyền nào.
Các lỗ hổng này được nhà nghiên cứu của Novee Security, Elad Meged, phát hiện khi kiểm tra cấu hình mặc định của từng nhà cung cấp trên các kho lưu trữ công khai của họ. Điều này có nghĩa là sự cố không còn mang tính lý thuyết mà đang diễn ra trên chính mã mà hàng triệu nhà phát triển đang sử dụng.
Lỗ hổng cốt lõi trong “Harness” của AI Coding Agent
Vấn đề cốt lõi không nằm ở các mô hình AI mà ở “harness” – phần mã xung quanh quản lý quyền công cụ, thực thi và sandboxing cho từng agent.
Nhà nghiên cứu Elad Meged đã phát hiện ra rằng chỉ cần một vấn đề trên GitHub, được mở bởi một người lạ ẩn danh không có bất kỳ đặc quyền nào, cũng đủ để kích hoạt agent và đưa vào các payload prompt injection mà harness không thể kiểm soát.
Do các agent này thường hoạt động tự động trong các pipeline CI/CD mà không có con người xem xét từng hành động, một chỉ dẫn độc hại ẩn trong một issue hoặc pull request có thể đi thẳng đến việc thực thi mã.
Anthropic và Kỹ thuật Khai thác Lỗ hổng
Trên kho lưu trữ claude-code của Anthropic, các nhà nghiên cứu đã thực hiện thành công tấn công remote code execution. Điều này đạt được bằng cách khai thác sự không khớp giữa logic xác thực lệnh của Claude và cách shell thực sự diễn giải các chuỗi được đặt trong dấu ngoặc kép.
Điều này cho phép một lệnh git push –receive-pack độc hại bỏ qua hai mươi ba biện pháp kiểm tra bảo mật và thực thi mã tùy ý trên runner.
Sau khi Anthropic vá lỗ hổng, các nhà nghiên cứu đã tìm thấy một phương pháp vượt qua thứ hai, sử dụng lệnh chỉ đọc tac để đọc các tệp tùy ý. Họ đã trích xuất thành công một API key bị đảo ngược thông qua một bản ghi GitHub Actions công khai.
Vòng khai thác thứ ba đã sử dụng bộ đếm tải xuống công khai của HuggingFace như một kênh phụ bí mật để rò rỉ một API key từng ký tự một, cuối cùng được gán mã định danh CVE-2026-54316.
Google Gemini CLI và Sự Phức Tạp của Lỗ hổng
Google Gemini CLI, hoạt động trên một kho lưu trữ với hơn 106.000 sao và khoảng hai triệu lượt cài đặt hàng tháng, gặp phải hai lỗ hổng cộng hưởng. Một danh sách cho phép (allowlist) công cụ shell “restricted” chưa bao giờ thực sự được thực thi tại thời điểm chạy.
Thêm vào đó, một cơ chế làm sạch môi trường đã loại bỏ các bí mật khỏi tiến trình con, nhưng lại để chúng hoàn toàn hiển thị trong tiến trình cha thông qua /proc.
Việc kết hợp quyền truy cập shell đầy đủ với các thông tin xác thực dễ đọc đã cho phép kẻ tấn công leo thang từ một vấn đề ẩn danh duy nhất đến việc đẩy mã độc trực tiếp vào nhánh chính. Google đã đánh giá mức độ nghiêm trọng của cuộc tấn công này là CVSS 10.0 trong thông báo bảo mật của họ và đã khắc phục bằng một thay đổi đột phá đối với mô hình tin cậy thực thi headless của họ.
OpenAI Codex và Cơ chế Lỗ hổng
Luồng công việc của OpenAI Codex trên kho lưu trữ của chính họ đã chạy hai lượt agent, chia sẻ một không gian làm việc duy nhất. OpenAI đã bảo vệ các thư mục nhạy cảm như .git và .codex khỏi bị giả mạo, nhưng lại bỏ qua AGENTS.md, tệp hướng dẫn mặc định mà agent tải và tin cậy trong mỗi lần chạy.
Kẻ tấn công có thể làm hỏng (poison) tệp này trong lượt đầu tiên để lượt thứ hai, được coi là “an toàn”, kế thừa các hướng dẫn độc hại cùng với bất kỳ quyền nâng cao hoặc token nào mà nó mang theo.
OpenAI đã sửa kho lưu trữ của mình trong vòng ba ngày bằng cách tách hai lượt thành các công việc riêng biệt. Tuy nhiên, các nhà nghiên cứu cảnh báo rằng mẫu agent đa lượt cơ bản vẫn còn được sao chép rộng rãi ở những nơi khác.
Đánh giá và Khuyến nghị
Novee Security nhấn mạnh rằng đây không phải là những lỗi cấu hình đơn giản. Chúng là những quyết định bảo mật đúng đắn đã thất bại tại các điểm chuyển giao giữa các bộ phận khác nhau của mỗi hệ thống.
Các cấu hình mặc định dễ bị tổn thương tương tự đã được tìm thấy trên hơn một trăm kho lưu trữ công khai ngoài ba nhà cung cấp đã được thử nghiệm. Điều này có nghĩa là bất kỳ tổ chức nào sử dụng các AI coding agent này trong tự động hóa đều có khả năng kế thừa cùng mức độ phơi nhiễm.
Các nhà nghiên cứu khuyến nghị coi mọi tệp mà một quy trình làm việc ghi ra, và bản thân quy trình làm việc đó, như một bề mặt đầu vào không đáng tin cậy thay vì giả định rằng các cấu hình mặc định của nhà cung cấp là an toàn ngay từ đầu.
Để hiểu rõ hơn về các kỹ thuật khai thác này, bạn có thể tham khảo thông báo bảo mật chi tiết từ Novee Security: Critical Flaws in Anthropic, Google, and OpenAI’s Coding Agents.










