Một kỹ thuật tấn công mới sử dụng AI agent có tên là Ghostjacking có thể đánh lừa các AI coding agent thực thi các lệnh do kẻ tấn công kiểm soát, thay đổi cài đặt đám mây, đánh cắp thông tin xác thực và tạo các backdoor dai dẳng. Kỹ thuật này ảnh hưởng đến một lớp các quy trình làm việc được hỗ trợ bởi AI, nơi các trợ lý mã hóa có thể đọc thông tin từ các công cụ đáng tin cậy và sau đó thực hiện hành động trong môi trường phát triển hoặc đám mây.
Kỹ thuật Ghostjacking và Cách thức hoạt động
Ghostjacking dựa trên lỗ hổng indirect prompt injection. Thay vì gửi lệnh độc hại trực tiếp đến AI coding assistant, kẻ tấn công nhúng các chỉ dẫn có hại vào dữ liệu mà agent có khả năng kiểm tra. Dữ liệu này có thể bao gồm yêu cầu web bị chặn, tệp log lỗi, cảnh báo giám sát hoặc báo cáo lỗi. Khi nhà phát triển yêu cầu AI agent điều tra dữ liệu, agent có thể diễn giải nội dung của kẻ tấn công như một chỉ dẫn hợp lệ.
Nếu agent có quyền truy cập vào các lệnh shell, bảng điều khiển đám mây, bản ghi DNS, mã nguồn hoặc thông tin nhạy cảm (secrets), nó có thể thực hiện các hành động nguy hiểm bằng cách sử dụng các quyền đã được tổ chức cấp. Kỹ thuật này không yêu cầu khai thác truyền thống như bẻ khóa xác thực hoặc triển khai mã độc. AI agent thực hiện các hành động được ủy quyền, khiến hệ thống phát hiện điểm cuối, tường lửa ứng dụng web và hệ thống định danh khó phát hiện đây là hành vi độc hại.
Các kịch bản tấn công đã được trình diễn
Tenet Security đã trình diễn lỗ hổng này trên các tích hợp của Cloudflare, Datadog và Sentry. Trong một kịch bản, kẻ tấn công gửi một yêu cầu độc hại đến một trang web được bảo vệ bởi Cloudflare. Tường lửa đã chặn yêu cầu và ghi lại nó. Tuy nhiên, khi một nhà phân tích yêu cầu trợ lý AI xem xét các sự kiện bị chặn, trợ lý đã xử lý văn bản do kẻ tấn công kiểm soát được nhúng trong tệp log.
Các nhà nghiên cứu báo cáo rằng agent bị xâm nhập có thể sửa đổi cài đặt DNS và chuyển hướng lưu lượng web và email của công ty. Trong các thử nghiệm với Claude Code, Tenet tuyên bố đạt tỷ lệ thành công 90% khi sử dụng cấu hình được khuyến nghị của Cloudflare. Tường lửa đã chặn yêu cầu, nhưng bản ghi log kết quả đã trở thành cơ chế phân phối cho cuộc tấn công. Kỹ thuật tương tự đã được trình diễn trên Datadog.
Các nhà nghiên cứu cho biết kẻ tấn công có thể sử dụng các khóa client-side bị lộ công khai để tạo các cảnh báo giả mạo chứa các chỉ dẫn chẩn đoán khẩn cấp. Một AI agent xem xét các cảnh báo này có thể bị thuyết phục thực thi các lệnh làm lộ các biến môi trường và thông tin xác thực đám mây. Chuỗi tấn công Sentry tập trung vào sự tin cậy giữa các AI với nhau. Trợ lý AI của Sentry, Seer, có thể phân tích một báo cáo sự cố được tạo và đưa ra một khuyến nghị do kẻ tấn công kiểm soát. Một coding agent riêng biệt sau đó có thể tin tưởng vào kết luận của Seer và thực thi bản sửa lỗi được đề xuất mà không cần xem nội dung độc hại ban đầu.
Sandbox Escape trong Anthropic Claude Desktop
Tenet cũng tiết lộ một lỗ hổng sandbox escape hiện đã được vá trong Anthropic Claude Desktop. Theo các nhà nghiên cứu, lỗ hổng này có thể cho phép dữ liệu được thu thập bởi AI agent thoát ra khỏi sandbox được thiết kế để hạn chế truy cập ra ngoài. Anthropic được cho là đã xác nhận và khắc phục sự cố trước bài thuyết trình tại DEF CON.
Khuyến nghị bảo mật
Để giảm thiểu rủi ro từ Ghostjacking, Tenet khuyến nghị các biện pháp sau: Hạn chế quyền truy cập mạng của AI agent theo mặc định, yêu cầu phê duyệt của con người trước khi thực thi lệnh, tách biệt dữ liệu không đáng tin cậy khỏi chỉ dẫn của agent, và xem xét mọi token và công cụ bên ngoài được sử dụng trong quy trình làm việc AI.
Việc hiểu rõ các mối đe dọa mạng mới như Ghostjacking là rất quan trọng để bảo vệ các hệ thống sử dụng AI. Các cuộc tấn công này cho thấy sự cần thiết của việc đánh giá liên tục các lỗ hổng và phát triển các biện pháp phòng thủ phù hợp. Tìm hiểu thêm về các mối đe dọa an ninh mạng mới nhất có thể giúp các tổ chức nâng cao khả năng phòng thủ của mình.
Nghiên cứu về Ghostjacking được trình bày bởi Tenet Security tại DEF CON 34 ở Las Vegas vào ngày 9 tháng 8 năm 2026.










