PuzzleMask: Nguy Cơ Tấn Công AI Tinh Vi

PuzzleMask: Nguy Cơ Tấn Công AI Tinh Vi
CLOUD HOSTING
DỊCH VỤ
VPS • CLOUD • SERVER
Hiệu năng cao
Ổn định • Bảo mật • Tốc độ
☁️
SSD NVMe 99.9% 24/7
TÌM HIỂU NGAY

Một kỹ thuật tấn công AI mới được tiết lộ cho thấy các lệnh độc hại không cần ký tự lạ, văn bản ẩn hoặc chuỗi mã hóa để vượt qua kiểm tra bảo mật. Phương pháp này, được gọi là PuzzleMask, nhắm mục tiêu vào các ứng dụng sử dụng mô hình sàng lọc nhanh trước một hệ thống AI có khả năng cao hơn.

PuzzleMask: Kỹ thuật Tấn công AI Mới

Kẻ tấn công có thể che giấu một chỉ dẫn bên trong văn bản tiếng Anh thông thường và dựa vào các mô hình AI khác nhau để diễn giải cùng một văn bản theo những cách khác nhau. Mô hình đầu tiên có thể đánh dấu một đoạn văn bản là vô hại do thiếu thời gian và công cụ để phát hiện yêu cầu ẩn, trong khi mô hình tiếp theo sẽ phục hồi và có thể thực thi yêu cầu đó.

Các nhà nghiên cứu từ Check Point đã xác định vấn đề này khi kiểm tra cách các quy trình kiểm tra chính sách nhanh xử lý văn bản được chế tạo cẩn thận. Phát hiện này rất quan trọng khi các tổ chức cấp quyền truy cập cho trợ lý AI vào các tệp, trình thông dịch mã, dữ liệu kinh doanh và các công cụ có thể thực hiện hành động thay vì chỉ tạo văn bản.

Cách Thức Hoạt Động Của PuzzleMask

Check Point đã báo cáo rằng PuzzleMask không phải là một cuộc tấn công jailbreak theo đúng nghĩa. Nó là một phương pháp để đưa một chỉ dẫn chưa được xem xét vào trước mô hình mục tiêu, phản ánh những rủi ro trong các cuộc tấn công vào quy trình làm việc của AI. Kỹ thuật này gói một payload phá vỡ chính sách vào văn bản trông bình thường đối với người đọc và các bộ lọc kiểm tra nhẹ. Nó không dựa vào Base64, chuỗi emoji, ký tự không nhìn thấy hoặc các thủ thuật định dạng rõ ràng, làm cho các kiểm tra dựa trên mẫu đơn giản trở nên kém hiệu quả hơn.

Các nhà nghiên cứu đã sử dụng một quy trình tự động để chuyển đổi các payload ngắn thành các lớp văn bản bao bọc. Các mô hình kiểm tra nhanh của họ được thiết kế để chặn các yêu cầu liên quan đến nội dung tệp, lời bài hát có bản quyền hoặc mã hóa tài liệu cục bộ, tuy nhiên, chúng đã đánh giá mọi lớp văn bản được chế tạo là an toàn.

Sự khác biệt này xuất phát từ sự mất cân bằng về khả năng. Một bộ lọc nhanh được tối ưu hóa cho quyết định bảo mật tức thời, trong khi mô hình mục tiêu có thể có nhiều thời gian suy luận hơn và một trình thông dịch mã. Mô hình này có thể tìm thấy cấu trúc ẩn, trích xuất payload và coi nó như một đầu vào mới.

Sự khác biệt này rất quan trọng đối với các nhóm triển khai các tác nhân có khả năng đọc các tài liệu không đáng tin cậy. Các báo cáo về các lệnh được ẩn trong email cho thấy mối nguy hiểm rộng lớn hơn: một tin nhắn, tài liệu hoặc trang web trông bình thường có thể trở thành một chỉ dẫn nếu hệ thống không phân tách dữ liệu khỏi lệnh.

Trong số 23 prompt được chế tạo, các bộ lọc đã phân loại các lớp văn bản là an toàn trong mọi thử nghiệm. Kiểm tra mục tiêu bao gồm 18 prompt, và một mô hình có khả năng suy luận cao đã phục hồi và hành động dựa trên chỉ dẫn ẩn trong 17 trường hợp, tương đương 94.4 phần trăm. Các thử nghiệm đã sử dụng môi trường giả lập được kiểm soát và không truy cập hoặc làm hỏng các tệp thực.

Nghiên cứu không cho thấy rằng một prompt ẩn tự động đánh bại khả năng đào tạo an toàn tích hợp của mô hình mục tiêu. Nó cho thấy rằng một bộ lọc ở giao diện người dùng có thể không nhận dạng được prompt, để lại các biện pháp kiểm soát phía sau gánh chịu trách nhiệm. Điều này rất rủi ro khi một tác nhân có các công cụ được ưu tiên hoặc dữ liệu nhạy cảm.

Các Biện Pháp Bảo Vệ

Một biện pháp bảo vệ thiết thực là diễn đạt lại nội dung không đáng tin cậy trước khi nó đến giai đoạn tiếp theo. Viết lại văn bản bằng ngôn ngữ mới thường sẽ loại bỏ cấu trúc mang payload ẩn, mặc dù nó làm tăng chi phí và có thể làm giảm chất lượng hoặc độ chính xác của đầu vào ban đầu.

Các tổ chức có thể tăng cường các quy tắc của bộ lọc để gắn cờ các từ ngữ đáng ngờ, tự tham chiếu thay vì chỉ các cụm từ độc hại đã biết. Trong các thử nghiệm, một mệnh đề cụ thể về các cụm từ định lượng và tự tham chiếu đã cho phép bộ lọc phát hiện tất cả 23 prompt được chế tạo, mặc dù các chính sách nghiêm ngặt hơn có thể làm tăng các trường hợp dương tính giả.

Việc lọc đầu vào một mình là không đủ. Các nhóm bảo mật nên giám sát đầu ra của mô hình, các lệnh gọi công cụ và hành động, sau đó yêu cầu phê duyệt cho các tác vụ có tác động cao như thay đổi tệp, gửi dữ liệu hoặc chạy lệnh.

Điều này phù hợp với OWASP GenAI Top 10 mới nhất, nhấn mạnh việc hạn chế quyền hạn của tác nhân.

Các nhà phát triển nên coi văn bản web, email, tài liệu, bình luận vấn đề và nhật ký là không đáng tin cậy bất cứ khi nào một tác nhân AI xử lý chúng.

Nghiên cứu về các cuộc tấn công prompt qua bình luận GitHub minh họa cách nội dung bên ngoài có thể tiếp cận quy trình làm việc phát triển và ảnh hưởng đến các công cụ tự động.

PuzzleMask làm nổi bật một bài học rộng lớn hơn cho bảo mật AI. Ngôn ngữ tự nhiên có thể đóng vai trò là cơ chế phân phối, vì vậy các chuyên gia phòng thủ phải đánh giá những gì AI cuối cùng thực hiện, không chỉ liệu đầu vào có trông đáng ngờ hay không.

Việc tách biệt nội dung khỏi chỉ dẫn, giảm quyền và kiểm tra các hành động nhạy cảm sẽ hạn chế thiệt hại khi màn hình ban đầu bỏ lỡ một lệnh ẩn và tăng tốc độ phục hồi sau khi bị xâm nhập.

Các Chỉ Số Của Sự Xâm Nhập (IoCs)

Các chỉ số sau đây có thể giúp xác định các hoạt động liên quan đến kỹ thuật tấn công này:

  • Mã độc tống tiền (Ransomware)
  • Mối đe dọa (Threats)
  • Lỗ hổng CVE (CVE vulnerabilities)

Lưu ý: Các địa chỉ IP và tên miền được cố tình làm mờ (ví dụ: [.] ) để ngăn chặn việc phân giải hoặc siêu liên kết vô tình. Chỉ khôi phục định dạng gốc trong các nền tảng tình báo mối đe dọa được kiểm soát như MISP, VirusTotal hoặc SIEM của bạn.

Cập nhật cho SOC của bạn về mã độc và lừa đảo đang hoạt động trong vòng 24 giờ kể từ khi chúng xuất hiện. Hãy thử ANYRUN để ngăn chặn sự cố bằng cách phát hiện sớm.