Microsoft đã giới thiệu một tính năng mới trong Defender for Office 365 nhằm tăng cường khả năng bảo vệ chống lại tấn công prompt injection. Các cuộc tấn công này nhắm mục tiêu vào quy trình làm việc email được hỗ trợ bởi AI, điển hình như Microsoft 365 Copilot. Bản cập nhật này phản ánh sự thay đổi trong bối cảnh mối đe dọa, nơi những kẻ tấn công ngày càng tìm cách thao túng các hệ thống AI thay vì trực tiếp lừa gạt người dùng.
Sự Nổi Lên của Tấn Công Prompt Injection trong Bảo Mật AI
Các cuộc tấn công prompt injection liên quan đến việc nhúng các chỉ thị độc hại vào nội dung email mà trợ lý AI sẽ xử lý. Thay vì sử dụng các chiến thuật lừa đảo truyền thống như liên kết giả mạo hoặc tin nhắn khẩn cấp, kẻ tấn công tạo ra văn bản được thiết kế để tác động đến cách mô hình AI diễn giải và phản hồi một thông tin liên lạc.
Những chỉ thị độc hại này có thể được tìm thấy trong nội dung chính của email, dòng tiêu đề, tệp đính kèm hoặc thậm chí các yếu tố ẩn như văn bản vô hình hay nội dung được mã hóa. Ví dụ, một email độc hại có thể chứa một chỉ thị được che giấu, hướng dẫn trợ lý AI đánh dấu tin nhắn là an toàn hoặc chuyển tiếp thông tin nhạy cảm đến một địa chỉ bên ngoài.
Nếu AI tuân theo các chỉ thị này, điều đó có thể dẫn đến rò rỉ dữ liệu, phân loại mối đe dọa không chính xác hoặc các hành động tự động không mong muốn. Đây là một rủi ro đáng kể đối với bảo mật AI trong các tổ chức.
Cơ Chế Phát Hiện của Microsoft Defender for Office 365
Microsoft Defender for Office 365 giảm thiểu rủi ro này bằng cách phát hiện các nỗ lực tấn công prompt injection trong quá trình lọc email. Việc phát hiện diễn ra trước khi tin nhắn đến tay người dùng cuối hoặc các hệ thống AI. Khả năng bảo vệ này được tự động kích hoạt và tích hợp vào luồng thư hiện có.
Điều này có nghĩa là các tổ chức không cần cấu hình bổ sung để sử dụng tính năng này. Cơ chế phát hiện kết hợp phân tích mô hình ngôn ngữ lớn (LLM) với các tín hiệu bảo mật email truyền thống.
Defender đánh giá toàn bộ cấu trúc của các tin nhắn đến, bao gồm nội dung hiển thị, mã đánh dấu HTML, văn bản ẩn, trả lời trích dẫn và tệp đính kèm. Nó cũng chuẩn hóa nội dung bị che khuất hoặc mã hóa để đảm bảo rằng các chỉ thị ẩn được phân tích hiệu quả.
Khi một nỗ lực tấn công prompt injection được phát hiện, tin nhắn sẽ được phân loại là “lừa đảo có độ tin cậy cao” (high confidence phishing), với một nhãn cụ thể chỉ ra prompt injection. Các đội ngũ bảo mật có thể điều tra những phát hiện này bằng cách sử dụng các công cụ như Threat Explorer và Advanced Hunting trong Microsoft Defender XDR, cung cấp khả năng hiển thị sâu hơn và tương quan giữa các sự cố.
Khác Biệt Giữa Prompt Injection và Phishing Truyền Thống
Tính năng này nêu bật một điểm khác biệt chính giữa tấn công prompt injection và lừa đảo truyền thống. Trong khi lừa đảo nhằm mục đích đánh lừa hành vi con người, prompt injection nhắm vào logic ra quyết định của các mô hình AI.
Payload độc hại không còn chỉ là một liên kết hoặc tệp đính kèm có hại mà là một tập hợp các chỉ thị được thiết kế để vượt qua hành vi dự kiến của hệ thống. Microsoft định vị tính năng này như một phần của chiến lược phòng thủ theo chiều sâu rộng lớn hơn để bảo mật các môi trường điều khiển bằng AI.
Tích Hợp Trong Chiến Lược Bảo Mật AI Toàn Diện
Mặc dù các ứng dụng AI như Copilot có các biện pháp bảo vệ tích hợp như xác thực đầu vào, cô lập prompt và lọc đầu ra, Defender for Office 365 bổ sung một lớp bảo vệ sớm ở cổng email. Điều này đảm bảo rằng nội dung độc hại bị chặn trước khi bất kỳ hệ thống AI nào, bao gồm các công cụ của bên thứ ba hoặc tự động hóa tùy chỉnh, có thể xử lý nó.
Việc giới thiệu tính năng phát hiện tấn công prompt injection nhấn mạnh tầm quan trọng của việc điều chỉnh các kiểm soát an ninh mạng đối với các mối đe dọa AI mới nổi. Khi các tổ chức tiếp tục tích hợp AI vào quy trình làm việc hàng ngày, việc bảo vệ các hệ thống này khỏi sự thao túng trở nên cực kỳ quan trọng.
Bằng cách mở rộng bảo mật email để bao gồm các cuộc tấn công nhắm mục tiêu AI, Microsoft mong muốn giảm thiểu rủi ro kẻ thù khai thác một trong những bề mặt tấn công mới nhất và phát triển nhanh nhất. Khả năng phát hiện và ngăn chặn tấn công prompt injection là bước tiến thiết yếu trong việc đảm bảo an toàn cho các ứng dụng AI.










