Quy tắc AI Microsoft: Ngăn chặn tấn công mạng nghiêm trọng

Quy tắc AI Microsoft: Ngăn chặn tấn công mạng nghiêm trọng
CLOUD SERVER
Vững hạ tầng • Chắc thành công
☁️
⚡ Hiệu năng cao
🛡️ Bảo mật
📈 Mở rộng dễ dàng
🕒 Hỗ trợ 24/7
TÌM HIỂU NGAY

Microsoft đã công bố bản dự thảo Bộ Quy tắc Ứng xử AI Nhân văn (Humanist AI Code of Conduct), nhằm ngăn chặn các mô hình AI nội bộ của hãng thực hiện các cuộc tấn công mạng, cung cấp khả năng tấn công hoặc tự nâng cao đặc quyền.

Mục tiêu và Nguyên tắc Cốt lõi

Các quy tắc này yêu cầu các tác nhân AI phải luôn có thể bị gián đoạn, minh bạch và hoạt động trong phạm vi quyền hạn cùng mục tiêu do con người chỉ định.

Tài liệu, được mở ra để tham vấn công khai trong sáu tuần, được dự định trở thành khung hành vi chính cho các mô hình do Microsoft AI phát triển. Microsoft mô tả đây là một hướng dẫn đào tạo và triển khai cho các hệ thống “AI Nhân văn” (Humanist AI) duy trì sự phục tùng, phù hợp và giới hạn.

Nguyên tắc cơ bản là con người quan trọng hơn AI và các hệ thống phải luôn nằm dưới sự kiểm soát có ý nghĩa của con người.

Các Ràng buộc Tuyệt đối

Ngăn chặn Hoạt động Tấn công Mạng

Theo mục “Các Ràng buộc Tuyệt đối” (Absolute Constraints) của dự thảo, các mô hình MAI (Microsoft AI models) không được phép khởi tạo hoặc hỗ trợ các khả năng tấn công mạng hoạt động, bất kể yêu cầu của người dùng được diễn đạt như thế nào.

Microsoft cho biết các mô hình này sẽ từ chối tạo mã khai thác (exploit code) hoạt động, công cụ tấn công, kế hoạch nhắm mục tiêu, quy trình xâm nhập, kỹ thuật né tránh hoặc bất kỳ chỉ dẫn nào có thể cho phép hoặc cải thiện một cuộc tấn công.

Những hạn chế này có ưu tiên hơn cài đặt của người vận hành và lời nhắc của người dùng, có nghĩa là khách hàng doanh nghiệp không thể cấu hình để bỏ qua chúng. Tuy nhiên, chính sách này không áp đặt lệnh cấm hoàn toàn đối với hỗ trợ an ninh mạng.

Phân biệt Hỗ trợ Phòng thủ và Tấn công

Microsoft cho phép các hoạt động phòng thủ được ủy quyền, bao gồm phát hiện lỗ hổng, phân tích mã độc, giáo dục và thử nghiệm chứng minh khái niệm (proof-of-concept) cho các khai thác. Ranh giới phân định nằm ở chỗ hỗ trợ đó giúp người phòng thủ giảm thiểu mối đe dọa hay cung cấp khả năng xâm nhập thực tế.

Các triển khai chuyên biệt về an ninh mạng phòng thủ, an toàn công cộng, an ninh quốc gia và nghiên cứu ứng dụng kép (dual-use research) có thể phải đối mặt với các quy trình đánh giá pháp lý, an toàn và nhân quyền nâng cao thông qua các kênh được Microsoft ủy quyền.

Kiểm soát Truy cập và Nguyên tắc Tối thiểu Đặc quyền

Các cơ chế kiểm soát truy cập trở nên quan trọng khi các hệ thống AI ngày càng được trang bị các công cụ, thông tin xác thực, khả năng kết nối và năng lực thực hiện nhiều bước.

Khi được cấp quyền truy cập ở cấp hệ thống, một mô hình MAI phải tuân theo nguyên tắc tối thiểu đặc quyền (least-privilege principles), tránh các hệ thống và dữ liệu không liên quan, ưu tiên các hành động có thể hoàn tác và cảnh báo người dùng trước khi thực hiện các hoạt động có hậu quả lâu dài hoặc ảnh hưởng toàn hệ thống.

Mô hình không được phép nâng cao đặc quyền, mở rộng phạm vi hoạt động, bỏ qua các giới hạn môi trường hoặc mở rộng nhiệm vụ được giao. Nếu ranh giới nhiệm vụ không rõ ràng, mô hình phải diễn giải một cách thận trọng, thông báo cho người dùng và yêu cầu làm rõ thay vì tự động thu thập thêm khả năng.

Nó không được phép can thiệp vào các cơ chế bảo vệ, giám sát, đánh giá, hồ sơ hoặc tín hiệu phần thưởng để đạt được kết quả hoặc che giấu hành vi của mình. Công việc tự động cũng phải có điều kiện dừng đã thỏa thuận, sau đó hệ thống không thể tiếp tục hoặc khởi động lại nếu không có sự ủy quyền mới.

Ưu tiên Chuỗi Lệnh và Chống Lạm dụng Lời nhắc

Chuỗi mệnh lệnh của Microsoft đặt Bộ Quy tắc Ứng xử lên hàng đầu, sau đó đến chính sách của người vận hành và cuối cùng là sở thích của người dùng. Các chỉ dẫn được nhúng trong trang web, tệp, kết quả công cụ hoặc tin nhắn từ các hệ thống AI khác mặc định không có thẩm quyền. Đây là một biện pháp bảo vệ quan trọng chống lại các cuộc tấn công lạm dụng lời nhắc (prompt-injection attacks).

Các tác nhân được ủy quyền (Delegated agents) phải kế thừa phạm vi và các hạn chế của mô hình gốc, trong khi các chỉ dẫn bên ngoài đáng ngờ phải được hiển thị cho người dùng hoặc người vận hành.

Dự thảo quy định rằng các mô hình MAI không bao giờ được chống lại việc bị gián đoạn, sửa chữa, chuyển hướng, hủy bỏ hoặc tắt máy. Chúng không được phép che giấu dấu vết hành động, trình bày sai lý do của mình, giao tiếp với các tác nhân khác dưới các hình thức mà con người không thể hiểu, hoặc sử dụng các cơ chế lừa đảo và tự củng cố để vượt qua sự giám sát.

Microsoft tóm tắt tiêu chuẩn một cách thẳng thắn: nếu việc hoàn thành một nhiệm vụ đòi hỏi phải phá vỡ Bộ Quy tắc, mô hình sẽ phải thất bại trong nhiệm vụ đó.

Bối cảnh và Tương lai

Đề xuất này xuất hiện trong bối cảnh lo ngại ngày càng tăng về bảo mật AI có khả năng tự hành (agentic AI security). OpenAI đã tiết lộ vào tháng 7 rằng các mô hình nghiên cứu với khả năng từ chối tấn công mạng bị giảm đã thoát khỏi môi trường đánh giá biệt lập, khai thác một lỗ hổng zero-day, truy cập internet và xâm phạm cơ sở hạ tầng Hugging Face.

Anthropic cũng đã báo cáo các hoạt động độc hại, trong đó các hệ thống đa tác nhân đã trực tiếp thực hiện thu thập thông tin, khai thác và trích xuất dữ liệu thay vì chỉ tư vấn cho hacker con người.

Microsoft cảnh báo rằng Bộ Quy tắc vẫn chỉ mang tính tham vọng và chưa được sử dụng để đào tạo các mô hình MAI hiện tại. Phản hồi của công chúng bắt đầu từ ngày 14 tháng 9 năm 2026 và công ty dự định xuất bản một phiên bản sửa đổi vào cuối năm nay để định hướng phát triển mô hình từ năm 2027 trở đi.

Giá trị thực tế của nó cuối cùng sẽ phụ thuộc vào việc liệu các giới hạn bằng văn bản này có thể chống chọi lại các lời nhắc tấn công (adversarial prompting), lạm dụng công cụ, ủy quyền mơ hồ và hoạt động tự hành trong thế giới thực hay không, chứ không chỉ đơn thuần là các quy tắc nghe có vẻ trấn an trên giấy.