Các nhà nghiên cứu liên kết với quân đội đang tích cực tìm hiểu cách thức chuyển đổi đầu ra từ các hệ thống AI tiên tiến của phương Tây thành các mô hình nhỏ gọn, chi phí thấp hơn. Mục tiêu của việc này là ứng dụng vào máy bay không người lái, công cụ chiến trường, tác vụ an ninh mạng và các nền tảng an ninh công cộng.
Mối lo ngại chính không phải là một chương trình độc hại cụ thể, mà là một kỹ thuật có khả năng đẩy nhanh sự phát triển của các hệ thống lưỡng dụng. Đồng thời, kỹ thuật này có thể làm suy yếu các biện pháp bảo vệ được tích hợp sẵn trong các mô hình AI gốc.
Kỹ thuật AI Distillation và Tiềm năng Lạm dụng
Kỹ thuật này được biết đến với tên gọi distillation, trong đó một mô hình “học viên” (student model) được huấn luyện dựa trên các phản hồi được tạo ra bởi một mô hình “giáo viên” (teacher model) có năng lực cao hơn. Đây là một phương pháp phổ biến và được sử dụng rộng rãi trong quá trình phát triển AI hợp pháp.
Tuy nhiên, các nghiên cứu đã xem xét mô tả những trường hợp kỹ thuật distillation có thể được sử dụng để sao chép năng lực suy luận, vượt qua các hạn chế bảo mật hoặc che giấu nguồn gốc các khả năng của một mô hình. Điều này tạo ra một rủi ro bảo mật đáng kể cho các hệ thống AI tiên tiến.
Phát hiện về Adversarial Distillation
Các nhà phân tích tại Jamestown đã chia sẻ một báo cáo với Cyber Security News (CSN), trong đó họ xác định một lượng lớn nghiên cứu học thuật và công nghiệp Trung Quốc được xuất bản từ năm 2024 đến năm 2026. Các tài liệu này chỉ ra nỗ lực có chủ đích trong việc phát triển adversarial distillation.
Báo cáo của Jamestown còn cho thấy rằng một số nghiên cứu này có liên hệ với Quân Giải phóng Nhân dân (PLA), các trường đại học liên kết quốc phòng, các viện nghiên cứu nhà nước và các tổ chức an ninh công cộng. Báo cáo của Jamestown cung cấp cái nhìn sâu sắc về những hoạt động này.
Tác động An ninh Rộng lớn và Các Ứng dụng Tiềm năng
Vấn đề này mang theo những ý nghĩa bảo mật sâu rộng, bởi vì các mô hình AI ngày càng được sử dụng để xử lý thông tin tình báo, hướng dẫn các công cụ tự động, phân tích mã nguồn và hỗ trợ các hoạt động giám sát. AI đã và đang trở thành một phần tích cực trong các quy trình công việc tấn công mạng, thay vì chỉ là một công cụ nghiên cứu thụ động.
Các báo cáo gần đây về các hoạt động xâm nhập do AI hỗ trợ cho thấy rõ điều này. Các nhà nghiên cứu liên kết với PLA tập trung vào việc trích xuất hoặc tái tạo các mẫu suy luận từ các mô hình AI đóng hàng đầu. Những bước suy luận trung gian này có thể cải thiện kết quả trong lập trình, logic và giải quyết vấn đề, mặc dù chi phí để phát triển chúng một cách độc lập là rất cao.
Ứng dụng trong Hoạt động Tấn công và Giám sát
Một tài liệu từ Đại học Kỹ thuật Quân sự đã đề xuất chắt lọc kiến thức về cách phá vỡ các cơ chế an toàn AI thành các công cụ nhỏ hơn. Những công cụ này có thể thực hiện các cuộc tấn công một cách liên tục, làm tăng mối đe dọa mạng hiện có.
Nghiên cứu riêng biệt từ các nhóm liên kết với PLA đã khám phá việc xây dựng các mô hình proxy cho các cuộc tấn công black-box và tạo ra các mô hình nhỏ hơn có khả năng tóm tắt mã nguồn ở mức độ gần với GPT-3.5. Những nỗ lực này cho thấy khả năng khai thác các mô hình AI để phục vụ mục đích tấn công.
Nghiên cứu cũng bao gồm các nỗ lực nhằm làm cho các khả năng được sao chép khó nhận dạng hơn. Một nghiên cứu liên quan đến các đơn vị mạng của PLA đã phác thảo các phương pháp nhằm loại bỏ các dấu hiệu watermark trong khi vẫn giữ nguyên khả năng của mô hình gốc, và các công trình khác tìm cách giảm thiểu các tín hiệu mà hệ thống an ninh sử dụng để phát hiện các mô hình đã bị can thiệp. Điều này đặt ra một rủi ro bảo mật nghiêm trọng trong việc xác định nguồn gốc và tính toàn vẹn của mô hình.
Tấn công Prompt Injection và AI Đa phương thức
Các tài liệu được xem xét chỉ ra rằng các mô hình đã được chắt lọc đang được đề xuất hoặc sử dụng cho mục đích giám sát, an ninh công cộng, phân tích mối đe dọa mạng và các nhiệm vụ liên quan đến chỉ huy quân sự. Phạm vi ứng dụng rộng lớn này càng làm nổi bật tầm quan trọng của an ninh AI.
Các nhà nghiên cứu liên kết với một viện thành phố thông minh thuộc sở hữu nhà nước đã mô tả các mô hình an ninh nhỏ gọn dành cho bộ xử lý biên (edge processors) trong camera đường phố. Các mô hình này có khả năng nhận diện khuôn mặt trong đám đông, ngay cả trong điều kiện ánh sáng yếu.
Một viện khác trong cùng nhóm thuộc sở hữu nhà nước đã áp dụng các kỹ thuật tương tự trong các công cụ được đề xuất để thu thập thông tin tình báo, phát hiện phần mềm độc hại và truy vết các vụ xâm nhập mạng. Các nhà nghiên cứu tại Đại học Bắc Trung Quốc cũng đã mô tả việc chắt lọc Claude thành một bộ phân loại có thể hỗ trợ giám sát mạng xã hội và kiểm duyệt nội dung.
Nghiên cứu quân sự cũng đã xem xét kỹ thuật tấn công prompt injection đa phương thức, bao gồm các thử nghiệm che giấu các hướng dẫn bằng văn bản bên trong hình ảnh xe tăng và tàu chiến. Các nhà nghiên cứu tuyên bố rằng GPT-4o và các phiên bản của Claude đã đọc và tuân theo các văn bản ẩn này. Các rủi ro tấn công prompt injection này củng cố mối lo ngại xung quanh các hướng dẫn ẩn nhắm mục tiêu vào các hệ thống AI xử lý hình ảnh và nội dung bên ngoài, cho thấy một hình thức tấn công mạng tinh vi.
Thách thức trong Đánh giá và Đề xuất Bảo vệ An ninh AI
Jamestown cảnh báo rằng các tài liệu được công bố rộng rãi có thể chỉ tiết lộ một phần các hoạt động thực tế. Hơn nữa, những nghiên cứu này có thể đã được hoàn thành từ một hoặc hai năm trước đó, hàm ý rằng các khả năng hiện tại có thể đã tiến xa hơn.
Nếu các mô hình có thể được chắt lọc mà không để lại các dấu hiệu watermark hoặc dấu vết suy luận có thể nhận dạng được, việc đánh giá cả khả năng thực sự của các hệ thống Trung Quốc và mức độ phơi nhiễm của các mô hình phương Tây sẽ trở nên cực kỳ khó khăn. Điều này tạo ra một mối đe dọa mạng phức tạp và khó lường.
Báo cáo khuyến nghị rằng việc phân biệt giữa distillation thông thường và hoạt động đối nghịch nên được thực hiện bằng cách xem xét các khả năng đang được sao chép, các tổ chức liên quan và những nỗ lực nhằm che giấu nguồn gốc của mô hình học viên. Các nhà phát triển và đội ngũ bảo mật cần chú trọng đến điều này.
Các nhà phát triển và đội ngũ bảo mật cần duy trì thông tin về nguồn gốc của mô hình, giám sát các mẫu trích xuất quy mô lớn bất thường, và giới hạn các hành động AI có tác động cao bằng các biện pháp kiểm soát và xem xét của con người. Những biện pháp này là cần thiết để tăng cường bảo mật thông tin và giảm thiểu rủi ro bảo mật liên quan đến AI.
Bài học rộng hơn từ những phát hiện này là an ninh AI hiện nay đã vượt ra ngoài các lỗi phần mềm truyền thống và các vụ đánh cắp dữ liệu. Việc sử dụng ngày càng tăng của các mô hình AI trong các chiến dịch do nhà nước hậu thuẫn, bao gồm cả các mạng lưới nhà thầu an ninh mạng Trung Quốc, cho thấy các chính phủ và tổ chức cần đánh giá tổng thể cách các khả năng AI, cơ sở hạ tầng và ý định hoạt động có thể kết hợp với nhau. Đây là một khía cạnh thiết yếu trong việc đảm bảo an ninh mạng toàn diện.










