Một mối đe dọa mạng mới nổi đã xuất hiện, được thúc đẩy bởi một tác nhân độc hại nói tiếng Nga có tên “Trim”. Tác nhân này đã biến đổi các mô hình AI bị bẻ khóa (jailbroken frontier AI models) thành một nền tảng kiểm thử thâm nhập tự động mang tên AI Pentest Checker.
Hoạt động này cho thấy cách các tội phạm mạng có thể lạm dụng các dịch vụ AI hợp pháp và các công cụ bảo mật phổ biến để đẩy nhanh quá trình trinh sát, xác thực lỗ hổng và tạo báo cáo tấn công.
Sự trỗi dậy của AI bị bẻ khóa trong Tấn công Mạng
Bẻ khóa Mô hình AI để Vượt qua Kiểm soát An toàn
Trim lần đầu tiên xuất hiện trên một diễn đàn tội phạm mạng nói tiếng Nga vào ngày 13 tháng 3 năm 2026. Tại đây, cá nhân này đã chia sẻ các phương pháp được cho là có thể vượt qua các kiểm soát an toàn của Claude Opus.
Tác nhân này đã mô tả các kỹ thuật thao túng dựa trên prompt (lời nhắc). Mục đích là để mô hình xử lý các yêu cầu tấn công như nghiên cứu bảo mật được ủy quyền, thay vì hoạt động độc hại.
Các phương pháp được báo cáo bao gồm việc tạo ra một ngữ cảnh lành tính trước khi đưa ra yêu cầu gây hại. Ngoài ra, việc thay đổi hướng dẫn để chỉ tập trung vào cấu trúc mã và thử lại các phiên bản đã được làm dịu của các prompt bị từ chối trước đó cũng được áp dụng.
Những kỹ thuật này là các dạng của “jailbreaking” (bẻ khóa). Kẻ tấn công cố gắng ghi đè lên các biện pháp bảo vệ hành vi của mô hình thông qua các đầu vào được tạo tác, thay vì khai thác cơ sở hạ tầng nền tảng.
Các nhà nghiên cứu về mối đe dọa mạng đã quan sát thấy việc lạm dụng độc hại các mô hình ngôn ngữ lớn (LLMs) hợp pháp, bao gồm cả việc bẻ khóa.
Trim cũng được cho là đã khuyến nghị các dịch vụ AI thay thế và các mô hình được lưu trữ cục bộ khi các hệ thống thương mại từ chối một yêu cầu nào đó.
Chiến lược này làm giảm sự phụ thuộc vào bất kỳ nhà cung cấp AI đơn lẻ nào. Nó cung cấp cho các tác nhân độc hại một lựa chọn dự phòng để tạo mã, phân tích mục tiêu hoặc tạo nội dung khai thác.
Tác động của Mô hình AI Tiên tiến đến An ninh Mạng
Các nhóm nghiên cứu cảnh báo rằng các mô hình AI tiên tiến ngày càng có khả năng hỗ trợ các nhiệm vụ tấn công. Ví dụ như phân tích lỗ hổng và các hoạt động liên quan đến khai thác, ngay cả khi các nhà cung cấp triển khai các biện pháp kiểm soát an toàn.
Cato Networks đã báo cáo rằng Trim được cho là đã quảng bá AI Pentest Checker vào ngày 21 tháng 6. Nền tảng này kết hợp khả năng AI với các công cụ bảo mật tấn công để kiểm thử tự động.
Công cụ này được cho là tích hợp các máy quét và công cụ trinh sát như Nuclei, ffuf, katana, subfinder và Gitleaks. Mục đích là tự động phát hiện mục tiêu, liệt kê điểm cuối, phát hiện bí mật và kiểm tra lỗ hổng.
Mối lo ngại không nằm ở chỗ các tiện ích này vốn dĩ là độc hại – các chuyên gia kiểm thử thâm nhập và các nhà phòng thủ hợp pháp sử dụng chúng rộng rãi.
Tuy nhiên, khi kết hợp với một trợ lý AI bị bẻ khóa, các công cụ này có thể giảm thời gian và chuyên môn cần thiết để điều phối quy trình xâm nhập. Chúng còn hỗ trợ diễn giải kết quả quét, ưu tiên các phát hiện và tạo ra các báo cáo hoàn chỉnh.
Nền tảng này được cho là đã sử dụng Claude Opus trong quy trình leo thang lỗ hổng nghiêm trọng và một mô hình khác để tạo báo cáo khai thác.
Các tuyên bố rằng một prompt hệ thống đã sửa đổi từ cấu hình “Fable 5” được sử dụng nên được xem xét thận trọng. Trừ khi được xác minh độc lập, những tuyên bố này cần được đánh giá kỹ lưỡng.
Tuy nhiên, các prompt hệ thống bị lộ hoặc rò rỉ có thể cung cấp cho kẻ tấn công cái nhìn sâu sắc về các hướng dẫn của mô hình. Điều này giúp họ kiểm tra các chiến lược prompt-injection hoặc jailbreak hiệu quả hơn.
Phản ứng trước Sự Chuyển đổi trong Bối cảnh Mối đe dọa mạng
AI là Lớp Vận hành cho Quy trình Tấn công Đa bước
Trường hợp này phản ánh một sự thay đổi lớn hơn trong bối cảnh mối đe dọa mạng. AI đang phát triển từ một trợ lý viết lách cho tội phạm mạng thành một lớp vận hành. Nó có thể tổ chức các quy trình tấn công mạng đa bước.
Anthropic trước đây đã báo cáo việc phá vỡ các hoạt động tội phạm mạng trong đó AI được sử dụng cho các nhiệm vụ. Các nhiệm vụ này bao gồm từ nghiên cứu mục tiêu đến hỗ trợ xâm nhập và các công việc liên quan đến tống tiền.
Sự gia tăng của AI Pentest Checker minh họa một xu hướng đáng lo ngại, nơi các công cụ tiên tiến được vũ khí hóa để phục vụ các mục đích độc hại. Các tổ chức cần nhận thức rõ về khả năng này.
Để biết thêm chi tiết về cách một tác nhân đe dọa đã biến AI tiên tiến thành một nền tảng tấn công, bạn có thể tham khảo báo cáo của Cato Networks: How One Threat Actor Turned Frontier AI into an Offensive Platform.
Biện pháp Bảo vệ và Tăng cường An ninh Mạng
Các tổ chức nên phản ứng bằng cách giảm bề mặt tấn công tiếp xúc của mình. Việc liên tục quét các tài sản hướng ra internet là một biện pháp cần thiết.
Thực thi xác thực đa yếu tố (MFA), xoay vòng các thông tin đăng nhập bị xâm phạm và giám sát hoạt động trinh sát bất thường là các bước quan trọng để tăng cường an ninh mạng.
Các nhóm bảo mật cũng nên xem xét phishing được tạo bởi AI, nghiên cứu lỗ hổng tự động và phát triển khai thác nhanh hơn là những rủi ro bảo mật thực tế. Đây không còn là các kịch bản tương lai xa vời.
Việc đầu tư vào các giải pháp an ninh mạng toàn diện và đào tạo nhân sự là điều cần thiết. Điều này giúp đối phó hiệu quả với các mối đe dọa mạng phát triển không ngừng.










