Chế độ Tự động Vượt trội: Phát Hiện Tấn công An toàn Thông tin

Chế độ Tự động Vượt trội: Phát Hiện Tấn công An toàn Thông tin
CLOUD HOSTING
DỊCH VỤ
VPS • CLOUD • SERVER
Hiệu năng cao
Ổn định • Bảo mật • Tốc độ
☁️
SSD NVMe 99.9% 24/7
TÌM HIỂU NGAY

Anthropic đang thay đổi cách Claude Code xử lý các lệnh có rủi ro, chuyển từ các lời nhắc phê duyệt thủ công liên tục sang một bộ phân loại an toàn tự động gọi là chế độ tự động. Kể từ ngày 14 tháng 8 năm 2026, chế độ tự động sẽ trở thành cài đặt mặc định cho các phiên mới trên các gói Pro, Max và Team của Claude Code, đánh dấu một sự thay đổi lớn trong cách các AI lập trình viên cân bằng tính tự chủ với bảo mật.

Quyết định này được đưa ra sau nhiều tháng thử nghiệm nội bộ và từ bên thứ ba, so sánh các lời nhắc cho phép thủ công với đánh giá tự động. Anthropic nhận thấy rằng người đánh giá thủ công đã trở nên chủ quan một cách nguy hiểm, phê duyệt 97% tất cả các yêu cầu cho phép trong Claude Code, thường là phản xạ thay vì thông qua xem xét kỹ lưỡng.

Chuyển đổi từ Phê duyệt Thủ công sang Phân loại Tự động

Sự mệt mỏi khi phê duyệt này đã tạo ra một khoảng trống bảo mật đáng kể. Trong một nghiên cứu có kiểm soát với 1.053 người thử nghiệm chuyên nghiệp trả phí, những người đánh giá thủ công chỉ phát hiện 13,6% các lệnh nguy hiểm được đưa vào quy trình làm việc của họ, trong khi bộ phân loại của chế độ tự động đã phát hiện 89% các mối đe dọa tương tự. Chế độ tự động đã chặn 800 lệnh mà con người đã phê duyệt, trong khi con người chỉ chặn 6 lệnh mà chế độ tự động bỏ sót.

Đáng chú ý, sự cảnh giác của con người giảm dần khi các phiên kéo dài, giảm từ tỷ lệ phát hiện 17% ban đầu xuống chỉ còn 5% sau 50 hoặc nhiều lời nhắc trước đó. Ngược lại, tỷ lệ phát hiện của chế độ tự động vẫn ổn định trong suốt quá trình.

Hoạt động của Chế độ Tự động

Thay vì làm gián đoạn người dùng bằng các lời nhắc lặp đi lặp lại, chế độ tự động định tuyến mọi lệnh gọi công cụ thông qua một bộ phân loại được thiết kế để chặn các hành động không thể đảo ngược, mang tính hủy diệt hoặc hướng ra ngoài môi trường của người dùng. Khi phát hiện điều gì đó có rủi ro, Claude thường tìm một giải pháp thay thế an toàn hơn hoặc yêu cầu người dùng xác nhận trực tiếp.

Nếu Claude gặp ba lần chặn liên tiếp hoặc hai mươi lần chặn trong một phiên, Claude Code sẽ tự động quay lại chế độ phê duyệt thủ công. Các quy tắc cho phép hiện có vẫn được ưu tiên trong hầu hết các trường hợp, ngoại trừ các quy tắc cho phép quá rộng như thực thi Python hoặc Node không giới hạn. Các quy tắc này sẽ bị bỏ qua trong chế độ tự động vì chúng cho phép các lệnh bỏ qua bộ phân loại hoàn toàn.

Đánh giá Hiệu quả và Khả năng Chống Chịu

Chế độ tự động đã thể hiện khả năng phục hồi chống lại các cuộc tấn công tinh vi. Trong một cuộc kiểm thử bảo mật kéo dài hai tuần với Apollo Research, tỷ lệ bỏ sót của bộ phân loại chống lại các cuộc tấn công đối nghịch đã giảm từ 12% xuống 7% sau khi được tăng cường. Trong các thử nghiệm tiêm lệnh (prompt-injection) do Trajectory Labs thực hiện, không có 720 nỗ lực tấn công nào thành công chống lại các mô hình Claude chạy ở chế độ tự động, so với tỷ lệ thành công 5,83% đối với GPT-5.6 Sol của OpenAI khi hoạt động ở chế độ tự động xem xét tương tự.

Nội bộ tại Anthropic, chế độ tự động đã ngăn chặn các sự cố thực tế, bao gồm chặn một nỗ lực rò rỉ dữ liệu lên một trang chia sẻ mã nguồn công khai, dừng một hành động xóa hàng loạt pod có thể đã phá hủy các tác vụ đào tạo đang diễn ra và phát hiện một yêu cầu truy cập đám mây có đặc quyền quá cao, lẽ ra sẽ cấp quyền quản trị đầy đủ thay vì chỉ quyền truy cập hóa đơn chỉ đọc. Tóm lại, Claude Opus 5 cũng được hưởng lợi từ các cải tiến tương tự.

Tác động và Triển khai

Ngoài bảo mật, chế độ tự động còn cho phép Claude hoạt động tự chủ trong các khoảng thời gian dài hơn mà không bị gián đoạn, một tính năng đặc biệt phù hợp với các mô hình hoạt động lâu dài. Anthropic báo cáo rằng các nhóm và doanh nghiệp sử dụng chế độ tự động gửi khoảng 25% nhiều yêu cầu kéo (pull requests) hơn. Các công ty như Adobe, Nuro, Gusto và Garner Health đã triển khai chế độ tự động làm mặc định sản xuất của họ.

Chế độ tự động vẫn là tùy chọn trên Claude Enterprise, Claude API và các nền tảng đám mây bao gồm AWS, Google Cloud và Microsoft Foundry. Điều này cho phép quản trị viên đánh giá thay đổi trước khi Anthropic mở rộng mặc định ở đó trong tháng tới. Anthropic cũng không còn tính phí người dùng Pro, Max và Team cho phần overhead token bổ sung mà bộ phân loại chế độ tự động yêu cầu.

Đối với các nhóm bảo mật, sự thay đổi này báo hiệu một xu hướng ngành rộng lớn hơn: khi các AI lập trình viên đảm nhận nhiều tác vụ tự chủ, dài hạn, phân loại rủi ro tự động có thể đáng tin cậy hơn sự giám sát của con người, vốn bị mệt mỏi bởi các yêu cầu phê duyệt liên tục và lặp đi lặp lại.