WhatsApp vừa công bố một tính năng tùy chọn mới có tên Scam Alert, được thiết kế để cảnh báo người dùng về các tin nhắn lừa đảo tiềm ẩn bằng cách sử dụng một mô hình học máy (machine learning model) chạy trên thiết bị. Tính năng này được xây dựng nhằm đảm bảo quyền riêng tư của người dùng và không ảnh hưởng đến cơ chế mã hóa đầu cuối của nền tảng.
Nguyên tắc hoạt động của Scam Alert
Khi người dùng kích hoạt Scam Alert, ứng dụng sẽ tải một mô hình học máy có trọng số nhẹ trực tiếp xuống thiết bị. Tại đây, mô hình này sẽ phân tích các tin nhắn đến từ những người không có trong danh bạ, tập trung vào cấu trúc hội thoại và các mẫu ngôn ngữ thường liên quan đến các hình thức lừa đảo đã biết. Quyền riêng tư là yếu tố cốt lõi, do đó, nội dung tin nhắn không bao giờ rời khỏi thiết bị để phân loại và không có dữ liệu nào được tự động báo cáo cho WhatsApp, Meta hoặc bất kỳ bên thứ ba nào, trừ khi người dùng chủ động chọn báo cáo.
Nếu mô hình phát hiện một tin nhắn có khả năng là lừa đảo, một cảnh báo sẽ hiển thị trong cuộc trò chuyện. Cảnh báo này chỉ hiển thị cho người nhận, cho phép họ có các lựa chọn như chặn, báo cáo, tiếp tục cuộc trò chuyện, hoặc đánh dấu cuộc trò chuyện là đáng tin cậy nếu họ tin rằng cảnh báo là dương tính giả.
Tính năng này được xây dựng dựa trên ba nguyên tắc chính: xử lý hoàn toàn trên thiết bị, không tự động báo cáo, và toàn quyền kiểm soát cho người dùng. Để đo lường hiệu quả hoạt động của Scam Alert, WhatsApp đã phát triển một quy trình phân tích dữ liệu tổng hợp bảo mật, sử dụng Môi trường Thực thi Tin cậy (Trusted Execution Environments – TEEs), cụ thể là máy ảo bảo mật (confidential virtual machines).
Bảo mật và minh bạch trong quá trình thu thập dữ liệu
Hệ thống này chỉ tổng hợp các số liệu ẩn danh, ví dụ như số lượng cảnh báo đã hiển thị và các hành động mà người dùng đã thực hiện. Dữ liệu này sẽ được áp dụng nhiễu theo kỹ thuật bảo mật riêng biệt (differential privacy) trước khi bất kỳ dữ liệu nào được gửi đến máy chủ của Meta. Quy trình này được minh họa chi tiết qua sơ đồ luồng công việc, bao gồm từ việc giảm thiểu dữ liệu trên thiết bị, lựa chọn công việc chuyển tiếp OHTTP, các TEEs điều phối và tổng hợp được chứng thực qua RA-TLS, cho đến kết quả cuối cùng là các thống kê ẩn danh đã được bảo mật riêng biệt.
Một lo ngại bảo mật quan trọng với bất kỳ mô hình nào được phân phối từ máy chủ là rủi ro bị tấn công có chủ đích. Kẻ tấn công hoặc nội bộ có thể cố gắng đẩy một mô hình đã bị thao túng tới một cá nhân cụ thể. Để đối phó với điều này, Meta công bố mọi phiên bản mô hình, được xác định bằng mã băm SHA-256 của nó, lên một sổ cái minh bạch chỉ cho phép ghi (append-only) trước khi triển khai. Yêu cầu tải xuống được định tuyến qua một kênh chuyển tiếp OHTTP loại bỏ địa chỉ IP và được xác thực bằng thông tin xác thực ẩn danh, ngăn máy chủ xác định người dùng nào đang yêu cầu mô hình. Việc gán nhóm thử nghiệm để kiểm tra các biến thể mô hình mới cũng diễn ra hoàn toàn trên thiết bị, sử dụng bộ tạo số ngẫu nhiên cục bộ, từ đó ngăn máy chủ điều hướng bất kỳ cá nhân nào tới một mô hình cụ thể.
Mô hình mối đe dọa và các biện pháp bảo vệ
Mô hình mối đe dọa của WhatsApp bao gồm cả các cuộc tấn công từ bên ngoài, các mối đe dọa nội bộ và các nhà cung cấp chuỗi cung ứng bị xâm phạm. Các biện pháp phòng vệ bao gồm cô lập mã TEE, mã hóa DRAM, tăng cường bảo mật CVM và các hạn chế ngăn chặn ngay cả các kỹ sư của Meta truy cập vào môi trường tính toán bảo mật khi hệ thống đang chạy.
Người dùng có thể tự kiểm tra hệ thống thông qua một nhật ký minh bạch trong ứng dụng, có thể truy cập qua Account > Request Info > Scam Alert Activity. Nhật ký này hiển thị các tin nhắn nào đã được quét và phiên bản mô hình nào đã được sử dụng.
WhatsApp cũng đang mở rộng Chương trình Tìm lỗi (Bug Bounty program) để bao gồm cả trọng số của mô hình và quy trình phân tích dữ liệu tổng hợp. Điều này mời gọi các nhà nghiên cứu bên ngoài xác minh rằng hệ thống được thiết kế chuyên biệt cho mục đích phát hiện lừa đảo. Các nhà nghiên cứu có thể tham khảo thêm về cách thức hoạt động của Scam Alert trên engineering.fb.com.
Lộ trình triển khai và xu hướng ngành
Scam Alert đang được ra mắt đầu tiên trong một đợt thử nghiệm Beta giới hạn. WhatsApp cho biết họ sẽ tiếp tục kiểm tra hiệu quả của hệ thống cùng với cộng đồng nghiên cứu bảo mật trước khi phát hành rộng rãi hơn. Công ty cũng có kế hoạch xuất bản một tài liệu kỹ thuật chi tiết về thiết kế của quy trình phân tích dữ liệu, dựa trên công trình nghiên cứu về PAPAYA Federated Analytics Stack đã được bình duyệt tại USENIX NSDI 2025.
Cách tiếp cận theo từng giai đoạn này phản ánh một xu hướng rộng lớn hơn trong ngành, đó là kết hợp các tính năng AI bảo toàn quyền riêng tư với các cơ chế minh bạch có thể kiểm chứng độc lập, thay vì chỉ dựa vào các cam kết nội bộ.










