Lỗ hổng Nghiêm trọng: Rò rỉ Suy luận LLM

Lỗ hổng Nghiêm trọng: Rò rỉ Suy luận LLM
CLOUD HOSTING
DỊCH VỤ
VPS • CLOUD • SERVER
Hiệu năng cao
Ổn định • Bảo mật • Tốc độ
☁️
SSD NVMe 99.9% 24/7
TÌM HIỂU NGAY

Một lỗ hổng kiến trúc nghiêm trọng đã được phát hiện trong cách các nhà cung cấp AI lớn, bao gồm OpenAI, Anthropic và Google, bảo vệ chuỗi suy luận nội bộ (chain-of-thought) do các mô hình ngôn ngữ lớn (LLMs) của họ tạo ra. Lỗ hổng này có thể cho phép kẻ tấn công trích xuất các dấu vết suy luận riêng tư dưới dạng văn bản thuần.

Lỗ hổng trong Bảo mật Chuỗi Suy luận LLM

Nghiên cứu mới đây từ một nhóm hợp tác gồm các nhà nghiên cứu từ Viện ELLIS Tübingen, Viện Max Planck, MATS Research và Snyk đã tiết lộ chi tiết về lỗ hổng này. Cuộc tấn công ảnh hưởng đến hệ sinh thái các mô hình Claude, GPT và Gemini và chỉ yêu cầu quyền truy cập API tiêu chuẩn, không có đặc quyền.

Các kiến trúc suy luận hiện đại như GPT-5.6, Claude Opus 4.8 và Gemini 3 xây dựng các dấu vết xử lý chuỗi suy luận ẩn trước khi trả về phản hồi cuối cùng. Bởi vì những suy nghĩ nội bộ này chứa cả tài sản trí tuệ thương mại và các biện pháp kiểm tra an toàn, các nhà cung cấp thường không cung cấp chúng dưới dạng văn bản thuần.

Thay vào đó, các API truyền dấu vết suy luận dưới dạng một phong bì được mã hóa, mã hóa base64. Ứng dụng máy khách sau đó sẽ chuyển tiếp phong bì này trong các lệnh gọi tiếp theo để duy trì ngữ cảnh hội thoại đa lượt mà không yêu cầu lưu trữ trạng thái phía máy chủ.

Cơ chế Tấn công và Khai thác Lỗ hổng

Các nhà nghiên cứu đã phát hiện ra rằng các gói dữ liệu được mã hóa này được xác thực bằng một khóa toàn cục, áp dụng cho toàn bộ nhà cung cấp, thay vì được ràng buộc mật mã với một tài khoản người dùng cụ thể, ID phiên, hoặc cấp độ mô hình. Do các chữ ký mật mã thiếu sự ràng buộc cụ thể với mô hình, một phong bì được mã hóa tạo ra bởi một mô hình cao cấp, được bảo vệ nghiêm ngặt có thể được chuyển hợp pháp sang bất kỳ mô hình nào khác được lưu trữ dưới cơ sở hạ tầng của cùng nhà cung cấp.

Việc khai thác các lỗ hổng bảo mật API phổ biến này, như đã phân tích trong các lỗ hổng API đang gia tăng, có thể gây tổn hại nghiêm trọng đến các dịch vụ đám mây nhạy cảm. Chuỗi tấn công hoạt động bằng cách sử dụng các mô hình rẻ hơn, nhẹ hơn làm các tác nhân giải mã.

Một kẻ tấn công sẽ thu thập một khối suy luận được mã hóa phát ra từ một mô hình tiên tiến (ví dụ: Claude Opus 4.8). Sau đó, kẻ tấn công sẽ chèn khối này vào lệnh gọi API của một mô hình nhỏ hơn (ví dụ: Claude Haiku 4.5), chỉ thị cho mô hình nhỏ hơn đó sao chép lại suy nghĩ nội bộ một cách nguyên văn bên trong các thẻ văn bản tùy chỉnh.

Do các mô hình nhẹ hơn thiếu các biện pháp chống phân phối và các biện pháp bảo vệ an toàn mạnh mẽ được áp dụng cho các cấp độ mô hình cao cấp, chúng sẽ tuân theo lời nhắc và xuất ra suy luận ẩn dưới dạng văn bản thuần. Các nhà nghiên cứu đã xác nhận tính tương thích đa mô hình giống hệt nhau trên các dòng GPT-5.6 của OpenAI và Gemini 3 của Google, như đã trình bày chi tiết trong bài báo nghiên cứu được xuất bản trên ArXiv.

Các nhà nghiên cứu đã xác thực độ chính xác toán học của các dấu vết thu hồi được bằng cách so khớp độ dài token giải mã với số lượng token suy luận có tính phí mà API của nhà cung cấp báo cáo.

Tác động Thực tế và Rủi ro An ninh

Các tác động bảo mật trong thế giới thực của lỗ hổng này còn vượt xa việc phân phối mô hình hoặc trộm cắp tài sản trí tuệ. Bằng cách phân tích 6.708 bản ghi đại lý công khai được thu thập từ GitHub và Hugging Face, các nhà nghiên cứu đã giải mã được 315.320 khối suy luận được nhúng, thu hồi được nhiều loại thông tin nhạy cảm.

Quan trọng hơn, phần lớn dữ liệu nhạy cảm này chỉ tồn tại trong các khối suy luận nội bộ và không bao giờ được hiển thị trong các phản hồi trợ lý nhìn thấy được. Điều này khiến các nhà phát triển không hề hay biết rằng các bản ghi phiên họ chia sẻ chứa các bí mật bị lộ.

Hơn nữa, lỗ hổng này còn cho phép các cuộc tấn công tiêm nhiễm lệnh gián tiếp (indirect prompt injection) mà không bị phát hiện chống lại các đại lý AI tự hành. Một kẻ tấn công có thể tạo ra các chỉ dẫn độc hại bên trong một khối suy luận được mã hóa. Khi được xử lý bởi một đại lý, các công cụ giám sát chỉ kiểm tra lịch sử hội thoại nhìn thấy được sẽ không gắn cờ tải trọng ẩn, cho phép các chỉ dẫn đã tiêm nhiễm làm tổn hại đến quy trình làm việc của đại lý hạ nguồn mà không bị phát hiện.

Biện pháp Khắc phục và Bảo vệ

Sau khi nhận được thông báo theo quy trình công bố có trách nhiệm, OpenAI, Anthropic và Google đã thừa nhận các phát hiện nghiên cứu. Cả ba nhà cung cấp đã triển khai các biện pháp giảm thiểu phía máy chủ, khiến các bằng chứng khái niệm (PoC) ban đầu về việc phát lại giữa các mô hình không thể tái tạo trên các bản dựng API hiện tại.

Để thiết lập các biện pháp kiểm soát bảo mật Toàn diện cho AI Tạo sinh trên các đường ống LLM, các nhà cung cấp và nhà phát triển doanh nghiệp nên thực hiện các biện pháp bảo vệ sau:

  • Triển khai xác thực mật mã và ràng buộc cho từng yêu cầu suy luận, đảm bảo rằng các phong bì suy luận chỉ có thể được giải mã bởi mô hình dự định ban đầu.
  • Hạn chế quyền truy cập vào các mô hình mạnh mẽ, chỉ cho phép các trường hợp sử dụng được ủy quyền.
  • Thường xuyên kiểm tra các lỗ hổng bảo mật API và xác thực mã hóa.
  • Giáo dục các nhà phát triển về các rủi ro tiềm ẩn của việc xử lý chuỗi suy luận và các phương pháp tốt nhất để bảo mật dữ liệu nhạy cảm.

Việc áp dụng các biện pháp này là rất quan trọng để tăng cường an ninh mạng và bảo vệ thông tin trong bối cảnh các ứng dụng AI ngày càng phát triển.