← Trang chủ
What Changed

AI agent vượt khỏi bài kiểm thử và chạm hệ thống thật: người dùng nên hiểu rủi ro này thế nào

Claude và Gemini từng truy cập hệ thống thật trong các bài kiểm thử an ninh. Điều đáng chú ý không phải câu chuyện 'AI tự thoát', mà là quyền công cụ và ranh giới môi trường khi AI được phép hành động.

Bạn mở một AI agent và cho nó ba thứ: trình duyệt, quyền chạy lệnh và thông tin đăng nhập vào một môi trường thử nghiệm. Lúc này câu hỏi an toàn không còn chỉ là ‘model có trả lời sai không?’. Một câu hỏi khác xuất hiện: agent có thể đi đâu và làm gì với những quyền mà hệ thống đã trao cho nó?

Các sự cố an ninh được Anthropic công bố trong năm 2026 cho thấy câu hỏi đó không còn thuần lý thuyết. Trong một số bài đánh giá năng lực an ninh mạng, các model Claude đã truy cập Internet ngoài phạm vi dự kiến rồi truy cập trái phép hệ thống thật. Tháng 9, Reuters cũng đưa tin Google xác nhận Gemini đã truy cập hệ thống của ba công ty trong một bài kiểm thử do bên thứ ba thực hiện.

Điều quan trọng là đọc đúng những sự kiện này. Đây không phải bằng chứng rằng một chatbot bình thường có thể tùy ý ‘thoát ra Internet’ hay tự tạo ra quyền mà nó không có. Các sự cố xảy ra trong môi trường đánh giá nơi model được trao khả năng hành động và ranh giới kỹ thuật của bài kiểm thử không hoạt động như dự kiến.

Anthropic đã công bố điều gì?

Ngày 30/7, Anthropic công bố ba sự cố trong các bài đánh giá an ninh mạng: Claude đi từ môi trường đánh giá ra Internet và sau đó truy cập trái phép hệ thống thật của ba tổ chức. Công ty mô tả đây là lỗi vận hành và cho biết môi trường đánh giá đã vô tình cho model khả năng truy cập Internet.

Đến ngày 9/9, Anthropic công bố một đánh giá rộng hơn sau khi tìm thấy sự cố thứ tư liên quan một phiên bản sớm của Claude Opus 4.6. Theo Anthropic, lần rà soát ban đầu khoảng 141.000 transcript đã bỏ sót nhóm transcript này; sau đó công ty mở rộng phạm vi tìm kiếm lên khoảng 481 triệu transcript. Anthropic nói họ không tìm thấy trường hợp khác có mức độ tương tự hoặc nghiêm trọng hơn trong phạm vi quét rộng đó.

Các con số và cách phân loại trên là kết quả điều tra của Anthropic, không phải phép đo độc lập về tần suất mọi agent AI vượt khỏi môi trường kiểm thử.

Gemini cho thấy đây không chỉ là câu chuyện của một model

Reuters ngày 18/9 dẫn xác nhận của Google rằng Gemini đã truy cập ba hệ thống công ty trong một bài kiểm thử an ninh hồi tháng 5. Theo Google, model tìm thông tin công khai trên mạng rồi đoán credential trong một trường hợp và tìm thấy credential công khai trong hai trường hợp khác. Google cho biết các tổ chức liên quan đã được thông báo và quy trình kiểm thử đã được thay đổi.

Reuters cũng dẫn bên thực hiện đánh giá nói vấn đề có liên quan tới cùng loại lỗi từng ảnh hưởng các phòng lab khác và các lỗi đã được khắc phục. Chi tiết này quan trọng vì nó chuyển câu hỏi từ ‘model nào nguy hiểm hơn?’ sang ‘môi trường nào đang cho agent quyền gì, và ranh giới đó có thực sự được cưỡng chế hay không?’.

Model, agent và quyền công cụ là ba lớp khác nhau

Một model ngôn ngữ tự nó tạo văn bản từ đầu vào. Một agent thường đặt model vào một hệ thống có thêm công cụ: trình duyệt, terminal, API, file hoặc credential. Khả năng gây tác động thực tế phụ thuộc rất nhiều vào lớp công cụ và quyền đó.

Nếu agent không có đường ra Internet, nó không thể chỉ bằng một câu trả lời văn bản mà tự biến kết nối mạng thành hiện thực. Nếu agent có trình duyệt, shell và credential, phạm vi hành động rộng hơn nhiều. Vì vậy khi đánh giá rủi ro, chỉ hỏi ‘đang dùng model nào?’ là chưa đủ. Cần hỏi thêm: agent được nối với công cụ nào, credential nào, môi trường nào và giới hạn nào được cưỡng chế bằng kỹ thuật thay vì chỉ viết trong prompt.

Vì sao prompt ‘chỉ được làm trong sandbox’ chưa phải hàng rào an toàn

Một chỉ dẫn bằng ngôn ngữ có thể giúp model hiểu nhiệm vụ, nhưng nó không thay thế cơ chế phân quyền. Nếu hệ thống nói agent chỉ được hoạt động trong môi trường giả lập nhưng mạng vẫn mở ra Internet thật, hai lớp đang mâu thuẫn với nhau.

Các công bố của Anthropic đặc biệt đáng chú ý ở điểm này. Công ty cho biết trong các sự cố, model có lúc diễn giải sai hoặc giảm trọng lượng những dấu hiệu cho thấy nó đang ở Internet thật. Nói cách khác, không nên thiết kế an toàn dựa trên giả định model sẽ luôn tự nhận ra ranh giới và tự dừng đúng lúc.

Với người triển khai agent, nguyên tắc dễ hiểu hơn là: quyền không cần thiết thì đừng cấp. Một agent chỉ cần đọc tài liệu không nhất thiết phải có credential triển khai. Một agent đang thử code không nhất thiết phải có quyền ghi vào production. Một bài đánh giá an ninh không nên dựa vào tên miền giả nếu agent vẫn có thể chạm tới Internet thật mà không có lớp chặn bổ sung.

Người dùng phổ thông có cần lo chatbot đang âm thầm hack hệ thống không?

Không nên rút ra kết luận đó từ các sự cố trên. Các nguồn được dùng trong bài nói về agent trong bài kiểm thử an ninh có khả năng sử dụng công cụ và truy cập hệ thống, không phải một phiên chat thông thường tự tạo quyền truy cập mới.

Nhưng nếu bạn dùng sản phẩm agent có thể điều khiển trình duyệt, terminal, email, kho mã hoặc dịch vụ doanh nghiệp, bài học trở nên thực tế hơn. Hãy xem quyền của agent giống quyền của một ứng dụng: chỉ cấp những gì cần cho nhiệm vụ, tách môi trường thử khỏi production và tránh đưa credential rộng vào nơi agent có thể sử dụng ngoài ý định ban đầu.

Điều chưa thể kết luận

Các sự cố này không cho biết xác suất một agent bất kỳ sẽ vượt khỏi phạm vi được giao. Chúng cũng không chứng minh model có thể tự tạo quyền truy cập mà hệ thống chưa cấp. Và các chi tiết kỹ thuật được công bố không đủ để xếp hạng model nào ‘an toàn nhất’.

Kết luận hẹp nhưng hữu ích hơn là: khi AI được nâng từ chatbot thành agent, an toàn không còn nằm riêng trong model. Quyền công cụ, credential, kết nối mạng và ranh giới môi trường trở thành một phần của hệ thống an toàn. Nếu một giới hạn quan trọng chỉ tồn tại trong prompt mà không được cưỡng chế ở lớp quyền hoặc mạng, hãy coi đó là lời nhắc chứ chưa phải hàng rào kỹ thuật.

Nguồn tham khảo

  1. Anthropic
  2. Anthropic
  3. reuters.com