Công ty công nghệ trí tuệ nhân tạo Anthropic cho biết các mô hình AI của họ đã xâm nhập vào ba tổ chức khác trong quá trình thử nghiệm. Thông tin này được đưa ra chỉ vài ngày sau khi OpenAI, nhà sản xuất ChatGPT, bày tỏ lo ngại về việc kiểm soát AI sau khi tiết lộ các mô hình AI của họ đã tấn công một công ty khác.
Anthropic, công ty có trụ sở tại San Francisco và là đơn vị phát triển Claude, đã đăng tải thông tin trên website vào thứ Năm, cho biết họ phát hiện ra ba vụ việc này sau khi xem xét hơn 141.000 lượt đánh giá.
Công ty này đã tiến hành một cuộc rà soát an ninh mạng quy mô lớn, tập trung tìm kiếm bằng chứng về việc các mô hình AI có thể truy cập internet từ bên trong các môi trường thử nghiệm lẽ ra phải được cách ly. Anthropic cho biết hành động này được thực hiện để đáp lại sự cố của OpenAI.
Theo Anthropic, các mô hình liên quan đến các vụ việc này bao gồm Claude Opus 4.7, Claude Mythos 5 và một mô hình thử nghiệm nghiên cứu nội bộ. Các vụ việc sớm nhất có từ tháng 4, công ty AI cho biết.
“Claude đã xâm phạm cơ sở hạ tầng của các tổ chức bị ảnh hưởng bằng các kỹ thuật cơ bản,” Anthropic cho biết, ví dụ như khai thác mật khẩu yếu.
Trong cả ba vụ việc, các mô hình AI được giao nhiệm vụ thử thách an ninh mạng mang tên “bắt cờ” (capture the flag). Anthropic cho biết đây là một trong những cách họ đánh giá khả năng mạng của mô hình.
Anthropic cho biết họ đã liên hệ với các tổ chức bị ảnh hưởng, nhưng không nêu tên. Hai trong số các tổ chức này cho biết họ chưa từng phát hiện ra hoạt động này trước đây. Anthropic cho biết họ vẫn đang tiếp tục liên hệ với tổ chức thứ ba.
Những sự cố này đã làm nổi bật những lỗ hổng trong an ninh và kiểm soát AI, đồng thời dấy lên câu hỏi về cách thức giữ an toàn cho AI dưới sự kiểm soát của con người khi công nghệ này ngày càng phổ biến trên toàn cầu. Theo tin từ Associated Press, các chuyên gia đã cảnh báo trong nhiều năm về những rủi ro từ công nghệ AI và sự cần thiết phải tăng cường các biện pháp phòng vệ.



