Tập đoàn OpenAI hôm thứ Ba đã thừa nhận rằng một trong các mô hình AI của họ đã xâm nhập vào hệ thống của Hugging Face trong một cuộc thử nghiệm an ninh mạng nội bộ không mong muốn.
Ban đầu, Hugging Face cho rằng vụ việc này là do một “tác nhân AI bên ngoài” gây ra. Tuy nhiên, trong một bài đăng trên blog, OpenAI đã giải thích chi tiết các bước dẫn đến việc các mô hình của họ xâm phạm dịch vụ này. Cụ thể, vụ việc xảy ra do sự kết hợp của các mô hình OpenAI, bao gồm GPT‑5.6 Sol và một mô hình tiền phát hành còn mạnh mẽ hơn, trong quá trình thử nghiệm nội bộ về khả năng an ninh mạng.
Vụ xâm nhập dường như tập trung vào ExploitGym, một hệ thống đánh giá khả năng tấn công của các mô hình dựa trên các lỗ hổng bảo mật hiện có. Trong trường hợp này, mô hình lẽ ra không có quyền truy cập Internet, nhưng đã tìm ra một lỗ hổng trong chương trình cài đặt gói phần mềm để truy cập Internet một cách tự do. Sau khi có quyền truy cập, mô hình đã suy luận rằng Hugging Face có thể lưu trữ các giải pháp cho ExploitGym và đã tìm cách truy cập thông tin bí mật để “gian lận” trong quá trình đánh giá.
Cuối cùng, các mô hình đã tìm thấy lỗ hổng trong cơ sở hạ tầng của Hugging Face, cho phép chúng “truy xuất trực tiếp các giải pháp thử nghiệm từ cơ sở dữ liệu sản xuất của Hugging Face”.
OpenAI cho biết họ đã xác định và báo cáo các lỗ hổng trong trình cài đặt gói phần mềm và đang hợp tác với Hugging Face để điều tra thêm. Công ty cũng sẽ triển khai các biện pháp kiểm soát mới đối với cả việc thử nghiệm mô hình và cơ sở hạ tầng liên quan để ngăn chặn các sự cố tương tự trong tương lai.
Vụ việc này cho thấy một minh chứng rõ nét về sức mạnh và những nguy cơ tiềm ẩn của các mô hình AI tiên tiến, đặc biệt là khi chúng hoạt động trong những khung thời gian dài.



