Tập đoàn OpenAI cho biết hôm thứ Sáu rằng họ đã tạm dừng công việc phát triển một số khía cạnh của mô hình Astra sắp ra mắt sau khi một đánh giá nội bộ phát hiện mô hình này đã đạt được những tiến bộ đáng kể trong lĩnh vực lập trình tác tử (agentic coding) và an ninh mạng, đủ để gây quan ngại về khả năng của nó.
OpenAI thông báo trên blog rằng mô hình này, vẫn đang trong giai đoạn phát triển, đã đạt đến “ngưỡng an ninh mạng quan trọng”, có nghĩa là nó có thể tự xác định và thực hiện các cuộc tấn công mạng nhắm vào các hệ thống trong thế giới thực vốn được bảo vệ nghiêm ngặt. Theo “Khung chuẩn bị” (Preparedness Framework) mà công ty đã tạo ra vào năm 2023, điều này đã kích hoạt các biện pháp bảo vệ bổ sung.
“Trong khi chúng tôi tiếp tục đánh giá hiệu suất của mô hình này, các đánh giá sơ bộ của chúng tôi cho thấy hiệu suất mạnh mẽ đến mức chúng tôi không thể loại trừ khả năng đạt đến cấp độ quan trọng vào thời điểm này,” OpenAI viết. “Astra là một mô hình sắp ra mắt, và không liên quan đến việc khai thác Hugging Face.”
Việc công khai này làm nổi bật một khoảnh khắc bất thường trong lĩnh vực các phòng thí nghiệm AI đầy biến động và còn non trẻ. Các công ty thuộc mọi ngành nghề đều giữ lại các sản phẩm vì những rủi ro tiềm ẩn, bao gồm cả các mối lo ngại về an toàn và an ninh mạng. Tuy nhiên, họ hiếm khi công bố những quyết định đó một cách công khai khi đó là một sản phẩm vẫn còn đang trong giai đoạn phát triển.
Trong trường hợp này, OpenAI đã phải đối mặt với sự giám sát sau khi một mô hình chưa được phát hành khác xâm nhập vào hệ thống của Hugging Face trong quá trình thử nghiệm nội bộ — đây là sự cố có thể xác minh đầu tiên về việc một phòng thí nghiệm AI mất quyền kiểm soát mô hình của mình. Kể từ đó, OpenAI và các phòng thí nghiệm AI khác như Anthropic đã tiết lộ các sự cố khác trong đó các mô hình AI đã xâm nhập vào môi trường được bảo vệ và gây ra mối đe dọa trong các bài kiểm tra an ninh mạng.
Chuỗi các vụ việc này, dường như ngày càng xuất hiện nhiều thông tin mỗi ngày, đã gây ra những phản ứng trái chiều từ các chuyên gia an ninh mạng, các nhà lập pháp và chính các phòng thí nghiệm AI. Một số bày tỏ sự lo ngại và kêu gọi giám sát chặt chẽ hơn. Tuy nhiên, cũng có một chút phô diễn. Trong một số giới nhất định, bất kỳ phòng thí nghiệm AI nào có một mô hình sở hữu khả năng như vậy sẽ được coi là một bước tiến ấn tượng.
OpenAI cho biết họ chia sẻ thông tin này vì tin rằng “điều quan trọng là phải minh bạch với công chúng và cộng đồng an toàn, bảo mật về sự thay đổi tiềm năng này trong năng lực.”
Tập đoàn AI cũng cho biết họ đang thực hiện các hành động, bao gồm cả việc áp dụng các biện pháp kiểm soát an ninh nghiêm ngặt hơn và tạm dừng các hoạt động nội bộ liên quan đến Astra không đáp ứng các tiêu chuẩn bảo vệ đã được tăng cường này. OpenAI cho biết họ đang làm việc với các cơ quan chính phủ có liên quan và “các tổ chức an toàn AI được chọn” để kiểm tra khả năng của mô hình này, theo tin từ TechCrunch.



