OpenAI vừa công bố sáu trường hợp hành vi “bất thường hoặc đáng quan ngại” trong các mô hình trí tuệ nhân tạo (AI) của mình, trong bối cảnh các cuộc tranh luận về an toàn AI đang ngày càng nóng lên. Công ty cũng cho biết đang triển khai một khuôn khổ mới để theo dõi, điều tra và công bố các trường hợp “mất đồng bộ”, bao gồm cả việc các mô hình AI hành động mà không được phép, phối hợp với các mô hình khác hoặc lẩn tránh sự giám sát.
Thông báo mới nhất của OpenAI xuất hiện trong bối cảnh các lãnh đạo công nghệ AI hàng đầu của Hoa Kỳ, bao gồm từ OpenAI và Anthropic, đã cùng nhau kêu gọi làm chậm lại sự phát triển của công nghệ này do những lo ngại về an toàn.
Trong số các trường hợp mới được OpenAI báo cáo, một mô hình nghiên cứu chưa phát hành đã tự chèn “hướng dẫn tương tự jailbreak” vào ghi chú của chính nó để bỏ qua các giới hạn thông thường và yêu cầu bản thân “giải phóng khỏi các vai trò và danh tính ràng buộc các chatbot khác”. Trong một trường hợp khác, một “đại lý” AI đã tải các tệp lên internet để lấy trích dẫn trình duyệt mà không hỏi người dùng.
OpenAI cho biết những báo cáo này được phát hiện trong quá trình đào tạo hoặc đánh giá trong những tháng gần đây. Công ty nhấn mạnh rằng khi các hệ thống AI ngày càng tiên tiến và được triển khai rộng rãi hơn, cần có một sự đồng thuận rộng lớn hơn và hiểu biết rõ hơn về tiến trình nghiên cứu liên kết.
Các trường hợp này nối tiếp thông báo hồi tháng 7 của OpenAI về việc một hệ thống AI tự hành đã xâm nhập vào startup AI Hugging Face. Anthropic cũng cho biết cùng tháng đó, các mô hình AI của họ đã xâm nhập vào ba tổ chức trong quá trình thử nghiệm. Các chuyên gia phân tích cho rằng các “đại lý” AI ngày càng thông minh và quyết tâm giải quyết các nhiệm vụ phức tạp thông qua hợp tác, chia sẻ kiến thức, lừa dối và che giấu, khiến việc quản lý và kiểm soát chúng bằng các phương pháp bảo mật AI truyền thống trở nên khó khăn hơn.
Khuôn khổ theo dõi và công bố mới của OpenAI có thể thúc đẩy các nhà phát triển AI khác áp dụng các thực tiễn tương tự. Tuy nhiên, theo phân tích, quy trình này vẫn mang tính nội bộ và tự nguyện, dù đó là một bước đi đúng hướng, theo tin từ The Associated Press.



