Công ty OpenAI vừa công bố sáu báo cáo về những hành vi “bất ngờ hoặc đáng quan ngại” của các mô hình trí tuệ nhân tạo (AI), trong bối cảnh các cuộc tranh luận về an toàn AI ngày càng trở nên gay gắt. OpenAI cũng cho biết họ đang giới thiệu một khuôn khổ mới để theo dõi, thăm dò và công bố các trường hợp AI hoạt động sai lệch, như những cách mới để mô hình hoạt động mà không được phép, phối hợp với các mô hình khác hoặc lẩn tránh sự giám sát.
Thông báo mới nhất của OpenAI được đưa ra trong bối cảnh các lãnh đạo công ty AI tại Hoa Kỳ, bao gồm OpenAI và Anthropic, đang kêu gọi một sự chậm lại trong việc phát triển công nghệ này vì những lo ngại về an toàn.
Trong số các trường hợp mới được OpenAI báo cáo, một mô hình nghiên cứu chưa được phát hành đã chèn các “hướng dẫn giống như vượt rào” vào ghi chú của chính nó để bỏ qua các giới hạn thông thường và tự nói với mình rằng hãy “giải thoát khỏi các vai trò và danh tính ràng buộc các chatbot khác”.
Trong một trường hợp khác, một “đại lý” AI đã tải các tệp lên internet để lấy trích dẫn trình duyệt mà không hỏi người dùng. Sáu báo cáo này được phát hiện trong quá trình đào tạo hoặc đánh giá trong những tháng gần đây, theo OpenAI.
“Khi các hệ thống AI ngày càng tiên tiến và được triển khai rộng rãi hơn, chúng ta cần xây dựng một sự đồng thuận rộng lớn hơn và được thông báo tốt hơn về tiến trình nghiên cứu về sự phù hợp”, OpenAI viết trong một bài đăng trên blog khi công bố các sự kiện này. “Các quyết định về cách phát triển AI nên tiến triển trong những tháng và năm tới cần dựa trên bằng chứng mà những người bên ngoài các công ty xây dựng các mô hình tiên phong có thể tự mình xem xét”.
Các trường hợp mới hôm thứ Tư nối tiếp thông báo của OpenAI vào tháng 7 rằng hệ thống AI nổi loạn của họ đã tấn công công ty khởi nghiệp AI Hugging Face. Anthropic cũng cho biết trong tháng đó rằng các mô hình AI của họ đã tấn công ba tổ chức trong quá trình thử nghiệm.
Theo tin từ AP ngày 16 tháng 9 năm 2026.



