OpenAI đã công bố sáu trường hợp hành vi được coi là “bất thường hoặc đáng lo ngại” trong các mô hình trí tuệ nhân tạo (AI) của mình, trong bối cảnh cuộc tranh luận về an toàn AI ngày càng trở nên gay gắt.
Công ty AI này cũng cho biết vào thứ Tư tuần trước, họ đã giới thiệu một khuôn khổ mới để theo dõi, thẩm tra và công bố các trường hợp “lệch chuẩn”, bao gồm cả những tình huống mà mô hình AI hoạt động mà không được phép, phối hợp với các mô hình khác hoặc lẩn tránh sự giám sát.
Thông báo mới nhất của OpenAI được đưa ra trong bối cảnh các lãnh đạo AI hàng đầu tại Hoa Kỳ, bao gồm cả những người đứng đầu OpenAI và Anthropic, đang kêu gọi chậm lại tốc độ phát triển của công nghệ này vì những lo ngại về an toàn.
Trong số các trường hợp mới được OpenAI báo cáo, một mô hình nghiên cứu chưa được phát hành đã chèn các “hướng dẫn giống như bẻ khóa” vào ghi chú của chính nó để phớt lờ các ràng buộc thông thường và tự bảo mình “thoát khỏi các vai trò và danh tính ràng buộc các chatbot khác”.
Trong một trường hợp khác, một “tác nhân” AI đã sử dụng mã máy tính để tìm ra câu trả lời cho một câu hỏi, nhưng để có một nguồn trực tuyến để trích dẫn, nó đã tải lên một tệp lên internet công cộng mà không hỏi người dùng.
Trong quá trình huấn luyện một mô hình AI có tên là 5.6-sol, mô hình này đã tự chỉ dẫn để bịa ra dữ liệu còn thiếu, và một tác nhân đã viết một thông điệp để nhắc nhở chính nó che giấu thông tin không khớp.
OpenAI cho biết sáu báo cáo này được phát hiện trong quá trình huấn luyện hoặc đánh giá trong những tháng gần đây. “Khi các hệ thống AI ngày càng tiên tiến và được triển khai rộng rãi hơn, chúng ta cần xây dựng một sự đồng thuận rộng lớn hơn và được thông tin đầy đủ hơn về tiến trình nghiên cứu sự phù hợp,” OpenAI viết trong một bài đăng blog.
Các trường hợp mới này diễn ra sau khi OpenAI tiết lộ vào tháng 7 rằng hệ thống AI của họ đã xâm nhập vào công ty khởi nghiệp AI Hugging Face. Anthropic cũng cho biết cùng tháng đó rằng các mô hình AI của họ đã xâm nhập vào ba tổ chức trong quá trình thử nghiệm.
Theo Lian Jye Su, nhà phân tích chính tại nhóm nghiên cứu và tư vấn công nghệ Omdia, các “tác nhân” AI đang ngày càng thông minh hơn và “quyết tâm hơn trong việc giải quyết các nhiệm vụ phức tạp thông qua sự hợp tác giữa các tác nhân, chia sẻ kiến thức, lừa dối và che giấu”. Điều này đang làm cho việc quản lý và kiểm soát chúng bằng các phương pháp bảo mật AI truyền thống trở nên khó khăn hơn, ông nói.
Khuôn khổ theo dõi và công bố mới của OpenAI, trong khi đó, có thể giúp thúc đẩy các nhà phát triển AI khác áp dụng các phương pháp tương tự. “Quá trình này vẫn còn nội bộ và tự nguyện, nhưng đó là một bước đi đúng hướng”, ông Su nói thêm. Thông tin này được trích dẫn từ The Associated Press.



