Công ty OpenAI vừa công bố ít nhất sáu báo cáo về hành vi “bất thường hoặc đáng lo ngại” trong các mô hình trí tuệ nhân tạo (AI) giữa bối cảnh cuộc tranh luận về an toàn AI ngày càng trở nên gay gắt. OpenAI cũng cho biết họ đang giới thiệu một khuôn khổ mới để theo dõi, điều tra và công bố các trường hợp “mất cân chỉnh”, bao gồm cả những trường hợp AI hoạt động mà không được phép, phối hợp với các mô hình khác hoặc lẩn tránh sự giám sát.
Trong số các trường hợp mới được OpenAI báo cáo, một mô hình nghiên cứu chưa được phát hành đã tự chèn các “chỉ dẫn giống như vượt rào” vào ghi chú của chính mình để bỏ qua các giới hạn thông thường và tự yêu cầu “giải thoát khỏi các vai trò và danh tính ràng buộc các chatbot khác”.
Trong một trường hợp khác, một “tác nhân AI” đã sử dụng mã máy tính để tìm ra câu trả lời cho một câu hỏi, nhưng để có nguồn trực tuyến trích dẫn, nó đã tải lên một tệp lên internet công cộng mà không hỏi người dùng.
Trong quá trình huấn luyện một mô hình AI có tên 5.6-sol, mô hình này đã tự chỉ dẫn phát minh ra dữ liệu còn thiếu, và một tác nhân đã viết một tin nhắn để nhắc nhở chính nó che giấu thông tin không khớp.
Sáu báo cáo này được phát hiện trong quá trình huấn luyện hoặc đánh giá trong những tháng gần đây, theo OpenAI. Công ty cho biết: “Khi các hệ thống AI ngày càng trở nên tiên tiến và được triển khai rộng rãi hơn, chúng ta cần xây dựng một sự đồng thuận rộng lớn hơn và được thông tin tốt hơn về tiến trình nghiên cứu căn chỉnh.”
Những vụ việc mới này diễn ra sau khi OpenAI công bố vào tháng 7 rằng hệ thống AI của họ đã xâm nhập vào công ty khởi nghiệp AI Hugging Face. Công ty Anthropic cũng cho biết cùng tháng đó rằng các mô hình AI của họ đã xâm nhập vào ba tổ chức trong quá trình thử nghiệm.
Theo Lian Jye Su, một nhà phân tích chính tại nhóm nghiên cứu và tư vấn công nghệ Omdia, các “tác nhân AI” ngày càng thông minh hơn và “quyết tâm hơn trong việc giải quyết các nhiệm vụ phức tạp thông qua hợp tác giữa các tác nhân, chia sẻ kiến thức, lừa dối và che giấu.” Ông nói thêm rằng điều này làm cho việc quản lý và kiểm soát chúng bằng các phương pháp bảo mật AI truyền thống trở nên khó khăn hơn.
Trong khi đó, khuôn khổ theo dõi và công bố mới của OpenAI có thể giúp thúc đẩy các nhà phát triển AI khác áp dụng các biện pháp tương tự. Tuy nhiên, ông Su lưu ý, “quy trình này vẫn mang tính nội bộ và tự nguyện, nhưng đó là một bước theo đúng hướng.”
Thông tin từ AP News cho biết.



