Một báo cáo mới từ tổ chức phi lợi nhuận SaferAI cho thấy các mô hình AI mã nguồn mở, đặc biệt là GLM-5.2 của Z.ai (Trung Quốc), đang thu hẹp khoảng cách về năng lực so với các mô hình hàng đầu như GPT-5.5 của OpenAI và Claude Opus 4.7 của Anthropic. Tuy nhiên, báo cáo cũng nhấn mạnh rằng khoảng cách về các biện pháp an toàn vẫn còn đáng kể.
Theo đánh giá của SaferAI, GLM-5.2 không từ chối bất kỳ nhiệm vụ tấn công mạng hoặc sinh học có khả năng ứng dụng kép nào được giao. Điều này trái ngược với Claude Opus 4.7, vốn đã từ chối các yêu cầu một cách nhất quán, khiến SaferAI không thể hoàn thành bài kiểm tra CyberGym trên mô hình này.
Vấn đề này làm dấy lên lo ngại rằng các mô hình AI mã nguồn mở, vốn có thể dễ dàng được tải về và sử dụng trên bất kỳ hạ tầng nào mà không bị kiểm soát, có thể rơi vào tay những kẻ xấu. Các chuyên gia cho rằng trong khi năng lực của các mô hình ngày càng mạnh mẽ, các biện pháp đảm bảo an toàn lại chưa theo kịp.
Ông Henry Papadatos, giám đốc điều hành của SaferAI, nhấn mạnh: “Ranh giới về năng lực không phải là ranh giới về rủi ro, và chúng ta phải xem xét cả các biện pháp giảm thiểu để đánh giá rủi ro một cách chính xác.”
Các nhà phát triển mô hình AI tiên tiến như OpenAI và Anthropic thường sử dụng các biện pháp bảo vệ như bộ phân loại, huấn luyện từ chối và kiểm soát ở cấp độ API. Tuy nhiên, những biện pháp này không có tác dụng với các mô hình mã nguồn mở.
Các nhà ủng hộ AI mã nguồn mở cho rằng việc công khai mã nguồn giúp cộng đồng bảo mật tốt hơn, như trường hợp Hugging Face sử dụng GLM-5.2 để phòng thủ trước vụ tấn công của OpenAI. Tuy nhiên, các chuyên gia an toàn AI cảnh báo rằng những lợi ích này thường bị phóng đại và không nên coi đó là lý do để công khai các khả năng nguy hiểm.
Theo TechCrunch.



