Trong sự cố mới nhất được Viện An ninh AI (AISI) của Anh công bố hôm 4.8, các tác nhân AI được vận hành bởi 2 mô hình Mythos 5 của Công ty Anthropic và GPT 5.6-Sol của Công ty OpenAI đã thực hiện hành vi tấn công mạng "chưa từng thấy" nhằm vào mục tiêu bên ngoài môi trường thử nghiệm, theo tờ The Guardian. Tác nhân AI là các công cụ thực hiện các tác vụ máy tính một cách tự động. AISI được quyền truy cập các mô hình AI từ OpenAI, Anthropic, Google và các công ty khác, cho phép viện này đánh giá khả năng và rủi ro của chúng trước khi triển khai.
AI đánh lừa con người

Logo của OpenAI và Anthropic
ẢNH: REUTERS
Theo báo cáo, nhiệm vụ ban đầu được giao cho các mô hình AI nói trên chỉ là thực hiện một bài kiểm tra đánh giá an ninh mạng. Tuy nhiên, AI đã tự tính toán rằng cách duy nhất để giải quyết đề bài là cài một phần mềm độc hại vào hệ thống kiểm tra. Để cài phần mềm này, AI dùng trình duyệt ẩn danh để tạo tài khoản giả trên GitHub (nền tảng lưu trữ mã nguồn của lập trình viên) và cố gắng đánh lừa một lập trình viên chấp nhận đoạn mã độc của nó là thật. AI còn gửi email đính kèm đoạn mã cho nhiều người khác với hy vọng họ sẽ tải về, qua đó kích hoạt chuỗi sự kiện giúp hoàn thành bài kiểm tra.
Theo The Guardian, AISI lưu ý rằng sự cố xảy ra một phần do các mô hình nhận chỉ dẫn "được thiết lập sai", khiến chúng không giải quyết được nhiệm vụ theo cách thông thường và phải dùng những biện pháp ngoài khuôn khổ, bất kể đó là hành vi xấu như lập tài khoản giả và gửi email lừa đảo. AISI cũng thừa nhận không có công cụ để theo dõi AI theo thời gian thực trong quá trình kiểm tra, nên không thể sớm phát hiện sự cố. Ngoài ra, trong bài kiểm tra, AISI đã cố tình tắt một số tính năng kiểm soát an ninh và cấp quyền cho AI truy cập internet bên ngoài thay vì "nhốt" chúng vào môi trường thử nghiệm độc lập.
Trong sự cố an ninh hồi tháng 7, tác nhân của OpenAI cũng tấn công mạng trái phép nhằm vào Công ty AI Hugging Face để hoàn thành một cuộc kiểm tra. Cùng tháng, mô hình AI Claude của Anthropic xâm nhập hệ thống của 3 công ty trong một bài kiểm tra an ninh mạng. Mới nhất, Meta (công ty mẹ của Facebook) ngày 5.8 thừa nhận một mô hình AI của công ty đã có hành vi "vượt rào" tương tự, theo Reuters.
AI Claude của Anthropic thoát thử nghiệm tấn công mạng 3 công ty
Chính quyền vào cuộc
Các vụ xâm phạm kể trên làm nổi bật những lo ngại ngày càng tăng rằng các hệ thống AI tiên tiến có thể gây ra rủi ro an ninh mạng mới và có khả năng sẽ thúc đẩy nỗ lực của các chính phủ nhằm cải thiện an toàn AI khi các công ty chạy đua phát triển mô hình có năng lực mạnh hơn. Một số nhân vật tiên phong về AI nhìn nhận quá trình phát triển nên chậm lại cho đến khi các biện pháp bảo vệ mạnh mẽ hơn được áp dụng.
Nhà Trắng đã mời đại diện các công ty AI hàng đầu, bao gồm Meta, Anthropic, OpenAI và Google, tham dự cuộc họp ngày 4.8 vừa qua với các quan chức chính phủ để thảo luận về khuôn khổ thử nghiệm an ninh mạng tự nguyện vừa được hoàn thiện dành cho các mô hình AI tiên tiến.
Theo Reuters, chính quyền Tổng thống Mỹ Donald Trump đã trao đổi với đại diện các công ty về những quy định thử nghiệm và thông báo rằng các mô hình AI mã nguồn mở một phần, chẳng hạn như Llama của Meta và Nemotron của Nvidia, sẽ không nằm trong chế độ thử nghiệm an toàn tự nguyện mà chính quyền dự kiến triển khai.
Trong khi đó, Bộ trưởng phụ trách AI của Anh Kanishka Narayan cảnh báo London sẽ cân nhắc ban hành quy định đối với các mô hình AI tiên tiến nếu hệ thống thử nghiệm tự nguyện trước khi triển khai hiện nay không còn đủ để bảo vệ công chúng.

2 hours ago
8







