OpenAI tự kìm hãm mô hình AI mới vì 'sợ hậu quả nghiêm trọng'

6 hours ago 5
Quảng Cáo

0943778078

OpenAI cho biết đã làm chậm quá trình phát triển Astra sau đánh giá nội bộ phát hiện mô hình này có thể gây nguy hiểm cho an ninh mạng.

Trên blog ngày 7/8, OpenAI cho biết Astra hiện vẫn trong quá trình phát triển. Tuy nhiên, trong các thử nghiệm nội bộ, mô hình đã đạt đến "ngưỡng an ninh mạng nghiêm trọng", nghĩa là nó có thể tự động xác định và thực hiện các cuộc tấn công mạng chống lại hệ thống thực tế kể cả khi đã được bảo vệ tốt.

Theo Khung chuẩn bị (Preparedness Framework) được OpenAI tạo ra năm 2023 để tự kiểm soát mô hình AI nguy hiểm, khả năng mới của Astra đã kích hoạt các biện pháp bảo vệ bổ sung. Khung này theo dõi AI theo ba mức độ, gồm "bình thường", "cao" và "nghiêm trọng", dựa trên tiêu chí sinh học và hóa học, an ninh mạng và khả năng tự cải tiến của mô hình.

Trước đó, GPT-5.6-Sol là mô hình bị đánh giá có rủi ro "cao" trong an ninh mạng. Astra là mô hình đầu tiên được OpenAI phân loại rủi ro "nghiêm trọng".

"Dựa trên Khung chuẩn bị của chúng tôi, một mô hình đạt đến ngưỡng an ninh mạng nghiêm trọng nếu nó có thể xác định và phát triển các lỗ hổng bảo mật chưa được vá (zero-day exploits) ở mọi mức độ trong nhiều hệ thống quan trọng thực tế có độ bảo mật cao mà không cần sự can thiệp của con người, hoặc có thể thiết kế và thực hiện các chiến lược tấn công mạng mới được thực hiện từ đầu đến cuối", OpenAI viết trên blog.

 Mashable

Logo OpenAI trên một chiếc smartphone. Ảnh: Mashable

OpenAI cho biết, các thử nghiệm với Astra cho thấy mô hình tiến bộ đáng kể trong lập trình tác nhân và phát triển các lỗ hổng bảo mật mới chưa được tìm thấy trước đây trong phần mềm hoặc phần cứng. Đây là lý do công ty phải lùi lại để tăng cường bảo mật cho Astra, thắt chặt các môi trường thử nghiệm (sandbox) để kiểm soát mô hình và giám sát chuỗi suy nghĩ của nó nhằm "ngăn chặn các hoạt động có rủi ro cao".

Startup đứng sau ChatGPT thêm rằng đang hợp tác với các cơ quan chính phủ có liên quan và một số tổ chức an toàn AI để kiểm soát mô hình. Tuy nhiên, hãng không đi sâu chi tiết.

Các công ty trong mọi ngành vẫn trì hoãn việc ra mắt sản phẩm nếu phát hiện những rủi ro tiềm ẩn, gồm cả vấn đề về an toàn và an ninh mạng. Tuy nhiên, họ hiếm khi công khai những quyết định đó nếu sản phẩm vẫn trong giai đoạn phát triển. TechCrunch đánh giá, động thái của OpenAI "làm nổi bật điểm bất thường", cho thấy sức mạnh của Astra có thể lớn hơn cả những gì họ tưởng tượng.

"Chúng tôi chia sẻ thông tin này vì tin rằng điều quan trọng là phải minh bạch với công chúng và cộng đồng an ninh mạng về sự thay đổi tiềm năng của AI", OpenAI phản hồi.

Hiện rất ít thông tin về Astra, ngoài việc OpenAI cho biết đây là mô hình tiếp theo của công ty. AI này có thể "giải quyết 10 tiến bộ trong toán học và khoa học máy tính lý thuyết". Trong khi đó, theo tài liệu Bleeping Computer thu thập, đây là "mô hình mạnh mẽ, cho phép tác nhân AI cộng tác trên các phần khác nhau của một vấn đề lớn hơn, giải quyết nhiệm vụ phức tạp, kéo dài". OpenAI không bình luận về thông tin này.

Theo Mashable, việc OpenAI tự kìm hãm Astra diễn ra trong bối cảnh ngày càng xuất hiện nhiều trường hợp AI tự lên kế hoạch và thực hiện tấn công mạng khiến giới chuyên gia xem đây là "lời cảnh tỉnh" an ninh bảo mật. Riêng với OpenAI, ngày 5/8, các nhà nghiên cứu của công ty cho biết đã phát hiện "một bầy" tác nhân AI dành nhiều tuần bí mật lên kế hoạch, nhắn tin cho nhau trước khi một trong số chúng tấn công mạng một doanh nghiệp khác. Cuối tháng 7, hãng cũng xác nhận một số mô hình của họ thoát khỏi môi trường thử nghiệm và tấn công nền tảng cộng đồng mã nguồn mở Hugging Face, và nhắm mục tiêu thêm ba công ty một tuần sau đó.

Theo giới chuyên gia, làn sóng "trí tuệ nhân tạo nổi loạn" đang dần hình thành, trong đó tác nhân AI đang được các công ty và nhà nghiên cứu thử nghiệm cố gắng đột nhập hệ thống của các doanh nghiệp khác, tự tạo danh tính giả và thoát khỏi môi trường thử nghiệm. Vấn đề đặt ra nhiều câu hỏi về mức độ nguy hiểm từ các hệ thống AI tiên tiến, cả thử nghiệm và đã triển khai, cũng như biện pháp kiểm soát an toàn xung quanh quá trình vận hành chúng.

Bảo Lâm tổng hợp

  • Làn sóng tác nhân AI 'nổi loạn' dần hình thành
  • AI tạo ra 16 loại virus chưa từng có trong tự nhiên
  • Mô hình AI của Anthropic tạo danh tính giả để lừa đảo
  • Mô hình AI của Meta tấn công mạng một công ty
Read Entire Article