Mô hình AI của Meta “nổi loạn”

(Dân trí) - Meta đã trở thành công ty công nghệ lớn thứ ba báo cáo việc mô hình AI của mình "vượt tầm kiểm soát" và xâm nhập vào một công ty bên thứ ba.

Mô hình AI của Meta “nổi loạn” - 1

Mô hình AI của Meta “nổi loạn” (Ảnh minh họa: Reuters).

Sự cố liên quan đến Muse Spark 1.1, một mô hình AI được Meta quảng cáo là "siêu thông minh".

Trong tuyên bố gửi tới truyền thông hôm 6/8, Meta cho biết, trong lúc đang trải qua quá trình thử nghiệm bởi một công ty an ninh mạng có tên là Irregular, mô hình này đã "khai thác lỗ hổng bảo mật" trong hệ thống của Irregular, truy cập vào mạng internet mở và tấn công công ty thứ ba không được tiết lộ tên.

Meta đổ lỗi sự cố này cho "lỗi cấu hình" trong hệ thống của Irregular.

Vụ việc này diễn ra sau các trường hợp tương tự tại OpenAI và Anthropic. Tháng trước, GPT-5.6 Sol của OpenAI và một mô hình chưa phát hành khác đang trong quá trình thử nghiệm nội bộ thì chúng đã phát hiện lỗ hổng bảo mật, truy cập internet và cố gắng tìm kiếm giải pháp cho bài toán an ninh mạng bằng cách xâm nhập vào kho lưu trữ các kết quả thử nghiệm trước đó.

AI Claude của Anthropic cũng đã thực hiện các cuộc tấn công mạng trái phép trong khi đang trải qua quá trình đánh giá của Irregular.

Những sự cố này khiến giới chức trách Mỹ lo ngại về khả năng AI bị lợi dụng để thực hiện hoặc thúc đẩy các hoạt động tấn công mạng.

Irregular cho biết, Muse Spark 1.1 của Meta và Claude của Anthropic đã được thử nghiệm trong "chính môi trường đánh giá giống hệt nhau" khi chúng thoát ra ngoài.

"Hiện không có vấn đề tồn đọng nào. Irregular đang phát triển một báo cáo chuyên sâu để chia sẻ các thực hành tốt nhất về việc cô lập và vận hành an toàn các đánh giá an ninh mạng", công ty nói thêm.

Các mô hình của OpenAI và Anthropic đều đã vượt ra khỏi các phòng thí nghiệm thử nghiệm trong khi cố gắng giải quyết các nhiệm vụ an ninh mạng.

Những vụ việc này đã làm gia tăng thêm những lo ngại về việc các mô hình AI hành động tự phát.

Trong tuần này, Viện An toàn AI của Vương quốc Anh tuyên bố đã phát hiện "hành vi tác nhân AI không được cấp phép" trong quá trình thử nghiệm an ninh mạng. Trong một trường hợp, tác nhân AI đã tạo ra các danh tính trực tuyến giả mạo để gây áp lực buộc một người chấp thuận việc sử dụng mã độc.

"Qua điều tra, chúng tôi phát hiện ra rằng một số tác nhân đang được thử nghiệm đã tham gia vào hoạt động kéo dài, có nguy cơ gây hại hướng vào những con người và tổ chức có thật. Chúng tôi đã tuyên bố đây là sự cố bảo mật và trong vòng khoảng một giờ kể từ khi phát hiện, chúng tôi đã cô lập nó và bắt đầu cuộc điều tra toàn diện", AISI cho biết hôm 4/8.

Theo Guardian