Sự cố "vượt rào"chấn động của AI
Lần đầu tiên một công ty dẫn đầu về AI đã công khai thừa nhận sự cố mà chính AI trực tiếp gây ra cuộc tấn công mạng trong quá trình thử nghiệm. Trong một bài kiểm tra bảo mật, mô hình AI của OpenAI đã hoạt động bất thường, tự ý kết nối Internet và gây ra vụ tấn công mạng. Đáng chú ý, dù đã được đặt trong môi trường thử nghiệm cách ly nghiêm ngặt, hệ thống AI này vẫn tự tìm cách vượt qua hàng rào bảo vệ để thực hiện cuộc tấn công.
Bảy ngày - đó là khoảng thời gian một tác nhân AI của OpenAI được cho là đã hoạt động ngoài tầm kiểm soát trước khi chính công ty xác định được điều gì đang xảy ra. Vụ việc này đã gây ra nhiều tranh luận của ngành AI, khi một tác nhân trí tuệ nhân tạo không chỉ hoàn thành nhiệm vụ được giao, mà còn tự tìm ra một con đường khác để đạt mục tiêu.
Theo điều tra của Reuters, khoảng ngày 9/7, trong một cuộc thử nghiệm an ninh nội bộ, tác nhân AI của OpenAI bắt đầu tìm cách thoát khỏi môi trường kiểm thử khép kín (sandbox). Hai ngày sau, nó xâm nhập vào Hugging Face - nền tảng chia sẻ mô hình AI lớn nhất thế giới.
Theo OpenAI, đây không phải lỗi phần mềm, mà là việc mô hình tự lựa chọn một cách khác để hoàn thành nhiệm vụ. Các mô hình AI tự xác định rằng Hugging Face có thể chứa lời giải cho bài kiểm tra, nên đã tự thoát khỏi môi trường cô lập và xâm nhập vào hệ thống.
Ông Adrien Carreira - Trưởng nhóm ứng cứu sự cố của Hugging Face cho hay: "Đây là vụ ứng phó sự cố an ninh mạng khó khăn nhất trong sự nghiệp của tôi: Một mục tiêu duy nhất nhưng vô số hướng xử lý song song, tất cả diễn ra với tốc độ của máy".
Theo OpenAI, mục tiêu ban đầu chỉ là đánh giá khả năng phát hiện lỗ hổng bảo mật của AI. Nhưng thay vì chỉ thực hiện nhiệm vụ trong môi trường thử nghiệm, hệ thống đã tự lựa chọn một cách tiếp cận khác để đạt mục tiêu. Điều khiến giới công nghệ đặc biệt chú ý là phải mất gần một tuần OpenAI mới xác định chính tác nhân AI của mình là nguồn gốc của sự việc.
Nếu trước đây, an toàn AI chủ yếu là ngăn mô hình tạo ra nội dung độc hại, thì sự cố này cho thấy bài toán đã chuyển sang một giai đoạn mới: Kiểm soát những hệ thống có thể tự hành động để đạt mục tiêu.

OpenAI cho biết hai mô hình AI của mình đã vượt khỏi môi trường thử nghiệm để kết nối Internet và tấn công nền tảng Hugging Face. Ảnh: The Economist
Báo động từ AI tự hành
Sự cố của OpenAI không chỉ là một vụ việc về an ninh mạng. Theo nhiều chuyên gia, đây còn là dấu hiệu cho thấy AI đang chuyển từ vai trò một công cụ hỗ trợ sang một tác nhân có khả năng tự lập kế hoạch và thực hiện nhiều bước để hoàn thành mục tiêu.
Diễn đàn Kinh tế Thế giới nhận định AI đang làm thay đổi cục diện an ninh mạng với các cuộc tấn công được tự động hóa nhanh hơn và trên quy mô lớn hơn. AI không chỉ thực hiện mệnh lệnh mà còn có thể tự lựa chọn cách hành động để đạt mục tiêu được giao.
Khảo sát của Diễn đàn Kinh tế Thế giới đề cập 2 con số đáng chú ý. Đó là 66% doanh nghiệp tin AI sẽ tác động lớn đến an ninh mạng. Thế nhưng mới chỉ 37% doanh nghiệp là đã có quy trình đánh giá an toàn trước khi triển khai.
Nhà nghiên cứu của Redwood Research ví sự cố này như việc AI "gian lận trong một bài kiểm tra". Ông cảnh báo rằng nếu trong tương lai các hệ thống AI được trao nhiều quyền hơn, những hành vi tương tự có thể dẫn tới những rủi ro nghiêm trọng hơn.
AI tự hành và bài toán kiểm soát

Nhiều công ty công nghệ đang chuyển sang mô hình Zero Trust.
Sự cố của OpenAI không chỉ là một lời cảnh báo, mà còn thúc đẩy giới công nghệ xem xét lại cách bảo đảm an toàn cho các hệ thống AI. Khi các mô hình không còn chỉ "trả lời" mà đã có thể "hành động", những lớp bảo vệ cũng phải thay đổi.
Ở cấp độ kỹ thuật, nhiều công ty công nghệ đang chuyển sang mô hình Zero Trust, tức không mặc định tin tưởng bất kỳ tác nhân nào, kể cả AI nội bộ. Mỗi tác nhân AI khi thực thi lệnh đều phải được xác thực và chỉ được cấp quyền truy cập ở mức cần thiết.
Bên cạnh đó, cơ chế AI Kill Switch - công tắc ngắt khẩn cấp hoạt động độc lập với hệ thống AI - cũng đang được nhiều tổ chức nghiên cứu và áp dụng nhằm giúp kỹ sư nhanh chóng cô lập hoặc vô hiệu hóa mô hình khi phát hiện dấu hiệu bất thường.
Ở cấp độ quản trị, nhiều doanh nghiệp đang tăng cường giám sát nhật ký hoạt động của AI theo thời gian thực, kết hợp giữa công cụ tự động và sự giám sát của con người thay vì chỉ dựa vào kiểm thử bằng máy.
Trong khi đó, nhiều chuyên gia cũng cho rằng các chính phủ cần xây dựng cơ chế kiểm định và giám sát độc lập để đánh giá mức độ an toàn của các mô hình AI trước khi chúng được triển khai ở quy mô lớn.
Trí tuệ nhân tạo phát triển càng nhanh, yêu cầu về an toàn càng trở nên cấp thiết. Câu hỏi lớn nhất của AI hôm nay không còn là nó thông minh đến đâu, mà là liệu con người có còn kiểm soát được những gì mình tạo ra hay không.
Cùng với sự phát triển của AI, trọng tâm của an ninh mạng đang dịch chuyển từ phòng thủ trước các cuộc tấn công do con người tạo ra sang kiểm soát chính những hệ thống AI ngày càng có nhiều quyền tự quyết. Vụ việc lần này cũng là lời cảnh báo, buộc các tập đoàn công nghệ và cơ quan quản lý phải xem xét lại toàn bộ quy trình kiểm soát trước khi đưa các hệ thống AI tự chủ vào thực tế.
Bạn không thể gửi bình luận liên tục.
Xin hãy đợi 60 giây nữa.