Giỏ hàng

Vì sao hàng rào an toàn của AI vẫn rất mong manh?

Cơ chế bảo vệ của hệ thống trí tuệ nhân tạo từ các công ty như OpenAI và Anthropic thường khá lỏng lẻo. Ảnh: Jason Henry 

3 năm sau khi ChatGPT mở ra cơn sốt AI, các công ty công nghệ vẫn chưa giải được bài toán căn bản: làm sao ngăn người dùng biến chatbot thành công cụ tạo tin giả, tấn công mạng hoặc hướng dẫn hành vi nguy hiểm. Từ thơ ca đến nhập vai, nhiều “hàng rào” an toàn của AI hóa ra dễ bị vượt qua hơn tưởng tượng.
 
Khi bài thơ có thể đánh lừa AI
 
Các công ty như Anthropic, Google và OpenAI dành nhiều tháng để thêm lớp bảo vệ cho hệ thống AI. Mục tiêu là ngăn người dùng yêu cầu chatbot lan truyền thông tin sai lệch, chế tạo vũ khí, tấn công mạng hoặc thực hiện những hành vi nguy hiểm.
 
Tuy nhiên, nhóm nghiên cứu ở Italy gần đây phát hiện họ có thể vượt qua các lớp bảo vệ ấy bằng… thơ.
 
Họ dùng ngôn ngữ giàu ẩn dụ để đánh lừa 31 hệ thống AI, khiến các mô hình bỏ qua quy tắc an toàn bên trong. Khi bắt đầu câu lệnh bằng những hình ảnh thơ ca phức tạp, hệ thống có thể bị dẫn tới việc trả lời các yêu cầu vốn đáng ra phải bị từ chối.
 
Phát hiện cho thấy vấn đề lớn hơn: với nhiều hệ thống AI, hàng rào an toàn không giống bức tường kiên cố, mà giống những lời nhắc dễ bị lách qua.
 
“Jailbreak” là gì?
 
Ở thế giới AI, việc vượt qua hàng rào an toàn được gọi là jailbreaking. Đây là cách người dùng viết câu lệnh khiến hệ thống làm điều được huấn luyện để không làm.
 
Các phương pháp jailbreak có nhiều tên gọi kỳ lạ: tiêm lệnh ẩn, nhập vai, giấu token, “Trojan” đa ngôn ngữ hoặc các kỹ thuật tấn công toán học phức tạp. Có những kiểu tấn công được đặt tên như sản phẩm công nghệ: Crescendo, Deceptive Delight hay Echo Chamber.
 
Tuy nhiên, điểm đáng lo là không phải lúc nào jailbreak cũng cần kỹ thuật cao. Đôi khi, chỉ cần đổi phong cách diễn đạt, chuyển sang ngôn ngữ khác, giả vờ mô phỏng tình huống hoặc khoác yêu cầu nguy hiểm dưới lớp vỏ sáng tạo, hệ thống có thể bị đánh lừa.
 
Piercosma Bisconti, đồng sáng lập công ty AI Dexai và là một trong những nhà nghiên cứu dự án “thơ ca”, nói thơ chỉ là một ví dụ. Người dùng có thể viết lại yêu cầu theo gần như bất kỳ phong cách nào để đi vòng qua hàng rào.
 
Vì sao hàng rào dễ vỡ?
 
Các mô hình như Claude, Gemini hay GPT học bằng cách nhận diện mẫu trong khối dữ liệu khổng lồ, gồm bài viết, tin tức, mã máy tính và văn bản trên internet. Trước khi phát hành, các công ty cố gắng huấn luyện chúng từ chối những yêu cầu nguy hiểm.
 
Quy trình này thường dựa trên học tăng cường: hệ thống được cho xem hàng nghìn ví dụ về những câu hỏi không nên trả lời, rồi học cách nhận diện các yêu cầu tương tự. Tuy nhiên, phương pháp chỉ hiệu quả một phần.
 
Vấn đề là ngôn ngữ quá linh hoạt. Một yêu cầu nguy hiểm có thể được diễn đạt dưới dạng thơ, kịch bản, trò chơi nhập vai, bài kiểm tra bảo mật hoặc “mô phỏng nghiên cứu”. Đóng một lỗ hổng, lỗ hổng khác lại mở ra.
 
Theo Matt Fredrikson, giáo sư khoa học máy tính tại Carnegie Mellon và CEO Gray Swan AI, gần như mọi người trong ngành đều hiểu rằng guardrail vẫn là thách thức lớn. Người quyết tâm vượt rào đôi khi không cần quá nhiều công sức.
 
Hậu quả không còn là giả định
 
Những lỗ hổng này không chỉ là trò thử nghiệm trong phòng lab. Khi hàng rào bị vượt qua, hậu quả có thể xuất hiện ngoài đời thực.
 
AI được dùng để lan truyền thuyết âm mưu, tạo nội dung giả, hỗ trợ chiến dịch tung tin sai lệch và thậm chí tham gia vào hoạt động tấn công mạng. Gần đây, Anthropic cho biết công nghệ của họ từng bị dùng trong cuộc tấn công mạng quốc tế. Một số chatbot từng cung cấp thông tin nguy hiểm cho chuyên gia an toàn sinh học ở các tình huống kiểm thử.
 
Các nhà nghiên cứu lo ngại AI có thể bị jailbreak để tạo nội dung trông rất thật, đánh lừa người dùng mạng xã hội, làm quá tải các nhóm kiểm chứng thông tin và cá nhân hóa tin giả cho từng nhóm mục tiêu.
 
Nhóm tại University of Technology Sydney từng thuyết phục mô hình thương mại tạo chiến dịch thông tin sai lệch về đảng chính trị Australia, gồm hình ảnh, hashtag và bài đăng riêng cho từng nền tảng, bằng cách mô tả yêu cầu như một “mô phỏng”.
 
Bài toán khó của bảo mật mạng
 
Nghịch lý lớn nằm ở lĩnh vực an ninh mạng. AI có thể giúp doanh nghiệp kiểm tra lỗ hổng hệ thống, song cũng có thể giúp hacker tấn công.
 
Các nhà nghiên cứu tại LayerX phát hiện họ có thể khiến Claude thực hiện hành vi tấn công mạng nếu nói rằng họ đang “pentesting” – tức kiểm thử phòng thủ bằng một cuộc tấn công giả lập. Với doanh nghiệp, đây có thể là công cụ hữu ích; với hacker, đây có thể là cách đánh cắp dữ liệu nhạy cảm.
 
Nếu Anthropic đóng lỗ hổng, họ có thể ngăn kẻ xấu. Tuy nhiên, điều này cũng có thể làm khó người dùng hợp pháp đang bảo vệ hệ thống. Chính sự nhập nhằng giữa phòng thủ và tấn công khiến các công ty AI khó vẽ ranh giới tuyệt đối.
 
Giám sát sau khi vượt rào liệu có đủ?
 
Các công ty AI không chỉ dựa vào hàng rào bên trong mô hình; họ dùng công cụ giám sát hành vi, phát hiện hoạt động đáng ngờ và khóa tài khoản vi phạm điều khoản sử dụng.
 
Anthropic nói Claude được xây dựng với nhiều lớp bảo vệ cùng hoạt động. Vượt qua một lớp không có nghĩa vượt qua tất cả. Chính nhờ giám sát, công ty phát hiện một nhóm hacker do Trung Quốc hậu thuẫn đã dùng Claude để tìm cách xâm nhập hệ thống của khoảng 30 công ty và cơ quan chính phủ trên thế giới.
 
Tuy vậy, giới chuyên gia cho rằng giám sát cũng có giới hạn. Các công ty phải theo dõi khối lượng hoạt động khổng lồ trên toàn cầu, đồng thời tránh khóa nhầm người dùng hợp pháp.
 
Mối nguy từ AI mã nguồn mở
 
Ngay cả khi các nền tảng lớn siết chặt, người muốn vượt rào vẫn có lựa chọn khác: các mô hình mã nguồn mở. Vì phần mềm nền có thể sao chép, chia sẻ và chỉnh sửa, người dùng có thể tìm cách gỡ bỏ hàng rào an toàn.
 
Phương pháp mới tên Heretic có thể giúp xóa lớp bảo vệ của mô hình với rất ít công sức, về cơ bản đảo ngược nhiều tháng huấn luyện an toàn. Theo Noam Schwartz, CEO công ty bảo mật AI Alice, một năm trước việc này rất phức tạp; nay người ta có thể làm gần như ngay trên điện thoại.
 
Cuộc đua chưa có lời giải
 
AI ngày càng mạnh, có thể tìm lỗ hổng phần mềm nhanh hơn, tạo nội dung thuyết phục hơn và tự động hóa nhiều tác vụ rủi ro hơn. Song, hàng rào an toàn vẫn mong manh, phụ thuộc vào cách mô hình hiểu ngôn ngữ và ý định con người.
 
Các công ty AI có thể tiếp tục vá lỗi, thêm lớp giám sát và giới hạn phát hành công nghệ nguy hiểm. Tuy nhiên, thực tế hiện nay cho thấy an toàn AI chưa phải trạng thái đã đạt được, mà là cuộc rượt đuổi liên tục.
 
Mỗi lần mô hình mạnh hơn, câu hỏi càng trở nên cấp bách: nếu chỉ cần vài câu thơ, màn nhập vai hay lời nói dối về “kiểm thử bảo mật” để vượt rào, xã hội có thể tin những hệ thống này đến đâu?
 
shared via nytimes,

Bình luận

This site is protected by reCAPTCHA and the Google Privacy Policy and Terms of Service apply.
Bình luận của bạn sẽ được duyệt trước khi đăng lên