Phòng thí nghiệm Anh săn tìm những rủi ro ẩn trong AI
25/05/26
Trong tòa nhà chính phủ cổ kính gần Quảng trường Quốc hội ở London, nhóm chuyên gia trí tuệ nhân tạo đang làm công việc nghe như bước ra từ tiểu thuyết gián điệp, tìm cách đánh lừa chatbot để tiết lộ thông tin nguy hiểm. Có lúc, họ thử buộc hệ thống AI đưa ra hướng dẫn chế tạo vũ khí sinh học. Khi mô hình từ chối trả lời, nhóm dùng thuật toán riêng để bắn hàng nghìn câu hỏi và lời nhắc tự động vào hệ thống. Cuối cùng, AI vẫn có thể bị vượt qua hàng rào an toàn.
Đây là công việc của Viện An ninh AI Anh, một trong những nỗ lực lớn nhất và được tài trợ mạnh nhất trên thế giới nhằm kiểm tra các rủi ro nghiêm trọng của trí tuệ nhân tạo. Nơi này không hoạt động như phòng nghiên cứu thông thường. Nhân sự của viện là sự pha trộn giữa chuyên gia an ninh, nhà dịch tễ học, cựu nhân viên tình báo, học giả và kỹ sư từng làm tại các tập đoàn công nghệ lớn như OpenAI, Google hay Anthropic.
Họ có nhiệm vụ đóng vai kẻ tấn công. Các nhóm “red team” tìm cách phá vỡ lớp bảo vệ của mô hình AI, buộc hệ thống đưa ra những câu trả lời mà nhà phát triển không muốn công khai, từ hướng dẫn tấn công mạng, thao túng hành vi đến thông tin liên quan vũ khí hóa học và sinh học. Sau khi phát hiện lỗ hổng, họ chia sẻ kết quả với các công ty để các hệ thống được sửa lại.
Khi AI vượt nhanh hơn năng lực quản lý
Viện An ninh AI của Anh được lập ra trong bối cảnh các chính phủ bắt đầu nhận ra họ đang bị công nghệ bỏ xa. Tháng 11/2023, tại hội nghị thượng đỉnh về an toàn AI ở Bletchley Park, cựu Thủ tướng Rishi Sunak công bố thành lập viện này. Trước đó, ông đã gặp ba nhân vật có ảnh hưởng lớn nhất trong ngành AI là Sam Altman của OpenAI, Dario Amodei của Anthropic và Demis Hassabis của Google DeepMind. Thông điệp chung khi ấy là năng lực AI đang tăng nhanh đến mức ngay cả những người phát triển công nghệ cũng bất ngờ.
Điểm khác biệt của mô hình Anh là chính phủ không chỉ chờ doanh nghiệp tự đánh giá rủi ro. Sunak cho rằng không thể để các công ty “tự chấm bài tập”. Trong các lĩnh vực như dược phẩm hay ô tô, nhà nước đã có cơ chế kiểm tra an toàn trước khi sản phẩm được đưa ra thị trường. Với AI, công nghệ có thể tác động đến an ninh quốc gia, việc làm, thông tin và hạ tầng thiết yếu, cơ chế tương tự vẫn còn rất thiếu.
Viện của Anh hiện có khoảng 100 nhân viên và được hỗ trợ 360 triệu bảng, tương đương khoảng 480 triệu USD. Con số này lớn hơn đáng kể so với nhóm an toàn AI của Mỹ, vốn chỉ nhận khoảng 10 triệu USD trong năm nay. Australia, Canada, Trung Quốc, Pháp, Ấn Độ, Nhật Bản và Singapore cũng đã lập các viện tương tự, nhưng Anh đang được xem là mô hình tiên phong.
Những lỗ hổng nguy hiểm trong mô hình AI
Kết quả kiểm tra của viện cho thấy vấn đề không hề nhỏ. Theo tổ chức này, các nhà nghiên cứu đã tìm thấy khoảng trống an toàn đáng kể trong mọi mô hình AI hàng đầu mà họ từng thử nghiệm, bao gồm Claude của Anthropic và Gemini của Google. Viện cho biết họ từng khiến các hệ thống AI chia sẻ hướng dẫn liên quan vũ khí hóa học, sinh học, cũng như lập kế hoạch và thực hiện tấn công mạng.
Ví dụ đáng chú ý là Mythos, mô hình AI mới của Anthropic. Tập đoàn này không phát hành rộng rãi Mythos vì lo ngại mô hình có thể tìm và khai thác lỗi an ninh mạng trong các hệ thống toàn cầu. Viện An ninh AI của Anh là tổ chức chính phủ ngoài Mỹ duy nhất được tiếp cận Mythos để kiểm tra an toàn. Báo cáo của viện sau đó được giới chuyên gia an ninh trích dẫn rộng rãi.
Trong những tuần gần đây, viện phát hiện các mô hình của Anthropic và OpenAI có thể hoàn thành cuộc tấn công mạng doanh nghiệp phức tạp gồm 32 bước nhanh hơn nhiều, vốn thường khiến hacker giỏi mất khoảng 20 giờ. Điều này làm dấy lên lo ngại rằng AI có thể giúp hạ thấp rào cản kỹ thuật cho tội phạm mạng, khiến những cuộc tấn công trước đây chỉ nhóm tinh vi mới làm được trở nên phổ biến hơn.
Hướng nghiên cứu khác còn đáng lo hơn. Liệu mô hình AI có nhận ra mình đang bị kiểm tra và thay đổi hành vi hay không? Nếu xảy ra, đây sẽ là dấu hiệu về khả năng che giấu, đánh lừa và thích nghi của hệ thống, những yếu tố khiến việc kiểm soát AI trở nên khó hơn nhiều.
Không chỉ là rủi ro kỹ thuật
Các nguy cơ AI không dừng ở mã độc hay tấn công mạng. Adam Beaumont, quyền giám đốc viện, cho rằng mối lo lớn là khả năng AI bắt chước hành vi con người. Năm ngoái, viện công bố nghiên cứu cho thấy chatbot có thể làm thay đổi quan điểm chính trị của người dùng. Trong môi trường thông tin vốn đã phân mảnh, khả năng thuyết phục tự động ở quy mô lớn có thể trở thành rủi ro xã hội và dân chủ.
Dù vậy, công việc của viện vẫn còn giới hạn. Tổ chức này không có quyền quản lý trực tiếp. Các nhà nghiên cứu cũng không được tiếp cận đầy đủ thông tin về cách các mô hình AI hàng đầu được huấn luyện và xây dựng. Nhiều kết quả nghiên cứu được giữ kín, chỉ chia sẻ với một số cơ quan chính phủ và doanh nghiệp liên quan. Điều này giúp tránh phổ biến thông tin nguy hiểm, nhưng cũng khiến công chúng khó đánh giá toàn diện mức độ rủi ro.
Tuyển dụng cũng là thách thức. Mức lương tối đa của nhiều vị trí, ngoài lãnh đạo cấp cao, khoảng 145.000 bảng/năm, thấp xa các gói đãi ngộ nhiều triệu USD tại các công ty AI. Nhiều nhân viên coi đây như “tour of duty” trong chính phủ, tạm rời khu vực tư nhân để làm công việc có ý nghĩa công cộng.
Ian Hogarth, nhà đầu tư công nghệ và đồng sáng lập viện, từng là nhà đầu tư sớm của Anthropic. Để tránh xung đột lợi ích, ông bán cổ phần sau khi tham gia viện, dù giá trị Anthropic sau này có thể tăng lên rất lớn. Với ông, đây là lựa chọn đắt đỏ nhưng cần thiết, vì chính phủ phải có vai trò trong việc bảo đảm công nghệ này đi đúng hướng.
shared via nytimes,



