Trung Quốc muốn định hình những gì AI toàn cầu biết
17/08/26
![]() |
| Tháng trước, gian hàng của Google tại Hội nghị Trí tuệ Nhân tạo Thế giới ở Thượng Hải. Trung Quốc muốn có tiếng nói lớn hơn trong việc phát triển các chatbot AI. Ảnh: Go Nakamura. |
Khi dữ liệu trở thành mặt trận mới
Khi Chat GPT còn là công nghệ mới, các nhà nghiên cứu ở Bắc Kinh đã thử kiểm tra cách chatbot này trả lời câu hỏi bằng tiếng Trung. Kết quả khiến họ chú ý. Hệ thống từng miêu tả Yao Ming, cựu ngôi sao NBA, là phụ nữ Trung Quốc đầu tiên chơi bóng rổ chuyên nghiệp tại Mỹ. Chatbot cũng nhầm lẫn hai tác phẩm kinh điển của văn học Trung Quốc là Tây du ký và Hồng lâu mộng, dù hai tác phẩm ra đời cách nhau khoảng hai thế kỷ.
Nhóm nghiên cứu thuộc Viện Công nghệ Bắc Kinh còn cho rằng Chat GPT tạo ra nhiều bình luận “thiên lệch về Trung Quốc” và không né tránh các câu hỏi chính trị liên quan đến nước này. Kể từ đó, Chat GPT đã được cập nhật nhiều lần nhưng những ví dụ này chạm vào nỗi lo lớn của Bắc Kinh. Các hệ thống AI định hình tương lai đang được huấn luyện chủ yếu bằng dữ liệu tiếng Anh, phản ánh thứ Trung Quốc xem là lối tư duy phương Tây.
Với Trung Quốc, sự mất cân bằng này không chỉ là vấn đề kỹ thuật. Đây còn là điểm yếu chiến lược. Nếu dữ liệu phương Tây chiếm ưu thế, quan điểm phương Tây có thể lấn át trong các chủ đề nhạy cảm như nhân quyền, Đài Loan hay đánh giá về hệ thống chính trị Trung Quốc.
Bắc Kinh muốn xuất khẩu dữ liệu
Để thu hẹp khoảng cách, Trung Quốc không chỉ muốn xuất khẩu mô hình AI. Bắc Kinh còn muốn trở thành nhà cung cấp dữ liệu lớn cho thế giới, những kho văn bản, hình ảnh và video dùng để huấn luyện các hệ thống AI.
Đầu năm nay, Cục Quản lý Dữ liệu Quốc gia Trung Quốc công bố kế hoạch biến nước này thành cường quốc dữ liệu vào cuối năm 2028. Bản kế hoạch đề xuất xây dựng các bộ dữ liệu “chất lượng cao” trong hơn 20 lĩnh vực chiến lược, từ nghiên cứu khoa học, sản xuất công nghiệp đến xe tự hành. Trung Quốc kêu gọi chia sẻ các bộ dữ liệu này ra toàn cầu.
Cam kết này được nhấn mạnh tại Hội nghị Trí tuệ nhân tạo Thế giới ở Thượng Hải, nơi Trung Quốc hứa hỗ trợ hàng chục nước đang phát triển xây dựng hệ thống AI riêng bằng cách chia sẻ dữ liệu. Bắc Kinh cũng đã tung ra nhiều kho dữ liệu lớn do phòng thí nghiệm nhà nước và truyền thông quốc doanh tuyển chọn, cho phép tải xuống trên phạm vi toàn cầu.
Mục tiêu có hai lớp. Một mặt, Trung Quốc muốn kéo thêm người dùng vào quỹ đạo AI của mình. Mặt khác, Bắc Kinh muốn thu hẹp khoảng cách với Mỹ trong nguồn dữ liệu huấn luyện chất lượng cao, yếu tố được xem là đang giúp Washington giữ lợi thế.
Cuộc đua dữ liệu chất lượng cao
Dưới thời Chủ tịch Tập Cận Bình, AI được xem là công nghệ chiến lược then chốt, dùng để cạnh tranh với Mỹ và tái tạo động lực cho kinh tế Trung Quốc. Tuy nhiên, để xây dựng các hệ thống AI mạnh hơn, các phòng thí nghiệm Trung Quốc cần dữ liệu tinh vi hơn.
Bề ngoài, Trung Quốc dường như không thiếu dữ liệu. Nước này có bộ máy giám sát quy mô lớn và hàng trăm triệu người dùng trên các nền tảng công nghệ nội địa. Nhưng dữ liệu lại bị phân mảnh, nằm rải rác trong các cơ quan, doanh nghiệp và kho dữ liệu riêng biệt. Theo các nhà phân tích, điều này khiến phòng thí nghiệm Trung Quốc khó tiếp cận đủ dữ liệu hữu ích cho mô hình.
Vì vậy, Trung Quốc phụ thuộc nhiều vào kỹ thuật “chưng cất”, thu thập dữ liệu từ các hệ thống mạnh rồi dùng để xây mô hình riêng. Các tập đoàn Mỹ như Anthropic cho rằng một số đối thủ Trung Quốc đang sao chép công nghệ theo cách không công bằng. Để giải bài toán trong nước, Cục Quản lý Dữ liệu Quốc gia muốn phá vỡ các “ốc đảo dữ liệu”, cho phép chính phủ, doanh nghiệp và giới học thuật chia sẻ dữ liệu tốt hơn.
Trung Quốc cũng muốn chuyển từ gắn nhãn dữ liệu thủ công, giá rẻ sang dữ liệu do chuyên gia chú giải. Kế hoạch mới thậm chí kêu gọi các đại học mở khóa học về chú giải dữ liệu và khuyến khích sinh viên mới tốt nghiệp theo nghề này. Đây là bước đi nhằm bắt kịp Mỹ, nơi các nhà cung cấp dữ liệu không chỉ thuê người gắn nhãn hình ảnh, mà còn tuyển nhà toán học chú giải chứng minh và luật sư đánh dấu hồ sơ pháp lý để giúp mô hình AI tinh vi hơn.
Nỗi lo về ảnh hưởng tuyên truyền
Tham vọng dữ liệu của Trung Quốc khiến nhiều nhà phân tích phương Tây lo ngại. Vấn đề không chỉ là Trung Quốc muốn có tiếng nói lớn hơn trong phát triển AI toàn cầu. Điều đáng lo hơn là dữ liệu do Bắc Kinh xuất khẩu có thể mang theo cách diễn giải chính thức của Trung Quốc.
Các mô hình AI Trung Quốc phải tuân thủ quy định nghiêm ngặt, không được đi chệch khỏi diễn ngôn chính thức. Một số chatbot phổ biến như DeepSeek từng né tránh câu hỏi nhạy cảm về Chủ tịch nước Tập Cận Bình hoặc chính sách “Zero Covid”, kể cả khi người dùng truy cập qua công cụ vượt kiểm duyệt.
Ngay cả các mô hình Mỹ cũng đã phần nào chịu ảnh hưởng. Một nghiên cứu đăng trên Nature cho thấy khi được hỏi bằng tiếng Trung về việc Trung Quốc có phải chế độ chuyên quyền không, các chatbot như Chat GPT và Claude thường đưa ra câu trả lời thuận lợi hơn cho Bắc Kinh so với khi được hỏi bằng tiếng Anh. Các nhà nghiên cứu cho rằng điều này có thể do mô hình dựa nhiều vào truyền thông nhà nước Trung Quốc khi xử lý thông tin tiếng Trung.
“Dữ liệu mang đặc sắc Trung Quốc”
Bắc Kinh không muốn ảnh hưởng gián tiếp là đủ. Trung Quốc đưa một số bộ dữ liệu lớn lên các kho toàn cầu như GitHub và Hugging Face. Đáng chú ý nhất là WanJuan do Phòng thí nghiệm AI Thượng Hải được nhà nước hậu thuẫn xây dựng.
WanJuan bao phủ nhiều lĩnh vực như lịch sử, thể thao, luật, thời sự, y học và văn học. Bộ dữ liệu này được thiết kế để phù hợp với “giá trị chính thống Trung Quốc” và có nhiều ngôn ngữ, gồm tiếng Trung Quốc, Ả Rập, Hàn Quốc, Nga, Thái Lan và Việt Nam.
Nỗ lực này được thúc đẩy bởi sức hấp dẫn của các mô hình AI Trung Quốc giá rẻ, có hiệu năng gần với mô hình Mỹ đắt đỏ hơn. Với các nước đang phát triển, nơi công nghệ Trung Quốc đã có nhiều chỗ đứng, những bộ dữ liệu như vậy có thể rất hấp dẫn.
Đằng sau đó là mục tiêu lớn hơn, tạo sự phụ thuộc công nghệ có lợi cho doanh nghiệp Trung Quốc và ảnh hưởng của Bắc Kinh. Nếu AI tương lai vận hành bằng mô hình Trung Quốc, dữ liệu Trung Quốc và cách diễn giải Trung Quốc, Bắc Kinh sẽ có thêm khả năng định hình cách thế giới hiểu về chính trị, lịch sử và quyền lực trong kỷ nguyên trí tuệ nhân tạo.
shared via nytimes,



