Giỏ hàng

Khi AI bắt đầu nhìn lại con người

Ảnh: Sebastian Mast

Năm 2002, trong quảng cáo của Apple, một người đàn ông đi qua cửa kính vào ban đêm, bên trong là chiếc iMac với màn hình LCD gắn trên cánh tay điều chỉnh được và đặt trên phần thân vòm chứa phần cứng, khi anh bước qua, màn hình xoay theo và khi lắc đầu, máy tính lắc màn hình,... Thông điệp rất rõ: con người luôn muốn công nghệ phản ứng tự nhiên. Ngày nay, câu hỏi ấy tiến thêm bước mới: nếu ta nhìn vào màn hình, mất bao lâu để màn hình nhìn lại ta?
 
Điều đó không còn xa. iPhone dùng Face ID xử lý ánh nhìn. Một số xe đời mới nhận ra gương mặt và chào người lái. Trợ lý AI trò chuyện với ta trong nhà. Giao diện người dùng không còn chỉ một chiều. Với AI agent, máy còn có thể hành động tự chủ thay chủ nhân. Vì vậy, thiết kế trải nghiệm người dùng (UX) có thể phải mở rộng thành trải nghiệm của máy về người dùng (XU).
 
OpenAI từng miêu tả dịch vụ Operator như t agent có thể “nhìn vào trang web và tương tác bằng cách gõ, nhấp chuột và cuộn”, giống người dùng thật. Nay năng lực ấy được hấp thụ vào ChatGPT, cho phép AI dùng “cùng giao diện và công cụ con người tương tác hằng ngày”, giúp mở rộng tiện ích của AI, nhưng cũng đặt ra câu hỏi lớn: máy móc nhìn thế giới bằng cách nào?
 
Nhìn qua những chiếc khung
 
Các giao diện hiện nay vốn được thiết kế cho con người. Ta hiểu máy tính qua ẩn dụ vật lý: tệp nằm trong thư mục, thư mục nằm trên màn hình nền. Kiểu thiết kế mô phỏng vật thật (skeuomorphism) từng giúp người dùng chuyển từ thế giới cũ sang thế giới số. Don Norman, người tiên phong trong UX, gọi đó là cách “làm dịu quá trình chuyển đổi từ cũ sang mới”. Nhưng ẩn dụ cũng có thể che khuất bản chất công nghệ. Năm 2012, Clive Thompson trên Wired phê phán việc iPhone đời đầu bắt chước giấy, da và đường khâu, vì các ẩn dụ cũ có thể ngăn việc khai thác đúng sức mạnh của máy tính.
 
Giờ đây, khi máy tính bắt đầu cảm nhận thế giới, các bot dường như dùng dạng ẩn dụ ngược. Nếu con người hiểu máy qua biểu tượng vật lý, máy lại hiểu thế giới vật lý qua lăng kính tính toán. Điển hình như xe tự hành, camera ghi dữ liệu thô, hệ thống thị giác máy biến ô tô, người đi bộ, xe đạp thành các vùng được đóng khung và gán nhãn. Nhãn ấy là bản dịch số của vật thể ngoài đời, thẻ thông tin giúp máy đưa vào cơ sở dữ liệu. Nói cách khác, máy nhìn vật thể như dữ liệu có thể phân loại.
 
Cách nhìn này có giới hạn. Elisa Giardina Papa, nghệ sĩ kiêm học giả, khi tham gia phân loại ảnh huấn luyện AI, nhận ra công việc ấy dựa trên các quyết định nhị phân. Năm 2022, trong cuốn sách Leaking Subjects and Bounding Boxes: On Training AI (hững chủ thể rò rỉ và các khung bao: Về việc huấn luyện AI năm 2022), bà cho biết để gán nhãn bức ảnh phụ nữ ngồi trên ghế sofa, bà phải vẽ đường bao quanh cả người và ghế, rồi tách thành “phụ nữ” và “ghế”. Hệ thống gặp lỗi khi hoa văn trên áo giống hoa văn trên ghế. Để máy học được, thế giới phải bị cắt nhỏ, đóng khung và đặt tên.
 
Các vật thể trong suốt cũng gây khó cho robot thị giác. Năm 2023, một khảo sát cho biết vì vật thể thiếu “đặc điểm bề mặt nổi bật như màu sắc và kết cấu”, nên hình dạng phụ thuộc mạnh vào nền ảnh. Chiếc ghế quen thuộc bị lật nghiêng cũng có thể làm AI bối rối.
 
AI thường nhìn thế giới qua trung bình và chuẩn hóa. AI Eryk Salvaggio, nghệ sĩ kiêm nhà nghiên cứu cho biết khi chụp ảnh thiên nhiên để huấn luyện mạng GAN tạo ảnh, ông phải từ bỏ bản năng nhiếp ảnh là tìm điểm khác biệt. Thay vào đó, phải tìm các mẫu lặp lại đủ nhất quán giúp AI hiểu. Cây nấm bắt mắt không còn là điểm nhấn nghệ thuật, mà trở nên dị thường so với nền rừng. Salvaggio nói logic ấy vẫn “cơ bản đúng” với các hệ thống hình ảnh mới hơn, kể cả mô hình khuếch tán dùng tạo ảnh hiện nay.
 
Đồng cảm với cách máy cảm nhận
 
Khi AI nhìn thế giới bằng phương pháp xa lạ như vậy, con người có thể phải dùng khái niệm quen thuộc trong thiết kế: đồng cảm. Năm 1934, nhà sinh học Jakob von Uexküll, trong tác phẩm A Stroll Through the Worlds of Animals and Men (Dạo bước qua các thế giới của động vật và con người), từng miêu tả cách con ve cảm nhận thế giới qua áp lực, mùi và nhiệt độ, có thế giới trải nghiệm riêng (Umwelt) rất khác con người.
 
Với AI, đồng cảm không có nghĩa tin máy có cảm xúc. Có thể hiểu theo nghĩa nhận thức: đứng vào góc nhìn của thực thể và cố hiểu cách chúng nhìn thế giới. Năm 2025, một nghiên cứu cho thấy hướng này có giá trị thực tế. Các nhà nghiên cứu cải thiện khả năng AI hiểu ảnh thiếu sáng qua việc tối ưu ảnh cho máy, không cho mắt người. Họ giữ lại thay vì khử nhiễu như xử lý ảnh truyền thống, vì những pixel vô nghĩa với người vẫn có thể chứa thông tin cho AI. Ảnh sau xử lý có các vệt tím “không dễ chịu với thị giác con người”, nhưng giúp máy giải mã tư thế người trong ảnh tốt hơn nhiều, gần bằng mắt người khi xh đủ sáng. Ở đây, UX và XU xung đột: hình ảnh không thể cùng lúc tối ưu cho mắt người và cho máy.
 
Sự khác biệt này ngày càng quan trọng khi chia sẻ môi trường vật lý với AI. Robot hình người đang thu hút đầu tư mạnh; Apple cũng đang nỗ lực phát triển robot. Khi công nghệ có thân thể, con người có thể gán cảm xúc cho Al nhiều hơn, giống như một số người gắn bó với ô tô hoặc chatbot. Cùng lúc, môi trường thật có thể phải được thiết kế lại cho máy nhìn.
 
trong đại dịch Covid, Menu mã QR bùng nổ là ví dụ sơ khai: bất tiện với người, nhưng dễ đọc với máy. Amazon từng theo đuổi tiện ích này bằng công nghệ “Lấy hàng rồi đi”: khách ở cửa hàng Amazon Go cầm hàng rồi rời đi, hệ thống thị giác máy tự theo dõi món đồ và tính tiền. Nhưng hệ thống vận hành kém. Năm 2022, theo The Information, Amazon có hơn 1.000 người làm công việc gồm rà soát giao dịch và gán nhãn ảnh từ video; cứ 1.000 lượt bán cần khoảng 700 lượt kiểm tra của con người. Đầu năm 2026, Amazon thông báo đóng thử nghiệm bán lẻ này. Ngay cả khi hoạt động, hệ thống cũng phụ thuộc mạnh vào bố cục cửa hàng, đặt sản phẩm sai kệ có thể làm máy nhận thức sai.
 
Khi AI hiểu sai xã hội
 
Vấn đề nghiêm trọng hơn xuất hiện khi AI nhận thức sai con người. Dữ liệu thiên lệch có thể tạo ra đối xử bất bình đẳng. Tom Williams, nhà nghiên cứu robot chỉ ra trợ lý giọng nói thường hiểu sai nhiều hơn với người nói giọng địa phương hoặc phương ngữ nằm ngoài chuẩn hẹp. Dựa trên nghiên cứu của Christina Harrington, ông miêu tả tình huống một người muốn nói với robot bằng tiếng Anh Mỹ gốc Phi có thể phải “làm trắng” cách nói, dạng chuyển mã vì công nghệ. Như vậy, “giọng nói da trắng” bị đặt thành chuẩn, còn các cách nói khác bị xem là lệch chuẩn.
 
Nhưng mở rộng dữ liệu huấn luyện cũng có rủi ro. Năm 2019, New York Daily News đưa tin nhân viên nhà thầu phụ của Google cho biết được yêu cầu mời người có “tông da tối hơn” chơi một trò chơi điện thoại trong lúc bị quay video, đồng thời thúc giục ký nhanh biểu mẫu đồng ý. Google nói việc thu thập dữ liệu nhằm đưa “công bằng” vào tính năng mở khóa bằng khuôn mặt. Williams lập luận, nếu đa dạng hóa dữ liệu đòi hỏi cách làm khai thác tương tự, có lẽ máy tính không nên nhận diện con người theo nhóm nhân khẩu học ngay từ đầu.
 
Bộ dữ liệu khuôn mặt của Microsoft dùng cho thị giác máy, do Morgan Klauss Scheuerman, nhà đạo đức AI phát hiện, dường như chia dân số thế giới thành ba nhóm chủng tộc cùng thuật ngữ gợi lại “khoa học chủng tộc thế kỷ 19”. Thay vì để máy đoán sắc tộc hay giới tính, Williams đề xuất dùng các dấu hiệu tự nguyện như thẻ QR, RFID hoặc ứng dụng điện thoại. Một chiếc ghim có thể tự nguyện cung cấp đại từ nhân xưng, tránh việc AI gọi sai giới tính. Cách này giảm theo dõi không xin phép, nhưng cũng tạo thêm lao động cho con người trong việc giúp máy hiểu.
 
Bài học từ xe tự hành
 
Rủi ro của nhận thức có thể dẫn đến sai lầm chết người khi AI điều khiển vật thể thật. Tháng 3/2018, một xe thử nghiệm tự động của Uber ở Tempe, Arizona, đâm chết người đi bộ Elaine Herzberg khi bà băng qua đường vắng ban đêm. Báo cáo của NTSB cho biết hệ thống phát hiện bà trên đường 5,6 giây trước va chạm, nhưng xe không giảm tốc hay phanh. Tài xế an toàn duy nhất cũng mất tập trung và không kịp nhận ra.
 
Lỗi phân loại đóng vai trò lớn. Hệ thống phát hiện và theo dõi Herzberg, nhưng “không bao giờ phân loại chính xác bà là người đi bộ hay dự đoán đường đi”. Phần mềm ban đầu xếp bà là xe, vật thể không xác định, rồi người đi xe đạp. Việc bà dắt xe đạp có thể khiến hình dạng không khớp mẫu “người đi bộ” chuẩn. Hành vi băng qua đường ngoài vạch cũng nằm ngoài giả định của phần mềm Uber.
 
Năm 2019, NVIDIA miêu tả cách hệ thống xe tự động chuyển từ khung bao đơn giản sang phân đoạn hình ảnh chi tiết hơn, vì “trong thế giới thật, không phải mọi thứ đều vừa trong một chiếc hộp”. Kỹ thuật phân đoạn toàn cảnh giúp nhận ra mặt đường, tán cây, xe, người, vật thể chồng lấp, rác trên đường hoặc người dỡ hàng khỏi xe van. Năm 2022, Waymo cũng tuyên bố khung bao không cho biết người đi bộ đang đứng, ngồi hay ra hiệu. Hệ thống của Waymo dùng các điểm và đường mô phỏng khung xương người, giúp theo dõi tay chân, tư thế, đầu và dự đoán ý định băng qua đường.
 
Ý tưởng “dạy máy tính về con người” từng xuất hiện từ thời Macintosh, quảng cáo Apple khi đó hỏi: “Vì máy tính thông minh như vậy, chẳng phải hợp lý hơn nếu dạy máy tính về con người, thay vì dạy con người về máy tính sao?” Khi ấy, đó chỉ là ẩn dụ UX. Ngày nay, AI thật sự học về con người. Nhưng nếu chỉ học qua các biểu diễn thô, nhị phân và thuận tiện cho tính toán, bài học ấy vẫn quá nghèo.
 
Tương lai cần cả hai phía học lẫn nhau. AI cần giao diện sâu hơn với thế giới: mô hình giải phẫu như Waymo, bản sao số của hạ tầng, thuật toán giúp robot ước lượng trọng lượng khi cầm vật, giúp làm giàu “mô hình thế giới” của AI. Con người cũng cần hiểu hơn cách máy nhìn. Sống cùng AI không đơn giản như vuốt giao diện iOS, ta phải làm việc với cả mã văn hóa lẫn mã tính toán, nhằm giúp máy nhìn con người đúng hơn, và con người hiểu rõ hơn đôi mắt mới đang quan sát mình.
 
shared via noema

Bình luận

This site is protected by reCAPTCHA and the Google Privacy Policy and Terms of Service apply.
Bình luận của bạn sẽ được duyệt trước khi đăng lên