Dữ liệu tổng hợp đang thay đổi cách xây dựng và kiểm thử hệ thống AI

Trong quá trình phát triển một hệ thống AI, mô hình thường được chú ý nhiều hơn dữ liệu đứng phía sau nó. Tuy nhiên, chất lượng, phạm vi và cách quản lý dữ liệu mới là những yếu tố quyết định hệ thống có hoạt động ổn định hay không. Khi dữ liệu thực tế khó thu thập, chứa thông tin nhạy cảm hoặc không đủ đại diện cho các tình huống hiếm gặp, dữ liệu tổng hợp đang trở thành một hướng tiếp cận được quan tâm.

Dữ liệu tổng hợp là dữ liệu được tạo ra bằng thuật toán hoặc mô hình mô phỏng thay vì thu thập trực tiếp từ một sự kiện hay một cá nhân cụ thể. Nó có thể là hình ảnh của những vật thể không tồn tại, hồ sơ giao dịch giả lập, đoạn hội thoại được tạo theo kịch bản, dữ liệu cảm biến mô phỏng hoặc các trường hợp ngoại lệ được dựng lại để kiểm thử. Mục tiêu không phải là tạo ra những bản sao hoàn hảo của thế giới, mà là cung cấp thêm nguyên liệu có cấu trúc phù hợp cho việc huấn luyện, đánh giá và cải thiện hệ thống AI.

Vì sao dữ liệu thực tế không phải lúc nào cũng đủ

Dữ liệu thực tế có lợi thế rõ ràng vì nó phản ánh các tình huống đã xảy ra. Dù vậy, việc thu thập và sử dụng loại dữ liệu này thường gặp nhiều giới hạn. Một bộ dữ liệu y tế có thể chứa thông tin riêng tư, dữ liệu giao dịch có thể liên quan đến danh tính và thói quen tài chính, còn dữ liệu hình ảnh trong môi trường công cộng có thể đặt ra câu hỏi về sự đồng thuận và mục đích sử dụng. Do đó, không phải dữ liệu nào có thể thu thập cũng có thể đưa ngay vào quy trình huấn luyện.

Một vấn đề khác là những tình huống quan trọng thường không xuất hiện đủ nhiều trong dữ liệu lịch sử. Một hệ thống hỗ trợ phát hiện lỗi trong dây chuyền sản xuất cần nhận biết cả những trạng thái bất thường, nhưng lỗi nghiêm trọng có thể hiếm khi xảy ra. Một công cụ hỗ trợ giao thông cần được kiểm thử trong điều kiện thời tiết, ánh sáng và mật độ phương tiện đa dạng, trong khi việc chờ các tình huống đó xuất hiện ngoài đời vừa tốn thời gian vừa khó kiểm soát.

Dữ liệu tổng hợp cho phép đội ngũ phát triển chủ động tạo ra các trường hợp còn thiếu. Họ có thể điều chỉnh một số biến, tăng tần suất của tình huống hiếm hoặc dựng môi trường có kiểm soát để quan sát phản ứng của mô hình. Đây là lý do dữ liệu tổng hợp thường được xem như phần bổ sung cho dữ liệu thực tế, chứ không nhất thiết là phương án thay thế hoàn toàn.

Dữ liệu tổng hợp được tạo ra như thế nào

Có nhiều cách tạo dữ liệu tổng hợp, tùy vào dạng dữ liệu và mục tiêu của dự án. Với dữ liệu có cấu trúc như bảng giao dịch, hồ sơ vận hành hoặc thông tin cảm biến, hệ thống có thể học các mối quan hệ thống kê giữa các trường rồi tạo ra những bản ghi mới có đặc điểm tương tự. Các bản ghi này không nhất thiết trùng với một cá nhân hay giao dịch thật, nhưng vẫn giữ được những quy luật cần thiết để phục vụ thử nghiệm.

Trong lĩnh vực hình ảnh và âm thanh, dữ liệu có thể được tạo từ môi trường mô phỏng, kỹ thuật biến đổi hoặc mô hình sinh. Chẳng hạn, một đội ngũ có thể xây dựng nhiều phiên bản ánh sáng, góc nhìn, nền cảnh và điều kiện thời tiết khác nhau để kiểm tra khả năng nhận diện của hệ thống. Với xử lý ngôn ngữ, dữ liệu tổng hợp có thể là các đoạn hội thoại theo vai trò, mục đích và mức độ mơ hồ được xác định trước.

Một phương pháp khác là kết hợp dữ liệu thực với dữ liệu mô phỏng. Dữ liệu thực cung cấp bối cảnh và đặc điểm gần với đời sống, còn dữ liệu tổng hợp giúp mở rộng những vùng còn thiếu. Sự kết hợp này có thể hữu ích khi dữ liệu thật quá ít, quá lệch về một nhóm người dùng hoặc chưa bao phủ các trường hợp bất thường. Dù sử dụng phương pháp nào, đội ngũ phát triển vẫn cần ghi chép rõ dữ liệu được tạo ra bằng cách nào và dùng cho mục đích gì.

Lợi ích không chỉ nằm ở việc tiết kiệm dữ liệu

Lợi ích dễ thấy nhất của dữ liệu tổng hợp là giảm sự phụ thuộc vào việc thu thập dữ liệu nhạy cảm. Trong một số dự án, dữ liệu có thể được tạo để phục vụ giai đoạn phát triển ban đầu mà không cần đưa toàn bộ thông tin cá nhân vào môi trường thử nghiệm. Điều này không tự động loại bỏ mọi rủi ro riêng tư, nhưng có thể giúp giảm số lượng dữ liệu thật phải sao chép, chia sẻ hoặc lưu trữ trong quá trình xây dựng sản phẩm.

Dữ liệu tổng hợp cũng giúp việc kiểm thử trở nên có chủ đích hơn. Thay vì đánh giá mô hình chủ yếu bằng các mẫu đã có, nhóm phát triển có thể tạo ra một tập kiểm thử tập trung vào những điểm yếu dự kiến. Họ có thể đặt câu hỏi như hệ thống phản ứng ra sao khi hình ảnh bị che khuất, khi câu hỏi có cách diễn đạt khác thường, khi tín hiệu bị nhiễu hoặc khi nhiều điều kiện bất lợi xuất hiện cùng lúc.

Khả năng kiểm soát còn có giá trị trong quá trình tái hiện lỗi. Nếu một lỗi xảy ra ngẫu nhiên trong môi trường thực tế, việc tạo lại đúng hoàn cảnh đó có thể rất khó. Một môi trường mô phỏng được thiết kế tốt cho phép thay đổi từng yếu tố và quan sát nguyên nhân khiến mô hình thất bại. Nhờ vậy, dữ liệu tổng hợp có thể hỗ trợ không chỉ khâu huấn luyện mà cả việc chẩn đoán, so sánh phiên bản và xác nhận bản sửa lỗi.

Rủi ro của việc dùng dữ liệu do máy tạo ra

Dữ liệu tổng hợp không mặc nhiên đáng tin cậy chỉ vì nó không chứa bản ghi của một người thật. Nếu mô hình tạo dữ liệu học từ một nguồn thiên lệch, sản phẩm đầu ra có thể lặp lại hoặc khuếch đại thiên lệch đó. Khi dữ liệu gốc đại diện quá nhiều cho một nhóm và quá ít cho nhóm khác, dữ liệu tổng hợp được tạo từ nó có thể tạo cảm giác phong phú nhưng vẫn thiếu những góc nhìn quan trọng.

Chất lượng bề ngoài cũng có thể gây nhầm lẫn. Một hình ảnh trông tự nhiên hoặc một câu trả lời có vẻ mạch lạc chưa chắc phản ánh đúng phân bố của dữ liệu thực tế. Trong dữ liệu có cấu trúc, các mối quan hệ giữa những trường khác nhau có thể bị tạo sai. Trong dữ liệu ngôn ngữ, câu chữ có thể đúng ngữ pháp nhưng không thể hiện cách con người thực sự diễn đạt trong một bối cảnh cụ thể. Nếu không kiểm chứng, đội ngũ phát triển dễ huấn luyện mô hình trên những mẫu đẹp mắt nhưng thiếu giá trị vận hành.

Rủi ro lớn khác là vòng lặp tự củng cố. Khi dữ liệu do máy tạo tiếp tục được dùng để huấn luyện các hệ thống tạo dữ liệu mới, những sai lệch nhỏ có thể tích lũy qua nhiều vòng. Các mẫu hiếm hoặc cách diễn đạt ít phổ biến có thể dần biến mất, trong khi những mẫu quen thuộc được lặp lại quá nhiều. Vì thế, dữ liệu tổng hợp cần được xem là một nguồn có xuất xứ cụ thể, không phải nguồn vô hạn có thể sử dụng mà không cần giám sát.

Đánh giá dữ liệu tổng hợp cần bắt đầu từ mục tiêu

Không có một tiêu chí duy nhất để kết luận dữ liệu tổng hợp là tốt hay xấu. Một bộ dữ liệu phù hợp cho kiểm thử độ bền có thể không phù hợp để huấn luyện mô hình trong môi trường thực tế. Trước khi tạo dữ liệu, đội ngũ cần xác định rõ mục tiêu: muốn mở rộng phạm vi trường hợp, bảo vệ riêng tư, kiểm tra một lỗi cụ thể hay mô phỏng một quy trình vận hành.

Với mục tiêu huấn luyện, cần xem xét dữ liệu tổng hợp có giúp mô hình học được đặc điểm cần thiết hay không. Với mục tiêu đánh giá, điều quan trọng là tập kiểm thử phải đủ độc lập với dữ liệu dùng để phát triển mô hình. Nếu cùng một quy trình tạo dữ liệu được dùng cho cả huấn luyện và đánh giá mà không có kiểm soát, kết quả có thể lạc quan hơn năng lực thật của hệ thống.

Việc đánh giá nên kết hợp nhiều góc nhìn. Có thể so sánh các đặc điểm thống kê giữa dữ liệu tổng hợp và dữ liệu tham chiếu, kiểm tra sự hiện diện của các nhóm hoặc trường hợp quan trọng, đồng thời nhờ người có chuyên môn xem xét những mẫu đại diện. Trong các lĩnh vực nhạy cảm, cần đánh giá thêm nguy cơ dữ liệu tổng hợp có thể suy ra thông tin từ nguồn gốc hoặc vô tình tái tạo một bản ghi gần như nguyên bản.

Minh bạch về nguồn gốc là điều kiện để sử dụng có trách nhiệm

Mỗi bộ dữ liệu tổng hợp nên đi kèm thông tin về nguồn dữ liệu tham chiếu, phương pháp tạo, các biến đã điều chỉnh, phạm vi sử dụng và những giới hạn đã biết. Hồ sơ này giúp người dùng sau đó hiểu dữ liệu được tạo ra trong điều kiện nào, có thể dùng để trả lời câu hỏi gì và không nên dùng vào đâu. Nếu thiếu thông tin nguồn gốc, việc phát hiện nguyên nhân của một kết quả sai sẽ khó khăn hơn.

Cũng cần phân biệt giữa việc giảm rủi ro riêng tư và việc bảo đảm riêng tư tuyệt đối. Dữ liệu tổng hợp có thể hạn chế việc chia sẻ trực tiếp dữ liệu cá nhân, nhưng hiệu quả bảo vệ phụ thuộc vào phương pháp tạo và mức độ kiểm tra. Một bộ dữ liệu được tạo từ nguồn quá nhỏ hoặc quá đặc thù vẫn có thể chứa dấu hiệu khiến người khác suy đoán về dữ liệu ban đầu.

Trong tổ chức, trách nhiệm quản lý không nên chỉ thuộc về nhóm kỹ thuật. Bộ phận pháp chế, an toàn thông tin, chuyên gia nghiệp vụ và người chịu trách nhiệm sản phẩm đều cần tham gia ở mức phù hợp. Họ có thể đặt ra các câu hỏi về mục đích sử dụng, thời hạn lưu trữ, quyền truy cập, tiêu chí loại bỏ dữ liệu và cách thông báo khi hệ thống được xây dựng một phần từ dữ liệu tổng hợp.

Triển vọng thực tế của dữ liệu tổng hợp

Dữ liệu tổng hợp nhiều khả năng sẽ phát triển song song với dữ liệu thực tế thay vì thay thế hoàn toàn nguồn dữ liệu này. Dữ liệu thực giúp duy trì liên hệ với thế giới thật, còn dữ liệu tổng hợp cho phép mở rộng các kịch bản, tăng tốc thử nghiệm và tạo điều kiện nghiên cứu trong những môi trường khó tiếp cận. Mối quan hệ này đòi hỏi một quy trình liên tục: tạo dữ liệu, kiểm tra, đối chiếu với thực tế, ghi nhận lỗi rồi điều chỉnh.

Điều quan trọng nhất không phải là tạo được càng nhiều dữ liệu càng tốt. Giá trị nằm ở việc dữ liệu có phục vụ đúng câu hỏi mà hệ thống cần giải quyết hay không. Một tập dữ liệu nhỏ nhưng có mục tiêu rõ, được đánh giá độc lập và có hồ sơ đầy đủ có thể hữu ích hơn một kho dữ liệu lớn được tạo ra thiếu kiểm soát.

Trong giai đoạn AI ngày càng được đưa vào các quy trình quan trọng, khả năng giải thích nguồn gốc và giới hạn của dữ liệu sẽ trở thành một phần của chất lượng sản phẩm. Dữ liệu tổng hợp có thể giúp các đội ngũ xây dựng hệ thống an toàn và linh hoạt hơn, nhưng chỉ khi nó được nhìn nhận như một công cụ cần kiểm chứng. Sự tiện lợi trong việc tạo dữ liệu không thể thay thế cho trách nhiệm hiểu dữ liệu, đo lường tác động và biết lúc nào không nên sử dụng nó.