Để một hệ thống trí tuệ nhân tạo hoạt động tốt, dữ liệu thường quan trọng không kém thuật toán. Dữ liệu giúp mô hình nhận ra khuôn mẫu, phân biệt các trường hợp khác nhau và điều chỉnh cách dự đoán. Thế nhưng trong nhiều lĩnh vực, dữ liệu thật không dễ thu thập. Dữ liệu y tế có thể chứa thông tin riêng tư, hình ảnh từ nhà máy thường thuộc quyền kiểm soát của doanh nghiệp, còn các tình huống hiếm gặp gần như không xuất hiện đủ trong những bộ dữ liệu thông thường.
Trong bối cảnh đó, dữ liệu tổng hợp đang được nhắc đến như một cách bổ sung nguồn dữ liệu cho AI. Đây là dữ liệu được tạo ra bằng mô hình máy tính hoặc quy trình mô phỏng, thay vì được ghi nhận trực tiếp từ một người, một thiết bị hay một sự kiện cụ thể trong đời sống. Dữ liệu tổng hợp có thể là văn bản, hình ảnh, âm thanh, video, bảng dữ liệu hoặc những bản ghi mô tả hành vi.
Điểm đáng chú ý là dữ liệu tổng hợp không đơn giản đồng nghĩa với dữ liệu giả. Giá trị của nó nằm ở việc tái tạo một số đặc điểm và mối quan hệ cần thiết của thế giới thật để phục vụ một mục tiêu cụ thể. Tuy nhiên, chính vì được tạo ra từ mô hình và các giả định ban đầu, dữ liệu tổng hợp luôn cần được đánh giá trước khi dùng để huấn luyện, kiểm thử hoặc vận hành AI.
Dữ liệu tổng hợp được tạo ra như thế nào?
Có nhiều cách tạo dữ liệu tổng hợp. Ở mức đơn giản, người phát triển có thể xây dựng các quy tắc để tạo những bản ghi mới. Chẳng hạn, một hệ thống có thể sinh ra các trường hợp giao thông dựa trên tốc độ, khoảng cách giữa các phương tiện, điều kiện ánh sáng và trạng thái mặt đường. Cách này phù hợp khi các quy luật cần mô phỏng đã tương đối rõ ràng.
Với những bài toán phức tạp hơn, dữ liệu có thể được tạo bởi các mô hình học máy. Mô hình được huấn luyện trên dữ liệu thật để học cách dữ liệu phân bố, sau đó tạo ra những mẫu mới có hình thức tương tự nhưng không nhất thiết trùng với bản ghi ban đầu. Trong xử lý hình ảnh, quy trình này có thể tạo ra các cảnh vật, vật thể hoặc điều kiện ánh sáng khác nhau. Trong dữ liệu dạng bảng, nó có thể tạo những bản ghi mô phỏng mối liên hệ giữa các trường thông tin.
Một hướng khác là mô phỏng môi trường. Nhà phát triển dựng lại một không gian kỹ thuật số với các quy tắc về vật lý, chuyển động và tương tác, rồi cho hệ thống AI quan sát nhiều tình huống trong môi trường đó. Phương pháp này đặc biệt hữu ích khi việc thu thập dữ liệu thật tốn kém, nguy hiểm hoặc cần quá nhiều thời gian. Dù vậy, môi trường mô phỏng chỉ có ý nghĩa khi nó thể hiện đủ những biến động quan trọng của thế giới bên ngoài.
Vì sao doanh nghiệp và nhà phát triển quan tâm?
Lợi ích đầu tiên của dữ liệu tổng hợp là khả năng bổ sung những trường hợp khó tìm thấy trong dữ liệu thật. Một hệ thống nhận diện vật thể chẳng hạn có thể cần nhìn thấy vật thể ở nhiều góc, trong điều kiện thiếu sáng hoặc bị che khuất một phần. Nếu chỉ dựa vào dữ liệu thu thập tự nhiên, những tình huống này có thể xuất hiện không đều. Dữ liệu mô phỏng giúp chủ động tạo thêm các trường hợp cần thiết để kiểm thử khả năng của mô hình.
Dữ liệu tổng hợp cũng có thể hỗ trợ bảo vệ quyền riêng tư. Thay vì chia sẻ trực tiếp hồ sơ hoặc hình ảnh gắn với cá nhân, tổ chức có thể tạo ra một bộ dữ liệu mới nhằm giữ lại một số đặc điểm thống kê cần cho nghiên cứu. Điều này không có nghĩa mọi dữ liệu tổng hợp đều tự động an toàn. Nếu quá trình tạo dữ liệu làm lộ lại thông tin của các bản ghi gốc, hoặc nếu người khác có thể suy ra cá nhân từ những chi tiết kết hợp, rủi ro riêng tư vẫn còn tồn tại.
Khả năng kiểm soát là một ưu điểm khác. Với dữ liệu thật, người thu thập thường phải chờ sự kiện xảy ra, sau đó làm sạch và gắn nhãn. Với dữ liệu tổng hợp, họ có thể chỉ định một số điều kiện mong muốn, tạo ra nhiều biến thể và lặp lại quá trình với chi phí thấp hơn trong một số trường hợp. Dữ liệu này cũng hữu ích ở giai đoạn thử nghiệm ban đầu, khi nhóm phát triển cần kiểm tra ý tưởng trước khi đầu tư vào một hệ thống thu thập dữ liệu quy mô lớn.
Tuy nhiên, không nên hiểu rằng dữ liệu tổng hợp luôn rẻ hơn hoặc nhanh hơn dữ liệu thật. Xây dựng mô hình tạo dữ liệu, thiết kế môi trường mô phỏng, xác định quy tắc hợp lý và kiểm tra chất lượng đều cần thời gian, chuyên môn và nguồn lực. Với những bài toán mà mô phỏng không phản ánh đúng thực tế, chi phí sửa sai có thể lớn hơn lợi ích ban đầu.
Giới hạn lớn nhất nằm ở khoảng cách với thực tế
Rủi ro cơ bản của dữ liệu tổng hợp là mô hình tạo dữ liệu chỉ có thể tạo ra những gì nó được thiết kế hoặc huấn luyện để biểu diễn. Nếu dữ liệu ban đầu thiếu một nhóm trường hợp, dữ liệu mới có thể tiếp tục bỏ qua nhóm đó. Nếu các quy tắc mô phỏng đơn giản hóa quá mức, hệ thống AI được huấn luyện bằng dữ liệu ấy có thể hoạt động tốt trong môi trường thử nghiệm nhưng thất bại khi gặp tình huống ngoài đời.
Khoảng cách này thường được gọi theo nghĩa rộng là khoảng cách giữa mô phỏng và thực tế. Một hình ảnh được tạo trong điều kiện ánh sáng hoàn hảo không bảo đảm giúp mô hình nhận diện tốt trong mưa, sương mù hoặc không gian bị che khuất. Một bảng dữ liệu nhân tạo có thể giữ được các mối quan hệ trung bình nhưng bỏ qua những ngoại lệ vốn rất quan trọng trong các quyết định liên quan đến con người.
Chất lượng hình thức cũng không đủ để đánh giá dữ liệu. Một mẫu dữ liệu có vẻ hợp lý với người quan sát vẫn có thể chứa những mối liên hệ sai về mặt nghiệp vụ. Ví dụ, dữ liệu tổng hợp về khách hàng có thể tạo ra các trường thông tin nhất quán về mặt kỹ thuật nhưng lại gán những hành vi không phù hợp với quy trình thực tế. Nếu không có người am hiểu lĩnh vực kiểm tra, lỗi này dễ đi qua các bước đánh giá tự động.
Một vấn đề khác là sự lặp lại sai lệch. Khi dữ liệu tổng hợp được tạo từ dữ liệu thật đã có thiên lệch, mô hình tạo dữ liệu có thể học và tái tạo thiên lệch đó. Nếu dữ liệu tổng hợp tiếp tục được dùng để tạo ra dữ liệu mới, những sai lệch ban đầu có nguy cơ trở nên rõ hơn hoặc khó nhận biết hơn. Vì vậy, việc thay thế hoàn toàn dữ liệu thật bằng dữ liệu tổng hợp không phải là lựa chọn an toàn mặc định.
Khi nào nên kết hợp dữ liệu thật và dữ liệu tổng hợp?
Trong phần lớn trường hợp, cách tiếp cận hợp lý là kết hợp hai loại dữ liệu thay vì xem chúng là những lựa chọn loại trừ nhau. Dữ liệu thật giúp hệ thống bám sát các điều kiện thực tế, còn dữ liệu tổng hợp giúp mở rộng phạm vi tình huống và lấp vào những khoảng trống. Tỷ lệ kết hợp không nên được quyết định chỉ bằng một con số cố định mà cần dựa trên mục tiêu, lĩnh vực và mức độ rủi ro của ứng dụng.
Ở giai đoạn phát triển, dữ liệu tổng hợp có thể được dùng để tạo nguyên mẫu, kiểm tra đường biên và phát hiện lỗi trong logic của mô hình. Sau đó, hệ thống cần được đánh giá bằng dữ liệu thật độc lập với dữ liệu dùng để huấn luyện. Nếu kết quả trên dữ liệu mô phỏng tốt nhưng giảm mạnh trên dữ liệu thực tế, đó là dấu hiệu cho thấy mô hình hoặc quy trình tạo dữ liệu cần được xem xét lại.
Với những hệ thống ảnh hưởng đến quyền lợi của con người, việc đánh giá càng cần thận trọng. Không chỉ cần đo độ chính xác trung bình, nhóm phát triển nên xem xét kết quả theo các nhóm người, điều kiện vận hành và loại tình huống khác nhau. Những trường hợp hiếm nhưng hậu quả nghiêm trọng cũng cần được kiểm tra riêng, thay vì để chúng bị che khuất bởi kết quả tổng thể.
Nguyên tắc sử dụng có trách nhiệm
Trước hết, tổ chức cần ghi rõ dữ liệu được tạo bằng phương pháp nào, dựa trên giả định gì và dùng cho mục đích nào. Một bộ dữ liệu có thể phù hợp để kiểm tra phần mềm nhưng không phù hợp để đưa vào huấn luyện một hệ thống ra quyết định quan trọng. Việc ghi chép giúp các nhóm khác hiểu giới hạn của dữ liệu và tránh sử dụng nó ngoài phạm vi ban đầu.
Tiếp theo, dữ liệu tổng hợp cần được kiểm tra cả về tính đa dạng, tính nhất quán và khả năng đại diện. Các chuyên gia kỹ thuật nên làm việc cùng người hiểu nghiệp vụ để phát hiện những mẫu dữ liệu không hợp lý. Khi dữ liệu có liên quan đến quyền riêng tư, tổ chức cũng cần đánh giá nguy cơ tái nhận diện thay vì chỉ dựa vào nhãn gọi là “tổng hợp”.
Cuối cùng, dữ liệu không nên được xem là tài sản tạo ra một lần rồi dùng mãi. Môi trường thực tế thay đổi, hành vi người dùng thay đổi và những trường hợp mới có thể xuất hiện. Một quy trình quản trị tốt cần theo dõi hiệu quả của mô hình sau khi triển khai, ghi nhận các lỗi ngoài dự đoán và cập nhật cách tạo cũng như cách đánh giá dữ liệu khi cần.
Kết luận
Dữ liệu tổng hợp mở ra một cách tiếp cận linh hoạt cho quá trình phát triển AI, nhất là khi dữ liệu thật khan hiếm, nhạy cảm hoặc khó thu thập. Nó có thể giúp tạo thêm tình huống kiểm thử, hỗ trợ nghiên cứu và giảm việc sử dụng trực tiếp một số dữ liệu cá nhân. Nhưng dữ liệu tổng hợp không phải bản sao hoàn hảo của thế giới thật, cũng không tự động loại bỏ thiên lệch hay rủi ro riêng tư.
Giá trị của dữ liệu tổng hợp phụ thuộc vào mục tiêu, phương pháp tạo và chất lượng kiểm chứng. Cách sử dụng đáng tin cậy nhất thường là xem nó như một lớp bổ sung cho dữ liệu thật, kết hợp với đánh giá độc lập và sự giám sát của con người. Khi hiểu rõ cả khả năng lẫn giới hạn của công cụ này, tổ chức mới có thể khai thác AI hiệu quả mà không nhầm sự hợp lý trên màn hình với độ chính xác ngoài đời.

