Trong nhiều năm, hình dung phổ biến về một ứng dụng AI là người dùng gửi yêu cầu lên máy chủ từ xa, hệ thống xử lý trong trung tâm dữ liệu rồi trả kết quả về thiết bị. Mô hình này tạo điều kiện để tận dụng phần cứng mạnh và các mô hình lớn, nhưng không phải lúc nào cũng phù hợp với những tình huống cần phản hồi tức thì, hạn chế kết nối hoặc yêu cầu dữ liệu được giữ lại tại chỗ. Từ đó, một hướng tiếp cận ngày càng được quan tâm là đưa một phần hoặc toàn bộ quá trình suy luận AI xuống điện thoại, máy tính, camera, xe hơi và các thiết bị cảm biến.
AI trên thiết bị, thường được gọi là AI tại biên hoặc AI chạy cục bộ, không đơn giản là phiên bản thu nhỏ của một chatbot trực tuyến. Đây là cách tổ chức hệ thống trong đó dữ liệu được phân tích gần nơi nó phát sinh, thay vì mặc định chuyển tất cả lên đám mây. Sự thay đổi này ảnh hưởng đến thiết kế mô hình, lựa chọn chip, cách quản lý năng lượng, cơ chế cập nhật và cả cách đánh giá rủi ro. Khi các nhà phát triển chú ý hơn đến toàn bộ vòng đời của một sản phẩm AI, xử lý tại chỗ trở thành một lựa chọn kiến trúc đáng cân nhắc chứ không chỉ là một tính năng kỹ thuật.
AI tại chỗ hoạt động như thế nào?
Ở mức cơ bản, một mô hình AI được huấn luyện trước trên hạ tầng có năng lực tính toán lớn. Sau giai đoạn đó, mô hình có thể được tối ưu để thực hiện suy luận trên một thiết bị cụ thể. Quá trình tối ưu có thể bao gồm giảm kích thước mô hình, thay đổi cách biểu diễn số, loại bỏ những phần ít ảnh hưởng đến kết quả hoặc phân chia nhiệm vụ giữa bộ xử lý trung tâm, bộ xử lý đồ họa và các khối tăng tốc AI chuyên dụng.
Không phải ứng dụng nào cũng cần đưa toàn bộ mô hình xuống thiết bị. Một hệ thống có thể nhận diện câu lệnh đơn giản tại chỗ, sau đó chuyển những yêu cầu phức tạp lên máy chủ. Cách kết hợp này thường được gọi là kiến trúc lai. Thiết bị đảm nhiệm các tác vụ cần phản hồi nhanh hoặc liên quan đến dữ liệu nhạy cảm, còn đám mây cung cấp năng lực xử lý cho những công việc vượt quá giới hạn phần cứng. Ranh giới giữa hai phía phải được thiết kế rõ ràng, bởi việc chuyển dữ liệu qua lại cũng tạo ra độ trễ, chi phí kết nối và những điểm cần bảo vệ.
Trong một số trường hợp khác, thiết bị chỉ tạo ra bản tóm tắt hoặc đặc trưng cần thiết trước khi gửi đi. Chẳng hạn, camera có thể phát hiện một sự kiện theo quy tắc đã định rồi chỉ gửi đoạn dữ liệu liên quan thay vì truyền liên tục toàn bộ luồng hình ảnh. Tuy nhiên, cách làm này không tự động bảo đảm riêng tư. Nếu thiết bị phân tích sai hoặc gửi đi nhiều thông tin hơn mức cần thiết, rủi ro vẫn có thể xuất hiện. Vì vậy, xử lý tại chỗ nên được xem là một lớp trong chiến lược bảo vệ dữ liệu, không phải lời bảo đảm tuyệt đối.
Bốn lợi ích nổi bật của xử lý AI tại thiết bị
Phản hồi nhanh hơn
Độ trễ của một tính năng AI không chỉ đến từ thời gian mô hình tạo ra kết quả. Dữ liệu còn phải được đóng gói, truyền qua mạng, chờ máy chủ xử lý rồi quay trở lại thiết bị. Khi tác vụ được thực hiện tại chỗ, nhiều bước trong chuỗi này được loại bỏ. Điều đó đặc biệt hữu ích với các tính năng tương tác bằng giọng nói, dịch trực tiếp, hỗ trợ lái xe, nhận diện cử chỉ hoặc điều khiển máy móc.
Phản hồi nhanh không chỉ tạo cảm giác sử dụng mượt mà hơn. Trong những hệ thống có liên quan đến an toàn hoặc vận hành theo thời gian thực, việc không phải chờ kết nối mạng có thể giúp thiết bị duy trì chức năng khi mạng chập chờn. Dù vậy, nhà phát triển vẫn phải xác định rõ giới hạn của hệ thống. Một mô hình chạy nhanh nhưng nhận diện không ổn định có thể gây hại nhiều hơn một mô hình chậm hơn nhưng có cơ chế kiểm tra phù hợp.
Giảm việc truyền dữ liệu nhạy cảm
Điện thoại, đồng hồ thông minh, camera và thiết bị gia đình có thể thu thập những dữ liệu rất riêng tư như giọng nói, hình ảnh, thói quen sinh hoạt hoặc thông tin về vị trí. Nếu dữ liệu được xử lý tại thiết bị, nhà cung cấp có thể giảm nhu cầu đưa dữ liệu thô lên máy chủ. Đây là lợi ích quan trọng về mặt thiết kế, vì dữ liệu chưa rời khỏi thiết bị sẽ không phải đi qua nhiều hệ thống trung gian.
Tuy nhiên, quyền riêng tư còn phụ thuộc vào nhiều yếu tố khác. Ứng dụng phải thông báo rõ dữ liệu nào được xử lý cục bộ, dữ liệu nào được đồng bộ, dữ liệu lưu trong bao lâu và người dùng có thể xóa chúng bằng cách nào. Bản thân thiết bị cũng cần được bảo vệ khỏi việc truy cập trái phép. Một mô hình chạy tại chỗ nhưng nằm trong hệ thống dễ bị khai thác không thể được xem là giải pháp riêng tư hoàn chỉnh.
Giảm sự phụ thuộc vào kết nối mạng
Những nơi có mạng yếu, mất kết nối hoặc bị giới hạn lưu lượng có thể vẫn sử dụng các chức năng AI cơ bản nếu mô hình đã được cài đặt trên thiết bị. Đây là ưu điểm đáng kể đối với các ứng dụng di động, thiết bị làm việc ngoài hiện trường và những hệ thống cần hoạt động liên tục. AI tại chỗ cũng có thể giúp giảm lượng dữ liệu phải truyền, từ đó hạn chế chi phí băng thông trong các triển khai có nhiều cảm biến.
Tạo thêm quyền chủ động cho người dùng và tổ chức
Khi mô hình và dữ liệu được kiểm soát ở gần người sử dụng, tổ chức có thể chủ động hơn trong việc lựa chọn phiên bản, đặt chính sách lưu trữ và quyết định thời điểm cập nhật. Một đơn vị có yêu cầu nghiêm ngặt về dữ liệu nội bộ có thể ưu tiên mô hình chạy trong mạng riêng hoặc trên thiết bị thay vì phụ thuộc hoàn toàn vào dịch vụ bên ngoài. Quyền chủ động này đi kèm trách nhiệm lớn hơn, bởi tổ chức phải tự quản lý hiệu năng, bảo mật và vòng đời phần mềm.
Những giới hạn không thể bỏ qua
Thiết bị cá nhân thường có bộ nhớ, năng lực tính toán và khả năng tản nhiệt hạn chế hơn hạ tầng đám mây. Mô hình càng lớn thì yêu cầu về bộ nhớ và năng lượng càng cao. Nếu tối ưu quá mạnh, mô hình có thể mất độ chính xác ở những trường hợp ít xuất hiện trong dữ liệu huấn luyện. Bài toán không phải là làm cho mô hình nhỏ nhất bằng mọi giá, mà là tìm được điểm cân bằng giữa chất lượng, tốc độ, mức tiêu thụ điện và dung lượng phần mềm.
Năng lượng là một ràng buộc đặc biệt rõ trên thiết bị dùng pin. Một tính năng AI hoạt động liên tục có thể làm giảm thời lượng sử dụng hoặc khiến thiết bị nóng hơn. Vì thế, hệ thống cần biết khi nào nên kích hoạt mô hình, khi nào có thể dùng phương pháp đơn giản hơn và khi nào nên chuyển tác vụ lên máy chủ. Thiết kế tốt thường không chạy suy luận ở mức cao nhất mọi lúc, mà điều chỉnh theo ngữ cảnh và mức độ cần thiết.
Khả năng cập nhật cũng là một vấn đề quan trọng. Mô hình AI có thể trở nên kém phù hợp khi môi trường, ngôn ngữ hoặc hành vi người dùng thay đổi. Một thiết bị triển khai ngoài thực địa trong thời gian dài cần cơ chế cập nhật an toàn, có thể quay lại phiên bản trước nếu phát sinh lỗi và không làm gián đoạn chức năng thiết yếu. Nếu bỏ qua khâu này, mô hình cài đặt ban đầu dù hoạt động tốt vẫn có thể suy giảm theo thời gian.
Thêm vào đó, mô hình chạy cục bộ không miễn nhiễm với các cuộc tấn công. Kẻ xấu có thể tìm cách trích xuất mô hình, can thiệp vào dữ liệu đầu vào hoặc khai thác lỗi trong phần mềm bao quanh mô hình. Những hệ thống phụ thuộc vào nhận diện hình ảnh hay giọng nói còn phải đối mặt với dữ liệu giả mạo và các tình huống bất thường mà quá trình kiểm thử thông thường chưa bao phủ. Bảo mật vì thế phải được xem xét từ phần cứng, hệ điều hành, ứng dụng đến cơ chế phân phối mô hình.
Thiết kế một sản phẩm AI tại chỗ có trách nhiệm
Bước đầu tiên không phải là chọn một mô hình nổi tiếng, mà là xác định nhiệm vụ cụ thể. Nhà phát triển cần biết hệ thống phải trả lời câu hỏi nào, trong bao lâu, ở điều kiện nào và mức sai sót nào có thể chấp nhận. Một tác vụ hẹp với đầu vào ổn định thường phù hợp với mô hình nhỏ hơn một hệ thống cố gắng xử lý mọi yêu cầu. Phạm vi rõ ràng giúp tránh việc đưa năng lực dư thừa vào thiết bị mà không tạo thêm giá trị thực tế.
Tiếp theo, cần đánh giá trên dữ liệu gần với môi trường sử dụng thật. Một mô hình nhận diện giọng nói có thể hoạt động tốt trong phòng yên tĩnh nhưng kém ổn định ở nơi đông người. Một mô hình phân tích hình ảnh có thể cho kết quả khác nhau dưới điều kiện ánh sáng thay đổi. Việc đo lường nên bao gồm không chỉ độ chính xác trung bình, mà cả những nhóm trường hợp dễ bị bỏ sót, mức tiêu thụ năng lượng, thời gian phản hồi và hành vi khi đầu vào không rõ ràng.
Giao diện cũng cần thể hiện sự không chắc chắn một cách phù hợp. Khi mô hình không đủ cơ sở để kết luận, ứng dụng nên yêu cầu người dùng xác nhận, chuyển sang phương án khác hoặc thông báo rằng cần kết nối với dịch vụ có năng lực cao hơn. Một hệ thống đáng tin cậy không cố tỏ ra chắc chắn trong mọi tình huống. Nó giúp người dùng hiểu kết quả được tạo ra như thế nào và khi nào cần kiểm tra lại.
Cuối cùng, quyền kiểm soát dữ liệu phải được đưa vào ngay từ đầu. Người dùng cần biết dữ liệu nào được lưu, dữ liệu nào chỉ được xử lý tạm thời và việc gửi dữ liệu lên máy chủ có phải là bắt buộc hay không. Với sản phẩm dành cho tổ chức, cần có nhật ký hoạt động, phân quyền truy cập và quy trình xử lý sự cố. Những nguyên tắc này không làm giảm giá trị của AI tại chỗ; ngược lại, chúng giúp lợi ích về riêng tư và chủ động trở thành đặc tính có thể kiểm chứng.
AI tại chỗ sẽ thay thế đám mây?
Khả năng cao tương lai không nằm ở việc chọn một bên và loại bỏ bên còn lại. AI tại chỗ phù hợp với phản hồi nhanh, dữ liệu nhạy cảm, tác vụ lặp lại và điều kiện kết nối không ổn định. Đám mây vẫn có lợi thế khi cần mô hình lớn, dữ liệu tổng hợp ở quy mô rộng, cập nhật tập trung hoặc năng lực tính toán vượt quá giới hạn thiết bị. Kiến trúc lai cho phép mỗi bên đảm nhiệm phần việc phù hợp hơn.
Điều quan trọng là quyết định nơi xử lý phải xuất phát từ yêu cầu của sản phẩm, chứ không chỉ từ xu hướng công nghệ. Một ứng dụng nên đưa tác vụ xuống thiết bị khi điều đó thực sự cải thiện trải nghiệm, giảm rủi ro hoặc tăng khả năng hoạt động. Ngược lại, nếu mô hình cục bộ quá nặng, khó cập nhật và không tạo ra lợi ích rõ ràng, việc giữ một phần xử lý trên máy chủ có thể hợp lý hơn.
AI chạy ngay trên thiết bị đang mở rộng cách chúng ta nghĩ về một hệ thống thông minh. Thay vì coi dữ liệu luôn phải rời khỏi nơi phát sinh, các nhà phát triển có thể thiết kế sản phẩm theo hướng xử lý vừa đủ, đúng nơi và đúng thời điểm. Thành công của hướng đi này sẽ không được quyết định chỉ bởi kích thước mô hình, mà bởi khả năng kết hợp giữa hiệu năng, riêng tư, bảo mật, tính minh bạch và nhu cầu thực tế của con người.

