Trình Dịch AI Offline của Google Cho Thấy AI Địa Phương Có Thể Làm Gì Khi Không Có Đám Mây

News

Bởi Wendy Frey

Trí tuệ nhân tạo không phải lúc nào cũng cần một trung tâm dữ liệu để hữu ích. Thí nghiệm mới nhất của Google với Gemma Translator khiến ý tưởng đó trở nên rõ ràng một cách bất ngờ: một thiết bị dịch giọng nói nhỏ gọn, di động có thể lắng nghe, dịch và nói mà không cần kết nối internet.

Được xây dựng dựa trên Raspberry Pi 5 và mô hình nhẹ của Google là Gemma 4 E2B, dự án biến một tập hợp các thành phần giá rẻ thành một thiết bị dịch AI hoàn toàn địa phương. Đây không phải là một thiết bị thương mại mới của Google, mà là một nguyên mẫu mã nguồn mở được thiết kế để minh chứng khả năng của AI có thể chuyển từ đám mây sang phần cứng hàng ngày.

Và điều đó có thể quan trọng hơn chính bản thân trình dịch. Gemma Translator là một ví dụ khác về sự chuyển dịch rộng hơn hướng tới AI trên thiết bị, nơi xử lý diễn ra tại chỗ thay vì gửi mọi yêu cầu đến một máy chủ từ xa.

Google Gemma Translator Là Gì?

Gemma Translator là một dự án dịch giọng nói mã nguồn mở được phát triển với sự hỗ trợ của Google Antigravity. Mục đích của nó rất đơn giản: cho phép hai người nói những ngôn ngữ khác nhau giao tiếp qua một thiết bị nhỏ gọn thực hiện toàn bộ quy trình dịch tại chỗ.

Nguyên mẫu kết hợp một Raspberry Pi 5 với 8GB RAM, một micro, một loa hoặc tai nghe và một màn hình nhỏ. Phần cứng có thể được đặt bên trong một vỏ in 3D tùy chỉnh, khiến sản phẩm trông giống như một trình dịch cầm tay thực thụ hơn là một máy tính đơn lẻ thông thường.

Tuy nhiên, có một sự phân biệt quan trọng. Google chưa công bố Gemma Translator như một sản phẩm tiêu dùng. Đây là một bản trình diễn công nghệ và một dự án mã nguồn mở. Mã, kịch bản triển khai và các tệp vỏ in 3D có sẵn cho các nhà phát triển và những người đam mê muốn tái tạo hoặc sửa đổi hệ thống.

Thành phầnVai trò
Raspberry Pi 5, 8GBPhần cứng tính toán địa phương
Gemma 4 E2BDịch AI
LiteRT-LMThời gian chạy mô hình địa phương
MoonshineXử lý giọng nói
MicroĐầu vào giọng nói
Loa/tai ngheĐầu ra giọng nói đã dịch
Màn hình nhỏGiao diện người dùng
Vỏ in 3DVỏ di động

Trình Dịch AI Offline Hoạt Động Như Thế Nào?

Phần thú vị nhất của dự án không phải là phần cứng mà là cách mà bộ phần mềm được chia thành vài thành phần địa phương.

Khi một người nói vào micro, âm thanh được xử lý trên thiết bị. Giọng nói được chuyển thành văn bản, văn bản kết quả được dịch bởi Gemma, và câu đã dịch sau đó được chuyển lại thành giọng nói. Kho lưu trữ mô tả điều này như một quy trình địa phương liên quan đến nhận diện giọng nói, dịch dựa trên Gemma và chuyển văn bản thành giọng nói.

Dự án được thiết kế xung quanh hai làn giao tiếp. Mỗi người chọn một ngôn ngữ, ghi lại câu của họ và nhận được bản dịch sang ngôn ngữ của người kia. Trong cách triển khai hiện tại, tương tác dựa trên điều khiển đẩy để nói thay vì một trợ lý luôn lắng nghe.

Điều quan trọng là suy diễn AI diễn ra tại chỗ. Khi phần mềm và mô hình yêu cầu đã được cài đặt, trình dịch không cần kết nối internet để thực hiện nhiệm vụ chính của nó.

Điều đó thay đổi đáng kể cách sử dụng thực tế. Một trình dịch dựa trên đám mây có thể trở nên không đáng tin cậy khi kết nối kém. Một thiết bị offline có thể tiếp tục hoạt động trên máy bay, ở khu vực xa xôi hoặc ở những nơi không có cơ sở hạ tầng mạng.

Tại Sao Gemma 4 E2B Quan Trọng

Ở trung tâm của dự án là Gemma 4 E2B, một trong những mô hình nhỏ hơn của Gemma do Google thiết kế cho các ứng dụng biên.

Các mô hình AI lớn mạnh mẽ, nhưng thường yêu cầu nhiều tài nguyên tính toán. Mục đích của các mô hình biên nhỏ hơn là khác: họ hy sinh một số quy mô đổi lấy khả năng chạy trực tiếp trên điện thoại, máy tính và phần cứng nhúng.

Google đã tích cực đẩy mạnh cách tiếp cận này với Gemma 4 và thời gian chạy LiteRT-LM của nó. Công ty cho biết LiteRT-LM được thiết kế để làm cho các mô hình Gemma trở nên thực tế trên một loạt các thiết bị, bao gồm Raspberry Pi 5. Tài liệu của Google cũng chỉ ra rằng các mô hình E2B và E4B là những lựa chọn cho các ứng dụng biên và IoT.

Gemma Translator chứng minh chiến lược đó trông như thế nào ngoài một bài kiểm tra hoặc bản trình diễn dành cho nhà phát triển. Thay vì yêu cầu một dịch vụ AI từ xa dịch một câu, Raspberry Pi trở thành máy tính AI.

Điều đó là một sự thay đổi đáng kể trong cách chúng ta có thể nghĩ về phần cứng AI.

Không Có Đám Mây Có Nghĩa Là Hơn Chỉ Là Làm Việc Offline

Lợi thế rõ ràng của dịch địa phương là kết nối. Nếu không có Wi-Fi hoặc tín hiệu di động, thiết bị vẫn có thể thực hiện chức năng chính của mình.

Nhưng quyền riêng tư có thể cũng quan trọng không kém.

Với một dịch vụ dịch đám mây, các bản ghi âm giọng nói hoặc các cuộc trò chuyện được chuyển thành văn bản có thể cần phải rời khỏi thiết bị để xử lý. Một kiến trúc offline có thể giữ quy trình xử lý giọng nói trên phần cứng địa phương thay vào đó. Đối với các cuộc trò chuyện nhạy cảm, các cuộc họp riêng tư hoặc các hoạt động thực địa, điều đó có thể là một lợi thế có ý nghĩa.

Điều này không tự động làm cho mọi ứng dụng AI địa phương hoàn toàn riêng tư hoặc an toàn. Các bảo đảm về quyền riêng tư thực sự phụ thuộc vào cấu hình phần mềm và phần cứng hoàn chỉnh. Tuy nhiên, việc loại bỏ nhu cầu truyền dữ liệu giọng nói đến một dịch vụ AI từ xa loại bỏ một loại phơi bày quan trọng.

Nguyên tắc tương tự cũng áp dụng ngoài dịch thuật. AI địa phương có thể hữu ích cho trợ lý cá nhân, công cụ tiếp cận, thiết bị giáo dục, hệ thống công nghiệp và thiết bị khẩn cấp nơi mà kết nối không thể được đảm bảo.

Google Đang Xây Dựng Một Hệ Sinh Thái AI Trên Thiết Bị Lớn Hơn

Gemma Translator càng có ý nghĩa hơn khi được xem như một phần của chiến lược AI biên rộng lớn hơn của Google.

Ngăn xếp LiteRT-LM của công ty được thiết kế đặc biệt để chạy AI sinh điều kiện tại chỗ. Google mô tả nó như một phần mở rộng của công nghệ LiteRT với các khả năng tối ưu hóa cho các mô hình sinh, trong khi công việc gần đây của Gemma 4 đã nhấn mạnh khả năng chạy các mô hình nhỏ hơn trên phần cứng di động, máy tính để bàn và IoT.

Raspberry Pi đặc biệt thú vị vì nó nằm giữa máy tính truyền thống và một thiết bị nhúng. Nó rẻ, nhỏ gọn và dễ tiếp cận với các nhà phát triển. Nếu các mô hình đủ khả năng để thực hiện các nhiệm vụ hữu ích trên phần cứng nhỏ như vậy, số lượng các ứng dụng AI khả dĩ sẽ mở rộng đáng kể.

Vì vậy, trình dịch ít thú vị hơn như một sự thay thế cho Google Dịch mà như một bằng chứng về khái niệm.

Nó đặt ra một câu hỏi lớn hơn: điều gì sẽ xảy ra khi AI hữu ích không còn cần sống trong đám mây?

Bạn Có Thể Tự Xây Dựng Trình Dịch Google Không?

Có. Một trong những khía cạnh mạnh mẽ nhất của dự án là Google đã làm cho việc triển khai có sẵn dưới dạng mã nguồn mở.

Kho lưu trữ chính thức bao gồm mã ứng dụng, kịch bản cài đặt, cấu hình triển khai và các tệp STL cho vỏ in 3D. Yêu cầu phần cứng được tài liệu là một Raspberry Pi 5 với 8GB RAM, cùng với đầu vào âm thanh, đầu ra âm thanh và một màn hình.

Phần mềm có thể được triển khai thông qua các kịch bản đã cung cấp. Dự án tạo ra một môi trường Python, tải xuống mô hình Gemma cần thiết và khởi động các dịch vụ địa phương. Cũng có một kịch bản triển khai Raspberry Pi chuyên dụng để cấu hình thiết bị như một ứng dụng kiosk vĩnh viễn.

Điều này làm cho Gemma Translator trở thành một thứ gì đó hơn là một cuộc trình diễn flashy. Các nhà phát triển có thể kiểm tra việc triển khai, thử nghiệm với giao diện, thay thế các thành phần hoặc sử dụng kiến trúc như một điểm khởi đầu cho các dự án AI biên của riêng họ.

Vẫn còn những hạn chế rõ ràng. Thiết bị là một nguyên mẫu hơn là một sản phẩm thương mại hoàn thiện, và hiệu suất AI địa phương phụ thuộc vào cấu hình phần cứng và phần mềm. Một Raspberry Pi không thể đơn giản cung cấp khả năng xử lý tương đương như một cụm hạ tầng đám mây lớn.

Nhưng chính điều đó làm cho thí nghiệm trở nên thú vị.

Hình Ảnh Lớn Hơn: AI Đang Di Chuyển Gần Hơn Đến Người Dùng

Trong nhiều năm, mô hình AI thống trị rất đơn giản: thiết bị của bạn gửi một yêu cầu đến một máy chủ mạnh mẽ, máy chủ xử lý và gửi lại kết quả.

Mô hình đó không biến mất. AI đám mây sẽ vẫn rất quan trọng cho nhiều ứng dụng đòi hỏi cao.

Nhưng các dự án như Gemma Translator của Google chứng minh sự thay thế. Khi các mô hình trở nên nhỏ hơn và thời gian chạy trở nên hiệu quả hơn, nhiều khả năng AI hơn có thể di chuyển trực tiếp vào những thiết bị mà chúng ta đã sở hữu.

Dịch thuật là một ví dụ đặc biệt tốt vì quy trình làm việc dễ hiểu. Bạn nói, AI xử lý yêu cầu và người khác nghe thấy kết quả. Không có hạ tầng máy chủ đáng chú ý và, sau khi thiết lập, không cần kết nối internet.

Phần quan trọng nhất trong dự án của Google có thể không phải là trình dịch nhỏ bé đó. Nó là sự chứng minh rằng một mô hình AI sinh hiện đại có thể trở thành một thành phần bên trong một thiết bị nhỏ gọn, giá rẻ và di động.

Gemma Translator không phải là sản phẩm Google Translate tiếp theo. Đây là một cái nhìn về những gì đến sau AI chỉ trên đám mây: những thiết bị thông minh có thể hoạt động độc lập, giữ nhiều quy trình tại chỗ và vẫn hữu ích ngay cả khi internet biến mất.

Mẫu viral

Khám phá các mẫu AI viral của chúng tôi và áp dụng vào ảnh của bạn.

Khám phá mẫu