谷歌的离线 AI 翻译器展示了本地 AI 在没有云端的情况下可以做什么

News

作者:Wendy Frey

人工智能并不总是需要数据中心才能发挥作用。谷歌最新的 Gemma 翻译器实验让这个概念变得相当具体:一个小型便携的语音翻译器,可以在没有互联网连接的情况下进行听、翻译和说话。

该项目以 Raspberry Pi 5 和谷歌的轻量级 Gemma 4 E2B 模型为基础,将一组廉价组件转化为一个完全本地的 AI 翻译设备。这不是谷歌的新商业小工具,而是一个开源原型,旨在展示 AI 如何能够从云端转移到日常硬件。

而这可能比翻译器本身更为重要。Gemma 翻译器是向设备 AI 转变的又一个例证,在这里,处理是在本地进行的,而不是将每个请求发送到远程服务器。

什么是谷歌 Gemma 翻译器?

Gemma 翻译器是一个开源语音翻译项目,得到了谷歌反重力团队的支持。它的目的是简单的:允许说不同语言的两个人通过一个紧凑的设备进行沟通,该设备在本地执行整个翻译流程。

该原型结合了 Raspberry Pi 5 的 8GB 内存、一个麦克风、一个扬声器或耳机以及一个小显示屏。硬件可以放置在自定义的 3D 打印外壳内,使结果看起来更像一个专用的手持翻译器,而不是传统的单板计算机。

然而,有一个重要的区别。谷歌并没有将 Gemma 翻译器宣布为消费产品。它是一个技术展示和开源项目。代码、部署脚本和 3D 可打印的外壳文件都可供希望重现或修改该系统的开发者和爱好者使用。

组件角色
Raspberry Pi 5, 8GB本地计算硬件
Gemma 4 E2BAI 翻译
LiteRT-LM本地模型运行时
Moonshine语音处理
麦克风语音输入
扬声器/耳机翻译后的语音输出
小显示屏用户界面
3D 打印外壳便携外壳

离线 AI 翻译器如何工作?

该项目最有趣的部分并不是它的硬件,而是其软件堆栈被划分为几个本地组件的方式。

当一个人对着麦克风说话时,音频在设备上进行处理。语音被转录,生成的文本由 Gemma 翻译,翻译后的句子再转换回语音。该仓库描述了这作为一个本地管道,涉及语音识别、基于 Gemma 的翻译和文本转语音。

该项目是围绕两个会话通道设计的。每个人选择一种语言,录下他们的短语,并在另一个人的语言中收到翻译。在当前的实现中,交互是基于按键说话的控制,而不是一个不断监听的助手。

关键点是 AI 推断本身在本地进行。一旦安装了所需的软件和模型,翻译器便不需要互联网连接来执行其核心任务。

这在实际使用案例中改变了许多。当连接性不佳时,基于云的翻译器可能会变得不可靠。离线设备可以继续在飞机上、偏远地区或网络基础设施不可用的地方工作。

为什么 Gemma 4 E2B 重要

该项目的核心是 Gemma 4 E2B,这是谷歌为边缘应用设计的较小的 Gemma 模型之一。

大型 AI 模型非常强大,但通常需要大量计算资源。较小的边缘模型的目的是不同的,它们在规模上有所牺牲,以换取能够直接在手机、计算机和嵌入式硬件上运行的能力。

谷歌一直积极推动这种方法,借助 Gemma 4 及其 LiteRT-LM 运行时。该公司表示 LiteRT-LM 是为了让 Gemma 模型在更广泛的设备上变得实用而设计的,包括 Raspberry Pi 5。谷歌自己的文档强调 E2B 和 E4B 模型是边缘和物联网应用的选项。

Gemma 翻译器展示了这种策略在基准或开发者演示之外的样子。Raspberry Pi 成为 AI 计算机,而不是请求远程 AI 服务去翻译一个句子。

这在思考 AI 硬件的方式上是一个重大的变化。

无云意味着的不仅仅是离线运作

本地翻译的明显优势是连接性。如果没有 Wi-Fi 或手机信号,设备仍然可以执行其主要功能。

但是,隐私同样重要。

使用云翻译服务,语音录音或转录的对话可能需要离开设备进行处理。离线架构可以将语音处理管道保持在本地硬件上。对于敏感的对话、私人会议或野外操作,这可以是一个重要的优势。

这并不自动使每个本地 AI 应用都是完全私密或安全的。实际的隐私保证取决于完整的软件和硬件配置。尽管如此,消除了将语音数据传输到远程 AI 服务的需要,消除了一个重要的曝光类别。

同样的原则适用于翻译之外的应用。本地 AI 可能对个人助手、辅助工具、教育设备、工业系统和无法保证连接的紧急设备有所帮助。

谷歌正在建立更大的本地 AI 生态系统

将 Gemma 翻译器作为谷歌更广泛边缘 AI 战略的一部分来看更有意义。

该公司的 LiteRT-LM 堆栈专门为在本地运行生成性 AI 而设计。谷歌将其描述为对 LiteRT 技术的扩展,具有优化的生成模型能力,而最近的 Gemma 4 工作强调了在移动、桌面和物联网硬件上运行较小模型的能力。

Raspberry Pi 特别有趣,因为它位于传统计算机与嵌入式设备之间。它廉价、紧凑,并且对开发者友好。如果模型变得足够强大,可以在如此小的硬件上执行有用的任务,那么可能的 AI 应用数量将大幅增加。

因此,翻译器作为谷歌翻译的替代品的意义不如作为概念验证。

它提出了一个更大的问题:当有用的 AI 不再需要存在于云中时,会发生什么?

你可以自己构建谷歌翻译器吗?

可以。这个项目最强大的一个方面是谷歌已将实现作为开源提供。

官方仓库包括应用代码、设置脚本、部署配置和 3D 打印外壳的 STL 文件。文档中要求的硬件是一个带有 8GB 内存的 Raspberry Pi 5,以及音频输入、音频输出和显示屏。

可以通过提供的脚本进行软件部署。该项目创建了一个 Python 环境,下载所需的 Gemma 模型并启动本地服务。还有一个专门的 Raspberry Pi 部署脚本,用于将设备配置为永久性的亭子式设备。

这使得 Gemma 翻译器不仅仅是一个华丽的演示。开发者可以检查实现,实验界面,替换组件或将该架构用作他们自己边缘 AI 项目的起点。

当然仍然存在明显的局限性。该设备是一个原型,而不是一个完善的商业产品,本地 AI 的性能取决于硬件和软件配置。一个 Raspberry Pi 不能简单地提供与大型云基础设施集群相同的处理能力。

但这正是使这个实验变得有趣的原因。

更大的图景:AI 正在向用户靠近

多年来,主导的 AI 模型非常简单:您的设备向强大的服务器发送请求,服务器处理请求并将结果返回。

这种模式并不会消失。云 AI 对许多要求高的应用程序仍将至关重要。

但是,像谷歌的 Gemma 翻译器这样的项目展示了替代方案。随着模型变得更小,运行时变得更高效,更多的 AI 功能可以直接移入我们已经拥有的设备中。

翻译是一个特别好的展示,因为工作流程易于理解。你说,AI 处理请求,另一个人听到结果。没有可见的服务器基础设施,设置后也不需要互联网连接。

因此,谷歌项目中最重要的部分可能不是小翻译器本身。而是展示了现代生成 AI 模型可以成为一个小型、便宜且便携设备内部的一个组件。

Gemma 翻译器不是下一个谷歌翻译产品。它提供了对超越仅依赖云端 AI 的未来的一个视角:能够独立运作、保持更多本地处理的智能设备,即使在互联网消失时也能保持实用。

爆款模板

探索我们的爆款 AI 模板,应用到你的照片上。

探索模板
谷歌 Gemma 翻译器:离线 AI 语音翻译器