GoogleのオフラインAI翻訳機はクラウドなしでローカルAIの可能性を示す
執筆:Wendy Frey
人工知能は必ずしもデータセンターを必要とするわけではありません。Googleの最新の実験であるGemma Translatorは、そのアイデアを驚くほど具体化しています。これは、小型でポータブルな音声翻訳機で、インターネット接続なしでリスニング、翻訳、スピーキングが可能です。
Raspberry Pi 5とGoogleの軽量なGemma 4 E2Bモデルを核にしたこのプロジェクトは、安価なコンポーネントの集合体を完全なローカルAI翻訳デバイスに変えます。これは、商業用の新しいGoogle製ガジェットではなく、AIがクラウドから日常のハードウェアへと移行できる能力を示すために設計されたオープンソースのプロトタイプです。
そして、それは翻訳機自体以上に重要かもしれません。Gemma Translatorは、リモートサーバーにリクエストを送りするのではなく、ローカルで処理が行われるデバイス上のAIへのシフトのもう一例です。
Google Gemma Translatorとは?
Gemma Translatorは、Google Antigravityの支援を受けて開発されたオープンソースの音声翻訳プロジェクトです。その目的はシンプルです:異なる言語を話す2人が、ローカルで全ての翻訳パイプラインを実行するコンパクトなデバイスを通じてコミュニケーションを取ることです。
このプロトタイプは、8GBのRAMを搭載したRaspberry Pi 5、マイク、スピーカーまたはヘッドフォン、そして小型ディスプレイを組み合わせています。ハードウェアはカスタムの3Dプリントエンクロージャ内に配置でき、結果的に専用のハンドヘルド翻訳機のように見えます。
しかし、重要な違いがあります。GoogleはGemma Translatorを消費者向け製品として発表していません。これは技術デモであり、オープンソースプロジェクトです。コード、デプロイメントスクリプト、および3Dプリント可能なケースファイルは、システムを再現または変更したい開発者や愛好者のために入手可能です。
| コンポーネント | 役割 |
|---|---|
| Raspberry Pi 5, 8GB | ローカルコンピューティングハードウェア |
| Gemma 4 E2B | AI翻訳 |
| LiteRT-LM | ローカルモデル実行環境 |
| Moonshine | 音声処理 |
| マイク | 音声入力 |
| スピーカー/ヘッドフォン | 翻訳された音声出力 |
| 小型ディスプレイ | ユーザーインターフェース |
| 3Dプリントケース | ポータブルエンクロージャ |
オフラインAI翻訳機はどのように機能するのか?
プロジェクトの最も興味深い部分は、ハードウェアではなくソフトウェアスタックがいくつかのローカルコンポーネントに分かれている点です。
人がマイクに向かって話すと、音声はデバイス上で処理されます。音声が文字に転写され、その結果得られたテキストがGemmaによって翻訳され、翻訳された文が再度音声に変換されます。リポジトリでは、これは音声認識、Gemmaベースの翻訳、テキストから音声への変換を含むローカルパイプラインとして説明されています。
プロジェクトは二つの会話レーンを中心に設計されています。それぞれの人が言語を選択し、自分のフレーズを録音し、相手の言語で翻訳を受け取ります。現在の実装では、インタラクションは常に聞いているアシスタントではなく、プッシュ・トゥ・トークコントロールに基づいています。
重要なポイントは、AIの推論自体がローカルで行われることです。必要なソフトウェアとモデルがインストールされれば、翻訳機はそのコアタスクを実行するためにインターネット接続を必要としません。
それにより、実用的なユースケースが大きく変わります。クラウドベースの翻訳機は、接続状態が悪いと信頼性を欠く可能性があります。オフラインデバイスは、飛行機内、遠隔地域、またはネットワークインフラが利用できない場所でも動作し続けることができます。
Gemma 4 E2Bが重要な理由
プロジェクトの中心には、エッジアプリケーション向けに設計されたGoogleの小型Gemmaモデルの一つ、Gemma 4 E2Bがあります。
大規模なAIモデルは強力ですが、通常はかなりのコンピューティングリソースを必要とします。小型のエッジモデルの目的は異なります。彼らは直接電話、コンピュータ、および組み込みハードウェア上で動作する能力と引き換えに、いくつかのスケールを犠牲にします。
Googleは、Gemma 4とそのLiteRT-LMランタイムでこのアプローチを積極的に推進しています。同社はLiteRT-LMがGemmaモデルを広範なデバイス上で実用可能にするように設計されていると述べています。Google自身の文書では、E2BおよびE4BモデルがエッジおよびIoTアプリケーションのオプションとして強調されています。
Gemma Translatorは、その戦略がベンチマークや開発者デモの外でどのように見えるかを示しています。リモートAIサービスに文を翻訳させるのではなく、Raspberry PiがAIコンピュータとなるのです。
それは、AIハードウェアについて考える方法において大きな変化です。
クラウドをなくすことはオフラインで動作すること以上の意味がある
ローカル翻訳の明らかな利点は接続性です。Wi-Fiやモバイル信号がなくても、デバイスは依然としてその主要な機能を実行できます。
しかし、プライバシーも同じくらい重要だと言えます。
クラウド翻訳サービスを使用すると、音声録音や転写された会話が処理のためにデバイスを離れなければならないことがあります。オフラインアーキテクチャにより、音声処理パイプラインをローカルハードウェアに保持できます。敏感な会話やプライベートな会議、フィールドオペレーションの場合、これは意味のある利点となるかもしれません。
これは、すべてのローカルAIアプリケーションが完全にプライベートまたは安全であることを自動的に意味するわけではありません。実際のプライバシーに関する保証は、完全なソフトウェアとハードウェアの構成に依存します。それでも、音声データをリモートAIサービスに送信する必要を取り除くことは、重要な露出のカテゴリーを排除します。
この原則は翻訳を超えて適用されます。ローカルAIは、パーソナルアシスタント、アクセシビリティツール、教育デバイス、インダストリアルシステム、接続が保証できない緊急機器に役立つかもしれません。
Googleはより大きなデバイス上のAIエコシステムに向けて構築している
Gemma Translatorは、Googleのより広いエッジAI戦略の一部として見ると、より意味があります。
同社のLiteRT-LMスタックは、生成AIをローカルで実行するために特に設計されています。Googleはこれを、生成モデルのために最適化された機能を持つLiteRT技術の拡張として説明しており、最近のGemma 4の作業は、モバイル、デスクトップ、IoTハードウェア上で小型モデルを実行することを強調しています。
Raspberry Piは、従来のコンピュータと組み込みデバイスの間に位置し、特に興味深いです。これは安価で、コンパクトで、開発者にとってアクセスしやすいです。モデルがこの小さなハードウェアで有用なタスクを実行するのに十分な能力を持つようになると、可能なAIアプリケーションの数は劇的に拡大します。
したがって、この翻訳機はGoogle翻訳の代替としてよりも、概念実証としての方が興味深いです。
それは、役立つAIがもはやクラウドに依存しなくなるとどうなるのかという大きな疑問を提起します。
自分でGoogle翻訳機を構築できますか?
はい。プロジェクトの最も強力な側面の一つは、Googleが実装をオープンソースとして提供していることです。
公式リポジトリには、アプリケーションコード、セットアップスクリプト、デプロイメント構成、3DプリントエンクロージャのSTLファイルが含まれています。文書化されたハードウェア要件は、8GBのRAMを搭載したRaspberry Pi 5で、音声入力、音声出力、ディスプレイが必要です。
ソフトウェアは提供されたスクリプトを通じてデプロイできます。プロジェクトはPython環境を作成し、必要なGemmaモデルをダウンロードし、ローカルサービスを開始します。また、デバイスを常設のキオスクスタイルのアプライアンスとして構成するための専用のRaspberry Piデプロイスクリプトもあります。
これにより、Gemma Translatorは単なる派手なデモ以上のものになります。開発者は実装を検査し、インターフェースを実験し、コンポーネントを置き換えたり、アーキテクチャを自分のエッジAIプロジェクトの出発点として利用したりできます。
明らかな制約はまだあります。このデバイスはプロトタイプであり、洗練された商業製品ではありません。また、ローカルAIの性能はハードウェアとソフトウェアの構成に依存します。Raspberry Piは、大規模なクラウドインフラストラクチャのクラスターと同じ処理能力を提供するわけではありません。
しかし、それがこの実験を興味深くしている理由です。
より大きな絵:AIはユーザーに近づいている
何年もの間、支配的なAIモデルは単純でした:あなたのデバイスが強力なサーバーにリクエストを送り、そのサーバーがそれを処理し、結果を返すというものでした。
そのモデルは消えようとしているわけではありません。クラウドAIは、多くの要求の厳しいアプリケーションにとって依然として重要です。
しかし、GoogleのGemma Translatorのようなプロジェクトは、代替手段を示しています。モデルが小型化し、ランタイムが効率的になるにつれて、より多くのAI機能が私たちがすでに所有しているデバイスに直接移動できるようになります。
翻訳は、ワークフローが理解しやすいため、特に良いデモになるでしょう。あなたが話し、AIがリクエストを処理し、別の人が結果を聞くという流れです。目に見えるサーバーインフラはなく、設定後はインターネット接続も必要ありません。
したがって、Googleのプロジェクトで最も重要な部分は、この小さな翻訳機そのものであるとは限りません。現代の生成AIモデルが小型で安価かつポータブルなデバイス内のコンポーネントになることができるというデモンストレーションです。
Gemma Translatorは次のGoogle翻訳製品ではありません。クラウドオンリーのAIの後に訪れるものの一端を垣間見る機会です:インターネットが消えても独立して動作し、より多くの処理をローカルに保ちながら、役立ち続けるインテリジェントなデバイスです。




