LiteRT — オンデバイスAI推論(旧TensorFlow Lite)
Googleのオンデバイス推論ランタイム、旧TensorFlow Lite。CompiledModel API、GPU/NPU高速化、LiteRT-LMによるオンデバイスLLM。.tflite形式。
LiteRT(Lite Runtime)は、オンデバイスMLとGenAI推論のためのGoogleのオープンソースランタイム — 以前はTensorFlow Liteと呼ばれていました(2024年9月4日改名)。世界で最も広く展開されているMLランタイムで、数十億台のAndroidデバイスに推論を提供しています。.tfliteファイル形式は不変。変わったのは名前とプロジェクトの場所だけ(github.com/google-ai-edge/LiteRT)。
なぜ改名したか#
TensorFlow LiteはTensorFlowをはるかに超えて成長:PyTorch、JAX、Kerasで作成されたモデルも変換するようになったため、単一フレームワーク名は誤解を招くものになりました。「LiteRT」はフレームワーク非依存 — 同じチーム、同じコード、同じ形式。
2つの推論API#
| API | 状態 | 備考 |
|---|---|---|
| Interpreter | レガシー、安定 | 定番API、引き続き動作 |
| CompiledModel | 新(2026年1月に本番対応) | 合理化されたGPU/NPU高速化、大幅に高速 |
パイプライン#
訓練済みモデル(TF/Keras/JAX/PyTorch)
│
▼
Converter ──────────────► .tfliteファイル(FlatBuffers)
│
▼
LiteRTランタイム(CPU / GPU / NPU / DSP / TPUデリゲート)textコンバーター:
import tensorflow as tf
# Keras / SavedModelから
converter = tf.lite.TFLiteConverter.from_saved_model("model_dir")
# または: from_keras_model(model), from_jax(jax_fn)
# INT8に量子化(ポストトレーニング量子化)
converter.optimizations = [tf.lite.Optimize.DEFAULT]
tflite_model = converter.convert()
open("model.tflite", "wb").write(tflite_model)pythonPyTorchモデルはLiteRT Torch Converterで変換(内部でtorch.exportを使用)。LLMは.litertlmパッケージ形式を使用。
ハードウェアアクセラレーション(デリゲート)#
| デリゲート | ハードウェア |
|---|---|
| GPU | OpenGL/OpenCL/Vulkan(Android)、Metal(iOS)、WebGPU(Web) |
| Qualcomm QNN | Snapdragon NPU |
| MediaTek APU | MediaTek SoC |
| Samsung Exynos | Exynos NPU(S.LSI) |
| Google Tensor | Pixel NPU |
| Edge TPU | Coralボード |
| Hexagon DSP | 旧Snapdragon |
| Core ML | Apple Neural Engine(iOS/macOS) |
| XNNPACK | CPUフォールバック |
LiteRTはレガシーTF Lite比で約1.4倍高速なGPU推論に加え、新しいNPU高速化を提供。
量子化#
- ポストトレーニングINT8 / FP16 — 最小・最速のモデル
- AI Edge Quantizer — LLM向けの新しいツールキット
- 8ビット量子化モデルはGPU/NPUデリゲートで直接実行
オンデバイスLLM#
LiteRTはLiteRT-LM経由でオンデバイスLLMを実行 — Gemma、Phi-4-mini、Qwen、Llama系列。推論はローカルで完結:低レイテンシ、完全なプライバシー、オフライン動作。
Webとマイコン#
- LiteRT.js — WebGPUとWASMによる高パフォーマンスなブラウザ推論
- LiteRT for microcontrollers(旧TF Lite Micro)— MCU上で動作
推論の実行#
// Android — CompiledModel API(Kotlin)
val model = ai.edge.litert.loadCompiledModel(modelBuffer)
val output = model.run(inputTensor)kotlin# Python — Interpreter API
import ai_edge_litert as litert
interpreter = litert.Interpreter(model_path="model.tflite")
interpreter.allocate_tensors()
interpreter.invoke()pythonLiteRT vs 競合#
| ランタイム | ベンダー | 備考 |
|---|---|---|
| LiteRT | 最も成熟、数十億台、オンデバイスLLM | |
| ONNX Runtime Mobile | Microsoft | クロスフレームワーク、CPUが強い |
| Core ML | Apple | Apple Silicon/ANE、iOS限定 |
| ExecuTorch | Meta | PyTorchネイティブ、急速に差を縮める |
まとめ#
LiteRTはオンデバイス推論のリファレンス標準 — Android、iOS、Web、IoT、マイコンにわたる最も成熟したツールチェーンで、本番級のNPU高速化とオンデバイスLLMを備えています。ネットワークラウンドトリップなしでモデルをスマホで動かすなら、LiteRTは2026年でも最も安全な選択です。