LiteRT — 端侧 AI 推理(原 TF Lite)
Google 端侧推理运行时,前身是 TensorFlow Lite。CompiledModel API、GPU/NPU 加速、通过 LiteRT-LM 运行端侧 LLM。.tflite 格式。
LiteRT(Lite Runtime)是 Google 面向端侧 ML 和生成式 AI 推理的开源运行时——前身是 TensorFlow Lite(2024 年 9 月 4 日更名)。它是全球部署最广的 ML 运行时,运行在数十亿台 Android 设备中。.tflite 文件格式不变;改变的只是名称和项目地址(github.com/google-ai-edge/LiteRT)。
为什么更名?#
TensorFlow Lite 早已远超 TensorFlow 范畴:它现在可以转换 PyTorch、JAX 和 Keras 编写的模型,再用单一框架命名会误导人。“LiteRT” 对框架保持中立——同一团队、同一代码、同一格式。
两种推理 API#
| API | 状态 | 备注 |
|---|---|---|
| Interpreter | 旧版、稳定 | 经典 API,依然可用 |
| CompiledModel | 新版(2026 年 1 月生产就绪) | 精简的 GPU/NPU 加速,显著更快 |
流程#
训练好的模型(TF/Keras/JAX/PyTorch)
│
▼
转换器 ──────────────► .tflite 文件(FlatBuffers)
│
▼
LiteRT 运行时(CPU / GPU / NPU / DSP / TPU 委派)text转换器:
import tensorflow as tf
# 从 Keras / SavedModel
converter = tf.lite.TFLiteConverter.from_saved_model("model_dir")
# 或:from_keras_model(model)、from_jax(jax_fn)
# 量化为 INT8(训练后量化)
converter.optimizations = [tf.lite.Optimize.DEFAULT]
tflite_model = converter.convert()
open("model.tflite", "wb").write(tflite_model)pythonPyTorch 模型通过 LiteRT Torch Converter 转换(内部使用 torch.export)。LLM 使用 .litertlm 打包格式。
硬件加速(委派)#
| 委派 | 硬件 |
|---|---|
| GPU | OpenGL/OpenCL/Vulkan(Android)、Metal(iOS)、WebGPU(网页) |
| Qualcomm QNN | 骁龙 NPU |
| MediaTek APU | 联发科 SoC |
| Samsung Exynos | 猎户座 NPU(S.LSI) |
| Google Tensor | Pixel NPU |
| Edge TPU | Coral 开发板 |
| Hexagon DSP | 旧款骁龙 |
| Core ML | Apple Neural Engine(iOS/macOS) |
| XNNPACK | CPU 回退 |
LiteRT 的 GPU 推理比旧 TF Lite 快约 1.4 倍,并新增了 NPU 加速。
量化#
- 训练后 INT8 / FP16——最小最快的模型
- AI Edge Quantizer——面向 LLM 的新工具包
- 8 位量化模型可直接在 GPU/NPU 委派上运行
端侧 LLM#
LiteRT 现在通过 LiteRT-LM 在端侧运行 LLM——Gemma、Phi-4-mini、Qwen、Llama 系列。推理留在本地:低延迟、完全隐私、离线可用。
Web 与微控制器#
- LiteRT.js——通过 WebGPU 和 WASM 实现高性能浏览器推理
- 面向微控制器的 LiteRT(原 TF Lite Micro)——在 MCU 上运行
运行推理#
// Android — CompiledModel API(Kotlin)
val model = ai.edge.litert.loadCompiledModel(modelBuffer)
val output = model.run(inputTensor)kotlin# Python — Interpreter API
import ai_edge_litert as litert
interpreter = litert.Interpreter(model_path="model.tflite")
interpreter.allocate_tensors()
interpreter.invoke()pythonLiteRT 对比竞品#
| 运行时 | 厂商 | 备注 |
|---|---|---|
| LiteRT | 最成熟、数十亿设备、端侧 LLM | |
| ONNX Runtime Mobile | Microsoft | 跨框架、CPU 强劲 |
| Core ML | Apple | Apple Silicon/ANE、仅 iOS |
| ExecuTorch | Meta | PyTorch 原生、快速追赶 |
结论#
LiteRT 是端侧推理的参照标准——横跨 Android、iOS、Web、IoT 和微控制器的最成熟工具链,如今具备生产级 NPU 加速和端侧 LLM。如果你的模型必须在不联网的情况下跑在手机上,LiteRT 在 2026 年依然是最稳妥的选择。