blog.dopana

Back

LiteRT(Lite Runtime)是 Google 面向端侧 ML 和生成式 AI 推理的开源运行时——前身是 TensorFlow Lite(2024 年 9 月 4 日更名)。它是全球部署最广的 ML 运行时,运行在数十亿台 Android 设备中。.tflite 文件格式不变;改变的只是名称和项目地址(github.com/google-ai-edge/LiteRT)。

为什么更名?#

TensorFlow Lite 早已远超 TensorFlow 范畴:它现在可以转换 PyTorch、JAX 和 Keras 编写的模型,再用单一框架命名会误导人。“LiteRT” 对框架保持中立——同一团队、同一代码、同一格式。

两种推理 API#

API状态备注
Interpreter旧版、稳定经典 API,依然可用
CompiledModel新版(2026 年 1 月生产就绪)精简的 GPU/NPU 加速,显著更快

流程#

训练好的模型(TF/Keras/JAX/PyTorch)


转换器 ──────────────► .tflite 文件(FlatBuffers)


LiteRT 运行时(CPU / GPU / NPU / DSP / TPU 委派)
text

转换器:

import tensorflow as tf

# 从 Keras / SavedModel
converter = tf.lite.TFLiteConverter.from_saved_model("model_dir")
# 或:from_keras_model(model)、from_jax(jax_fn)

# 量化为 INT8(训练后量化)
converter.optimizations = [tf.lite.Optimize.DEFAULT]
tflite_model = converter.convert()
open("model.tflite", "wb").write(tflite_model)
python

PyTorch 模型通过 LiteRT Torch Converter 转换(内部使用 torch.export)。LLM 使用 .litertlm 打包格式。

硬件加速(委派)#

委派硬件
GPUOpenGL/OpenCL/Vulkan(Android)、Metal(iOS)、WebGPU(网页)
Qualcomm QNN骁龙 NPU
MediaTek APU联发科 SoC
Samsung Exynos猎户座 NPU(S.LSI)
Google TensorPixel NPU
Edge TPUCoral 开发板
Hexagon DSP旧款骁龙
Core MLApple Neural Engine(iOS/macOS)
XNNPACKCPU 回退

LiteRT 的 GPU 推理比旧 TF Lite 快约 1.4 倍,并新增了 NPU 加速。

量化#

  • 训练后 INT8 / FP16——最小最快的模型
  • AI Edge Quantizer——面向 LLM 的新工具包
  • 8 位量化模型可直接在 GPU/NPU 委派上运行

端侧 LLM#

LiteRT 现在通过 LiteRT-LM 在端侧运行 LLM——Gemma、Phi-4-mini、Qwen、Llama 系列。推理留在本地:低延迟、完全隐私、离线可用。

Web 与微控制器#

  • LiteRT.js——通过 WebGPU 和 WASM 实现高性能浏览器推理
  • 面向微控制器的 LiteRT(原 TF Lite Micro)——在 MCU 上运行

运行推理#

// Android — CompiledModel API(Kotlin)
val model = ai.edge.litert.loadCompiledModel(modelBuffer)
val output = model.run(inputTensor)
kotlin
# Python — Interpreter API
import ai_edge_litert as litert
interpreter = litert.Interpreter(model_path="model.tflite")
interpreter.allocate_tensors()
interpreter.invoke()
python

LiteRT 对比竞品#

运行时厂商备注
LiteRTGoogle最成熟、数十亿设备、端侧 LLM
ONNX Runtime MobileMicrosoft跨框架、CPU 强劲
Core MLAppleApple Silicon/ANE、仅 iOS
ExecuTorchMetaPyTorch 原生、快速追赶

结论#

LiteRT 是端侧推理的参照标准——横跨 Android、iOS、Web、IoT 和微控制器的最成熟工具链,如今具备生产级 NPU 加速和端侧 LLM。如果你的模型必须在不联网的情况下跑在手机上,LiteRT 在 2026 年依然是最稳妥的选择。

参考资料#