LiteRT — Inference AI Trên Thiết Bị (Trước Là TF Lite)
Runtime inference on-device của Google, trước là TensorFlow Lite. CompiledModel API, tăng tốc GPU/NPU, LLM on-device qua LiteRT-LM. Định dạng .tflite.
LiteRT (Lite Runtime) là runtime mã nguồn mở của Google cho inference ML và GenAI trên thiết bị — trước đây gọi là TensorFlow Lite (đổi tên ngày 4/9/2024). Đây là runtime ML được triển khai rộng rãi nhất thế giới, cung cấp inference bên trong hàng tỷ thiết bị Android. Định dạng file .tflite không đổi; chỉ tên và nơi lưu trữ dự án thay đổi (github.com/google-ai-edge/LiteRT).
Vì Sao Đổi Tên?#
TensorFlow Lite vượt xa TensorFlow: nó giờ chuyển đổi model tạo bởi PyTorch, JAX và Keras, nên đặt tên theo một framework là gây hiểu lầm. “LiteRT” trung lập với framework — cùng đội ngũ, cùng code, cùng định dạng.
Hai API Inference#
| API | Trạng thái | Ghi chú |
|---|---|---|
| Interpreter | Cũ, ổn định | API kinh điển, vẫn hoạt động |
| CompiledModel | Mới (production-ready 1/2026) | Tăng tốc GPU/NPU gọn nhẹ, nhanh hơn đáng kể |
Pipeline#
Model đã huấn luyện (TF/Keras/JAX/PyTorch)
│
▼
Converter ──────────────► file .tflite (FlatBuffers)
│
▼
Runtime LiteRT (delegate CPU / GPU / NPU / DSP / TPU)textCác converter:
import tensorflow as tf
# Từ Keras / SavedModel
converter = tf.lite.TFLiteConverter.from_saved_model("model_dir")
# hoặc: from_keras_model(model), from_jax(jax_fn)
# Lượng tử hóa INT8 (post-training quantization)
converter.optimizations = [tf.lite.Optimize.DEFAULT]
tflite_model = converter.convert()
open("model.tflite", "wb").write(tflite_model)pythonModel PyTorch chuyển đổi qua LiteRT Torch Converter (dùng torch.export). LLM dùng định dạng đóng gói .litertlm.
Tăng Tốc Phần Cứng (Delegate)#
| Delegate | Phần cứng |
|---|---|
| GPU | OpenGL/OpenCL/Vulkan (Android), Metal (iOS), WebGPU (web) |
| Qualcomm QNN | NPU Snapdragon |
| MediaTek APU | SoC MediaTek |
| Samsung Exynos | NPU Exynos (S.LSI) |
| Google Tensor | NPU Pixel |
| Edge TPU | Bo mạch Coral |
| Hexagon DSP | Snapdragon cũ |
| Core ML | Neural Engine Apple (iOS/macOS) |
| XNNPACK | Fallback CPU |
LiteRT cung cấp ~1.4x nhanh hơn inference GPU so với TF Lite cũ, thêm tăng tốc NPU mới.
Lượng Tử Hóa#
- Post-training INT8 / FP16 — model nhỏ và nhanh nhất
- AI Edge Quantizer — toolkit mới hướng tới LLM
- Model lượng tử hóa 8-bit chạy trực tiếp trên delegate GPU/NPU
LLM Trên Thiết Bị#
LiteRT giờ chạy LLM on-device qua LiteRT-LM — Gemma, Phi-4-mini, Qwen, biến thể Llama. Inference ở lại local: latency thấp, quyền riêng tư tuyệt đối, hoạt động offline.
Web & Vi Điều Khiển#
- LiteRT.js — inference trình duyệt hiệu suất cao qua WebGPU và WASM
- LiteRT cho vi điều khiển (trước là TF Lite Micro) — chạy trên MCU
Chạy Inference#
// Android — CompiledModel API (Kotlin)
val model = ai.edge.litert.loadCompiledModel(modelBuffer)
val output = model.run(inputTensor)kotlin# Python — Interpreter API
import ai_edge_litert as litert
interpreter = litert.Interpreter(model_path="model.tflite")
interpreter.allocate_tensors()
interpreter.invoke()pythonLiteRT vs Đối Thủ#
| Runtime | Hãng | Ghi chú |
|---|---|---|
| LiteRT | Trưởng thành nhất, hàng tỷ thiết bị, LLM on-device | |
| ONNX Runtime Mobile | Microsoft | Đa framework, CPU mạnh |
| Core ML | Apple | Apple Silicon/ANE, chỉ iOS |
| ExecuTorch | Meta | Native PyTorch, rút ngắn khoảng cách nhanh |
Kết Luận#
LiteRT là tiêu chuẩn tham chiếu cho inference on-device — toolchain trưởng thành nhất trên Android, iOS, web, IoT và vi điều khiển, giờ có tăng tốc NPU cấp production và LLM on-device. Nếu model của bạn phải chạy trên điện thoại mà không cần gọi mạng, LiteRT vẫn là lựa chọn an toàn nhất trong năm 2026.