blog.dopana

Back

LiteRT (Lite Runtime) là runtime mã nguồn mở của Google cho inference ML và GenAI trên thiết bị — trước đây gọi là TensorFlow Lite (đổi tên ngày 4/9/2024). Đây là runtime ML được triển khai rộng rãi nhất thế giới, cung cấp inference bên trong hàng tỷ thiết bị Android. Định dạng file .tflite không đổi; chỉ tên và nơi lưu trữ dự án thay đổi (github.com/google-ai-edge/LiteRT).

Vì Sao Đổi Tên?#

TensorFlow Lite vượt xa TensorFlow: nó giờ chuyển đổi model tạo bởi PyTorch, JAX và Keras, nên đặt tên theo một framework là gây hiểu lầm. “LiteRT” trung lập với framework — cùng đội ngũ, cùng code, cùng định dạng.

Hai API Inference#

APITrạng tháiGhi chú
InterpreterCũ, ổn địnhAPI kinh điển, vẫn hoạt động
CompiledModelMới (production-ready 1/2026)Tăng tốc GPU/NPU gọn nhẹ, nhanh hơn đáng kể

Pipeline#

Model đã huấn luyện (TF/Keras/JAX/PyTorch)


Converter ──────────────► file .tflite (FlatBuffers)


Runtime LiteRT (delegate CPU / GPU / NPU / DSP / TPU)
text

Các converter:

import tensorflow as tf

# Từ Keras / SavedModel
converter = tf.lite.TFLiteConverter.from_saved_model("model_dir")
# hoặc: from_keras_model(model), from_jax(jax_fn)

# Lượng tử hóa INT8 (post-training quantization)
converter.optimizations = [tf.lite.Optimize.DEFAULT]
tflite_model = converter.convert()
open("model.tflite", "wb").write(tflite_model)
python

Model PyTorch chuyển đổi qua LiteRT Torch Converter (dùng torch.export). LLM dùng định dạng đóng gói .litertlm.

Tăng Tốc Phần Cứng (Delegate)#

DelegatePhần cứng
GPUOpenGL/OpenCL/Vulkan (Android), Metal (iOS), WebGPU (web)
Qualcomm QNNNPU Snapdragon
MediaTek APUSoC MediaTek
Samsung ExynosNPU Exynos (S.LSI)
Google TensorNPU Pixel
Edge TPUBo mạch Coral
Hexagon DSPSnapdragon cũ
Core MLNeural Engine Apple (iOS/macOS)
XNNPACKFallback CPU

LiteRT cung cấp ~1.4x nhanh hơn inference GPU so với TF Lite cũ, thêm tăng tốc NPU mới.

Lượng Tử Hóa#

  • Post-training INT8 / FP16 — model nhỏ và nhanh nhất
  • AI Edge Quantizer — toolkit mới hướng tới LLM
  • Model lượng tử hóa 8-bit chạy trực tiếp trên delegate GPU/NPU

LLM Trên Thiết Bị#

LiteRT giờ chạy LLM on-device qua LiteRT-LM — Gemma, Phi-4-mini, Qwen, biến thể Llama. Inference ở lại local: latency thấp, quyền riêng tư tuyệt đối, hoạt động offline.

Web & Vi Điều Khiển#

  • LiteRT.js — inference trình duyệt hiệu suất cao qua WebGPU và WASM
  • LiteRT cho vi điều khiển (trước là TF Lite Micro) — chạy trên MCU

Chạy Inference#

// Android — CompiledModel API (Kotlin)
val model = ai.edge.litert.loadCompiledModel(modelBuffer)
val output = model.run(inputTensor)
kotlin
# Python — Interpreter API
import ai_edge_litert as litert
interpreter = litert.Interpreter(model_path="model.tflite")
interpreter.allocate_tensors()
interpreter.invoke()
python

LiteRT vs Đối Thủ#

RuntimeHãngGhi chú
LiteRTGoogleTrưởng thành nhất, hàng tỷ thiết bị, LLM on-device
ONNX Runtime MobileMicrosoftĐa framework, CPU mạnh
Core MLAppleApple Silicon/ANE, chỉ iOS
ExecuTorchMetaNative PyTorch, rút ngắn khoảng cách nhanh

Kết Luận#

LiteRT là tiêu chuẩn tham chiếu cho inference on-device — toolchain trưởng thành nhất trên Android, iOS, web, IoT và vi điều khiển, giờ có tăng tốc NPU cấp production và LLM on-device. Nếu model của bạn phải chạy trên điện thoại mà không cần gọi mạng, LiteRT vẫn là lựa chọn an toàn nhất trong năm 2026.

Tài liệu tham khảo#