blog.dopana

Back

LiteRT(Lite Runtime)は、オンデバイスMLとGenAI推論のためのGoogleのオープンソースランタイム — 以前はTensorFlow Liteと呼ばれていました(2024年9月4日改名)。世界で最も広く展開されているMLランタイムで、数十億台のAndroidデバイスに推論を提供しています。.tfliteファイル形式は不変。変わったのは名前とプロジェクトの場所だけ(github.com/google-ai-edge/LiteRT)。

なぜ改名したか#

TensorFlow LiteはTensorFlowをはるかに超えて成長:PyTorch、JAX、Kerasで作成されたモデルも変換するようになったため、単一フレームワーク名は誤解を招くものになりました。「LiteRT」はフレームワーク非依存 — 同じチーム、同じコード、同じ形式。

2つの推論API#

API状態備考
Interpreterレガシー、安定定番API、引き続き動作
CompiledModel新(2026年1月に本番対応)合理化されたGPU/NPU高速化、大幅に高速

パイプライン#

訓練済みモデル(TF/Keras/JAX/PyTorch)


Converter ──────────────► .tfliteファイル(FlatBuffers)


LiteRTランタイム(CPU / GPU / NPU / DSP / TPUデリゲート)
text

コンバーター:

import tensorflow as tf

# Keras / SavedModelから
converter = tf.lite.TFLiteConverter.from_saved_model("model_dir")
# または: from_keras_model(model), from_jax(jax_fn)

# INT8に量子化(ポストトレーニング量子化)
converter.optimizations = [tf.lite.Optimize.DEFAULT]
tflite_model = converter.convert()
open("model.tflite", "wb").write(tflite_model)
python

PyTorchモデルはLiteRT Torch Converterで変換(内部でtorch.exportを使用)。LLMは.litertlmパッケージ形式を使用。

ハードウェアアクセラレーション(デリゲート)#

デリゲートハードウェア
GPUOpenGL/OpenCL/Vulkan(Android)、Metal(iOS)、WebGPU(Web)
Qualcomm QNNSnapdragon NPU
MediaTek APUMediaTek SoC
Samsung ExynosExynos NPU(S.LSI)
Google TensorPixel NPU
Edge TPUCoralボード
Hexagon DSP旧Snapdragon
Core MLApple Neural Engine(iOS/macOS)
XNNPACKCPUフォールバック

LiteRTはレガシーTF Lite比で約1.4倍高速なGPU推論に加え、新しいNPU高速化を提供。

量子化#

  • ポストトレーニングINT8 / FP16 — 最小・最速のモデル
  • AI Edge Quantizer — LLM向けの新しいツールキット
  • 8ビット量子化モデルはGPU/NPUデリゲートで直接実行

オンデバイスLLM#

LiteRTはLiteRT-LM経由でオンデバイスLLMを実行 — Gemma、Phi-4-mini、Qwen、Llama系列。推論はローカルで完結:低レイテンシ、完全なプライバシー、オフライン動作。

Webとマイコン#

  • LiteRT.js — WebGPUとWASMによる高パフォーマンスなブラウザ推論
  • LiteRT for microcontrollers(旧TF Lite Micro)— MCU上で動作

推論の実行#

// Android — CompiledModel API(Kotlin)
val model = ai.edge.litert.loadCompiledModel(modelBuffer)
val output = model.run(inputTensor)
kotlin
# Python — Interpreter API
import ai_edge_litert as litert
interpreter = litert.Interpreter(model_path="model.tflite")
interpreter.allocate_tensors()
interpreter.invoke()
python

LiteRT vs 競合#

ランタイムベンダー備考
LiteRTGoogle最も成熟、数十億台、オンデバイスLLM
ONNX Runtime MobileMicrosoftクロスフレームワーク、CPUが強い
Core MLAppleApple Silicon/ANE、iOS限定
ExecuTorchMetaPyTorchネイティブ、急速に差を縮める

まとめ#

LiteRTはオンデバイス推論のリファレンス標準 — Android、iOS、Web、IoT、マイコンにわたる最も成熟したツールチェーンで、本番級のNPU高速化とオンデバイスLLMを備えています。ネットワークラウンドトリップなしでモデルをスマホで動かすなら、LiteRTは2026年でも最も安全な選択です。

参考資料#