LiteRT: on-device ML runtime
Официальная документация LiteRT — высокопроизводительного runtime Google для ML и GenAI на edge-устройствах, преемника TensorFlow Lite.
privacy
Эта заметка участвует в semantic memory.
AI Summary
LiteRT — это on-device runtime Google для высокопроизводительного ML и GenAI на edge-платформах. Продолжает TensorFlow Lite, добавляет GPU/NPU-ускорение, поддержку LLM через LiteRT-LM и Web-инференс через LiteRT.js. Ключевые тезисы: 1) автоматический выбор акселератора без явных delegates; 2) единый API для NPU от Qualcomm, MediaTek, Google Tensor, Intel; 3) новые форматы .tflite и .litertlm; 4) Tensor API для C++-графов; 5) CLI-инструмент litert-cli-nightly. Важные детали: обязательный переход на Compiled Model API (tflite::Interpreter deprecated); поддержка PyTorch → .tflite/.litertlm через LiteRT Torch Converter и Generative API; Docker-сборка для Linux/Android; платформы: Android, iOS, Linux, macOS, Windows, Web, IoT. Практические выводы: для новых Kotlin/C++ задач использовать Compiled Model API; конвертировать модели через LiteRT Torch; тестировать на NPU/GPU; следить за обновлениями в блоге (Google Tensor SDK Beta, Intel NPU через OpenVINO, Arm-оптимизации).