MAX: AI-инференс для любого железа
MAX — универсальная платформа для высокопроизводительного инференса и моделирования open-моделей на CPU, GPU и ASIC без привязки к вендору.
privacy
Эта заметка участвует в semantic memory.
AI Summary
MAX — это единая платформа для развёртывания и инференса открытых моделей на любых процессорах (CPU, GPU, ASIC). Платформа предоставляет OpenAI-совместимый API, PyTorch-подобные интерфейсы и сотни готовых ядер для NVIDIA, AMD и Apple Silicon. Установка одной командой, запуск через CLI или Docker, отсутствие зависимости от CUDA/ROCm/PyTorch, полностью открытый код (Python API, пайплайны, GPU-ядра). Поддерживает сотни моделей из коробки, позволяет писать собственные ядра на Mojo и разворачивать их в Docker. Включает встроенный бенчмарк (на базе vLLM) с экспортом YAML-конфигов. Для enterprise доступны распределённые гетерогенные эндпоинты, Pareto-оптимизация cost/performance и fully-managed развёртывание в Modular Cloud.