MAX: AI-инференс для любого железа

источник ↗ ·

MAX — универсальная платформа для высокопроизводительного инференса и моделирования open-моделей на CPU, GPU и ASIC без привязки к вендору.

privacy

Эта заметка участвует в semantic memory.

AI Summary

MAX — это единая платформа для развёртывания и инференса открытых моделей на любых процессорах (CPU, GPU, ASIC). Платформа предоставляет OpenAI-совместимый API, PyTorch-подобные интерфейсы и сотни готовых ядер для NVIDIA, AMD и Apple Silicon. Установка одной командой, запуск через CLI или Docker, отсутствие зависимости от CUDA/ROCm/PyTorch, полностью открытый код (Python API, пайплайны, GPU-ядра). Поддерживает сотни моделей из коробки, позволяет писать собственные ядра на Mojo и разворачивать их в Docker. Включает встроенный бенчмарк (на базе vLLM) с экспортом YAML-конфигов. Для enterprise доступны распределённые гетерогенные эндпоинты, Pareto-оптимизация cost/performance и fully-managed развёртывание в Modular Cloud.

Мои мысли

graph

Карта связей