Atlas: Чистый Rust+CUDA для сверхбыстрого LLM

источник ↗ ·

Atlas — LLM-движок на чистом Rust и CUDA без Python, с Docker-образом 2.5 ГБ, дающим до 3x ускорение инференса на DGX Spark.

AI Summary

🚀 Общий обзор: Atlas — это inference-движок для LLM, написанный с нуля на Rust и CUDA без PyTorch/Python (образ ~2.5 ГБ против 20+ ГБ vLLM). Обеспечивает невероятную скорость: Qwen3.5-35B на DGX Spark — 130 tok/s (batch=1), Qwen3.5-122B — ~54 tok/s (EP=2). Чистая архитектура с ручными CUDA-ядрами для attention/MoE/GDN/Mamba-2, поддержка NVFP4/FP8, MTP (Multi-Token Prediction) для 3x throughput. OpenAI-совместимый API, tool calling, работает с Claude Code/OpenWebUI. Запуск в 2 команды via Docker.

Ключевые тезисы: • Скорость: 3x быстрее статус-кво; 130 tok/s на Qwen3.5-35B (DGX Spark, MTP K=2). • Оптимизации: Ручные CUDA-ядра под Blackwell SM120/121, NVFP4/FP8 с tensor cores, без интерпретатора/GIL/JIT. • Модели: Поддержка Qwen3.5-35B/122B, MiniMax M2.7, Qwen3-VL (vision); community-driven расширение. • Запуск: docker pull avarok/atlas-gb10:latest + run с моделями из HF; порт 8888, max-seq-len 65536. • Hardware: DGX Spark (основной), ASUS Ascent GX10, Strix Halo/RTX 6000 в планах. • Будущее: Open source скоро, multimodal (audio), agentic-ready с tool calling/structured output.

Мои мысли

graph

Карта связей