Atlas: Чистый Rust+CUDA для сверхбыстрого LLM
Atlas — LLM-движок на чистом Rust и CUDA без Python, с Docker-образом 2.5 ГБ, дающим до 3x ускорение инференса на DGX Spark.
AI Summary
🚀 Общий обзор: Atlas — это inference-движок для LLM, написанный с нуля на Rust и CUDA без PyTorch/Python (образ ~2.5 ГБ против 20+ ГБ vLLM). Обеспечивает невероятную скорость: Qwen3.5-35B на DGX Spark — 130 tok/s (batch=1), Qwen3.5-122B — ~54 tok/s (EP=2). Чистая архитектура с ручными CUDA-ядрами для attention/MoE/GDN/Mamba-2, поддержка NVFP4/FP8, MTP (Multi-Token Prediction) для 3x throughput. OpenAI-совместимый API, tool calling, работает с Claude Code/OpenWebUI. Запуск в 2 команды via Docker.
✅ Ключевые тезисы:
• Скорость: 3x быстрее статус-кво; 130 tok/s на Qwen3.5-35B (DGX Spark, MTP K=2).
• Оптимизации: Ручные CUDA-ядра под Blackwell SM120/121, NVFP4/FP8 с tensor cores, без интерпретатора/GIL/JIT.
• Модели: Поддержка Qwen3.5-35B/122B, MiniMax M2.7, Qwen3-VL (vision); community-driven расширение.
• Запуск: docker pull avarok/atlas-gb10:latest + run с моделями из HF; порт 8888, max-seq-len 65536.
• Hardware: DGX Spark (основной), ASUS Ascent GX10, Strix Halo/RTX 6000 в планах.
• Будущее: Open source скоро, multimodal (audio), agentic-ready с tool calling/structured output.