Тестирование кластера из четырёх Mac Studio M3 Ultra с 1,5 ТБ Unified Memory и ПО Exo 1.0 для запуска гигантских AI-моделей через RDMA.
источник ↗#llm-inference
2 записейAtlas — LLM-движок на чистом Rust и CUDA без Python, с Docker-образом 2.5 ГБ, дающим до 3x ускорение инференса на DGX Spark.
источник ↗