Высокопроизводительный OpenAI-совместимый сервер для запуска LLM на Mac с Apple Silicon, построенный на MLX.
источник ↗#local-inference
3 записейСамодостаточный inference-движок, заточенный под DeepSeek V4 Flash/PRO, с поддержкой Metal, CUDA, ROCm, SSD-streaming, распределённого запуска и встроенного агента.
источник ↗Подробные инструкции по использованию нецензурированной модели HauhauCS/Qwen3.5-9B-Uncensored-HauhauCS-Aggressive (1.33k) с llama-cpp-python, llama.cpp, Ollama и Unsloth Studio для локального инференса. 🚀
источник ↗