FreeToken: MoE-инференс на ПК

источник ↗ ·

Edge-native движок для запуска 290B+ MoE-моделей на потребительских GPU с bandwidth-adaptive CPU–GPU ко-исполнением.

privacy

Эта заметка участвует в semantic memory.

AI Summary

FreeToken — это edge-native Mixture-of-Experts (MoE) serving engine, позволяющий запускать frontier-scale open-weight модели (DeepSeek-V4-Flash, Qwen3.6-35B-A3B, GLM-5.2) на RTX 30/40/50 и других потребительских GPU. Ключевые возможности: 1) Fast Edge-Native Runtime с $q^\star$ policy, full-layer double-buffered prefill streaming, global LRU expert caching и FTW fast weight format; 2) Semantic-Aware Caching — semantic anchor checkpoints для KV и recurrent state, позволяющие агентам редактировать контекст без перевычисления; 3) Elastic Memory Management — динамическая перераспределение VRAM между expert cache и KV memory без перезапуска; 4) Поддержка MXFP4, NVFP4, FP8, BF16 и Anthropic/OpenAI-совместимых API для Codex, Claude Code и других агентов. Установка: uv pip install "freetoken[accel]" или сборка из исходников; GUI-приложение и CLI доступны. Бумага: arXiv:2608.16157 (Yang et al., 2026). Лицензия Apache 2.0. Проект вдохновлён mini-sglang и использует код SGLang, vLLM, FlashInfer и llama.cpp.

Мои мысли

graph

Карта связей