Калькулятор запуска LLM на ПК

источник ↗ ·

Интерактивный гайд по выбору бэкенда, модели, квантизации и флагов llama.cpp под ограничения VRAM, RAM и скорости памяти.

privacy

Эта заметка участвует в semantic memory.

AI Summary

  1. Короткий обзор сути: инструмент помогает подобрать оптимальную модель и параметры запуска под реальное железо, учитывая VRAM, RAM, скорость памяти и архитектуру CPU.
  2. Ключевые тезисы: видеопамять — главный лимит; XMP/EXPO критичен для MoE; MoE выгружает эксперты в RAM, dense-модели — нет; MTP даёт ускорение 2–2.6× при acceptance 0.6–0.8; KV-кэш в q8_0 экономит VRAM вдвое.
  3. Важные детали и нюансы: монитор на iGPU освобождает 0.5–1 ГБ VRAM; Intel P/E-ядра требуют привязки потоков; --n-cpu-moe регулирует выгрузку экспертов; --parallel умножает размер KV-кэша; команда sudo dmidecode -t memory показывает реальную частоту RAM.
  4. Практические выводы/следующие шаги: включить XMP, проверить реальную частоту памяти, выбрать бэкенд по производителю GPU, подобрать квантизацию и контекст под бюджет VRAM, скопировать готовую команду llama-server и проверить риски безопасности перед открытием порта.

Мои мысли

graph

Карта связей