Как работают большие языковые модели
Подробное объяснение принципов работы LLM: от предсказания следующего слова до обучения трансформеров и RLHF.
privacy
Эта заметка участвует в semantic memory.
AI Summary
- Короткий обзор сути: LLM — это математическая функция, обученная предсказывать следующее слово в тексте; пользователь видит только финальный результат, а модель генерирует ответ итеративно, слово за словом. 🔑 Ключевые факты: обучение состоит из двух этапов — предварительного (предсказание следующего слова на триллионах токенов) и RLHF (корректировка по обратной связи человека); трансформер позволяет обрабатывать весь контекст параллельно через механизм attention. 📌 Важные детали: GPT-3 обучали на объёме текста, для чтения которого человеку потребовалось бы 2600 лет; современные модели имеют сотни миллиардов параметров (весов); исходные веса случайны, корректируются методом обратного распространения ошибки; GPU необходимы из-за миллиардов параллельных операций; поведение модели эмерджентно и не всегда интерпретируемо. 💡 Вывод и значение: при генерации иногда используют сэмплинг менее вероятных токенов для более естественного текста; понимание устройства LLM помогает лучше формулировать промпты и оценивать ограничения модели.