Большую модель вроде Claude можно ужать до компактной и быстрой версии — с помощью дистилляции знаний.
Это техника машинного обучения. Небольшая модель Student учится воспроизводить поведение крупной: её ответы, логит-вероятности и пошаговые цепочки рассуждений.
Разбираем, как устроено такое обучение и что именно Student перенимает у большой модели, — без воды.
Идея простая: модель меньше и быстрее, а поведение остаётся похожим на поведение большой модели.
Источник: habr.com · пост в Telegram