Маленькая модель быстро набрасывает несколько следующих токенов, а большая проверяет всю пачку за один проход. Совпавшее оставляет, на первом расхождении переписывает продолжение сама, поэтому ускорение не меняет распределение ответа. В speculative decoding большая модель буквально говорит…
Давай по новой, Миша: speculative decoding от черновика до проверки
Это краткое изложение. Полный текст материала доступен на сайте источника.