Спекулятивное декодирование обещает ускорение до 6.5 раза: маленькая черновая модель набрасывает несколько токенов вперёд, большая проверяет их за один свой проход, а текст на выходе получается тот же самый. Я воспроизвёл EAGLE-3 на бесплатной Kaggle T4 и получил разброс от 2.6 раза на коде до…
Спекулятивное декодирование: от чего на самом деле зависит ускорение
Это краткое изложение. Полный текст материала доступен на сайте источника.