Когда профилируешь вычисления или инференс небольших моделей в Python, часто натыкаешься на странную вещь: вроде бы под капотом у NumPy крутится мощный OpenBLAS или Intel MKL, но на небольших матрицах (16x16, 32x32) умножение A @ B работает подозрительно медленно — по 3–5 микросекунд на одну…
Почему NumPy тормозит на матрицах 16х16 и как микроядро на AVX2 в 100 кб решает эту проблему
Это краткое изложение. Полный текст материала доступен на сайте источника.