Для оптимизации вычислений на больших объемах данных чаще всего используется один из трех вариантов: потоки, SIMD-инструкции для ASM и GPU (обычно через CUDA). Многие считают, что эти возможности оптимально можно использовать только на низком уровне. На самом деле работы по преобразованию кода, написанного на высоком уровне, в низкоуровневый код стараются вынести на специальные компиляторы. Примером такого компилятора для Python является Numbda - это OpenSource JIT компилятор написанный для NumPy. Он позволяет значительно повысить скорость работы с NumPy массивами.
Если интересуетесь обработкой данный на питоне, то посмотрите официальный сайт проекта, там куча примеров использования - https://numba.pydata.org/