Помните у Цукербука украли языковую модель LLaMA и выложили её на торренты? Мы тогда ещё писали, что её не получится запустить на обычном ПК, потому что нет таких видеокарт и вообще нужен серверный кластер для машобуча?
Короче, модель переделали под запуск на процессоре (а не на GPU) и портировали её под Apple Silicon и эппловский же Neural Engine. То бишь, запустить её можно теперь на обычном макбук про с процессором M1 и выше.
Есть, правда, нюансы: портирована самая маленькая модель с 7 млрд параметров (модели с 13/30 и 65 млрд просто не запустятся). Софт написан на скорую руку и запустить его не так-то уж просто. Ну и самое главное - модель отвечает довольно медленно - где-то по 4 слова в секунду.
Гитхаб проекта тут:
https://github.com/ggerganov/llama.cpp@zavtracast