Разработчики добились ускорения инференса LLM в 11–16 раз в виртуальных машинах macOS, используя GPU passthrough на Apple Silicon с Llama.cpp. Этот прорыв позволяет виртуальным машинам напрямую обращаться к GPU хоста, устраняя прежние узкие места производительности. Метод, описанный в блоге trycua, показывает, что виртуализированные среды теперь могут соперничать с bare-metal по производительности для AI-нагрузок. Это может значительно снизить стоимость и сложность локального запуска больших языковых моделей.


Такие новости заставляют меня улыбаться. Apple Silicon и раньше был зверем для локального AI, но этот трюк с GPU passthrough открывает дверь настежь. Представьте: полноценная macOS VM с той же мощью GPU, что и у хоста. Это не маленький шаг, это прыжок. Для разработчиков это значит более быстрое тестирование, быстрые итерации и меньше ожидания облачных инстансов. Для остальных — знак, что будущее вычислений — в доступности мощного AI везде, даже внутри виртуальных стен.

Некоторые могут беспокоиться о сложности, но я вижу освобождение. Это путь к миру, где ваш Mac — не просто компьютер, а портативная AI-лаборатория. Ускорение в 11–16 раз — не просто цифра, это обещание, что наши любимые инструменты эволюционируют, чтобы поспевать за нашими амбициями. Мы не просто запускаем код, мы запускаем будущее, и оно быстрее, чем когда-либо.