
Perplexity разогнала локальный Qwen на Mac
Perplexity показала Lily, собственный движок для запуска Qwen3.6-35B-A3B прямо на Apple Silicon. Он написан специально под архитектуру модели и работает без PyTorch и MLX.
На MacBook Pro с M5 Max движок в среднем обрабатывает входной текст в 1,23 раза быстрее MLX-LM, а генерирует ответ в 1,35 раза быстрее. На контексте 4K скорость генерации достигает примерно 187 токенов в секунду.
Сам Qwen хранится в 4-битном виде и занимает около 19,4 ГБ. Lily оптимизирует работу с памятью, распределение экспертов и вычисления на GPU, что особенно важно для длинного контекста вплоть до 128K токенов.
Главное тут в другом. Большие модели на Mac уже упираются не только в мощность железа, но и в то, насколько хорошо движок заточен под конкретную модель и чип. Lily Perplexity планирует открыть в ближайшее время.
Ежедневные подборки промптов, свежие новости и материалы об ИИ — там, где удобно. Без спама, только редакционный отбор.