Что такое Splash Engine?
Splash — это движок для инференса с открытым исходным кодом от Inco AI для запуска языковых моделей локально на Apple Silicon. Он оптимизирован специально для Qwen3.6-35B-A3B и Qwen3.8-27B. Движок предоставляет GPU-ядра и план распределения памяти, адаптированный для каждой поддерживаемой модели. Каждая модель поставляется со специализированной черновой моделью DFlash 2 для спекулятивного декодирования, что повышает скорость генерации.
В тестах Inco на чипе M5 Pro с 48 ГБ оперативной памяти Splash показал скорость декодирования примерно в два раза выше, чем у следующего по быстродействию движка, измеренного ими на модели Qwen3.8-27B: 74 токена в секунду на коротких промптах и 54 токена при контексте 32K. При четырех одновременных запросах на коротких промптах общая пропускная способность достигла 170 токенов в секунду — это в 3,9 раза быстрее, чем у ближайшего конкурента в их сравнении. Подробнее о Splash читайте в блоге Inco.
Использование в LM Studio Bionic
Скачайте и установите LM Studio Bionic версии 1.1.5 или новее, затем откройте приложение. Для работы Splash требуется Mac с чипом M3 или новее под управлением macOS 26.4 или более поздней версии, а также не менее 36 ГБ объединенной памяти; Inco рекомендует 48 ГБ или больше.
Перейдите в Settings > Runtime. В разделе Experimental backends нажмите Download рядом с Splash (Metal), чтобы установить движок.
Скачайте движок Splash в разделе Settings > Runtime.
Затем перейдите в Settings > Explore, вставьте одну из следующих ссылок Hugging Face в строку поиска, выберите модель и нажмите Download:
После завершения загрузки начните новый сеанс и выберите модель в локальном селекторе моделей.










