Что такое Splash Engine?
Splash — это открытый инференсный движок от Inco AI, предназначенный для локального запуска языковых моделей на Apple Silicon. Он оптимизирован специально для моделей Qwen3.6-35B-A3B и Qwen3.8-27B. Движок предоставляет графические ядра GPU и план памяти, адаптированный к каждой поддерживаемой модели. Каждая модель поставляется с отдельной черновой моделью DFlash 2 для спекулятивного декодирования, что повышает скорость генерации.
В тестах Inco на 48 ГБ M5 Pro Splash показал примерно в два раза более высокую скорость декодирования по сравнению с самым быстрым из протестированных ими движков на Qwen3.8-27B: 74 токена в секунду на коротких запросах и 54 токена при 32K контексте. При четырех одновременных запросах на коротких запросах его общая пропускная способность достигла 170 токенов в секунду — в 3,9 раза больше, чем у самого быстрого движка в их сравнении. Подробнее о Splash читайте в блоге Inco по ссылке blog post.
Используйте его в LM Studio Bionic
Скачайте и установите LM Studio Bionic версии 1.1.5 или выше, затем откройте приложение. Splash требует Mac M3 или новее с macOS 26.4 или выше и не менее 36 ГБ объединенной памяти; Inco рекомендует 48 ГБ или больше.
Перейдите в Настройки > Среда выполнения. В разделе «Экспериментальные бэкенды» нажмите «Скачать» рядом с Splash (Metal), чтобы установить движок.
Скачайте движок Splash в разделе Настройки > Среда выполнения.
Затем перейдите в Настройки > Обзор, вставьте одну из следующих ссылок Hugging Face в строку поиска, выберите модель и нажмите «Скачать».
После завершения загрузки начните новую сессию и выберите модель из локального списка моделей.










