Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Predstavlyaem cerebras cs 4 samyy bystryy ii stanovitsya esche bystree
Dev48

© 2026 · All rights reserved.

Представляем Cerebras CS-4: самый быстрый ИИ становится еще быстрее

Источник: Cerebras

Представляем Cerebras CS-4: самый быстрый ИИ становится еще быстрее

Источник: Cerebras

Встречайте Cerebras CS-4, пластинчатый ИИ-ускоритель с инференсом до 30 раз быстрее по сравнению с GPU-системами, нативной дезагрегированной инференсной архитектурой и повышенной пропускной способностью.

29 сентября 2026 г.•Обновлено: 29 сентября 2026 г.

Сегодня мы представляем четвертое поколение нашей системы Cerebras: CS-4. Самый быстрый ИИ-ускоритель в отрасли и новую основу для передового ИИ. Созданный на базе трех новых процессоров Wafer Scale Engine 3 Turbo, CS-4 объединяет более мощный процессор с полностью переработанными стойкой и архитектурой системы. Он обеспечивает до 30 раз более быстрый инференс по сравнению с GPU-системами, лучшую экономику и простой путь развертывания гипе-масштабируемых мощностей.

CS-4 создан на основе простой идеи: следующий скачок в инфраструктуре ИИ не может быть достигнут за счет улучшения какого-то одного компонента изолированно. Вычислительная мощность, электропитание, охлаждение и ввод-вывод должны развиваться вместе. Результатом стала система, созданная для генерации быстрых токенов для высокоинтерактивных интерфейсов и обеспечивающая общую емкость токенов, необходимую крупномасштабным операторам.

Это сочетание имеет решающее значение для всей сферы ИИ:

  • Разработчики хотят получить отзывчивые рассуждения и агентские приложения с 30-кратным ускорением.
  • Операторы дата-центров стремятся к более высокой пропускной способности на гигаватт (ГВт).
  • Необлачные провайдеры и гиперскейлеры нуждаются в модульных системах, которые можно быстро производить, устанавливать, расширять и модернизировать в гигаваттном масштабе.

CS-4 воплощает эти приоритеты в единой стоечной платформе.

Создано для скорости в масштабе

CS-4 обеспечивает до 30 раз лучшую производительность благодаря скоординированным инновациям во всей системе. Более быстрая связь между пластинами, плотная подача питания и модульная стоечная платформа Nexus работают как единая архитектура.

До 30 раз быстрее, чем GPU

CS-4 устанавливает новый рекорд самого быстрого инференса, доступного в производстве. Для показанных ниже моделей CS-4 генерирует токены с такой скоростью, к которой GPU-системы даже близко не подбираются, достигая до 30 раз более быстрого инференса.

Загрузка плеера...

Эта скорость распространяется на весь спектр ИИ: от небольших эффективных моделей до крупнейших моделей в мире, доказывая, что возросшие возможности модели больше не должны достигаться в ущерб скорости.

Инференс на CS-4 до 30 раз быстрее для набора показанных моделей. Источник: Artificial Analysis и внутреннее тестирование (август 2026 г.)

1000 токенов в секунду для моделей с 10 трлн параметров и выше

Обслуживание массивных моделей на нескольких ускорителях требует достаточно быстрого перемещения информации между этими процессорами для поддержания интерактивного взаимодействия. CS-4 снижает задержку межпластинного соединения до 2 микросекунд. Благодаря этой связи с низкой задержкой CS-4 может выдавать более 1000 токенов в секунду на моделях, превышающих 10 триллионов параметров.

Межпластинная связь с низкой задержкой сохраняет интерактивную производительность декодирования по мере роста размера модели. Источник: экстраполяция на основе внутреннего тестирования (август 2026 г.).

Более высокая сверхбыстрая пропускная способность

Инфраструктура ИИ часто заставляла операторов выбирать между двумя ценными результатами: высокой интерактивностью для каждого пользователя или высокой общей пропускной способностью. CS-4 раздвигает эти границы. Решение CS-4 генерирует токены до 30 раз быстрее, чем производственные GPU-системы, обеспечивая при этом в 10 раз большую пропускную способность на ватт по сравнению с CS-3.

Поскольку быстрые токены ценнее медленных, CS-4 обеспечивает как токены более высокой ценности, так и большее общее количество токенов в рамках заданного бюджета мощности, что позволяет дата-центрам быть значительно более прибыльными. Пользователи получают более отзывчивый интерфейс, а операторы — возможность обслуживать больше задач.

Решение CS-4 обеспечивает сверхбыстрый инференс там, где важна каждая миллисекунда, и высокую общую производительность там, где важен каждый ватт.

CS-4 расширяет границы сверхбыстрого инференса, предлагая до 10 раз большую емкость токенов и до 2 раз более высокую производительность по сравнению с CS-3. Источник: внутреннее тестирование и прогнозы (август 2026 г.).

Нативная поддержка дезагрегированного инференса

CS-4 разработан для работы в составе гетерогенного инфраструктурного решения для ИИ благодаря нативной поддержке дезагрегированного инференса — подхода, который распределяет две основные фазы инференса по взаимодополняющим вычислительным платформам.

Сначала специализированный механизм предварительного заполнения (prefill) обрабатывает входящий промпт и подготавливает состояние модели. Затем это состояние передается на CS-4, где система выполняет декодирование с ультранизкой задержкой и генерирует ответ.

Для операторов эта архитектура объединяет ведущую в отрасли производительность декодирования Cerebras с гибкостью объединения CS-4 с взаимодополняющими платформами предварительного заполнения, включая AMD Helios и AWS Trainium. Провайдеры могут использовать инфраструктуру GPU или ASIC для эффективного префилла и при этом использовать CS-4 для сверхбыстрого декодирования, создавая гетерогенную инференс-систему, разработанную для предоставления дифференцированных высокоскоростных услуг.

Дезагрегированный инференс объединяет эффективный префилл на GPU или ASIC со сверхбыстрым декодированием на базе Cerebras.

Стоечная платформа Nexus: модульный дизайн стойки для ускорения развертывания

CS-4 — это первая система, построенная на базе новой архитектуры платформы Cerebras Nexus. Nexus переосмысливает стойку вокруг трех основополагающих элементов: вычислений, питания и ввода-вывода, привнося значительные инновации в каждый из них.

Модульность меняет то, как стоечная ИИ-система перемещается с завода в дата-центр. Благодаря сокращению количества компонентов на 50 процентов и автономным сборкам для вычислений, питания и ввода-вывода, CS-4 поддерживает более быстрое производство и оперативное развертывание. Вместо того чтобы рассматривать стойку как жестко связанный набор деталей, Nexus превращает ее в платформу из специализированных модулей.

Такой подход на основе платформы также создает более чистый путь для обновлений, позволяя инновациям в одной части системы доходить до клиентов без ожидания редизайна всех остальных частей. Nexus создана не только для CS-4, но и для будущего системного прогресса с более высокой частотой обновлений.

Конструкция с подключаемыми вычислительными модулями (Compute Backpack)

В центре Nexus находится кардинально переосмысленная вычислительная подсистема. В CS-4 используется устанавливаемый сзади пластинчатый вычислительный рюкзак (Wafer-Scale Backpack), который крепится вертикально к массиву питания.

Каждый Wafer-Scale Backpack представляет собой автономный узел, объединяющий преобразование питания, прямое жидкостное охлаждение, высокоскоростной ввод-вывод и управляющую электронику в компактный трехмерный корпус, созданный непосредственно вокруг кремниевой пластины.

Отделив вычисления от блоков питания, Wafer-Scale Backpack упрощает производство и сокращает время развертывания с дней до часов. По сравнению с системой предыдущего поколения, Wafer-Scale Backpack содержит на 50% меньше компонентов и использует на 60% больше автоматизированного производства.

Питание высокой плотности

Архитектура платформы Nexus обеспечивает значительные улучшения в подаче питания. Перенеся преобразование питания в 100 раз ближе к процессорам по сравнению с традиционными платами GPU, CS-4 практически сводит к нулю потери питания на уровне платы. Это позволяет подавать вдвое больше мощности на WSE-3 Turbo, обеспечивая более высокие рабочие частоты и ускоренную генерацию токенов.

Текущая схема интеграции узла питания вокруг пластины.

Новая модульная подсистема ввода-вывода

CS-4 представляет новую программируемую подсистему ввода-вывода, которая удваивает пропускную способность ввода-вывода при одновременном резком сокращении задержек. Модуль Wafer I/O Module расширяет фабрику от краев пластины и предназначен для поддержки как открытой экосистемной связи, так и самых быстрых прямых соединений между системами Cerebras.

Стандартный протокол RoCE v2 RDMA over Ethernet предоставляет привычный способ подключения CS-4 к существующей инфраструктуре и экосистеме разнородных систем. Прямые соединения между пластинами (Direct Wafer Links) обеспечивают бес коммутаторные подключения внутри стоек и между ними. Вместе эти два режима дают операторам гибкость при создании гетерогенной инфраструктуры и масштабировании массивных кластеров CS-4 для обслуживания передовых ИИ-моделей на скорости более 1000 токенов в секунду.

Интерфейс Wafer I/O нового поколения расширяет модульную программируемую фабрику от краев кремниевой пластины.

Что дальше

Первые поставки CS-4 начнутся в этом квартале. Самый быстрый ИИ стал еще быстрее благодаря непревзойденным токеномике и системной архитектуре, созданной для гипермасштабируемых систем.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностьюПресса
OpenAI

OpenAI, по сообщениям, отказывается от модели из-за проблем с безопасностью

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасностиПресса
OpenAI

OpenAI отказывается от плана выпустить новую модель из-за растущих опасений по поводу безопасности

Источник: Инфраструктурный провайдер AI-инференции Modal Labs приближается к раунду финансирования на $750 млн по оценке $15,75 млрд
Пресса
Modal

Источник: Инфраструктурный провайдер AI-инференции Modal Labs приближается к раунду финансирования на $750 млн по оценке $15,75 млрд

Tesla снова отложила событие Roadster 2 из‑за плохой погодыПресса
Tesla

Tesla снова отложила событие Roadster 2 из‑за плохой погоды

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларовПресса
OpenAI

OpenAI спровоцировала борьбу за Hugging Face ранним предложением об инвестициях в преддверии сделки Nvidia на 13 млрд долларов

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведениемПресса
OpenAI

OpenAI по-прежнему не до конца контролирует всю активность своих ИИ-агентов с непредсказуемым поведением