Год назад, когда издание EE Times посетило офис генерального директора Tenstorrent Джима Келлера, на маркерной доске у его двери было написано: «Мы ПОБЕДИМ!». Год спустя там красуется надпись: «Нифига себе, как быстро!»
25 июня 2026 г.
Автор: Салли Уорд-Фокстон (Sally Ward-Foxton)
САНТА-КЛАРА, Калифорния — Год назад, когда издание EE Times посетило офис генерального директора Tenstorrent Джима Келлера, на маркерной доске у его двери было написано: «Мы ПОБЕДИМ!». Год спустя там красуется надпись: «Нифига себе, как быстро!»
Вскоре после мероприятия TT-Deploy, на котором компания продемонстрировала первые возможности своих чипов при масштабировании, Келлер сообщил EE Times, что Tenstorrent может превзойти по производительности как графические процессоры (GPU), так и более специализированное ИИ-оборудование с помощью своего серверного решения BlackHole Galaxy.
Келлер убежден, что ИИ-инференс в конечном счете сводится к проблемам работы с сетью и памятью, и теперь архитектура Tenstorrent доказывает это в масштабных развертываниях.
На мероприятии TT-Deploy компания продемонстрировала производительность для различных рабочих нагрузок. Например, 16 серверов Tenstorrent Galaxy (512 чипов) могут выполнять инференс модели DeepSeek-671B со скоростью до 350 токенов в секунду на пользователя при размере батча 32.
По словам Келлера, высокая скорость генерации токенов Tenstorrent стала прямым результатом способности компании легко распределять большие тензоры между сотнями чипов. В стойках Galaxy предусмотрено по 58 портов Ethernet на блок, в то время как серверы с GPU обычно имеют по восемь внешних портов на сервер.
Келлер ссылается на правило Рента, сформулированное в IBM в 1960-х годах, которое гласит, что объем ввода-вывода, необходимый для блока логики, растет сублинейно по отношению к объему самой логики; на практике это означает, что площадь вычислительных элементов растет быстрее, чем доступная площадь периметра для коммуникации. По его словам, для других архитектур это часто становится фатальным недостатком.
«Никаких новых законов нет, — заявил он. — Основы вычислений для ИИ уходят корнями в высокопроизводительные вычисления (HPC) 1970-х годов, которые были прекрасно понятны на протяжении десятилетий».
По его словам, успешная ИИ-инфраструктура по-прежнему сводится к балансу между вычислениями, памятью и вводом-выводом.
«ИИ — это в основном матричные вычисления и нелинейные векторные операции, а для обеспечения высокой скорости работы вам необходим достаточный объем SRAM для хранения данных и результатов вычислений, а также буфер для перемещения данных между памятью, тензорными процессорами и чипами, который у нас есть, — пояснил он. — Если сделать память слишком большой, это не сильно поможет, а если слишком маленькой — это действительно плохо».
Конкурент Tenstorrent, компания Cerebras, оказавшаяся в центре внимания из-за производительности больших моделей после успешного выхода на биржу (IPO), опубликовала показатели производительности для модели Kimi K2.6 (1T). Это крупнейшая модель, с которой компания работала публично на данный момент; Cerebras заявила, что ее аппаратное обеспечение CS3 может достигать 981 токена в секунду.
По словам Келлера, Tenstorrent может превзойти этот результат при масштабном развертывании серверов BlackHole Galaxy, затратив лишь малую часть стоимости аппаратного обеспечения.
«Выход Cerebras на IPO и последовавшая за этим оценка были полезными, тем более что мы собираемся превзойти их во всем, — сказал он. — Вызов принят!»
Дизагрегированный инференс
Лидер рынка Nvidia лицензировала технологию у компании Groq для ускорения этапа декодирования при инференсе больших языковых моделей (LLM) с помощью метода, известного как дизагрегированный инференс. Для этого требуются три стойки процессоров и графических ускорителей Nvidia (примерно одна стойка для этапа предварительного заполнения [prefill] и две стойки для хранения огромного KV-кэша) на каждую одиночную стойку чипов Groq, отвечающую за декодирование.
По словам Келлера, Tenstorrent не нуждается в каких-либо дополнительных шагах для быстрого декодирования.
«Меня часто спрашивают, как мы справляемся с KV-кэшем, — отметил он. — Он находится в памяти DRAM на тех же чипах, что и декодирование, мы даже не задумываемся об этом. У нас это получается действительно отлично».
Ключевым моментом является то, что Tenstorrent может соединять между собой произвольное количество тензорных процессоров, заявил Келлер. При достаточном количестве чипов тензоры полностью помещаются в SRAM, но если чипов не хватает, данные могут поступать потоком из DRAM ценой небольшого снижения производительности. Он отметил, что архитектуры без какой-либо DRAM, такие как Groq и Cerebras, не способны на это.
«Они могут масштабироваться до больших моделей, им просто нужно много оборудования, — сказал он. — Наш ответ заключается в том, что даже относительно скромное по размерам оборудование может запускать большие модели, но если вам нужны сверхвысокие скорости токенов, мы можем управлять этим параметром так, как нам захочется».
Можно ли использовать аппаратное обеспечение Tenstorrent вместе с GPU для ускорения декодирования, аналогично дизагрегированной архитектуре Nvidia?
«У нас есть клиент, который использует Galaxy для ускорения купленных ими графических процессоров, — рассказал Келлер. — У нас есть плата PCIe с нашим чипом BlackHole, и для передачи данных мы используем Ethernet Layer 2, так что подключить ее было довольно просто».
По словам Келлера, благодаря этому методу клиент удвоил или утроил скорость генерации токенов.
«Если бы они изначально купили только Tenstorrent, это обошлось бы дешевле, потому что мы также умеем выполнять этап префилла, и это работает чище, — добавил он. — Но [клиент] уже купил графические процессоры и хотел извлечь выгоду из своих инвестиций».
Превращение этой идеи в полноценный продукт пока находится под вопросом («возможно»), добавил Келлер.
Сопроектирование рабочих нагрузок
Мнение о том, что гиперскейлеры и передовые лаборатории имеют преимущество в проектировании оборудования благодаря вертикальной интеграции (то есть они досконально знают свои рабочие нагрузки и могут совместно проектировать чипы и модели), возможно, преувеличено, считает Келлер. Tenstorrent, как и другие компании, имеет в своем оборудовании оптимизации для некоторых популярных нелинейных функций, но при необходимости их можно дорабатывать в последующих поколениях кремния.
По словам Келлера, на уровне чипа важнейшими задачами являются проектирование под большие модели, обеспечение правильной точности и грамотная работа как с огромными KV-кэшами, так и с вычислительно емкими рабочими нагрузками вроде диффузионных моделей.
«Пока что все работает отлично, если у вас есть баланс между DRAM, SRAM, вычислениями, матрично-векторными операциями и сетевой структурой на кристалле (NoC) — правило Рента работает безупречно», — подчеркнул он.
Еще один старый закон, который находит новое применение — это закон Амдала, который обычно используется для демонстрации того, что ускорение любой рабочей нагрузки ограничено теми ее частями, которые не поддаются ускорению.
«Агентные вычисления — это проблема закона Амдала, — пояснил Келлер. — Для ИИ требовалось колоссальное количество вычислений, поэтому процессоры отправляли ИИ-задачу и ждали ее завершения… агентный подход начал стимулировать спрос на CPU, поскольку ИИ наконец стал достаточно быстрым, чтобы упираться в узкое место скалярной части задачи».
Нацеленность на IPO
Келлер отказался комментировать сообщения о предложениях по поглощению со стороны таких компаний, как Intel и Qualcomm, подтвердив лишь то, что он действительно встречался с генеральными директорами обеих компаний, а также со всеми ключевыми гиперскейлерами, чтобы предложить им аппаратную IP-лицензию Tenstorrent.
«Я надеюсь заключить крупную сделку с кем-то из них, потому что наш процессорный IP на базе RISC-V великолепен, — сказал он. — Один из гиперскейлеров также присматривается к нашему IP для ИИ с целью создания небольшого чипа».
Хотя гиперскейлеры разработали собственные крупные чипы для ИИ, более компактные ИИ-чипы, подобные тем, что используются в периферийных устройствах (edge devices), не могут просто использовать урезанную версию той же интеллектуальной собственности, отметил Келлер. ИИ-IP от Tenstorrent разработана с расчетом на масштабируемость и полностью готова к коммерческому использованию (она поставляется со всем необходимым для масштабирования, например, от одного до 1000 ядер, пояснил Келлер).
Два крупных выхода на биржу конкурентов Tenstorrent в статусе стартапов за последние шесть месяцев состоялись в формате (фактического) поглощения и IPO. Келлер подтвердил, что Tenstorrent стремится к выходу на IPO, и в этих целях развивает свою цепочку поставок и международное присутствие.
«Прямо сейчас наши инвесторы очень горячо поддерживают IPO», — отметил он.
Делает ли потенциал Tenstorrent в качестве ускорителя декодирования привлекательной целью для поглощения со стороны GPU-компании? Келлер ответил, что более вероятна какая-либо стратегическая сделка или совместный вывод продуктов на рынок.
По его словам, как суверенная инфраструктура, так и крупные передовые лаборатории стремятся контролировать свою судьбу в том, что касается аппаратного и программного обеспечения. «Может случиться всякое», — добавил он.
Келлер сообщил, что после выпуска TT-Deploy компания Tenstorrent получила заказы на свое «железо», причем крупнейший заказ оформлен на кластер из 96 систем Galaxy с поставкой за пределы США (96 систем Galaxy — это 3 072 чипа Blackhole). Крупнейшим клиентом Tenstorrent на сегодняшний день остается компания AI& в Японии, генеральным директором которой является бывший топ-менеджер Tenstorrent Дэвид Беннетт.
«Частично ситуация выглядит так: у ряда людей были заказы на $100 млн у Nvidia, но Nvidia не будет осуществлять поставки в течение года, поэтому они приобрели машину Tenstorrent за $20 млн, поскольку она намного дешевле», — рассказал Келлер.
По его словам, Tenstorrent в настоящее время производит 1 000 серверов Galaxy, по меньшей мере половина из которых уже продана.
«Наши разработки работают довольно хорошо, у 10 клиентов установлены системы Galaxy на местах, мы миновали стадию проверки концепции», — заявил Келлер. «Мы начинаем получать повторные заказы… Я хочу заполучить 10 довольных клиентов, затем 20, а потом 30».
Эта статья впервые опубликована в EE Times
ai& и Tenstorrent запускают JapanFold, принося открытые технологии для суверенного поиска лекарств в Японию
3 сентября 2026 г.
Stealthium и Tenstorrent объявляют о партнерстве для обеспечения наблюдаемости во время выполнения в инфраструктуре ИИ
30 июля 2026 г.
Tenstorrent устанавливает новые рекорды производительности, представляет TT- Ascalon S и расширяет присутствие в Японии
30 июня 2026 г.









