Избыток вычислительных мощностей делает всех ленивыми в одном и том же направлении. Когда H100 повсюду, решение для медленной рабочей нагрузки — это еще больше H100. Неэффективность никуда не девается. Она просто прячется в шуме, и никто не получает денег за её поиск.
Дефицит меняет математику. У неэффективности появляется цена, и эта цена продолжает расти.
Я думаю об этом как о фрекинге. Десятилетиями существовали залежи нефти, о которых все знали, но никто их не трогал, потому что они были слишком маленькими, слишком плотными, слишком сложными для доступа. Затем цена изменилась, и экономика перевернулась. Оказалось, что эти «неудобные» залежи и есть вся игра.
С ядрами то же самое. В мире бесконечных вычислений кастомное ядро для какой-то нишевой архитектуры, спекулянт, настроенный на одну рабочую нагрузку, 20% прироста на пути, который большинство людей никогда не использует — всё это не стоит затраченного инженерного времени. В мире, который мы имеем на самом деле, каждое из них — это маржа:
- ядра для архитектур, которые крупные библиотеки так и не удосужились поддержать
- пути инференса, сформированные вокруг одной рабочей нагрузки, а не усредненного токена
- аппаратно-зависимые трюки, которые окупаются только в масштабе
- 20-процентное ускорение, которое решает, сойдется ли юнит-экономика
Люди понимают следующую часть превратно. Дефицит не замедляет эту работу. Это причина, по которой работа вообще происходит. Ценовой сигнал направляет инженерные ресурсы в те трещины, которые рынок годами обходил стороной, и в результате получается не один чистый универсальный стек. Это фрагментированный, более быстрый программный слой: рынок специализированных ядер, проходов компилятора и хаков для конкретных моделей, каждый из которых извлекает крупицы ценности, оставленные универсальным стеком в земле.
Универсальный стек не может последовать за вами туда. Это структурная особенность. Горизонтальная среда выполнения оптимизируется под усредненный токен, потому что она должна обслуживать все модели сразу. Как только она настраивается под вашу рабочую нагрузку, она перестает быть горизонтальной. Она никогда не сможет показать те цифры, которые показывает специалист. Инженеры не стали хуже. Сама позиция это запрещает.
Мы выбрали другой путь. Одна рабочая нагрузка — цикл агента кодирования — и мы владеем всеми четырьмя уровнями под ним: моделью, спекулянтом, ядром, оборудованием. Для открытых моделей, которые мы обслуживаем, мы обучаем собственные спекулятивные декодеры на распределении результатов кодирования, а не на усредненном веб-тексте, потому что спекулянт, прочитавший миллион диффов, предсказывает следующий токен гораздо лучше, чем тот, что прочитал весь интернет. Apply работает на скорости 10 500 токенов/с. Compaction — на 33 000. Ядра написаны и проверены на реальных трассах, а не на бенчмарках. Развернутая версия этого аргумента находится здесь.
Дефицит не ограничивает инновации. Это то, что наконец-то их оплачивает. Скучная инфраструктура всегда была тем местом, где лежала ценность. Теперь появился ценовой сигнал, указывающий прямо на неё.




