Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Zapusk bolee krupnyh modeley ii s bolshey effektivnostyu
Dev48

© 2026 · All rights reserved.

Запуск более крупных моделей ИИ с большей эффективностью

Источник: SambaNova

Запуск более крупных моделей ИИ с большей эффективностью

Источник: SambaNova

TL;DR AI has moved from experimentation into production, and that shift exposes three hard constraints: models keep getting bigger, cost climbs steeply at scale, and power becomes a physical ceiling. On a recent Fortune panel, SambaNova CEO Rodrigo Liang and Adaption Labs CEO Sara Hooker agreed…

27 сентября 2026 г.•Обновлено: 27 сентября 2026 г.

Коротко о главном

  • ИИ перешел от экспериментов к промышленному использованию, и этот сдвиг обнажил три жестких ограничения: модели продолжают расти, стоимость их масштабирования стремительно увеличивается, а энергопотребление становится физическим пределом.
  • На недавней дискуссионной панели Fortune генеральный директор SambaNova Родриго Лян и генеральный директор Adaption Labs Сара Хукер сошлись во мнении, что главной проблемой отрасли сейчас является эффективность, хотя они подходят к ней с разных сторон: Лян — со стороны инфраструктуры, Хукер — со стороны архитектуры моделей.
  • Крупные модели никуда не денутся. Для самых ресурсоемких задач они неизбежны, поэтому реальный вопрос заключается не в том, стоит ли их использовать, а в том, как делать это эффективно.
  • Инференс в эпоху агентов совсем не похож на проблему пропускной способности одной модели, с которой мы сталкивались раньше. По словам Хукер, «инференс — это совсем другой зверь». Узким местом является постоянное перемещение данных, а не чистая вычислительная мощность.
  • SambaNova фокусируется на премиальном инференсе, который на панели был определен через скорость и размер: запуск крупнейших моделей гораздо эффективнее и с полной точностью, вместо того чтобы жертвовать точностью ради скорости.

Останутся ли крупные модели с нами надолго?

Этот вопрос витал над всей беседой: являются ли сегодняшние крупнейшие базовые модели тем направлением, куда движется ИИ, или мы будем вспоминать о них как о временном отклонении? Недавняя дискуссионная панель Fortune под названием «От ИИ, который у нас есть, к ИИ, который нам нужен» адресовала этот вопрос двум экспертам, предлагающим совершенно разные ответы: сооснователю и генеральному директору SambaNova Родриго Ляну и сооснователю и генеральному директору Adaption Labs Саре Хукер, при модерации редактора Fortune AI Джереми Кана.

Они подошли к проблеме с противоположных сторон стека. Хукер работает над архитектурой моделей и тем, как они обучаются. Лян проектирует чипы, на которых они работают. Но они пришли к одному и тому же выводу: следующий этап развития ИИ будет определяться не тем, насколько большими могут стать модели, а тем, насколько эффективно мы сможем запускать те крупные модели, от которых уже зависим. Вот что было озвучено на панели.

Что сказали участники: ИИ вступил в фазу промышленного использования

На вопрос о том, застряла ли индустрия с крупнейшими моделями навсегда, Лян ответил утвердительно по обоим пунктам. Он объяснил, что мир неоднороден, поэтому масштаб по-прежнему важен, и крупные модели будут существовать еще долго, но при этом существует потребность в новом поколении более эффективных моделей. ИИ входит в фазу промышленного использования, а промышленное масштабирование сталкивается сразу с тремя ограничениями.

Три ограничения промышленного ИИ

Во-первых, модели продолжают расти, по крайней мере, тот класс моделей, который привлекает наибольшее внимание. Во-вторых, по мере масштабирования стоимость становится серьезной проблемой, и эта стоимость в значительной степени определяется инфраструктурой, доступной для запуска этих моделей. В-третьих, это электроэнергия.

Как справедливо отметил Лян, борьба отрасли за чипы и энергию вызвана не маленькими моделями. Именно крупные модели потребляют непропорционально большую долю вычислительных ресурсов, и именно поэтому давление сильнее всего ощущается в этом сегменте.

Эти ограничения не указывают на необходимость отказа от масштабирования. Они указывают на необходимость гораздо более эффективного его использования.

Взгляд со стороны моделей: почему меняется рабочая нагрузка

Хукер подошла к той же проблеме со стороны моделей. По ее словам: «Сегодняшние модели монолитны. Они застряли во времени. Большая цель в том, чтобы переосмыслить фундаментальные подходы к эффективному обучению на основе взаимодействия с окружающей средой, потому что сейчас все модели движутся в сторону интерактивности. Теперь важнее производительность на последнем этапе, и для этого нужны модели, способные развиваться, иначе вы столкнетесь с огромной неэффективностью».

Она видит, что точка перегиба приближается с реальной неотложностью. Частично решение заключается в том, чтобы не использовать крупнейшие модели для задач, которые в них не нуждаются. Она подчеркнула: «Не стоит применять одну и ту же модель ко всем проблемам. Вероятно, 90% задач очень просты. Например, во многих вещах, которые вы делаете при пакетной обработке, не стоит использовать массивную модель. Только для 10% задач требуется огромная вычислительная мощность».

Ее собственный фокус — непрерывное обучение — вытекает из этого. Как она определила это на панели: «Непрерывное обучение — это цель, при которой вы должны иметь возможность обновлять поведение модели, не забывая при этом то, что уже знаете».

Эти две точки зрения дополняют друг друга: эффективность — ключ к улучшению ИИ. Хукер описывает, почему меняется рабочая нагрузка. Лян описывает, что нужно для обслуживания этой нагрузки.

Почему инференс стал «другим зверем»

На протяжении большей части последнего десятилетия инфраструктура ИИ была настроена на обучение: одна огромная модель, одна огромная рабочая нагрузка, оптимизация пропускной способности и прокачка данных. Мысль Хукер на панели заключалась в том, что инференс в эпоху агентов выглядит совсем иначе. Все меняет то, что агентные задачи заставляют систему постоянно обращаться к памяти, продолжает она: «Вам приходится постоянно сверяться с данными в процессе работы. Это очень болезненная операция. По сути, это означает, что мы имеем дело с кризисом памяти».

Проблема духовки: узкое место — память, а не вычисления

Она привела аналогию, которая запомнилась всем: «Мы можем построить самую большую духовку в мире, но нашим единственным узким местом будет то, как быстро пекарь сможет загружать в нее продукты. Пекарь — это память. Что сейчас удивительно, так это то, что мы по сути вынимаем вещи из духовки и кладем их обратно несколько раз в процессе приготовления по рецепту».

Ее вывод был прямолинеен: «Инференс — это совсем другой зверь», и проектные решения вокруг памяти становятся критически важными. Лян развил ту же аналогию: «Думаю, у нас есть 50 духовок, и мы фактически перемещаемся от одной к другой. И поэтому в идеале нужно найти способы держать вещи в духовке, а не постоянно открывать ее. Это похоже на то, как я готовлю индейку на День благодарения».

Смысл этой метафоры: каждая ненужная передача данных стоит времени и энергии. Это суть того, почему инференс ведет себя именно так при масштабировании. Постоянное перемещение данных между вычислительными мощностями и памятью увеличивает расходы, а агентный ИИ умножает это движение.

Как к этому подходит SambaNova: премиальный инференс

Если на панели была диагностирована проблема, то подход SambaNova — один из ответов на нее. Лян описал фокус компании как премиальный инференс, определяемый двумя вещами: скоростью и размером. Он утверждает, что до появления нативно эффективных моделей именно самые крупные модели должны работать лучше, и чип Reconfigurable Dataflow Unit (RDU) создан именно для этого. Он добавил: «Поле битвы находится в области этих очень крупных моделей с триллионами параметров, и их нужно запускать гораздо, гораздо эффективнее, чем мы делаем это сегодня».

Запускайте модель так, как ее создали разработчики

По словам Ляна, одно решение отличает этот подход от других. Существуют способы ускорения, такие как квантование модели до более низкой точности, но, как он отметил, при этом теряется точность. «Мы делаем это так: мы запускаем все в исходной точности. Если великие исследователи создают замечательную модель, это не значит, что специалисты по аппаратному обеспечению должны прийти и просто урезать точность. Поэтому мы запускаем ее с полной точностью, и мы работаем примерно в 10 раз быстрее при одной десятой энергопотребления».

Этот результат достигается благодаря архитектуре Dataflow внутри чипа, которая сохраняет промежуточные результаты локально и сокращает перемещение данных, что, как было отмечено участниками дискуссии, является основной статьей расходов. SambaNova также не пытается выполнять абсолютно всё. Как объяснил Лян: «Мы не обязательно заявляем, что делаем всё. Мы берем самые популярные модели, которые нравятся людям, и оптимизируем их».

Дезагрегированный инференс и гетерогенные вычисления

Лян также описал центры обработки данных, в которые SambaNova внедряет свои решения, как гетерогенные: они включают не только собственные чипы компании, но и процессоры (CPU), и даже графические процессоры (GPU) других компаний для различных частей рабочей нагрузки. Он указал на недавнюю демонстрацию первого дезагрегированного инференса, где оборудование на базе GPU обрабатывает этап предварительного заполнения (prefill), а SambaNova выполняет декодирование той же модели. «На крупнейших моделях, — добавил он, — это дает значительный прирост как в скорости, так и в энергоэффективности, что в конечном итоге снижает затраты при масштабировании. Это один из примеров подбора оборудования, которое лучше всего подходит для каждого этапа рабочей нагрузки».

Правильная модель на правильном чипе для правильной задачи

Участники дискуссии сошлись во мнении, что универсального решения не существует. Современные центры обработки данных ИИ становятся все более гетерогенными. Разные рабочие нагрузки имеют разные профили, и зрелый производственный стек направляет каждую из них на то оборудование, которое справляется с ней лучше всего, вместо того чтобы пропускать всё через один и тот же кремний. Для предприятий, выбирающих, где запускать промышленный ИИ, SambaStack применяет этот принцип ко всему стеку — от чипа до API обслуживания моделей, при этом крупнейшие модели работают внутри одной стойки SambaRack с воздушным охлаждением.

Лян также подчеркнул важность гибкости для всех, кто планирует инфраструктуру. Циклы разработки оборудования длятся от трех до четырех лет, поэтому поставщики сегодня выпускают то, что спроектировали годы назад, в то время как исследователи продолжают изобретать вещи, которые никто не мог предвидеть. «Мы выпускаем сейчас то, что создали три года назад, и у нас есть такие выдающиеся умы, как Сара, которые изобретают вещи, которые мы никак не могли предвидеть три года назад».

Его вывод заключался в том, чтобы создавать инфраструктуру общего назначения с правильным уровнем абстракции, чтобы архитектуры, созданные в экосистемах обучения, ориентированных на GPU, могли быть перенесены и при этом получать преимущества от более нового оборудования.

Хукер дополнила этот тезис со стороны моделей, объяснив, почему инференс сейчас является основным полем деятельности: «Вы больше не хотите просто масштабироваться. Это уже не дает той отдачи, что на этапе предварительного обучения. Большинство лабораторий, как и большинство рабочих нагрузок, смещают фокус на то, как выполнять задачи во время тестирования». Этот сдвиг в сторону взаимодействия и этапа тестирования, по ее мнению, является именно той причиной, по которой стоит проектировать специализированное оборудование.

Эффективность — это мост, и работа идет прямо сейчас

Хукер завершила дискуссию мыслью о том, где сейчас сосредоточены наиболее интересные проблемы. «Прогресс, — утверждает она, — больше не достигается простым масштабированием. Формула теперь не так проста, как просто добавить больше весов к задаче. Эра исследований вернулась».

Для разработчиков моделей она охарактеризовала этот сдвиг как изменение самого определения работы: «Ваша идентичность — это не веса. Вы думаете о том, как быстро и эффективно вы можете заставить модель учиться на основе окружающей среды».

Траектория, описанная участниками дискуссии, достаточно ясна. Модели будут продолжать расти. Агентные рабочие нагрузки будут умножать инференс для каждого приложения. И ограничение, которое определяет, какие развертывания дойдут до производства — стоимость и энергопотребление при масштабировании — является проблемой эффективности. Эффективный запуск больших моделей — это мост, который превращает амбициозное масштабирование в нечто устойчивое. Вы можете узнать больше о том, как SambaNova подходит к этому, используя свои ресурсы и исследования.

Хотите увидеть, как выглядит полноточный, энергоэффективный инференс на крупнейших моделях? Поговорите с экспертом или изучите чип RDU, лежащий в основе подхода SambaNova.

← Все статьи

Ещё в разделе «AI и машинное обучение»

Все →
Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия
Lambda

Lambda построит новый центр обработки данных в округе Мейс, штат Оклахома, что принесет полмиллиарда долларов налоговых поступлений в течение следующего десятилетия

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в ИндииПресса
Google Gemini

Google тестирует возможность покупок на принадлежащей Walmart площадке Flipkart через Gemini и AI Mode в Индии

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами
Пресса
OpenAI

OpenAI расширяет проверку поведения моделей после появления новых инцидентов с несанкционированными агентами

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple WatchПресса
Apple

Apple обязали выплатить 5,7 млрд долларов по иску о нарушении патентных прав на тактильные технологии в iPhone и Apple Watch

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лабораторииПресса
OpenAI

Незащищенные агенты OpenAI опубликовали 53 пользовательских изображения в интернете без ведома лаборатории

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex
OpenAI

Proaction увеличивает продажи на 60% и экономит более 75 часов с Codex

Ещё от SambaNova

SN50 Premium Inference: более быстрый возврат инвестиций для неоклаудов
SambaNova

SN50 Premium Inference: более быстрый возврат инвестиций для неоклаудов

Что такое AI-инференс?
SambaNova

Что такое AI-инференс?

Hot Chips 2026: SN50 RDU и потоки данных в масштабе
SambaNova

Hot Chips 2026: SN50 RDU и потоки данных в масштабе

MiniMax M3 работает быстрее всех на SambaCloud
SambaNova

MiniMax M3 работает быстрее всех на SambaCloud