Dev48
ЯЗЫК
  • О нас
  • Услуги
  • Индустрии
  • Технологии
  • Статьи
  • Контакты
Забронировать звонок
    Главная/Статьи/Eksperiment s inferensom chto my uznali za pervuyu nedelyu
Dev48

© 2026 · All rights reserved.

Эксперимент с инференсом: что мы узнали за первую неделю

Источник: Hetzner

Эксперимент с инференсом: что мы узнали за первую неделю

Источник: Hetzner

От неожиданного спроса и ограничений пропускной способности до паттернов использования LLM и изменений в инфраструктуре.

25 сентября 2026 г.

Недавно мы запустили наш «Эксперимент с инференсом» (Inference Experiment): API для инференса, которое позволяет использовать большие языковые модели (LLM), размещенные на нашей инфраструктуре. Вы можете подключить к нему любого агента, инструмент или среду разработки по своему выбору и бесплатно пользоваться нашими LLM. Таким образом, вы можете протестировать работу LLM на мощном оборудовании, а мы получаем опыт эксплуатации таких моделей.

Теперь, когда «Эксперименту с инференсом» исполнилась неделя, мы хотели бы поделиться с вами некоторыми выводами о том, как он работает, что мы узнали и каким может быть его будущее. Для этого мы покажем хронологию платформы Hetzner Experiments и всех проведенных на ней экспериментов.

T - 4 месяца: представление Hetzner Experiments с OpenClaw

С тех пор как мы начали предлагать нашим клиентам GPU-серверы, мы тестировали различные способы запуска LLM внутри компании. Обладая многолетним опытом работы с Kubernetes, мы смогли создать внутреннюю платформу инференса, которую использовали для тестирования различных конфигураций серверов и программного обеспечения для обслуживания LLM.

В конечном итоге мы остановились на стеке, состоящем из нескольких серверов GEX131, vLLM и Open WebUI. Эта комбинация позволила нам запускать несколько небольших LLM, которые мы использовали для некоторых внутренних производственных задач. Это также позволило нам тестировать и оценивать более крупные модели внутри компании.

В начале 2026 года OpenClaw стал очень популярной темой в сфере ИИ. Многие энтузиасты использовали виртуальные машины Hetzner Cloud для тестирования OpenClaw, но сталкивались с трудностями при безопасной настройке сервера. Чтобы помочь нашим клиентам с этой задачей, мы решили предложить OpenClaw в виде предварительно настроенного инстанса.

Мы быстро создали новую платформу, которую можно было использовать не только для OpenClaw, но и для других сервисов и продуктов, с которыми мы хотели бы экспериментировать в будущем. Она позволила бы быстро проводить итерации и эксперименты, хотя и с меньшими гарантиями, чем наши более зрелые продукты. Одной из ключевых особенностей стала ценовая политика: изначально мы предлагали все эксперименты совершенно бесплатно.

OpenClaw также стал возможностью получить опыт работы с self-hosted инференсом. Наш OpenClaw поставлялся с уже настроенным собственным API для инференса. API не было общедоступным, а было ограничено рамками OpenClaw, чтобы мы могли в некоторой степени контролировать объем запросов. Предлагая инференс только через OpenClaw, мы могли тестировать небольшие модели с открытыми весами в различных конфигурациях. А наши клиенты получали ИИ-продукт, полностью базирующийся в ЕС.

Чтобы показать уникальность платформы Hetzner Experiments, мы создали для нее отдельную панель интерфейса по адресу experiments.hetzner.com.

Этот ограниченный эксперимент с OpenClaw дал нам много полезной информации:

  • Небольшие модели, такие как Qwen 3.6, оказались достаточными для большинства сценариев использования на базе OpenClaw.
  • Сервер GEX131 с одним GPU RTX PRO™ 6000 Blackwell был достаточен для небольших LLM, но не мог эффективно запускать крупные модели.
  • Многие пользователи высоко оценили тот факт, что решение полностью базируется в ЕС.
  • Качество кода OpenClaw было постоянной проблемой: каждый новый релиз OpenClaw приносил новые трудности, так как количество багов в апстриме было довольно высоким.

T - 1 месяц: получение специализированного оборудования

В Hetzner наши команды по аппаратному обеспечению постоянно работают над новыми моделями серверов. Одной из таких моделей стал новый кастомный сервер, в котором размещено восемь GPU RTX PRO™ 6000 Blackwell вместо одного GPU в GEX131. Это гораздо лучше подходит для запуска более крупных моделей.

Имея несколько таких серверов с 8 GPU, мы могли предложить нашим клиентам более крупные модели. Эксперимент с OpenClaw уже показал, что наши клиенты интересуются темами ИИ и инференса. Однако качество программного обеспечения OpenClaw оставалось проблемой.

Чтобы решить эту задачу, мы решили предлагать инференс напрямую в виде API со спецификацией OpenAI, которое мог бы использовать каждый, не прибегая к OpenClaw. Все, что для этого нужно — токен авторизации, который можно сгенерировать через experiments.hetzner.com на отдельной вкладке «Inference».

T - 2 недели: бенчмаркинг и выбор подходящих моделей

За этим последовало множество тестов и маркетинговых исследований.

Мы составили список LLM, которые хотели предложить:

• Qwen/Qwen3.6-35B-A3B

• Kimi-K2.7-Code

• GLM-5.2

• DeepSeek-V4-Flash-0731

Qwen продолжил использоваться как небольшая «базовая» модель, перекочевав из эксперимента с OpenClaw. Kimi предложил альтернативу, ориентированную на написание кода, двум крупнейшим моделям — GLM и DeepSeek. Каждая из этих моделей представляла новейшую версию соответствующего семейства LLM.

Единственным исключением стал Kimi: K3 уже вышел и обещал отличные результаты в публичных тестах. Однако очень специфические лицензионные требования K3 не позволили нам предложить его в качестве бесплатного эксперимента.

T - 1 неделя: финальная подготовка

В рамках финальной подготовки к «Эксперименту с инференсом» некоторые внутренние компоненты были переработаны, чтобы справиться с ожидаемым высоким спросом.

Маршрутизация запросов на инференс была значительно улучшена за счет внедрения llm-d и внесения изменений в некоторые компоненты маршрутизации, которые мы разработали собственными силами. Такие функции, как выгрузка kv-кэша в оперативную память хоста, также обещали существенный прирост производительности.

Мы также добавили еще несколько кастомных серверов с 8 GPU и выделили каждый из них для запуска DeepSeek, GLM или Kimi. А серверы GEX131 с одним GPU мы выделили для обслуживания небольшой модели Qwen 3.6.

T - 0 часов: запуск

Спрос на «Эксперимент с инференсом» было трудно оценить заранее. Чтобы перестраховаться, мы растянули запуск на несколько дней:

7 августа мы активировали новые модели и «Эксперимент с инференсом» на платформе Hetzner Experiments. Это дало первым пользователям возможность за выходные обнаружить любые проблемы, которые мы могли упустить. После выходных, 10 августа, мы начали активно сообщать об эксперименте нашим клиентам. Мы ожидали, что «сарафанное радио» со временем также увеличит спрос.

T + 6 часов: достижение пределов мощности

Информация распространялась быстро: уже через несколько часов мы заметили резкий рост запросов к API инференса. Спрос превзошел наши самые оптимистичные ожидания и продолжал расти высокими темпами.

Qwen 3.6, который был моделью по умолчанию для OpenClaw, оказался самым популярным в первый день как по количеству запросов, так и по количеству сгенерированных токенов. Другие модели также пользовались высоким спросом, но значительно отставали от Qwen.

Наша установка была способна генерировать достаточную пропускную способность токенов, чтобы справляться с запросами, но мы уже заметили увеличение задержки:

99-й перцентиль времени до первого токена (TTFT) показывал короткие скачки для некоторых моделей, но в целом работал достаточно хорошо, оставаясь в пределах от 5 до 10 секунд большую часть времени.

Еще одним сюрпризом стал огромный рост числа инстансов OpenClaw. Хотя ожидался некоторый рост спроса, количество инстансов в первый же день резко подскочило. Наш небольшой кластер Kubernetes для запуска инстансов OpenClaw быстро достиг предела своей мощности. Поэтому мы отключили вкладку OpenClaw на experiments.hetzner.com для всех учетных записей, которые еще не вошли в платформу Hetzner Experiments.

T + 1 день: борьба со спросом

На второй день эксперимента количество запросов ко всем моделям снова резко возросло.

Стали проясняться модели использования:

  • Наибольший интерес вызвала DeepSeek. Многие пользователи сообщали о благоприятных результатах тестирования.
  • Qwen оставалась популярной, получая огромное количество небольших запросов.
  • GLM и Kimi также пользовались высоким спросом, но значительно меньшим, чем две другие модели. У GLM была самая высокая задержка из всех, и ей требовалась дополнительная донастройка.
  • Мы не регистрируем данные промптов, но наши метрики токенов показали, что многие пользователи в это время все еще проводили бенчмарки.

Однако такое количество запросов превышало возможности нашей экспериментальной инфраструктуры. Время до получения первого токена (TTFT) резко возросло, достигнув пика почти в 10 минут для 99-го перцентиля, что временами делало API практически непригодным для использования. Наш эксперимент не был рассчитан на такой масштаб запросов, и это стало очевидно.

Особенно сложным оказалось большое количество небольших параллельных запросов. Чтобы лучше справляться с этим, мы сократили количество параллельных запросов, которые мы принимали.

Мы также получили много отзывов о настройках рассуждения (reasoning) различных моделей, которые некоторые пользователи сочли неинтуитивными.

Т + 2 дня: больше корректировок, больше оборудования

Спрос на инференс вырос еще больше, доведя нашу инфраструктуру до предела. Хотя количество запросов к API-эндпоинту снижалось, общее количество входных токенов продолжало расти.

Стремясь обеспечить больше вычислительной мощности, мы смогли собрать еще несколько специальных серверов с 8 GPU и добавили их в пул, обслуживающий GLM, так как эта модель в то время испытывала наибольшие трудности.

Модели использования теперь стабилизировались и оставались такими до конца недели:

  • DeepSeek получала все более сложные запросы с огромным количеством входных и выходных токенов.
  • Qwen продолжала получать очень большое количество небольших запросов.
  • GLM и Kimi получали запросы среднего размера, но в меньшем объеме, чем первые две.
  • Запросы в среднем были крупнее, чем в первый день. Это означало более практическое использование с большими реальными наборами данных.
  • Благодаря нашим настройкам пропускная способность всех моделей увеличилась.
  • В часы пик большое количество запросов вынуждено было ждать в очереди несколько минут, прежде чем сервер с GPU мог начать обработку запроса на инференс.

В течение недели мы попробовали множество улучшений: общие лимиты скорости инференса были снижены, чтобы дать большему количеству пользователей возможность попробовать эксперимент. Некоторые модели использования казались вредоносными, поэтому мы предприняли шаги по ограничению скорости и фильтрации таких запросов. Фактическое использование также отличалось от наших бенчмарков. Мы узнали, что для некоторых моделей меньшее количество параллельных запросов на экземпляр является наиболее оптимальным с точки зрения пропускной способности. С этим изменением общая пропускная способность токенов для эксперимента увеличилась.

Мы также расширили аппаратный пул для OpenClaw. Первые пользователи OpenClaw продолжали создавать еще больше экземпляров OpenClaw. Однако количество программных проблем с OpenClaw также возросло: несколько экземпляров OpenClaw фактически неправильно настроились при запросе пользователей и перешли в нерабочее состояние.

Т + 7 дней: подведение итогов и сокращение масштаба эксперимента

Оглядываясь назад через неделю, мы многое узнали:

Спрос оказался намного выше, чем мы ожидали, как с точки зрения количества пользователей, так и с точки зрения запросов и токенов на запрос. Серверы с 8 GPU доказали, что могут запускать большие модели, но спрос был просто слишком высок для тех немногих серверов, что были в нашем эксперименте. Метрики также показали нам некоторые узкие места в программном обеспечении, используемом для маршрутизации и обслуживания запросов.

Устранение некоторых из этих узких мест потребует вывода оборудования из пула для API инференса, чтобы протестировать некоторые изменения. Мы также планируем улучшить нашу документацию, добавив больше деталей и руководств, чтобы упростить работу для новичков.

Мы также пересмотрим наш выбор LLM на основе полученных метрик. Мы можем рассмотреть другие варианты использования, такие как переранжирование (re-ranking) или эмбеддинги, используемые в RAG-конвейерах. Кроме того, мы критически оценим эксперимент OpenClaw и объем поддержки, необходимый для него.

Эксперимент с инференсом продолжится, но в сокращенном объеме: мы продолжим обслуживать небольшие модели, такие как Qwen 3.6 и 3.8, но сделаем перерыв в обслуживании больших моделей.

Попробуйте сами на experiments.hetzner.com. Мы продолжим запускать новые проекты и экспериментировать, чтобы увидеть, что еще возможно. Следите за обновлениями.

Стефан Нойбауэр

DevOps-инженер, Managed Server

← Все статьи