Mellum2.1 вступает в работу: быстрая открытая модель для агентов написания кода

Источник: The JetBrains Blog•

Mellum2.1 вступает в работу: быстрая открытая модель для агентов написания кода

Обученная с помощью обучения с подкреплением в реальных средах, модель Mellum2.1 создана для агентов написания кода и быстрых субагентов, работающих на вашем собственном оборудовании. Сегодня мы выпускаем Mellum2.1 — следующую версию 12B смешанной экспертной модели (Mixture-of-Experts), которую…

Расширьте возможности своих инструментов с помощью функций на базе ИИ во многих продуктах JetBrains

Пресс-релизы

Mellum2.1 приступает к работе: быстрая открытая модель для агентов кодирования

Обученная с помощью обучения с подкреплением в реальных средах, модель Mellum2.1 создана для агентов кодирования и быстрых субагентов, работающих на вашем собственном железе.

Сегодня мы выпускаем Mellum2.1 — следующую версию нашей 12-миллиардной смеси экспертов (mixture-of-experts), которую мы выпустили в качестве open-source в июне. Архитектура не изменилась со времен версии 2: это по-прежнему компактная и быстрая модель с 2,5 млрд активных параметров, распространяемая под лицензией Apache 2.0. Изменилось все, что происходит после предварительного обучения.

Mellum2 была быстрой, но она не могла работать внутри репозитория на том уровне, который нам был нужен. После лета обучения с подкреплением в реальных средах с миллионами запусков в песочницах на тысячах сред модель Mellum2.1 научилась исследовать кодовую базу, редактировать файлы и проверять собственные изменения.

Попробовать Mellum

Изменения, которые мы внесли в Mellum2.1

Почти вся работа над этой версией пришлась на этап после предварительного обучения, в первую очередь на обучение с подкреплением (RL).

  • Обучение с подкреплением в новом масштабе: RL перешло от короткого заключительного этапа к основному этапу обучения. Мы провели множество экспериментов с методами и данными и сохранили то, что показало наилучшие результаты.
  • Больше данных, более жесткая фильтрация: мы добавили новые задачи RL в области математики, спортивного программирования, науки, использования инструментов и разработки программного обеспечения, объединив открытые наборы данных RL с задачами, созданными нами самостоятельно. Открытые данные часто содержат неработающие тесты, непроверяемые ответы или задачи, которые слишком просты или невыполнимы для модели, поэтому каждый источник проходил фильтрацию перед попаданием в обучение.
  • Реальные среды для агентных навыков: мы создали инфраструктуру для запуска тысяч сред RL собственными силами и задействовали миллионы песочниц в ходе обучения.

Производительность Mellum2.1

Мы сравнили Mellum2.1 с Mellum2, а также с двумя открытыми моделями аналогичного класса — Qwen3.5-9B и Gemma 4 E4B — используя для всех них одинаковую среду оценки.

Самое большое улучшение наблюдается в агентском кодировании, где Mellum2.1 продвинулась дальше всего по сравнению с Mellum2. Модель также стала лучше по всем направлениям, продемонстрировав прирост в кодировании, спортивном программировании, математике, вызове инструментов и общих знаниях, и она одинаково хорошо справляется как со сложными, так и с повседневными задачами.

Скорость

Посттренировка не затронула архитектуру, поэтому Mellum2.1 работает так же быстро, как Mellum2, а многотокеновое предсказание (MTP) делает ее еще быстрее.

При высокой нагрузке Mellum2.1 является самой быстрой моделью в группе и обрабатывает почти в два раза больше токенов, чем Qwen3.5-9B. Для отдельного запроса MTP делает ее примерно в 1,6 раза быстрее.

Ключевые варианты использования Mellum2.1

  • Эффективный рабочий элемент внутри агентных систем: Mellum2.1 может обрабатывать различные части плана агента, начиная с выявления первопричины сбоя теста и заканчивая написанием и проверкой исправления.
  • Задачи за пределами кодирования: Mellum2.1 также является способным универсальным ассистентом. Она справляется с повседневными вопросами и шаг за шагом решает сложные математические задачи и задачи на логику.
  • Приватное развертывание на собственных мощностях: запускайте Mellum2.1 локально или на собственной инфраструктуре, чтобы держать код и данные под полным контролем.

Начало работы с Mellum2.1

Mellum2.1 доступна на Hugging Face. Сборки GGUF для llama.cpp, Ollama и LM Studio, а также компонент многотокенового предсказания (MTP) для спекулятивного декодирования в vLLM появятся в ближайшее время.

Если вы создаете агентов кодирования, субагентов или инструменты ИИ, работающие на вашей собственной инфраструктуре, мы будем рады, если вы попробуете Mellum2.1. Расскажите нам, что работает хорошо, а что нет. Ваши отзывы определят облик следующей версии.

Open-source — это способ создания лучших моделей.

Попробовать Mellum

Узнать больше

О чём эта статья

Ещё в разделе «Разработка ПО»

Все →

Ещё от JetBrains