Новинка
Новинка
Сегодня мы выпускаем Solar Open 2 — нашу фундаментальную модель с открытыми весами, оптимизированную для агентных вычислений.
Solar Open 2 разработана и обучена для использования в качестве базовой модели для агентов в реальных рабочих средах. Она обучена на широком спектре агентных сценариев, включая вызов инструментов, программирование и офисную работу, и демонстрирует производительность, сопоставимую с ведущими мировыми моделями в тестах на агентные способности, корейский язык, знания и программирование.
Модель использует архитектуру MoE, которая активирует только 15 млрд из 250 млрд общих параметров на токен, что одновременно повышает возможности и эффективность вывода. Благодаря квантованию она работает на двух графических процессорах NVIDIA H200, что делает ее практичной для развертывания и эксплуатации предприятиями на собственной инфраструктуре. Созданная для агентных задач, выполняемых в несколько этапов, она поддерживает контекстное окно до 1 млн токенов и имеет официальную поддержку корейского, английского и японского языков.
Веса модели выпущены на Hugging Face по лицензии, допускающей коммерческое использование. Вместе с ними мы публикуем технический отчет Solar Open 2, охватывающий полную архитектуру, методологию обучения, ключевые эксперименты и условия оценки.
Ключевые особенности
- Разработана и обучена для агентного использования, готова к реальным рабочим средам
- Конкурирует с ведущими мировыми моделями в тестах на агентные способности, корейский язык, знания и программирование
- Архитектура MoE: 250 млрд общих / 15 млрд активных параметров для эффективного вывода
- Контекстное окно 1 млн токенов
- Работает на двух графических процессорах H200 с использованием квантования
- Официальная поддержка корейского, английского и японского языков
- Выпущена с открытыми весами, разрешено коммерческое использование
От чата к агентам
Роль больших языковых моделей (LLM) меняется.
До сих пор LLM в основном генерировали один ответ на вопрос пользователя. Теперь они превращаются в агентов, которые ищут информацию, читают документы, пишут код и вызывают внешние инструменты для выполнения реальной работы.
Работа, которую выполняют агенты, качественно отличается от чата. Вместо ответа на короткий вопрос агент повторяет десятки шагов рассуждения и вызовов инструментов. Ему приходится работать с информацией, разбросанной по файлам и документам, помнить о том, что он уже сделал, и принимать решения о следующем действии. Ошибка на одном этапе может привести к провалу всей задачи в дальнейшем.
Агентное использование требует трех возможностей.
- Во-первых, выполнение долгосрочных задач: доведение многоэтапной работы до конца.
- Во-вторых, обработка длинного контекста: удержание в поле зрения длинных документов и истории работы.
- В-третьих, точное следование инструкциям и надежный вызов нужных инструментов.
Этим способностям трудно научиться на обычных данных для ответов на вопросы. Модель должна сталкиваться с агентными сценариями во время обучения: поиск, вызов инструментов, программирование, работа с документами. И эти сценарии не должны просто выглядеть правдоподобно. Они должны отражать реальные рабочие среды, и мы должны иметь возможность проверить, что модель действительно выполнила задачу.
Стоимость также имеет значение. Агент не останавливается на одном вызове модели; он циклически проходит через планирование, выполнение, проверку и пересмотр, поэтому обычно использует гораздо больше токенов, чем чат. Чтобы предприятие могло развернуть модель на собственной инфраструктуре, она не должна быть слишком большой или медленной.
Мы создали Solar Open 2 не просто как модель с высокими результатами в тестах, а как модель с производительностью и структурой затрат, способную поддерживать агентов в реальных рабочих средах.
Обучающие данные, ориентированные на агентов
Мы разработали Solar Open 2, сделав агентное использование основной целью как на этапе предварительного обучения, так и на этапе дообучения. Сценарии обучения охватывают поиск, вызов инструментов (MCP), программирование и офисную работу. Модель научилась не просто генерировать объяснения, но и действовать в реальных средах, проверять результаты и исправлять себя при необходимости.
Чтобы создать реалистичные обучающие данные для агентов, мы разработали собственный конвейер синтеза и проверки данных. Начиная с исходных данных, полученных из реальных рабочих сред, мы создали условия, в которых можно однозначно определить правильные ответы, а затем повторяли процесс отбора только тех данных, которые прошли проверку. Только эти высококачественные агентные данные пошли в обучение.
Поиск
Данные для поискового агента различают вопросы, на которые модель может ответить, используя свои знания, и вопросы, требующие фактического поиска. Сгенерированные вопросы проходят через несколько этапов проверки, оценивающих структуру, нетривиальность, возможность поиска, разрешимость и обоснованность источниками. Это учит модель обращаться к поиску, когда она сталкивается с информацией, которой у нее нет.
Вызов инструментов
В отличие от традиционных подходов, которые оценивают только то, выбрала ли модель правильный инструмент, мы заставляем модель выполнять изменения в реальной среде, а затем считывать измененное состояние для проверки результата. Суть в том, чтобы отделить генерацию правдоподобного ответа от фактического завершения задачи. Это обучает модель предпринимать действия, которым можно доверять, а не просто выдавать ответы, которые звучат правильно.
Программирование
Агент-программист работает в терминале, а затем пишет и запускает собственные тесты. Когда тесты не проходят, обучающие данные включают цикл исправления кода и повторной проверки. Модель учится работать с долгосрочными задачами: исправлять ошибки и в конечном итоге достигать цели.
Офисная работа
Сценарии офисной работы отражают реальные рабочие условия: перекрестную проверку информации, разбросанной по документам и электронным таблицам, изменение входных данных в таблице с формулами и пересчет результатов, а также другие задачи, близкие к повседневной работе. Мы специально включили сценарии обработки документов и использования инструментов, распространенные на корейских рабочих местах. Цель состояла не только в том, чтобы генерировать грамотный корейский язык, но и в том, чтобы фактически выполнять работу, поставленную на корейском языке.
Контекст 1 млн токенов для длинных задач
Чем дольше работает агент, тем больше информации ему нужно удерживать. Чтобы ориентироваться в большой кодовой базе, сравнивать несколько документов и принимать решение о следующем действии на основе результатов предыдущих инструментов, модель должна воспринимать и обрабатывать длинный контекст.
Solar Open 2 поддерживает контекстное окно в 1 млн токенов. Для поддержки длинного контекста используется архитектура Hybrid Attention, сочетающая GQA (полное softmax-внимание) с линейным вниманием. Модель повторяет блоки из одного слоя GQA и трех слоев линейного внимания, применяя линейное внимание к 75% из своих 48 слоев.
Слои линейного внимания управляют информацией о последовательности в состоянии фиксированного размера. Это позволяет избежать роста KV-кэша каждого слоя пропорционально длине контекста и снижает нагрузку на память при работе с длинными входными данными.
Слои softmax-внимания используют NoPE, не применяя позиционное кодирование. Этот выбор направлен на экстраполяцию: обработку входных данных, длина которых превышает ту, которую модель в основном видела при обучении.
Этот эффект проявляется и в эффективности обучения. В контролируемом сравнении архитектура Solar Open 2 достигла на 210 млрд токенов производительности MMLU, для достижения которой архитектуре Solar 100B с полным softmax-вниманием потребовался 671 млрд токенов. Подробное сравнение и обоснование дизайна опубликованы в техническом отчете.
Эффективность вывода для повторяющихся вызовов
В среде, где агенты многократно вызывают модель, стоимость вывода становится стоимостью продукта.
Solar Open 2 использует архитектуру MoE, которая активирует только 15 млрд из 250 млрд своих общих параметров на каждый токен. Такая конструкция сохраняет знания и репрезентативную емкость большой модели, одновременно снижая объем активных вычислений, необходимых для обработки каждого токена.
Полносвязная сеть (FFN) в Solar Open 2 состоит из 320 маршрутизируемых экспертов и 1 общего эксперта, при этом для каждого токена выбираются 8 экспертов. В отличие от плотных моделей, которые каждый раз активируют все параметры, эта модель использует только тех экспертов, которые необходимы для входных данных.
Эта эффективная с точки зрения вывода архитектура позволяет Solar Open 2 сохранять производительность при работе на относительно небольшой инфраструктуре: четыре NVIDIA H200 для модели в формате BF16 или два H200 с квантованием.
Мы установили эти требования с прицелом на развертывание, а не только на исследовательскую оценку: предприятия, запускающие модель на собственной инфраструктуре и подключающие ее к агентским сервисам. Рекомендуемые конфигурации обслуживания, руководство по развертыванию vLLM и официальные квантованные модели представлены в карточке модели.
Мультиязычная модель, эффективная для корейского языка
Solar Open 2 использует токенизатор, оптимизированный для эффективности токенизации корейского языка. В результате она обрабатывает тот же корейский текст, используя лишь от 50 до 80% токенов, необходимых глобальным моделям. При работе с корейскими офисными текстами токенизатор Solar Open 2 оказался самым эффективным из 12 протестированных нами, опережая лучшую глобальную модель примерно на 24%. Выражение того же контента меньшим количеством токенов означает снижение затрат на вывод и увеличение эффективного контекста.
Селективный перенос весов (Selective Weight Transfer) для эффективного обучения
Чтобы обучить модель масштаба 250 млрд параметров более эффективно, мы разработали собственный метод селективного переноса весов. Вместо случайной инициализации всех весов мы взяли нашу предыдущую модель, Solar Open 100B, отобрали только те веса, которые могли быть перенесены в новую архитектуру, и использовали их для инициализации Solar Open 2.
На рисунке показан прокси-эксперимент 200B-A15B, в котором архитектура, данные для обучения и оптимизатор идентичны, а различается только инициализация. Модель с селективным переносом весов достигла целевых потерь при обучении примерно на 12 млрд токенов, в то время как случайно инициализированной модели потребовалось около 22 млрд. Другими словами, перенесенная модель достигла тех же потерь при использовании около 58% токенов, тогда как случайная инициализация потребовала примерно в 1,7 раза больше. Это показывает, что даже при использовании разных архитектур повторное использование только основных представлений позволяет модели быстрее достичь целевого уровня производительности с меньшим количеством обучающих токенов.
Селективный перенос весов — это наш собственный подход к сокращению времени обучения и вычислительных затрат. С этим релизом мы улучшили как производительность модели, так и эффективность процесса ее создания.
Бенчмарки
Первое место среди сопоставимых моделей в MMLU-Pro, LiveCodeBench и корейских бенчмарках
Помимо использования в качестве агента, производительности корейского языка и эффективности вывода, Solar Open 2 также конкурентоспособна в области базовых знаний и программирования.
По результатам наших бенчмарков, Solar Open 2 набрала 86,2 балла в MMLU-Pro (знания) и 92,4 балла в LiveCodeBench (программирование), что является самыми высокими показателями среди сопоставимых моделей.
Ее средний балл в корейских бенчмарках, равный 85,4, превосходит DeepSeek-V4-Flash (84,9) и значительно опережает быстрые закрытые API, такие как GPT-5.4 mini (80,8) и Claude Haiku 4.5 (69,6).
Модель также показала конкурентоспособность в следовании инструкциям и вызове инструментов — оценках, наиболее напрямую связанных с надежностью агентских сервисов. Она набрала 80 баллов в IFBench и 58,2 в MCP-Atlas, что ставит ее в один ряд с DeepSeek-V4-Flash. В APEX-Agents, где оцениваются реальные возможности агентов, она набрала 16,6 балла, что является самым высоким результатом в сравнении.
Корейская офисная работа на уровне модели, которая в шесть раз больше
Ko-GDPval — это бенчмарк, оценивающий способность агента выполнять работу в реальных условиях рабочего места. Он состоит из 170 реальных рабочих сценариев для 58 профессий, включая юристов, бухгалтеров и специалистов по инфекционному контролю, а модели оцениваются по результатам их работы: отчетам, планам и брифингам.
В этом бенчмарке Solar Open 2 набрала 86,8 балла, всего на 0,16 балла отстав от DeepSeek-V4-Pro (86,9), модели с 1,6 трлн параметров, которая более чем в шесть раз больше, и опередив все остальные модели в сравнении, включая MiMo-V2.5-Pro (84,6) масштаба 1 трлн параметров.
Результат еще более впечатляющий с точки зрения активных параметров: тех, которые действительно участвуют в вычислении каждого токена, когда агент вызывает модель. Solar Open 2 использует 15 млрд, что составляет около трети от объема DeepSeek-V4-Pro. Она выполняет ту же работу с третью вычислительных затрат, и в агентских сервисах, где повторные вызовы накапливаются, этот разрыв напрямую отражается на операционных расходах.
Ниже приведены выдержки из результатов работы, которые фактически предоставила Solar Open 2.
Значительный шаг вперед по сравнению с предыдущим поколением
По сравнению с нашей предыдущей моделью, Solar Open 100B, Solar Open 2 значительно улучшилась в областях знаний, математики, программирования и следования инструкциям.
Этот результат достигнут благодаря применению новой архитектуры, нового состава данных и методологии обучения, ориентированной на агентов, поверх весов и опыта обучения, накопленного в Solar Open 100B.
Чтобы каждый мог проверить и развить это
Веса модели Solar Open 2 выпущены на Hugging Face. Согласно лицензии Upstage Solar License, разрешено коммерческое использование, а также разработка производных моделей путем дообучения и дистилляции. Любой может развернуть модель на собственной инфраструктуре и оценить ее непосредственно на внутренних данных. Ее также можно адаптировать к конкретным доменам и задачам или дистиллировать в меньшие модели, которые послужат основой для новых агентов и коммерческих сервисов.
Обоснование нашего выбора архитектуры, методология обучения, ключевые абляции и условия оценки — все это содержится в Техническом отчете. Вместо того чтобы просто представить итоговые баллы, мы подробно рассказываем о проблемах, с которыми столкнулись во время разработки, и о технических ноу-хау, которые мы создали при их решении. Это позволяет любому желающему воспроизвести результаты бенчмарков и напрямую проверить технологию и производительность Solar Open 2.
Суверенный ИИ — это нечто большее, чем модель, созданная в конкретной стране. Пользователи должны иметь возможность самостоятельно развертывать и проверять модель, а также сохранять контроль над своими данными и операционной средой. Им нужны среды, где внутренние данные никогда не покидают организацию, а также свобода модифицировать модель и расширять ее новыми сервисами по мере изменения потребностей.
Именно поэтому мы выпускаем Solar Open 2 с открытыми весами. Делясь технологиями и опытом обучения, вложенными в эту модель, мы хотим дать глобальной экосистеме исследований и индустрии LLM, в Корее и за ее пределами, фундамент для создания новых моделей и агентских сервисов.
Начало работы
Solar Open 2 доступна по следующим каналам начиная с сегодняшнего дня:
- Веса модели: Hugging Face model card
- Технический отчет: Solar Open 2 Technical Report
- Лицензия: Upstage Solar License
- Минимальная рекомендуемая конфигурация: четыре NVIDIA H200 (BF16); два H200 с квантованием
Использование в Claude Code
Использование в Hermes Agent
Solar Open 2 — это официальная модель Hermes. Вы можете выбрать ее из списка моделей Hermes и сразу начать использовать.
Попробуйте в Playground
Вы также можете общаться с Solar Open 2 в Upstage Playground без какой-либо настройки. Пробная версия Playground доступна до 31 июля.
Команда Upstage
Анонсы
22 июля 2026 г.
Начните разработку с нашим API или свяжитесь с нашей командой.
Сегодня мы выпускаем Solar Open 2, нашу базовую модель с открытыми весами, оптимизированную для агентных задач.
Solar Open 2 разработана и обучена для использования в качестве базовой модели для агентов в реальных рабочих средах. Она обучена на широком спектре агентных сценариев, включая вызов инструментов, программирование и офисную работу, и обеспечивает производительность, конкурирующую с ведущими мировыми моделями в тестах на агентные способности, корейский язык, знания и программирование.
Модель использует архитектуру MoE, которая активирует только 15 млрд из 250 млрд своих общих параметров на токен, одновременно повышая возможности и эффективность вывода. Благодаря квантованию она работает на двух графических процессорах NVIDIA H200, что делает ее практичной для развертывания и эксплуатации предприятиями на собственной инфраструктуре. Созданная для агентных задач, выполняемых в несколько этапов, она поддерживает контекстное окно до 1 млн токенов и имеет официальную поддержку корейского, английского и японского языков.
Веса модели выпущены на Hugging Face по лицензии, допускающей коммерческое использование. Вместе с ними мы публикуем технический отчет Solar Open 2, охватывающий полную архитектуру, методологию обучения, ключевые эксперименты и условия оценки.
Основные характеристики
- Разработана и обучена для агентного использования, готова к реальным рабочим средам
- Конкурирует с ведущими мировыми моделями в тестах на агентные способности, корейский язык, знания и программирование
- Архитектура MoE: 250 млрд общих / 15 млрд активных параметров для эффективного вывода
- Контекстное окно 1 млн токенов
- Работает на двух графических процессорах H200 с квантованием
- Официально поддерживает корейский, английский и японский языки
- Выпущена с открытыми весами с разрешением на коммерческое использование
От чата к агентам
Роль LLM меняется.
До сих пор LLM в основном генерировали один ответ на вопрос пользователя. Теперь они расширяются до агентов, которые ищут информацию, читают документы, пишут код и вызывают внешние инструменты для выполнения реальной работы.
Работа, которую выполняют агенты, качественно отличается от чата. Вместо ответа на короткий вопрос агент повторяет десятки шагов рассуждения и вызовов инструментов. Ему приходится работать с информацией, разбросанной по файлам и документам, помнить о том, что он уже сделал, и принимать решение о следующем действии соответствующим образом. Ошибка на одном этапе может привести к провалу всей задачи в дальнейшем.
Агентное использование требует трех возможностей.
- Во-первых, выполнение долгосрочных задач: доведение многоэтапной работы до конца.
- Во-вторых, обработка длинного контекста: удержание в поле зрения длинных документов и истории работы.
- В-третьих, точное следование инструкциям и надежный вызов нужных инструментов.
Этим возможностям трудно научиться на обычных данных для ответов на вопросы. Модель должна сталкиваться с агентными сценариями во время обучения: поиск, вызов инструментов, программирование, работа с документами. И сценарии не должны просто выглядеть правдоподобно. Они должны отражать реальные рабочие среды, и мы должны иметь возможность проверить, что модель действительно выполнила задачу.
Стоимость также имеет значение. Агент не останавливается на одном вызове модели; он циклически проходит через планирование, выполнение, проверку и пересмотр, поэтому обычно использует гораздо больше токенов, чем чат. Чтобы предприятие могло развернуть модель на своей собственной инфраструктуре, она не должна быть слишком большой или медленной.
Мы создали Solar Open 2 не просто как модель с высокими баллами в тестах, а как модель с производительностью и структурой затрат, способную поддерживать агентов в реальных рабочих средах.
Обучающие данные, ориентированные на агентов
Мы разработали Solar Open 2, сделав агентное использование основной целью как на этапе предварительного обучения, так и на этапе дообучения. Сценарии обучения охватывают поиск, вызов инструментов (MCP), программирование и офисную работу. Модель научилась не просто генерировать объяснения, но и действовать в реальных средах, проверять результаты и исправлять себя при необходимости.
Чтобы создать реалистичные обучающие данные для агентов, мы разработали собственный конвейер синтеза и проверки данных. Начиная с исходных данных, взятых из реальных рабочих сред, мы создали условия, в которых правильные ответы могут быть определены однозначно, а затем повторяли процесс выбора только тех данных, которые прошли проверку. Только эти высококачественные агентные данные пошли в обучение.
Поиск
Данные для поискового агента различают вопросы, на которые модель может ответить с помощью того, что она уже знает, и вопросы, требующие фактического поиска. Сгенерированные вопросы проходят через несколько этапов проверки, проверяющих структуру, нетривиальность, возможность поиска, разрешимость и обоснованность источниками. Это учит модель обращаться к поиску, когда она сталкивается со знаниями, которыми не обладает.
Вызов инструментов
В отличие от традиционных подходов, которые оценивают только то, выбрала ли модель правильный инструмент, мы заставляем модель выполнять изменения в реальной среде, а затем считывать измененное состояние обратно для проверки результата. Суть в том, чтобы отделить генерацию правдоподобного ответа от фактического завершения задачи. Это обучает модель предпринимать действия, которым можно доверять, а не просто выдавать ответы, которые звучат правильно.
Программирование
Агент-программист работает в терминале, а затем пишет и запускает собственные тесты. Когда тесты не проходят, обучающие данные включают цикл исправления кода и повторной проверки. Модель учится работать с долгосрочными задачами: исправлять ошибки и в конечном итоге достигать цели.
Офисная работа
Сценарии офисной работы отражают реальные рабочие среды: перекрестную проверку информации, разбросанной по документам и электронным таблицам, изменение входных данных в таблице с формулами и пересчет результатов, а также другие задачи, близкие к повседневной работе. Мы специально включили сценарии обработки документов и использования инструментов, распространенные на корейских рабочих местах. Цель состояла не только в том, чтобы генерировать грамотный корейский язык, но и в том, чтобы действительно выполнять работу, поставленную на корейском языке.
Контекст 1 млн токенов для длинных задач
Чем дольше работает агент, тем больше информации он должен удерживать. Чтобы ориентироваться в большой кодовой базе, сравнивать несколько документов и принимать следующее действие на основе результатов предыдущих инструментов, модель должна воспринимать и обрабатывать длинный контекст.
Solar Open 2 поддерживает контекстное окно 1 млн токенов. Для поддержки длинного контекста используется архитектура Hybrid Attention, сочетающая GQA (полное softmax-внимание) с линейным вниманием. Модель повторяет блоки из одного слоя GQA и трех слоев линейного внимания, применяя линейное внимание к 75% из своих 48 слоев.
Слои линейного внимания управляют информацией о последовательности в состоянии фиксированного размера. Это позволяет избежать роста KV-кэша каждого слоя пропорционально длине контекста и снижает нагрузку на память при длинных входных данных.
Слои softmax-внимания используют NoPE, не применяя позиционное кодирование. Этот выбор направлен на экстраполяцию: обработку входных данных, превышающих длину, которую модель в основном видела при обучении.
Этот эффект также проявляется в эффективности обучения. В контролируемом сравнении архитектура Solar Open 2 достигла на 210 млрд токенов того же уровня производительности в MMLU, для которого архитектуре all-softmax модели Solar Open 100B потребовался 671 млрд токенов. Подробное сравнение и обоснование дизайна опубликованы в техническом отчете.
Эффективность вывода при повторных вызовах
В среде, где агенты многократно обращаются к модели, стоимость вывода становится стоимостью продукта.
Solar Open 2 использует архитектуру MoE, которая активирует только 15 млрд из 250 млрд своих общих параметров на каждый токен. Такая конструкция сохраняет знания и репрезентативную емкость большой модели, снижая при этом объем активных вычислений, необходимых для обработки каждого токена.
Сеть прямой связи (FFN) в Solar Open 2 состоит из 320 маршрутизируемых экспертов и 1 общего эксперта, при этом на каждый токен выбирается 8 экспертов. В отличие от плотных моделей, которые каждый раз активируют все параметры, она использует только тех экспертов, которые необходимы для входных данных.
Эта эффективная с точки зрения вывода архитектура позволяет Solar Open 2 сохранять производительность при работе на относительно небольшой инфраструктуре: четыре NVIDIA H200 для модели BF16 или два H200 с квантованием.
Мы установили эти требования с прицелом на развертывание, а не только на исследовательскую оценку: предприятия, запускающие модель на собственной инфраструктуре и подключающие ее к агентским сервисам. Рекомендуемые конфигурации обслуживания, руководство по развертыванию vLLM и официальные квантованные модели представлены в карточке модели.
Многоязычная модель, эффективная для корейского языка
Solar Open 2 использует токенизатор, оптимизированный для эффективности токенов в корейском языке. В результате она обрабатывает тот же корейский текст, используя лишь от 50 до 80% токенов, которые используют глобальные модели. В текстах, связанных с корейским офисным документооборотом, токенизатор Solar Open 2 является самым эффективным из 12 протестированных нами, опережая лучшую глобальную модель примерно на 24%. Выражение того же контента меньшим количеством токенов означает более низкую стоимость вывода и более длинный эффективный контекст.
Селективный перенос весов для эффективного обучения
Чтобы обучать модель масштаба 250 млрд более эффективно, мы разработали собственный метод селективного переноса весов (Selective Weight Transfer). Вместо случайной инициализации всех весов мы взяли нашу предыдущую модель, Solar Open 100B, отобрали только те веса, которые можно было перенести в новую архитектуру, и использовали их для инициализации Solar Open 2.
На рисунке показан прокси-эксперимент 200B-A15B, в котором архитектура, данные обучения и оптимизатор идентичны, а различается только инициализация. Модель с селективным переносом весов достигла целевых потерь при обучении примерно на 12 млрд токенов, в то время как модели со случайной инициализацией потребовалось около 22 млрд. Другими словами, перенесенная модель достигла тех же потерь примерно на 58% токенов, тогда как случайная инициализация потребовала примерно в 1,7 раза больше. Это показывает, что даже при разных архитектурах повторное использование только базовых представлений позволяет модели быстрее достичь целевого уровня производительности с меньшим количеством токенов обучения.
Селективный перенос весов — это наш собственный подход к сокращению времени обучения и вычислительных затрат. С этим выпуском мы улучшили как производительность модели, так и эффективность процесса ее создания.
Бенчмарки
Первое место среди сопоставимых моделей в MMLU-Pro, LiveCodeBench и корейских бенчмарках
Помимо агентского использования, производительности в корейском языке и эффективности вывода, Solar Open 2 также конкурентоспособна в области базовых знаний и программирования.







.avif)

.png)