Новинка
Новинка
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели от Upstage.
Лучшая модель, которую вы найдете с параметрами менее 30 млрд
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели (LLM) от Upstage. В декабре 2023 года Solar Mini произвела фурор, достигнув вершины рейтинга Open LLM Leaderboard на Hugging Face. Используя значительно меньше параметров, Solar Mini выдает ответы, сопоставимые с GPT-3.5, но работает в 2,5 раза быстрее. Позвольте мне рассказать вам, как Solar Mini произвела революцию в уменьшении размера LLM без ущерба для производительности.
Обзор модели
Почему нам нужны небольшие LLM
Размер стал ключевым фактором при интеграции больших языковых моделей (LLM) в реальные приложения. Главное преимущество небольших моделей — сокращение времени вычислений, что повышает скорость отклика и эффективность. Это означает меньшие трудозатраты на оптимизацию, поскольку такие LLM проще адаптировать для конкретных областей и сервисов. Кроме того, их компактный размер позволяет развертывать их непосредственно на устройствах, способствуя децентрализованному подходу, который переносит возможности ИИ прямо на локальное устройство пользователя. Это не только повышает доступность, но и снижает зависимость от обширных ресурсов GPU, прокладывая путь к новым и доступным решениям в области ИИ.
Компактный размер, мощная производительность
Solar Mini — это доказательство того, что для исключительной производительности не нужен огромный размер. Она впечатляюще превзошла конкурентов, таких как Llama2, Mistral 7B, Ko-Alpaca и KULLM, в ряде тестов.
Создание Solar Mini
Фундаментальная архитектура Solar Mini основана на 32-слойной структуре Llama 2 и инициализирована предварительно обученными весами Mistral 7B, одной из самых эффективных моделей, совместимых с архитектурой Llama 2.
Масштабирование глубины (DUS)
Как Solar Mini удалось остаться компактной и при этом стать удивительно мощной? Наш метод масштабирования «масштабирование глубины» (Depth Up-scaling, DUS) состоит из послойного масштабирования и продолженного предварительного обучения. DUS позволяет гораздо проще и эффективнее увеличивать небольшие модели по сравнению с другими методами масштабирования, такими как «смесь экспертов» (mixture-of-experts).
В отличие от Mixture of Experts (MoE), DUS не требует сложных изменений. Нам не нужны дополнительные модули или динамические компоненты; DUS сразу совместим с простыми в использовании фреймворками LLM, такими как HuggingFace, и применим ко всем архитектурам трансформеров. (Читать статью → )
Продолженное предварительное обучение
После масштабирования глубины модель работает хуже, чем базовая LLM. Поэтому применяется этап продолженного предварительного обучения для восстановления производительности масштабированной модели.
Настройка инструкций
На этом этапе модель проходит настройку инструкций специально для корейского языка, где она обучается следовать инструкциям в формате QA (вопрос-ответ).
Настройка согласования
На этом этапе модель, настроенная на инструкции, обучается согласовываться с предпочтениями человека или мощного ИИ.
Используйте Solar с высокопроизводительными компонентами
RAG
Solar Mini особенно хорошо работает с системами RAG. По мере роста размеров LLM они все больше полагаются на предварительно обученные параметрические знания для ответов на ваши вопросы. Solar Mini эффективно использует RAG для повышения точности и релевантности вывода, тем самым укрепляя свою надежность.
Анализ макета
У нас есть модели, которые извлекают таблицы и рисунки из любого вашего документа. Ваши данные в форматах PDF, PNG, JPG обрабатываются с помощью нашего модуля OCR и анализа макета. Благодаря сериализации элементов в порядке чтения и преобразованию вывода в HTML, данные становятся готовым вводом для LLM.
- Читать
- Попробуйте на Hugging Face
- Попробуйте на Poe
Solar Mini доступна публично по лицензии Apache 2.0.
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели от Upstage.
Юджон Чой
Анонсы
25 января 2024 г.
Начните разработку с нашим API или свяжитесь с нашей командой.
Лучшая модель, которую вы найдете с параметрами менее 30 млрд
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели (LLM) от Upstage. В декабре 2023 года Solar Mini произвела фурор, достигнув вершины рейтинга Open LLM Leaderboard на Hugging Face. Используя значительно меньше параметров, Solar Mini выдает ответы, сопоставимые с GPT-3.5, но работает в 2,5 раза быстрее. Позвольте мне рассказать вам, как Solar Mini произвела революцию в уменьшении размера LLM без ущерба для производительности.
Обзор модели
Почему нам нужны небольшие LLM
Размер стал ключевым фактором при интеграции больших языковых моделей (LLM) в реальные приложения. Главное преимущество небольших моделей — сокращение времени вычислений, что повышает скорость отклика и эффективность. Это означает меньшие трудозатраты на оптимизацию, поскольку такие LLM проще адаптировать для конкретных областей и сервисов. Кроме того, их компактный размер позволяет развертывать их непосредственно на устройствах, способствуя децентрализованному подходу, который переносит возможности ИИ прямо на локальное устройство пользователя. Это не только повышает доступность, но и снижает зависимость от обширных ресурсов GPU, прокладывая путь к новым и доступным решениям в области ИИ.
Компактный размер, мощная производительность
Solar Mini — это доказательство того, что для исключительной производительности не нужен огромный размер. Она впечатляюще превзошла конкурентов, таких как Llama2, Mistral 7B, Ko-Alpaca и KULLM, в ряде тестов.
Создание Solar Mini
Фундаментальная архитектура Solar Mini основана на 32-слойной структуре Llama 2 и инициализирована предварительно обученными весами Mistral 7B, одной из самых эффективных моделей, совместимых с архитектурой Llama 2.
Масштабирование глубины (DUS)
Как Solar Mini удалось остаться компактной и при этом стать удивительно мощной? Наш метод масштабирования «масштабирование глубины» (Depth Up-scaling, DUS) состоит из послойного масштабирования и продолженного предварительного обучения. DUS позволяет гораздо проще и эффективнее увеличивать небольшие модели по сравнению с другими методами масштабирования, такими как «смесь экспертов» (mixture-of-experts).
В отличие от Mixture of Experts (MoE), DUS не требует сложных изменений. Нам не нужны дополнительные модули или динамические компоненты; DUS сразу совместим с простыми в использовании фреймворками LLM, такими как HuggingFace, и применим ко всем архитектурам трансформеров. (Читать статью → )
Продолженное предварительное обучение
После масштабирования глубины модель работает хуже, чем базовая LLM. Поэтому применяется этап продолженного предварительного обучения для восстановления производительности масштабированной модели.
Настройка инструкций
На этом этапе модель проходит настройку инструкций специально для корейского языка, где она обучается следовать инструкциям в формате QA (вопрос-ответ).
Настройка согласования
На этом этапе модель, настроенная на инструкции, обучается согласовываться с предпочтениями человека или мощного ИИ.
Используйте Solar с высокопроизводительными компонентами
RAG
Solar Mini особенно хорошо работает с системами RAG. По мере роста размеров LLM они все больше полагаются на предварительно обученные параметрические знания для ответов на ваши вопросы. Solar Mini эффективно использует RAG для повышения точности и релевантности вывода, тем самым укрепляя свою надежность.
Анализ макета
У нас есть модели, которые извлекают таблицы и рисунки из любого вашего документа. Ваши данные в форматах PDF, PNG, JPG полностью обрабатываются нашим модулем OCR и анализа макета. Благодаря сериализации элементов в порядке чтения и преобразованию вывода в HTML, данные становятся готовым входным форматом для LLM.
- Читать
- Попробуйте на Hugging Face
- Попробуйте на
Solar Mini находится в открытом доступе по лицензии Apache 2.0.
Лучшая модель до 30 млрд параметров, которую вы найдете
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели (LLM) от Upstage. В декабре 2023 года Solar Mini произвела фурор, достигнув вершины рейтинга Open LLM Leaderboard на Hugging Face. Используя значительно меньше параметров, Solar Mini выдает ответы, сопоставимые с GPT-3.5, но работает в 2,5 раза быстрее. Позвольте мне рассказать вам, как Solar Mini произвела революцию в уменьшении размера моделей LLM без ущерба для их производительности.
Обзор модели
Почему нам нужны компактные LLM
Размер стал ключевым фактором при интеграции больших языковых моделей (LLM) в реальные приложения. Главное преимущество компактных моделей — сокращение времени вычислений, что повышает скорость отклика и эффективность. Это означает меньшие затраты человеческих ресурсов на оптимизацию, поскольку такие LLM проще адаптировать для конкретных областей и сервисов. Кроме того, их компактный размер позволяет развертывать их на устройствах, способствуя децентрализованному подходу, который переносит возможности ИИ непосредственно на локальное устройство пользователя. Это не только повышает доступность, но и снижает зависимость от обширных ресурсов GPU, открывая путь к новым и доступным решениям на базе ИИ.
Компактный размер, мощная производительность
Solar Mini — доказательство того, что для исключительной производительности не нужен огромный размер. Она впечатляюще превзошла конкурентов, таких как Llama2, Mistral 7B, Ko-Alpaca и KULLM, в ряде тестов.
Создание Solar Mini
Фундаментальная архитектура Solar Mini основана на 32-слойной структуре Llama 2 и инициализирована предварительно обученными весами от Mistral 7B, одной из самых эффективных моделей, совместимых с архитектурой Llama 2.
Масштабирование глубины (DUS)
Как Solar Mini удалось остаться компактной и при этом стать удивительно мощной? Наш метод масштабирования «масштабирование глубины» (DUS) состоит из послойного масштабирования и продолженного предварительного обучения. DUS позволяет значительно проще и эффективнее увеличивать размер компактных моделей по сравнению с другими методами масштабирования, такими как «смесь экспертов» (mixture-of-experts).
В отличие от «смеси экспертов» (MoE), DUS не требует сложных изменений. Нам не нужны дополнительные модули или динамические процессы; DUS сразу совместим с простыми в использовании фреймворками LLM, такими как HuggingFace, и применим ко всем архитектурам трансформеров. (Читать статью → )
Продолженное предварительное обучение
После масштабирования глубины модель работает хуже, чем базовая LLM. Поэтому применяется этап продолженного предварительного обучения для восстановления производительности масштабированной модели.
Настройка инструкций
На этом этапе модель проходит настройку инструкций специально для корейского языка, где она обучается следовать инструкциям в формате QA (вопрос-ответ).
Настройка согласования
На этом этапе модель, настроенная на инструкции, обучается соответствовать предпочтениям людей или мощных ИИ.
Используйте Solar с высокопроизводительными компонентами
RAG
Solar Mini особенно хорошо работает с системами RAG. По мере того как LLM становятся больше, они все чаще полагаются на предварительно обученные параметрические знания для ответов на ваши вопросы. Solar Mini эффективно использует RAG для повышения точности и релевантности вывода, тем самым укрепляя свою надежность.
Анализ макета
У нас есть модели, которые извлекают таблицы и рисунки из любого вашего документа. Ваши данные в форматах PDF, PNG, JPG полностью обрабатываются нашим модулем OCR и анализа макета. Благодаря сериализации элементов в порядке чтения и преобразованию вывода в HTML, данные становятся готовым входным форматом для LLM.
- Читать
- Попробуйте на Hugging Face
- Попробуйте на
Solar Mini находится в открытом доступе по лицензии Apache 2.0.







.avif)

.png)