Новинка
Новинка
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели от Upstage.
Лучшая модель до 30 млрд параметров, которую вы найдете
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели (LLM) от Upstage. В декабре 2023 года Solar Mini произвела фурор, заняв вершину рейтинга Open LLM Leaderboard на Hugging Face. Используя значительно меньше параметров, Solar Mini выдает ответы, сопоставимые с GPT-3.5, но работает в 2,5 раза быстрее. Позвольте мне рассказать, как Solar Mini произвела революцию в уменьшении размера LLM-моделей без ущерба для их производительности.
Обзор модели
Почему нам нужны компактные LLM
Размер стал ключевым фактором при интеграции больших языковых моделей (LLM) в реальные приложения. Главное преимущество небольших моделей — сокращение времени вычислений, что повышает скорость отклика и эффективность. Это означает меньшие затраты человеческих ресурсов на оптимизацию, поскольку такие LLM проще адаптировать под конкретные домены и сервисы. Кроме того, их компактный размер позволяет развертывать их непосредственно на устройствах, способствуя децентрализованному подходу, который переносит возможности ИИ прямо на локальное устройство пользователя. Это не только повышает доступность, но и снижает зависимость от мощных GPU, открывая путь к созданию новых и доступных ИИ-решений.
Компактный размер, мощная производительность
Solar Mini — доказательство того, что для исключительной производительности не нужен огромный размер. Она впечатляюще превзошла конкурентов, таких как Llama2, Mistral 7B, Ko-Alpaca и KULLM, в ряде тестов.
Создание Solar Mini
Фундаментальная архитектура Solar Mini основана на 32-слойной структуре Llama 2 и инициализирована предварительно обученными весами от Mistral 7B, одной из самых эффективных моделей, совместимых с архитектурой Llama 2.
Масштабирование глубины (DUS)
Как Solar Mini удалось остаться компактной и при этом стать невероятно мощной? Наш метод масштабирования «масштабирование глубины» (Depth Up-scaling, DUS) состоит из послойного масштабирования и продолженного предварительного обучения. DUS позволяет гораздо проще и эффективнее увеличивать размер небольших моделей по сравнению с другими методами масштабирования, такими как «смесь экспертов» (mixture-of-experts).
В отличие от Mixture of Experts (MoE), DUS не требует сложных изменений. Нам не нужны дополнительные модули или динамические компоненты; DUS сразу совместим с простыми в использовании LLM-фреймворками, такими как HuggingFace, и применим ко всем архитектурам трансформеров. (Читать статью → )
Продолженное предварительное обучение
После масштабирования глубины производительность модели становится хуже, чем у базовой LLM. Поэтому применяется этап продолженного предварительного обучения для восстановления производительности масштабированной модели.
Настройка инструкций
На этом этапе модель проходит настройку инструкций специально для корейского языка, где она обучается следовать инструкциям в формате QA (вопрос-ответ).
Настройка согласования
На этом этапе модель, настроенная на инструкции, обучается согласовываться с предпочтениями людей или мощных ИИ-систем.
Используйте Solar с высококлассными компонентами
RAG
Solar Mini особенно хорошо работает с системами RAG. По мере того как LLM становятся больше, они все чаще полагаются на предварительно обученные параметрические знания для ответов на ваши вопросы. Solar Mini эффективно использует RAG для повышения точности и релевантности вывода, тем самым укрепляя свою надежность.
Анализ макета
У нас есть модели, которые извлекают таблицы и рисунки из любых ваших документов. Ваши данные в форматах PDF, PNG, JPG обрабатываются с помощью нашего модуля OCR и анализа макета. Благодаря сериализации элементов в порядке чтения и преобразованию вывода в HTML, данные становятся готовым входным сигналом для LLM.
- Читать
- Попробуйте на Hugging Face
- Попробуйте на Poe
Solar Mini доступна публично по лицензии Apache 2.0.
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели от Upstage.
Юджон Чой
Анонсы
25 января 2024 г.
Начните разработку с нашим API или свяжитесь с нашей командой.
Лучшая модель до 30 млрд параметров, которую вы найдете
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели (LLM) от Upstage. В декабре 2023 года Solar Mini произвела фурор, заняв вершину рейтинга Open LLM Leaderboard на Hugging Face. Используя значительно меньше параметров, Solar Mini выдает ответы, сопоставимые с GPT-3.5, но работает в 2,5 раза быстрее. Позвольте мне рассказать, как Solar Mini произвела революцию в уменьшении размера LLM-моделей без ущерба для их производительности.
Обзор модели
Почему нам нужны компактные LLM
Размер стал ключевым фактором при интеграции больших языковых моделей (LLM) в реальные приложения. Главное преимущество небольших моделей — сокращение времени вычислений, что повышает скорость отклика и эффективность. Это означает меньшие затраты человеческих ресурсов на оптимизацию, поскольку такие LLM проще адаптировать под конкретные домены и сервисы. Кроме того, их компактный размер позволяет развертывать их непосредственно на устройствах, способствуя децентрализованному подходу, который переносит возможности ИИ прямо на локальное устройство пользователя. Это не только повышает доступность, но и снижает зависимость от мощных GPU, открывая путь к созданию новых и доступных ИИ-решений.
Компактный размер, мощная производительность
Solar Mini — доказательство того, что для исключительной производительности не нужен огромный размер. Она впечатляюще превзошла конкурентов, таких как Llama2, Mistral 7B, Ko-Alpaca и KULLM, в ряде тестов.
Создание Solar Mini
Фундаментальная архитектура Solar Mini основана на 32-слойной структуре Llama 2 и инициализирована предварительно обученными весами от Mistral 7B, одной из самых эффективных моделей, совместимых с архитектурой Llama 2.
Масштабирование глубины (DUS)
Как Solar Mini удалось остаться компактной и при этом стать невероятно мощной? Наш метод масштабирования «масштабирование глубины» (Depth Up-scaling, DUS) состоит из послойного масштабирования и продолженного предварительного обучения. DUS позволяет гораздо проще и эффективнее увеличивать размер небольших моделей по сравнению с другими методами масштабирования, такими как «смесь экспертов» (mixture-of-experts).
В отличие от Mixture of Experts (MoE), DUS не требует сложных изменений. Нам не нужны дополнительные модули или динамические компоненты; DUS сразу совместим с простыми в использовании LLM-фреймворками, такими как HuggingFace, и применим ко всем архитектурам трансформеров. (Читать статью → )
Продолженное предварительное обучение
После масштабирования глубины производительность модели становится хуже, чем у базовой LLM. Поэтому применяется этап продолженного предварительного обучения для восстановления производительности масштабированной модели.
Настройка инструкций
На этом этапе модель проходит настройку инструкций специально для корейского языка, где она обучается следовать инструкциям в формате QA (вопрос-ответ).
Настройка согласования
На этом этапе модель, настроенная на инструкции, обучается согласовываться с предпочтениями людей или мощных ИИ-систем.
Используйте Solar с высококлассными компонентами
RAG
Solar Mini особенно хорошо работает с системами RAG. По мере того как LLM становятся больше, они все чаще полагаются на предварительно обученные параметрические знания для ответов на ваши вопросы. Solar Mini эффективно использует RAG для повышения точности и релевантности вывода, тем самым укрепляя свою надежность.
Анализ макета
У нас есть модели, которые извлекают таблицы и рисунки из любого вашего документа. Ваши данные в форматах PDF, PNG, JPG полностью обрабатываются с помощью нашего модуля OCR и анализа макета. Благодаря сериализации элементов в порядке чтения и преобразованию вывода в HTML, данные становятся готовыми к использованию в качестве входных данных для LLM.
- Читать
- Попробуйте на Hugging Face
- Попробуйте на
Solar Mini находится в открытом доступе по лицензии Apache 2.0.
Лучшая модель, которую вы найдете с объемом менее 30 млрд параметров
Добро пожаловать в эру Solar, предварительно обученной большой языковой модели (LLM) от Upstage. В декабре 2023 года Solar Mini произвела фурор, достигнув вершины рейтинга Open LLM Leaderboard на Hugging Face. Используя значительно меньше параметров, Solar Mini выдает ответы, сопоставимые с GPT-3.5, но работает в 2,5 раза быстрее. Позвольте мне рассказать, как Solar Mini произвела революцию в уменьшении размера моделей LLM без ущерба для их производительности.
Обзор модели
Зачем нам нужны небольшие LLM
Размер стал ключевым фактором при интеграции больших языковых моделей (LLM) в реальные приложения. Главное преимущество небольших моделей — сокращение времени вычислений, что повышает скорость отклика и эффективность. Это означает меньшие затраты трудовых ресурсов на оптимизацию, поскольку такие LLM проще адаптировать для конкретных доменов и сервисов. Кроме того, их компактный размер позволяет развертывать их непосредственно на устройствах, способствуя децентрализованному подходу, который переносит возможности ИИ прямо на локальное устройство пользователя. Это не только повышает доступность, но и снижает зависимость от обширных ресурсов GPU, открывая путь к созданию новых и доступных решений на базе ИИ.
Компактный размер, мощная производительность
Solar Mini — это доказательство того, что для исключительной производительности не нужен огромный размер. Она впечатляюще превзошла конкурентов, таких как Llama2, Mistral 7B, Ko-Alpaca и KULLM, в ряде тестов.
Создание Solar Mini
Фундаментальная архитектура Solar Mini основана на 32-слойной структуре Llama 2 и инициализирована предварительно обученными весами из Mistral 7B, одной из наиболее эффективных моделей, совместимых с архитектурой Llama 2.
Масштабирование глубины (DUS)
Как Solar Mini удалось остаться компактной и при этом стать удивительно мощной? Наш метод масштабирования «масштабирование глубины» (Depth Up-scaling, DUS) состоит из послойного масштабирования и продолженного предварительного обучения. DUS позволяет значительно проще и эффективнее увеличивать небольшие модели по сравнению с другими методами масштабирования, такими как «смесь экспертов» (mixture-of-experts).
В отличие от Mixture of Experts (MoE), DUS не требует сложных изменений. Нам не нужны дополнительные модули или динамические процессы; DUS сразу совместим с простыми в использовании фреймворками LLM, такими как HuggingFace, и применим ко всем архитектурам трансформеров. (Читать статью → )
Продолженное предварительное обучение
После масштабирования глубины модель работает хуже, чем базовая LLM. Поэтому применяется этап продолженного предварительного обучения для восстановления производительности масштабированной модели.
Настройка инструкций
На этом этапе модель проходит настройку инструкций специально для корейского языка, где она обучается следовать инструкциям в формате QA (вопрос-ответ).
Настройка согласования
На этом этапе модель, настроенная на инструкции, обучается соответствовать предпочтениям людей или мощных систем ИИ.
Используйте Solar с высокопроизводительными компонентами
RAG
Solar Mini особенно хорошо работает с системами RAG. По мере того как LLM становятся больше, они все чаще полагаются на предварительно обученные параметрические знания для ответов на ваши вопросы. Solar Mini эффективно использует RAG для повышения точности и релевантности вывода, тем самым укрепляя свою надежность и достоверность.
Анализ макета
У нас есть модели, которые извлекают таблицы и рисунки из любого вашего документа. Ваши данные в форматах PDF, PNG, JPG полностью обрабатываются с помощью нашего модуля OCR и анализа макета. Благодаря сериализации элементов в порядке чтения и преобразованию вывода в HTML, данные становятся готовыми к использованию в качестве входных данных для LLM.
- Читать
- Попробуйте на Hugging Face
- Попробуйте на
Solar Mini находится в открытом доступе по лицензии Apache 2.0.







.avif)

.png)