В декабре прошлого года мы представили Bolmo, наше семейство полностью открытых байтовых языковых моделей. Теперь исследование, лежащее в основе Bolmo, опубликовано в журнале Nature, и мы выпускаем новые чекпоинты на Hugging Face, которые переносят базовый подход за рамки моделей Olmo, послуживших отправной точкой для Bolmo, на другие семейства моделей.
Мы также , которые оставляют исходную глобальную модель замороженной при обучении новых байтовых компонентов Bolmo, предоставляя исследователям более быструю отправную точку для экспериментов с архитектурой и ее расширения.
Большинство языковых моделей не обрабатывают текст напрямую. Вместо этого они сначала разбивают его на подслова: фрагменты слов, взятые из фиксированного словаря. Этот подход работает на редкость хорошо, но он также может делать модели менее гибкими при работе с правописанием, необычными строками, редкими словами или текстом, который неплотно ложится на эти предопределенные фрагменты.
Байтовые модели используют другой подход, обрабатывая текст в виде базовых байтов, которые компьютеры используют для представления символов. Модели, такие как Bolmo, работают с более низкоуровневым представлением текста — последовательностями байтов, соответствующими буквам, знакам препинания, символам и другим знакам.
Работа на этом уровне может улучшить понимание моделью мелкозернистой структуры текста, от пробелов до различных систем письма, не привязывая ее к фиксированному словарю. А поскольку байты являются фундаментальным представлением цифровых данных, байтовое моделирование в конечном итоге может обеспечить общую основу для работы с другими типами информации, включая изображения и аудио.
Однако исторически сложилось так, что для того, чтобы байтовые модели сравнялись по производительности с моделями на подсловах, требовалось обучать их с нуля — дорогостоящая задача, которая затрудняет конкуренцию байтовых подходов на фоне стремительного совершенствования моделей на подсловах.
С помощью Bolmo мы продемонстрировали другой подход. Мы создали процесс, который называем байтификацией (byteifying): он берет уже готовую модель на подсловах и преобразует ее в байтовую модель с помощью относительно короткого дополнительного этапа обучения. Мы использовали этот подход для создания Bolmo 1B и Bolmo 7B на базе наших открытых моделей Olmo, создав, как мы полагаем, первые полностью открытые байтовые языковые модели, конкурентоспособные с сильными моделями на подсловах в широком спектре задач.
В статье в журнале Nature мы показываем, что байтификация применима не только к Olmo. Мы применили тот же процесс к Qwen 3 8B и Llama 3 8B для создания двух новых байтовых моделей: Bwen 8B и BlamaLlama-B 8B. Обе модели близки по характеристикам к тем, на основе которых они были созданы, а Bwen 8B — наша на данный момент самая сильная байтифицированная модель, превосходящая Bolmo 7B по результатам нашего общего набора тестов.
Разработчики и исследователи уже начали адаптировать Bolmo для конкретных приложений, включая Bolmo 7B fine-tune for Russian-to-English poetry and lyric translation.
Публикация работы о Bolmo продолжает серию недавних исследований Ai2 в журнале Nature. В феврале наша статья «Синтез научной литературы с помощью языковых моделей, дополненных поиском» (Synthesizing scientific literature with retrieval-augmented language models) показала, как специализированный поиск, ранжирование и цитирование могут помочь языковым моделям синтезировать научную литературу с более надежной опорой на факты.
Bolmo, эта работа и наши более широкие исследования отражают общую уверенность в том, что фундаментальные достижения в области ИИ имеют больший резонанс, когда исследовательское сообщество может изучать их, воспроизводить и легко развивать.
В случае с Bolmo это означает открытие пути к моделям, которые не заперты в рамках единого способа представления информации. Будущие системы смогут адаптировать свои представления под разные языки, домены и задачи, в то время как исследователи смогут тестировать новые архитектуры без повторения полных затрат на обучение. Поскольку байты применимы не только к тексту, те же идеи со временем можно будет распространить и на другие типы данных.
Исследователи также начинают использовать Bolmo в качестве основы для новых работ, включая experiments on transferring capabilities between byte-level models и studies probing the tradeoff between the efficiency of hierarchical byte architectures like Bolmo and fine-grained character understanding.
Сделав Bolmo и его рецепт обучения полностью открытыми, мы надеемся помочь исследователям бросить вызов предположениям, заложенным в современные языковые модели, и узнать, что становится возможным, когда эти предположения меняются.









