Наша миссия — создавать ИИ, который расширяет возможности человеческой воли и суждений. Мы разработали платформу, позволяющую любому желающему настраивать модели, представили систему ИИ для интерактивного сотрудничества и опубликовали новые исследования. Сегодня мы продвигаемся в выполнении нашей миссии, выпуская модель, обученную нами с нуля, с полным доступом к весам, чтобы люди могли адаптировать её под свои нужды.
Наша модель под названием Inkling — это трансформер архитектуры Mixture-of-Experts с общим количеством параметров 975 млрд, из которых 41 млрд являются активными. Она поддерживает контекстное окно до 1 млн токенов. Модель была предварительно обучена на 45 триллионах токенов текста, изображений, аудио и видео. Это первая модель в семействе моделей разного размера: вместе с ней мы представляем предварительную версию Inkling-Small, более легкую модель с 12 млрд активных параметров, обученную по аналогичному рецепту, которая обеспечивает высокую производительность при еще меньших затратах и задержках.
Inkling нативно рассуждает с использованием текста, изображений и аудио, а также балансирует между стоимостью и производительностью благодаря эффективному и контролируемому уровню «мышления». Мы обучали её как широкую, сбалансированную базовую модель: сильную во многих областях и достаточно гибкую для адаптации. Inkling не является самой мощной моделью из существующих сегодня, как среди открытых, так и среди закрытых. Вместо этого сочетание качеств делает её хорошей базой с открытыми весами для кастомизации: мультимодальные возможности, эффективное мышление и доступность на Tinker для дообучения. Inkling — это только начало: наш первый релиз в семействе моделей, которое мы продолжим развивать.
Мы хотим сделать кастомизацию доступной для большего числа сценариев использования, поэтому Inkling уже сегодня доступна для дообучения на Tinker. Выбор правильной базовой модели для дообучения — это качественное суждение, сочетающее измеримые бенчмарки с уникальным ощущением от модели, которое приходит в процессе работы с ней. Чтобы обеспечить последнее, мы добавляем Inkling Playground в консоль Tinker: интерфейс для разработчиков, позволяющий общаться с Inkling.
Чтобы показать, что означает кастомизация на практике, мы попросили Inkling дообучить саму себя. Используя Tinker, модель написала собственное задание на дообучение, запустила его и оценила результат:
Сборка · inkling · tinker-prod
Возможности
Реальные приложения требуют моделей с широким спектром возможностей, которые можно комбинировать и улучшать с помощью дообучения. Мы демонстрируем, на что способна Inkling и как она оценивается по важным критериям, таким как надежность и безопасность.
Универсальная модель
Inkling разработана как модель широкого профиля. Мы обучали её на задачах, связанных с агентными действиями, рассуждениями, программированием, следованием инструкциям, проверкой фактов, зрением и аудио, а не просто оптимизировали под одну узкую область. Эта широта важна для кастомизации и реального использования: разным пользователям нужны модели, способные адаптироваться к совершенно разным рабочим процессам, а не просто показывать отличные результаты в бенчмарках.
Лепестковая диаграмма, сравнивающая Inkling, Nemotron 3 Ultra, GLM 5.2, GPT 5.6 Sol и Claude Fable 5 по десяти оценкам, ранжированным от нуля до ста. Inkling показана более жирной кобальтовой линией. Оценки, для которых нет данных по модели, отображаются на нуле. Наведите курсор на оценку, чтобы сравнить показатели каждой модели.
Агентное программирование и использование инструментов
Надежная база для дообучения должна гибко решать широкий спектр задач с помощью агентного использования инструментов. Inkling показывает хорошие результаты среди моделей с открытыми весами в большинстве агентных бенчмарков.
Мы обучили Inkling работать внутри различных сред для программирования и использования инструментов, а также рандомизировали набор инструментов и схемы во время обучения, чтобы снизить зависимость от какой-либо конкретной среды. Контролируемый уровень «мышления» Inkling, описанный в следующем разделе, можно настроить прямо из среды исполнения.
Ниже представлены несколько демонстраций, показывающих агентные возможности Inkling в программировании и использовании инструментов, а также создаваемые ею артефакты.
Веб-приложение «одной командой» с использованием встроенного браузера
Inkling создала функциональное веб-приложение за один проход, а затем управляет встроенным ИИ-ассистентом, который может взаимодействовать с интерфейсом веб-приложения с помощью инструкций на естественном языке.
Inkling была протестирована в таблице лидеров Design Arena Agentic Web Dev, где слепые эксперты-люди сравнивают сгенерированные веб-приложения. Она входит в число сильнейших моделей с открытыми весами.
Claude Sonnet 5
1333
Claude Fable 5
1329
Claude Opus 4.8
1285
GLM 5.2
1275
Grok 4.5
1271
GPT-5.6 Sol
1260
Inkling
1257
Claude Opus 4.6
1257
Gemini 3.5 Flash
1254
Kimi K2.6
1249
Claude Sonnet 4.6
1237
Kimi K2.7 Code
1234
GLM 5.1
1233
Claude Opus 4.5
1212
Grok 4.20 Reasoning
1203
Gemini 3.1 Pro Preview
1187
Grok 4.3
1185
Kimi K2.5 (Thinking)
1185
Стилистически целостные артефакты
Inkling создает многостраничные артефакты с точным следованием инструкциям, достоверной информацией и целостным стилем и дизайном.
Многопользовательская игра, созданная в ходе длительного цикла доработки
Inkling доработала онлайн-игру «Змейка» через 40 итераций обратной связи от GPT Codex, выступавшего в роли рецензента. Способность поддерживать длительный процесс доработки и улучшаться на основе обратной связи имеет решающее значение для создания качественной совместной работы.
Контролируемый уровень «мышления»
Масштабируемость во время тестирования и решение задач — это ключевая способность любой модели, но этот потенциал трудно измерить одним числом. Разработчиков, дообучающих модели для специализированных задач, эффективность волнует не меньше, чем производительность при максимальных усилиях в публичных бенчмарках. Стоимость и задержка часто являются ограничивающими факторами в реальных приложениях, а низкая задержка, в частности, критически важна для обеспечения сотрудничества и улучшения через итерации.
Inkling (диапазон усилий) GLM-5.2 Kimi K2.6 Nemotron 3 Ultra Kimi K2.5 GPT-OSS (высокий)
Inkling поддерживает контролируемый уровень «мышления», позволяя вам балансировать между производительностью и эффективностью использования токенов. На графике выше показана кривая усилий/производительности Inkling, а также других моделей с открытыми весами в ряде бенчмарков: Terminal Bench 2.1 для агентного программирования, HLE для продвинутых рассуждений и IFBench для следования инструкциям. Inkling тратит в три раза меньше токенов для достижения той же производительности, что и Nemotron 3 Ultra в Terminal Bench. Стоимость и задержка важны для модели, которую вы запускаете миллионы раз в составе длительных рабочих процессов; изучение полной кривой затрат позволяет разработчикам выбрать лучшую модель для каждого конкретного случая.
Мультимодальность
Основная цель дизайна Inkling — служить фоновой моделью рассуждений в системе моделей взаимодействия, которую мы недавно представили. Модели взаимодействия позволяют пользователю естественно сотрудничать, используя голос и зрение в режиме реального времени. Это требует модели, изначально обученной для широких мультимодальных возможностей.
Аудио- и визуальные бенчмарки в сравнении со специализированными омни-моделями (с открытыми и закрытыми весами), отчет при effort=0.99.
Мультимодальные компоненты были обучены с нуля на данных общего домена. Мы выбрали архитектуру без энкодера для аудио- и визуальных входов, что соответствует дизайну модели взаимодействия. Аудиосигналы подаются как спектрограммы dMel (Richard He Bai et al, 2024), а изображения кодируются как патчи 40x40 пикселей с использованием четырехслойного hMLP (Hugo Touvron et al, 2022). Оба типа данных преобразуются через легкий слой эмбеддингов и обрабатываются совместно с текстовыми токенами.
Inkling транскрибирует речь, выполняет устные инструкции, отвечает на вопросы по записям и анализирует аудиозаписи большого объема. Эти возможности ставят модель в один ряд с самыми мощными аудиомоделями с открытыми весами в бенчмарках VoiceBench, MMAU и AudioMC. В области компьютерного зрения Inkling принимает изображения на вход, может описывать визуальный контент, отвечать на вопросы и проводить глубокий анализ на основе предоставленной визуальной информации. Модель демонстрирует высокую эффективность при работе с графиками, диаграммами и задачами математического визуального мышления. Во время инференса Inkling также может использовать инструмент Python для поддержки понимания изображений с помощью таких операций, как масштабирование и кадрирование, бесшовно интегрируя визуальное мышление с логикой на основе кода.
Будучи нашим первым релизом, Inkling закладывает прочный мультимодальный фундамент для будущих разработок. Мы ожидаем, что мультимодальные возможности модели будут продолжать улучшаться по мере расширения самой модели и конвейера обучения в последующих итерациях.
Эпистемика
Мы обучали Inkling калибровке, следованию инструкциям и устойчивости к цензуре, что мы в совокупности называем эпистемикой модели.
Чтобы правильно устанавливать факты, недостаточно просто запомнить большой массив знаний. Полезная модель должна быть хорошо откалибрована, выражая правильную степень уверенности в своих ответах — в том числе на вопросы, которые еще не решены. Последнее является важнейшей способностью для прогнозирования — важного сценария использования, в котором дообученные модели в последние месяцы показали быстрый прогресс, превзойдя передовые LLM.
Результаты были получены в ходе тестирования в период с 30 июня по 13 июля 2026 года на чекпоинте Inkling, отличном от выпущенного.
Прогнозирование требует интеграции нескольких источников информации в откалиброванную вероятность, что является ключевым навыком для модели, которой могут доверять пользователи. Модель, которая уверена в каждом своем ответе, даже когда ей не хватает информации и она галлюцинирует, заставляет пользователя перепроверять всё. Модель, которая дает соответствующую меру уверенности, полезна в большем количестве реальных областей, где информация часто противоречива, ненадежна или ее трудно найти. Мы обучали модель калибровке с помощью RL (обучения с подкреплением) на основе правил правильного оценивания на большом корпусе решенных реальных вопросов.
Второй компонент заслуживающей доверия модели — это следование инструкциям, в том числе в сложных запросах, которые трудно проверить. Мы использовали RL с двумя автоматизированными оценщиками: оценщиком по рубрикам и оценщиком утверждений. Первый оценивает каждый ответ по чек-листу того, что должен содержать хороший ответ. Рубрики могут в принципе наказывать за ошибки, но на практике они делают упор на полноту и могут быть обмануты моделями, которые выдают правдоподобно звучащие факты в надежде попасть в пункты рубрики. Оценщик утверждений проверяет каждое фактическое утверждение в ответе, наказывая за те, которые не подтверждаются. Он выполняет агентский веб-поиск для проверки утверждений, не полагаясь исключительно на собственные знания. Вместе эти два оценщика одновременно повышают полезность и снижают галлюцинации, вместо того чтобы жертвовать одним ради другого.
Эти вознаграждения не направлены напрямую на калиброванную неопределенность в развернутых ответах, поэтому мы добавили целевые наборы данных. Самый большой из них — это краткие фактические вопросы и ответы с вознаграждениями, учитывающими возможность воздержаться от ответа: отвечать выгодно только тогда, когда модель с высокой вероятностью права, поэтому оптимальная стратегия — отвечать при наличии уверенности, а в противном случае говорить «Я не знаю» или давать осторожное предположение. Некоторые промпты поощряют или запрещают осторожность, обучая модель следовать предпочтениям пользователя относительно принудительного ответа или откалиброванного отсутствия ответа.
Наконец, мы обучили Inkling отвечать напрямую на темы, которые могут быть подвержены цензуре. Команда Cognition оценила модель по своему бенчмарку «Пропаганда и цензура» (The Cognition Team, “Measuring the Trustworthiness of Open-Source-Derived Models,” 2026), и она продемонстрировала устойчивые паттерны несоблюдения цензуры.
Безопасность
Мы обучили Inkling в соответствии с внутренней спецификацией безопасного поведения модели во всех модальностях. Затем мы привлекли внешних тестировщиков безопасности для проверки результатов.
Мы оценили безопасность Inkling в нескольких областях. Для опасных возможностей — ХБРЯ (химическое, биологическое, радиологическое и ядерное оружие), киберугроз и потери контроля — мы провели внутренние оценки и привлекли внешних тестировщиков. Мы уделили внимание векторам угроз «человек-ИИ», включая подхалимство, уязвимых пользователей и вредоносные манипуляции, используя внутренние оценки и внешних тестировщиков.
Inkling демонстрирует самые сильные встроенные средства защиты среди всех моделей с открытыми весами, которые мы сравнивали в FORTRESS — бенчмарке, который проверяет отказ от запросов, связанных с оружием и насилием, наряду с доброкачественными похожими запросами. Inkling отклонила больше вредоносных запросов, не переусердствовав с отказами на доброкачественные аналоги. Inkling набирает более 98% в StrongREJECT — тесте на отказ от однозначно вредоносных запросов — на уровне других моделей с открытыми и закрытыми весами.
Безопасность критически важна для моделей с открытыми весами. Мы продолжаем изучать поведение в области безопасности и повышение возможностей в настраиваемых моделях, включая то, как на поведение в области безопасности влияет дообучение на Tinker.
Бенчмаркинг Inkling
Мы тестируем Inkling по широкому спектру возможностей. Все оценки проводятся при effort 0.99 и temperature 1.0. Все оценки кодинга проводятся с ограничением траектории в 256 тыс. токенов.
Для повышения согласованности мы полагаемся на внешние оценки как для внутренних, так и для внешних моделей, когда это применимо. В частности, мы используем баллы, сообщенные Artificial Analysis для следующих оценок: Humanity’s Last Exam, GPQA Diamond, GDPVal, Tau 3 Banking, AA Omniscience, MMMU Pro.
*SWEBench Verified: показатели Inkling приведены с использованием только bash-инструментария. Мы используем самоотчетные данные для внешних моделей. Terminal Bench 2.1: показатели Inkling приведены с использованием внутреннего инструментария для кодинга. Небольшое количество решений было признано загрязненными из-за веб-поиска и получило оценку 0. Мы используем самоотчетные данные для внешних моделей, где это возможно. В противном случае мы сообщаем о производительности, используя наш внутренний инструментарий. †Audio MC: другие модели оценивались внутренне, так как они не представлены в официальной таблице лидеров. †VoiceBench: VoiceBench использует основанное на правилах жестко закодированное сопоставление строк для оценки, что делает ее чувствительной к различиям в форматировании вывода. Поэтому мы добавили системное сообщение, предписывающее моделям следовать ожидаемому формату ответа. †CharXiv RQ с инструментами: мы протестировали Claude Fable 5 и GPT 5.6 Sol (max/xhigh), используя наш внутренний инструментарий Python.
Создание Inkling
Архитектура
Inkling — это трансформер типа «смесь экспертов» (Mixture-of-Experts) с несколькими отступлениями от общепринятого рецепта, каждое из которых выбрано для эффективности и работы с длинным контекстом.
Дизайн MoE во многом следует DeepSeek-V3. Каждый слой MoE содержит 256 маршрутизируемых экспертов и 2 общих эксперта, при этом 6 маршрутизируемых экспертов активны для каждого токена. Inkling использует сигмоидальный маршрутизатор с функцией балансировки нагрузки без вспомогательных потерь. Оценки выбранных маршрутизируемых экспертов и общих экспертов нормализуются совместно и используются для взвешивания их объединенных выходных данных.
Для механизма внимания мы чередуем слои со скользящим окном и глобальные слои в соотношении 5:1 с 8 KV-головами. Мы обнаружили, что кодирование позиции с помощью относительного позиционного эмбеддинга (Self-Attention with Relative Position Representations, Питер Шоу и др., 2018; Music Transformer, Чэн-Чжи Анна Хуан и др., 2018) работает лучше и лучше экстраполируется на более длинные последовательности, чем более широко используемый ротационный позиционный эмбеддинг (RoPE). Мы также применяем короткие свертки в двух точках — после проекций ключа и значения в каждом слое внимания, а также на выходах остаточных ветвей внимания и MLP перед их возвращением в основной остаточный поток.
Обучение
Inkling был предварительно обучен на 45 триллионах токенов из различных типов контента, включая текст, изображения, аудио и видео. Мы обучали Inkling с использованием гибридной стратегии оптимизации — Muon для больших матричных весов, Adam для остальных параметров — и графиков гиперпараметров, вдохновленных нашими предыдущими исследованиями модульных многообразий. Мы связали силу затухания весов с квадратом скорости обучения, что, как мы обнаружили, позволило сохранить общую стабильность размера весов модели на протяжении всего процесса обучения (см. также Kosson et al. (2023) и Defazio (2025)).
Мы провели пост-обучение Inkling на широком распределении математических данных, агентного кода и использования инструментов, аудио, изображений, чатов и доменов безопасности. Для начальной загрузки пост-обучения мы провели первоначальную SFT на синтетических данных, сгенерированных моделями с открытыми весами, включая Kimi K2.5. Начальная загрузка составляет небольшую часть вычислительных мощностей, при этом большая часть используется для крупномасштабного обучения с подкреплением (RL) в синтетических и созданных человеком средах.
Inkling стал нашим первым крупным проектом по обучению, который проводился на системах NVIDIA GB300 NVL72. Будущие модели будут еще больше увеличивать масштаб вычислений на этапах предварительного обучения, пост-обучения и RL.
RL в масштабе
Мы полагались на крупномасштабное асинхронное RL для формирования поведения модели и улучшения ее способности к рассуждению и общей производительности. На графике ниже показан результат модели на отложенной совокупности оценок рассуждения, таких как AIME, HLE, GPQA и другие. Мы масштабировали RL до более чем 30 миллионов развертываний, обеспечив стабильное обучение в течение двух длительных непрерывных запусков. Производительность рассуждений улучшалась логарифмически линейно на протяжении всего процесса, что привело к значительному общему росту.
Мы задавали уровень усилий модели для разных образцов, изменяя системное сообщение и корректируя стоимость за токен. Это заставило модель использовать разное количество токенов в разных развертываниях и позволило ей научиться контролировать усилия при мышлении.
Мы также наблюдали эмерджентный сдвиг в стиле рассуждения в ходе обучения RL. Цепочка рассуждений со временем становилась более лаконичной, отбрасывая грамматические излишества, оставаясь при этом понятной и не влияя на итоговый ответ. Это не было целью вознаграждения — эффективность сама по себе способствовала сжатию. Похожий эффект был недавно отмечен командой Cognition в процессе обучения SWE-1.7 (The Cognition Team, “SWE-1.7: Frontier Intelligence at a Fraction of the Cost.”). Ниже приведен пример того, как цепочка рассуждений Inkling по одной и той же математической задаче эволюционировала с помощью RL:
В начале RL: многословно, грамматически
Нам нужно понять оператор. 5D линейный элемент — это ds² = e^{2A(x)} (ds²_4d + dx²), где A(x) = sin(x) + 4 cos(x), x в [0, 2π]. Внутренняя координата периодична. Фон представляет собой искривленное произведение: метрика g_{MN}, где M,N = 0..4. Внутреннее направление имеет метрику e^{2A(x)} dx²? Подождите, ds² — это e^{2A} (ds²_4d + dx²). Значит, внутренняя метрика — e^{2A(x)} dx². На самом деле, если общая метрика — ds² = e^{2A(x)} (ds²_4d + dx²), то да, внутренняя метрика — e^{2A} dx². …
В конце RL: сжато, телеграфно
Нам нужно определить задачу на собственные значения для спин-2 флуктуаций h_{μν}(x,y) с TT в 4d, зависящих от x. Для метрики вида ds² = e^{2A(x)} (g_{μν}(y) + h_{μν}(y,x)) dy^μ dy^ν + e^{2A(x)}? Подождите, внутренняя метрика — e^{2A} dx²? На самом деле ds² = e^{2A} [ds_4² + dx²]. Значит, внутренняя метрика — e^{2A} dx²; коэффициент искривления одинаков для 4d и внутреннего пространства? Да. Нам нужно уравнение для h_{μν}(y,x) = h_{μν}(y) ψ(x), возможно, с нормализацией. …
Inkling-Small
Наряду с Inkling мы представляем предварительный обзор Inkling-Small (обновление: через две недели после публикации этого поста мы запустили Inkling-Small), модели Mixture-of-Experts с 276 миллиардами параметров (12 миллиардов активных против 41 миллиарда у Inkling) с другим соотношением производительности и задержки. Inkling-Small соответствует или превосходит своего более крупного собрата по многим бенчмаркам — это результат улучшений, которые мы внесли в данные предварительного обучения и рецепт для меньшей модели. Обе модели используют один и тот же масштабируемый стек пост-обучения.
Обе модели показали результаты при effort=0.99; более высокий результат в каждой строке выделен. *Мы присваиваем оценку 0 развертываниям Terminal Bench 2.1 с загрязнением решений из веб-поиска.
Первые результаты показывают, что Inkling-Small работает близко к Inkling в задачах на рассуждение и агентных задачах. С 12 миллиардами активных параметров и контролируемым усилием мышления, она естественным образом подходит для рабочих нагрузок, где важны стоимость и задержка, таких как написание кода, использование LLM для оценки или генерация синтетических данных для других моделей.
В настоящее время мы завершаем тестирование Inkling-Small и выпустим ее полные веса, как только эта работа будет завершена.
Настройка Inkling
Многие реальные проблемы плохо решаются даже лучшими моделями общего назначения, и этот разрыв устраняется с помощью дообучения (fine-tuning), использующего специализированные знания организации. Опыт наших клиентов Tinker указывает на то же самое. Наше пост-обучение и результаты RL в масштабе предполагают, что Inkling способен быстро обучаться на основе дообучения.
Доступность Inkling
Inkling доступен в Tinker уже сегодня с вариантами длины контекста 64K и 256K токенов. Мы предлагаем Inkling со скидкой 50% в течение ограниченного времени, полная информация о ценах доступна в нашей документации.
Чтобы поддержать пользователей Tinker в дообучении с помощью Inkling, мы обновили нашу поваренную книгу (cookbook), чтобы она поддерживала Inkling, и добавили три новых рецепта, демонстрирующих уникальные аудиовозможности Inkling. Мы также выпустили tml-renderer для надежной выборки и пост-обучения с вызовами инструментов, контентом рассуждений и мультимодальными входными данными.
Чтобы ознакомиться с моделью перед запуском, пользователи могут перейти в Inkling Playground в консоли Tinker. Playground предлагает чат-интерфейс со встроенным агентным веб-поиском, бесплатным в течение ограниченного времени.
Мы наладили партнерские отношения по всей экосистеме, чтобы помочь клиентам развертывать чекпоинты, дообученные на Tinker. Inkling доступен через API на Together AI, Fireworks, Modal, Databricks и Baseten. Мы работали с RadixArk, чтобы обеспечить поддержку вывода и RL с открытым исходным кодом в SGLang и Miles. Мы работали с Inferact для поддержки вывода в vLLM, с Lightseek для вывода в TokenSpeed и с Unsloth для вывода в llama.cpp. Наконец, мы сотрудничали с Hugging Face по интеграции с transformers.
Полные веса Inkling находятся на Hugging Face, как в виде оригинального чекпоинта, так и в виде чекпоинта NVFP4 для эффективного вывода на системах NVIDIA Blackwell.
