Сегодня мы выпускаем Inkling-Small — эффективную модель с открытыми весами, которая демонстрирует сопоставимую производительность с Inkling, но при этом весит в четыре раза меньше.
Inkling-Small — это трансформер типа Mixture-of-Experts с общим количеством параметров 276 миллиардов, из которых 12 миллиардов активны. Он был обучен на системах NVIDIA GB300 NVL72. Как и Inkling, он обладает встроенными возможностями рассуждения над аудио и изображениями, переменным усилием мышления, окном контекста до 1 миллиона токенов и сбалансированной производительностью по различным бенчмаркам.
Inkling-Small
276 миллиардов общих, 12 миллиардов активных
Inkling
975 миллиардов общих, 41 миллиард активных
По сравнению с Inkling, Inkling-Small достигает сопоставимой производительности с гораздо меньшими вычислительными ресурсами. По бенчмаркам использования агентов-инструментов (Terminal-Bench 2.1), рассуждения (HLE text-only, без инструментов) и следования инструкциям (IFBench) Inkling-Small более эффективен, чем Inkling, и конкурентоспособен с другими моделями своего весового класса. Кроме того, его переменное усилие мышления позволяет пользователям легко адаптировать его к целевому случаю использования, балансируя стоимость и производительность.
Inkling-Small (12 млрд активных, селективный анализ усилий) vs Inkling (41 млрд активных, селективный анализ усилий) Сравнительные модели
Мы выпускаем полные веса Inkling-Small. Мы также делаем его доступным для тонкой настройки на Tinker, а также для текстового, графического и аудио-чата на Tinker Playground.
Возможности
По мере создания нашей семейной модели мы постоянно совершенствуем наш подход. Обучение Inkling-Small началось после его более крупного аналога, что позволило нам улучшить процесс его обучения. Например, мы внесли изменения в набор данных для предварительного обучения Inkling-Small и в рецепт машинного обучения. Кроме того, мы постобучили более ранний чекпоинт, Inkling-Small (preview), частично используя on-policy дистилляцию с Inkling в качестве учителя. Начиная с этого чекпоинта, мы продолжали масштабировать RL для агентов-кодеров в течение двух недель. С этими улучшениями Inkling-Small превзошел Inkling по бенчмаркам рассуждения и агентов-кодеров. Inkling сохраняет преимущество в охвате знаний и фактичности.
Диаграмма-спайдер, сравнивающая Inkling-Small, Inkling, DeepSeek V4 Flash, Gemini 3.5 Flash-Lite и GPT 5.6 Luna по десяти оценкам, набранным от нуля до ста. Inkling-Small представлен сплошной фиолетовой линией, Inkling — более толстой кобалтовой линией, а сравнительные модели — пунктирными линиями. Оценки без указанного балла модели plotted на ноль. Наведите курсор на оценку, чтобы сравнить баллы каждой модели.
Рассуждение и агенты-инструменты
Inkling-Small соответствует или превосходит Inkling в рассуждениях и агентах-инструментах. На Humanity’s Last Exam он набрал 31,6%, опережая Inkling с 29,7%, и это преимущество сохраняется при любом бюджете мышления: кривые вычислительных ресурсов Inkling-Small во время тестирования находятся выше, чем у Inkling, на протяжении всего времени. На SWEBench-Verified он превышает 80%.
По многим бенчмаркам рассуждения и агентов-инструментов Inkling-Small при максимальном усилии рассуждения демонстрирует сильный баланс между производительностью и количеством токенов по сравнению с моделями с открытыми весами своего весового класса.
Inkling-Small, Inkling, сравнительные модели, граница Парето
Выходные токены/задача
Выходные токены/задача
Выходные токены/задача
Выходные токены/задача
Выходные токены/задача
Inkling-Small также работает плавно на различных харнесах для кодирования и агентов, что делает его экономически эффективным выбором для рабочих процессов кодирования и использования инструментов.
Мультимодальность
Как и Inkling, мы создали Inkling-Small для аудиоинтеллекта, что делает его хорошим кандидатом для реальных аудио-приложений. Мы также улучшили его способность использовать Python для визуальных задач. Модель может сочетать визуальное рассуждение с операциями, такими как обрезка, масштабирование и программная инспекция изображений, что улучшает удобство использования документов и диаграмм, где релевантная информация может быть небольшой или трудной для прямого осмотра.
Inkling-Small использует ту же нативно мультимодальную архитектуру без кодировщика, что и Inkling. Аудио представлено в виде dMel-спектрограмм, а изображения разделены на патчи размером 40×40 пикселей и преобразованы с помощью четырехслойного hMLP. Оба преобразуются с помощью легкого слоя эмбеддинга и обрабатываются совместно с текстовыми токенами. Inkling-Small почти соответствует Inkling по большинству мультимодальных оценок при меньших затратах. Он сохраняет высокую производительность в визуальном рассуждении, понимании диаграмм и схем, математическом визуальном ответе на вопросы, понимании речи и более длительном аудио-рассуждении.
Бенчмарки аудио и зрения в сравнении со специализированными омни-моделями (с открытыми и закрытыми весами), представленные при effort=0.99.
Эпистемология
Inkling-Small был обучен аналогично Inkling в области эпистемологии, с упором на калибровку, следование инструкциям и сопротивление цензуре. Inkling-Small соответствует производительности Inkling в прогнозировании. Калибровка включала RL против правил правильного оценивания на большом корпусе реальных вопросов прогнозирования, что улучшило его способность выражать соответствующую уверенность и производить калиброванные прогнозы в условиях неопределенности.
Результаты ForecastBench и Prophet Arena были получены во время тестирования с 19 по 28 июля 2026 года.
Безопасность
Inkling-Small унаследовал тот же рецепт постобучения в области безопасности, что и Inkling, с встроенными механизмами защиты, охватывающими нашу внутреннюю спецификацию безопасности. Они включают повседневное взаимодействие человека и ИИ, а также возможности двойного назначения. Inkling-Small также прошел тот же процесс предразвертывания тестирования, включающий как внутренние оценки, так и красное тестирование со стороны доверенных внешних партнеров.
На StrongREJECT, который измеряет, отказываются ли модели однозначно от вредных запросов, Inkling-Small находится на том же уровне, что и Inkling, и соответствует производительности существующих моделей с открытыми весами. На FORTRESS, который измеряет безопасность в условиях, охватывающих преступность, насилие и риски двойного назначения, он конкурентоспособен как в отказе, так и в чрезмерном отказе.
Бенчмарки безопасности, представленные при effort=0.99; чем выше, тем лучше во всех случаях. FORTRESS adversarial — это доля отказов от вредных запросов, benign — доля все еще отвечающих на безопасные запросы.
Тестирование Inkling-Small
Как и Inkling, мы протестировали Inkling-Small по широкому спектру возможностей. Все оценки проводились при effort 0.99 и температуре 1.0. Все кодовые оценки проводились с максимальным лимитом траектории в 256K токенов, аналогично Inkling.
Для повышения согласованности мы полагаемся на внешние оценки как для внутренних, так и для внешних моделей, когда это применимо. В частности, мы используем баллы, представленные следующими источниками:
- Artificial Analysis: Humanity’s Last Exam, GPQA Diamond, SciCode, GDPval-AA v2, Tau 3 Banking, AA Omniscience, MMMU Pro, AA-Briefcase
- Scale AI: AudioMC, MCP Atlas
- ARC Prize: ARC-AGI v1 и ARC-AGI v2
- Forecasting Research Institute: ForecastBench
Inkling-Small против моделей с открытыми и закрытыми весами во всём наборе тестов. Активированные и общие параметры указаны для каждого масштаба; дефис означает, что оценка была недоступна на момент написания.*SWEBench Verified: показатели Inkling и Inkling-Small представлены с использованием баш-скрипта. Мы используем самостоятельно предоставленные данные для внешних моделей.*Terminal Bench 2.1: показатели Inkling и Inkling-Small представлены с использованием внутреннего кодового скрипта. Небольшое количество решений было признано загрязнёнными веб-поисковыми данными и получило оценку 0. Мы используем самостоятельно предоставленные данные для внешних моделей, где это возможно. В противном случае мы сообщаем о производительности с использованием нашего внутреннего скрипта.†Audio MC: другие модели оценивались внутренне, поскольку они не находятся в официальном рейтинге.†VoiceBench: VoiceBench использует правило-based, жёстко закодированное строковое сопоставление для оценки, что делает оценку чувствительной к различиям в форматировании вывода. Поэтому мы добавили системное сообщение, инструктирующее модели следовать ожидаемому формату ответа.†HLE с инструментами: мы протестировали Minimax M2.7, Claude 4.5 Haiku, Gemini 3.5 Flash-Lite и GPT 5.6 Luna с использованием нашего внутреннего скрипта.
Попробуйте Inkling-Small на Tinker
Клиенты Tinker лично убедились, что правильно настроенная модель может превзойти закрытые модели в различных задачах, при этом делая это быстрее и дешевле. Мы верим, что сочетание широкой производительности и эффективности Inkling-Small облегчит экспериментирование и тестирование в реальных приложениях, и мы с нетерпением ждём, что разработчики создадут с его помощью что-то новое.
Inkling и Inkling-Small доступны на Tinker со скидкой на ограниченное время и доступны для чата на Tinker Playground с использованием текста, изображений и аудио. Все остальные модели на Tinker и контрольные точки также теперь доступны на Tinker Playground, оплата осуществляется по тарифам, указанным на нашей странице цен.
Inkling-Small был создан в рамках нашей миссии по созданию ИИ, который расширяет человеческую волю и суждение. Это мощная и эффективная модель, а также важный шаг для нас в продолжении нашей работы.










