На прошлой неделе мне потребовалась небольшая версия средства переписывания промтов, которое поставляется с Qwen-Image 2.1. Официальная версия представляет собой модель на 9B, которой требуется около 20 ГБ памяти и которая размышляет над тысячами токенов, прежде чем написать хотя бы один абзац. На Hub я нашел лишь сжатые копии этой же модели на 9B. Поэтому я описал то, что мне нужно, для ML Intern, и на следующий день у меня появилась версия на 0.8B, которая работает на CPU. Она выдает валидный результат в 99,7% случаев и использует примерно четверть токенов модели-учителя. Вычислительные затраты на весь проект, включая разметку 8797 примеров запросов с помощью модели 9B, составили 16 долларов США.
В течение следующих нескольких дней я создал еще пять моделей тем же способом. Каждая из них начиналась как сообщение в HuggingChat с включенным ML-intern, а заканчивалась как публичная модель на Hub с результатами оценки в карточке модели. ML-intern планирует работу, запрашивает у меня бюджет перед тем, как потратить средства, запускает небольшой тест перед основной задачей, а затем обучает, оценивает и публикует на оборудовании Hugging Face.
Как я составляю промты для ML Intern
Первое сообщение — это то, куда я вкладываю больше всего усилий. Мой первый промт для модели citrus, описанной ниже, содержал около 450 слов. К моменту 6-го проекта их число приблизилось к 2000, потому что каждый проект учил меня чему-то, что я хотел бы видеть в следующем. Все семь промтов находятся на GitHub по адресу yvrjsharma/ml-intern-prompts, именно в том виде, в каком я их написал.
Промпт начинается с идеи в одну строку и описания того, зачем она мне нужна. Затем в нем перечисляются точные компоненты: датасет, базовая модель, скрипт обучения. Все, что я уже проверил, помещается под заголовок, который буквально звучит так: «Проверенные факты, не пересчитывать заново», чтобы агент тратил свой бюджет на работу, а не на повторное открытие того, что мне уже известно. Для LoRA угла обзора в этом разделе указывалось, какой инструмент обучения только что добавил поддержку прозрачных изображений и какие открытые тикеты на GitHub делали запасной инструмент обучения рискованным.
Две строки в промте имеют решающее значение. Первая запрашивает базовые показатели до любого обучения. Например, в промте для citrus говорится: «Также сообщите результат модели без дообучения (zero-shot) по той же метрике до начала обучения, чтобы мы могли увидеть прирост». Без этого вы получаете обученную модель и не имеете ни малейшего понятия о том, стала ли она лучше того, с чего вы начинали. Вторая строка — это дымовое тестирование с прикрепленной проверкой. Для LoRA изображений я запросил 50 шагов обучения, а затем проверку того, что сохраненные веса действительно изменились, перед тем как оплачивать полный запуск.
В конце промта я излагаю ожидаемые результаты и ограничиваю стоимость. Я определяю, что должно быть в карточке модели, и включаю инструкцию вроде: «Ограничьте общие расходы 12 долларами США и спрашивайте меня перед их превышением». Поскольку ML-intern начинает каждую задачу с нулевым бюджетом в долларах и требует разрешения перед выполнением платных задач, это ограничение расходов соблюдается строго. Если вы не указываете бюджет, агент предлагает пару вариантов в зависимости от размера проекта и спрашивает, какой из них вы предпочитаете.
Вам не обязательно использовать все это при первой попытке. Например, в моем задании для citrus не было раздела с проверенными фактами, и тем не менее ML Intern создал модель, которая более чем в три раза превзошла по точности модель Qwen3.5-2B. Позвольте мне рассказать вам о 6 вещах, которые я создал с помощью ML-Intern всего за пару дней.
1. Модель, которая разбирается в вашей предметной области
Общая модель компьютерного зрения может описать желтеющий лист цитрусового дерева. Однако определить, вызвана ли проблема клещами или дефицитом магния, а также назвать биологические и небиологические методы лечения растения — задача крайне сложная. С помощью Claude я собрал обучающий датасет, объединив три источника, размещенных организацией Project-AgML на Hub. Полученный citrus-disease-vlm-instruct представляет собой датасет, содержащий 3017 аннотированных изображений для 21 различных вредителей, болезней, нехватки питательных веществ и методов лечения. ML-intern выполнил тонкую настройку Qwen3.5-2B с использованием этих примеров, предварительно проведя бенчмаркинг базовой модели.
На 335 тестовых фотографиях базовая модель назвала правильную проблему в 14,9% случаев. После двух эпох на одном A10G дообученная модель показала результат 52,8%. Вычислительные затраты составили около 1,90 доллара США.
Посмотрите: Модель · Датасет · Приложение Citrus Doctor
2. Модель, которая рисует вашего персонажа
Модели генерации изображений знают множество персонажей. Хагги, нарисованный в плоском стиле фирменного стиля Hugging Face, не входил в их число. Я попросил ML-Intern создать LoRA на базе FLUX.2 klein base 4B, обученную на 84 рисунках с подписями из датасета Chunte/huggy_for_training.
Агент сохранял чекпоинт каждые 100 шагов и генерировал один и тот же набор промтов для каждого из них, что облегчило выбор. Шаг 200 стал первым, на котором Хагги полностью соответствовал своему стилю. Начиная с шага 500, стиль Хагги начал просачиваться в промты, которые вообще не имели к нему никакого отношения! Обученная LoRA также работает на дистиллированной модели klein за 4 шага. Вычислительные затраты: около 7,60 долларов США.
Посмотрите: Модель · Датасет · Приложение Huggy Generator
3. Модель, которая умеет делать новый трюк
- LoRA углы обзора камеры — одно из самых популярных дополнений от сообщества для предыдущих моделей Qwen-Image. Вы можете дать модели изображение объекта и попросить показать его под углом 45 градусов слева. Когда я проверял через несколько дней после релиза модели Qwen-Image 2.1, никто еще не создал такую, поэтому я поручил ML-intern разработать ее.
ML-intern отрендерил 1030 сканированных предметов домашнего обихода из Google Scanned Objects под 24 углами каждый, получив 24 722 прозрачных изображения в ходе задачи на CPU, которая стоила несколько центов. Позже он отобрал 461 объект для обучения и 40 отложенных для тестирования, а также 1844 обучающие пары «до и после», равномерно распределенные по 23 инструкциям для камеры.
Обучение заняло 2000 шагов примерно за 90 минут на одной A100 (~3,75 долл. США). Весь проект занял около половины дня и 48 запусков, если считать те, которые завершились ошибкой из-за отсутствующих пакетов или неправильных путей и которые пришлось перезапускать ML-Intern. Общие вычислительные затраты составили около 16 долларов США.
Посмотрите: Модель · Датасет · Приложение Viewpoint Orbit
- Doodle-in LoRA — еще одна крутая идея. Загрузите фото с фиолетовыми каракулями на нем и добавьте короткий промт с названием объекта. LoRA заменяет каракули этим объектом, сохраняя при этом исходное освещение и композицию.
Для этого не существовало датасета, поэтому в моем промте было описано, как его создать. Начните с реальной фотографии из Open Images, удалите один объект с помощью модели инпейнтинга LaMa и нарисуйте каракули там, где раньше находился объект. Неизмененная фотография является целевой. ML-intern написал и протестировал скрипты создания пар в песочнице CPU, а затем запустил их как задачи GPU, записывая автора и лицензию каждой исходной фотографии в процессе. Он создал 6042 обучающие пары и тестовый набор из 160 пар, причем 40 тестовых пар были получены из 23 классов объектов, полностью исключенных из обучения.
Перед обучением он оценил базовую модель саму по себе и с Viggle turbo LoRA, а также проверил, что выполнение правок пакетно приводит к созданию идентичных изображений, что сделало оценку более дешевой. Обучение заняло 2000 шагов за 1 час 38 минут на одной A100 (~4 долл. США), а сравнение сохраненных чекпоинтов на 48 тестовых парах позволило выбрать шаг 500.
В паре с турбо-LoRA от Viggle на 6 шагах LoRA показала себя очень хорошо. 67,5% объектов были обнаружены там, где они были нарисованы, при времени 4,7 секунды на одну правку. Объекты из 23 невиданных ранее классов распознавались так же надежно, как и остальные (65,0% против 64,2%). Проект занял чуть больше суток и 59 запусков. Общие затраты на вычисления составили около 24 долларов США.
Ознакомьтесь: Модель · Набор данных · Приложение Doodle-in
4. Модель, которая подходит для вашего устройства
- Pocket Rewriter из начала этого поста — первая из них. ML-intern начал с генерации 8797 коротких запросов на изображения с помощью небольшой модели инструкций через Inference Providers, используя смешанный набор из моего промпта: фотографии, плакаты, логотипы, инфографика и многое другое, причем примерно треть из них запрашивала точный текст в кавычках, а многие — на языках, отличных от английского. Затем учитель размером 9B переписал их все на одном A100 за 2 часа 37 минут (~6,50 долларов США). После фильтрации по качеству для обучающего набора данных было отобрано 1840 примеров.
Обучение студентов размером 0,8B и 2B заняло 12 и 18 минут на A10G (0,75 доллара США за оба). Версия 0,8B также поставляется в виде файла GGUF размером 812 МБ для запуска на CPU. Проект занял около 11 часов и 24 запуска. Общие затраты на вычисления составили около 16 долларов США.
Ознакомьтесь: Студент Pocket rewriter 0.8B · Студент 2B · Набор данных · Приложение Pocket Studio · Сравнить учителя и студента в Rewriter Arena
- Agate-Preview-002-4step — вторая модель. Agate Preview 002 от Logolabs — это модель преобразования текста в изображение с 260 миллионами параметров, достаточно маленькая для браузера, но ей требуется 50 шагов с подсказкой (guidance), что составляет 100 сетевых проходов на одно изображение. Я попросил ML-intern дистиллировать ее всего до 4 проходов!
Потребовалось два запуска. Первый кэшировал 155 000 тренировочных изображений в виде латентных представлений, встроил подсказку в модель, а затем поэтапно сократил количество шагов с 16 до 8 и до 4 — и все это на A100. Студент с 4 шагами превзошел результаты учителя при тех же 4 шагах на тестах GenEval и FID, после чего ML-intern экспортировал его в ONNX для браузера. Этот запуск занял около 13 часов и 22 доллара США.
Я сделал второй запуск обучения, попросив ML-Intern немного улучшить студента с 4 шагами. Затем он создал еще 24 000 пар изображений с учителем за 16 шагов и дообучил студента с 4 шагами на них в течение примерно часа. Показатель GenEval вырос с 0,509 до 0,536 по сравнению с 0,563 у учителя за 50 шагов, при этом потребовалось всего 4 шага (одна четвертая от объема вычислений). ML-intern повторно экспортировал версию для браузера. Второй запуск занял около 8 часов. Общие затраты на вычисления за оба запуска составили около 37 долларов США.
Ознакомьтесь: 4-шаговая модель Agate · Набор данных · Запуск Agate в браузере · Agate 4-шаговая в реальном времени
Во что это обошлось
Это расходы на запуск GPU и CPU, зафиксированные для каждого сеанса.
Создайте свою собственную
ML-intern доступен в HuggingChat. Включите режим ML-intern и вставьте промпт. Если вам нужна отправная точка, мои примеры промптов можно свободно копировать. Начните с модели, которую вы хотели бы иметь, и имеющегося у вас набора данных (или того, который вы можете описать). Выделите небольшой бюджет, запросите базовую модель и проверку работоспособности (smoke test), и ознакомьтесь с результатами, прежде чем увеличивать лимит.
Если вы что-то создадите с ее помощью, поделитесь этим в X и отметьте @Gradio и @HuggingFace. Мы будем рады увидеть модели, которые вы создадите и которые больше никому бы не пришло в голову собрать для вас.











