Kandinsky 6.0 Video дает вам чекпойнт с 29 миллиардами параметров, который можно скачать, и пятисекундный клип в придачу. Wan 2.7 предлагает четыре специализированных варианта, клипы длиной до пятнадцати секунд и счет за каждую секунду. Эти два предложения и есть все сравнение, а написать о нем стоит потому, что большинство сравнительных обзоров сопоставляют их по визуальному качеству, где ни у одной нет независимой оценки, способной все расставить по местам, и упускают главный момент, в котором они действительно расходятся: чего именно каждая из них ждет от вас.
Лаборатория Kandinsky Lab от Сбера выпустила Kandinsky 6.0 Video в первую неделю октября 2026 года под лицензией MIT в двух размерах — Pro (29B) и Lite (3B), с кодом, чекпойнтами и интеграцией с diffusers. Wan 2.7 от Alibaba вышла 3 апреля 2026 года в виде набора: текст-в-видео, изображение-в-видео, референс-в-видео и редактирование видео, с оплатой за каждую секунду сгенерированного видео. Одно из этого — модель, которую вы запускаете сами; другое — сервис, который вы покупаете. Интересный вопрос заключается не в том, какая из них лучше, а в том, какая из них подходит под конкретные задачи.
Единственный параметр, по которому их можно напрямую сравнить
Обе модели генерируют видео со звуком, а не видео, к которому звук затем подбирается отдельно. Это звучит проще, чем есть на самом деле, и именно поэтому их вообще упоминают вместе — большинство других систем все еще выдают беззвучный MP4, оставляя аудио для отдельного этапа.
Kandinsky 6.0 Video делает это с помощью двухпотоковой архитектуры CrossDiT: видеопоток инициализируется из чекпойнта Kandinsky 5.0 Video, аудиопоток обучается с нуля на крупных аудиокорпусах, а двунаправленное перекрестное внимание объединяет их после этапа непрерывного предварительного обучения. На выходе получается аудио 44 кГц с синхронизацией губ по текстовому промпту (T2AV) или опорному изображению (I2AV).
Wan 2.7 также выдает нативный звук, хотя механизм работы не описан в таких же деталях. В собственной документации разработчиков качество звука и точность текста на экране названы двумя областями, требующими доработки. Это оговорка о качестве, к которой стоит прислушаться, поскольку это мнение самого производителя, а не догадки стороннего рецензента.
На этом сходства заканчиваются. Все, что ниже этой черты — это различия, а не рейтинг.
Пять секунд против пятнадцати и то, как это влияет на список кадров
Kandinsky 6.0 Video обучена на 121 кадре при 24 кадрах в секунду (пять секунд), и в релизе нет режима удлинения. Научная статья, рецепт обслуживания, встроенный в vLLM-Omni, и таблица производительности в репозитории — все это завязано на одну длину клипа. Тридцатисекундный ролик — это шесть генераций и пять склеек, причем прятать эти склейки придется вам самим.
Wan 2.7 охватывает диапазон от двух до пятнадцати секунд за одну генерацию, определяемую по запросу. Для клипа с говорящей головой, демонстрации продукта или простого движения камеры эта разница — не просто удобство, а грань между одним рендером и этапом монтажа. Для проектов, которые строятся кадр за кадром, пять секунд — это нормальная рабочая единица, и этот разрыв в основном сглаживается.
• Максимальный клип — Kandinsky 6.0 Video: 5 с, фиксировано, 121 кадр при 24 к/с. Wan 2.7: 2–15 с, задается по запросу.
• Разрешение — Kandinsky 6.0 Video: SD, HD и Full HD (1920×1080) с помощью отдельной модели сверхвысокого разрешения (апскейла). Wan 2.7: до 1080p.
• Кондиционирование по референсу — Kandinsky 6.0 Video: одно изображение, применяется как маскированный конечный кадр. Wan 2.7: до пяти изображений объектов и пяти опорных клипов, десять ассетов на запрос.
• Задачи — Kandinsky 6.0 Video: T2AV и I2AV. Wan 2.7: текст-в-видео, изображение-в-видео, референс-в-видео и редактирование видео как отдельные варианты с отдельной тарификацией.
• Веса — Kandinsky 6.0 Video: MIT, доступны для скачивания, Pro и Lite. Wan 2.7: нет.
Четыре задачи против двух режимов
Количество задач — это то, о чем Wan 2.7 часто умалчивают в сравнительных таблицах, поскольку речь идет не о качестве, а о возможностях. Редактирование существующего материала на основе инструкций, когда вы описываете изменения и получаете тот же кадр с внесенными правками, — это рабочий процесс, который Kandinsky 6.0 Video вообще не поддерживает. Референс-в-видео, где заданное исполнение управляет сгенерированным объектом, также выходит за рамки ее двух режимов.
Тарификация отражает эти возможности. Варианты текст-в-видео и изображение-в-видео в Wan 2.7 тарифицируются только по длительности вывода — $0.10/с для 720p и $0.15/с для 1080p на международных эндпоинтах в Сингапуре, в то время как в Пекине и Токио аналогичная работа стоит $0.086/с и $0.143/с. Вариант референс-в-видео также тарифицирует входное видео с ограничением в пять секунд, поэтому пятисекундный референс, управляющий пятнадцатисекундной генерацией, оплачивается как двадцать секунд работы. Вариант редактирования видео тарифицирует только результат, а исходный материал предоставляется бесплатно — это самый выгодный тариф в линейке и причина, почему редактирование в Wan 2.7 обходится действительно дешево.
Рядом с этими цифрами стоит упомянуть два факта жизненного цикла. Alibaba установила ограниченную по времени 30-процентную скидку на запуск на собственных платформах Bailian и Qwen Cloud, срок действия которой истек 23 сентября 2026 года. Кроме того, согласно уведомлению об отмене Model Studio от Alibaba Cloud (ID 118434), 10 октября 2026 года несколько старых моделей выводятся из эксплуатации, и wan2.7-r2v и wan2.7-image входят в этот список. Это касается конкретных вариантов, а не всей генерации в целом — wan2.7-t2v и wan2.7-i2v остаются в списке с действующими тарифами, но если референс-в-видео был главной причиной вашего интереса к 2.7, у этого направления осталось всего четыре дня.
Что показывают и не показывают независимые рейтинги
В этом разделе большинство сравнений этих двух моделей молчаливо лукавят, поэтому стоит четко зафиксировать то, что существует на самом деле.
Wan 2.7 имеет независимые оценки на трех различных оценочных площадках Artificial Analysis, и они не совпадают друг с другом, поскольку измеряют разные вещи:
• Текст-в-видео — Wan2.7-260612 (июньская сборка) занимает 13–14 места с рейтингом Elo 1030 (±9) по результатам 5 571 голоса при стоимости $9.00/мин.
• Изображение-в-видео — Wan 2.7 (апрельская сборка) занимает 12 место с рейтингом Elo 1077 (±8) по результатам 4 571 голоса при стоимости $9.00/мин.
• Редактирование видео — Wan 2.7 занимает 5 место с рейтингом Elo 1077 (±5) по результатам 17 988 голосов при стоимости $16.90/мин.
Если сопоставить эти три показателя, полезный вывод заключается не в том, что «Wan 2.7 занимает двенадцатое место в видео», а в том, что модель значительно сильнее в редактировании, чем в генерации (согласно специализированным тестам), и что называть какое-то одно число для нее в любом случае ошибочно.
У Kandinsky 6.0 Video нет оценок ни на одной из этих платформ. Опубликованные данные предоставлены самим разработчиком, и стоит четко описать, что они собой представляют: это прогон VABench, в котором лаборатория заявляет о лидерстве версии Pro по качеству речи, аудиоэстетике, соответствию текста видео и аудио, точности синхронизации губ, десинхронизации и визуальному реализму среди трех оцениваемых систем (две другие — ее собственная модель Lite и LTX 2.5), а также проведенная лабораторией слепая сравнительная оценка людьми, включающая примерно 200 или более попарных сравнений по каждому критерию. В этом тестировании Pro конкурентоспособна с Kling 2.6 и Veo 3.1 Fast, уступает MiniMax H3 и Dreamina Seedance 2.0 по визуальным критериям, но сохраняет конкурентоспособность по качеству речи и аудиовизуальной синхронизации. Ни один из этих результатов не был независимо воспроизведен за пределами Сбера, и ни один из них не является рейтингом Elo на слепой публичной площадке. Правильная интерпретация звучит как «перспективно и без независимого аудита», а не «не уступает Veo».
Во что обходится каждая из них, в тех терминах, которые использует каждая из сторон
Эти две модели ценообразования невозможно свести к какому-то одному числу, и делать вид, что это возможно, — верный способ для команды принять неверное решение.
Wan 2.7 использует тариф за секунду. Пятнадцатисекундный клип в разрешении 1080p обойдется примерно в $2,25. Тридцатисекундный ролик — это две генерации плюс монтаж: $4,50 чистой стоимости генерации плюс ваше время на сборку (или меньше, если работает вариант редактирования, поскольку он не тарифицирует входные данные).
У Kandinsky 6.0 Video вообще нет тарифа, потому что здесь нечего покупать как услугу. Всё, что у вас есть, — это затраты на часы работы графического процессора, которые вы обеспечиваете сами. Собственные цифры репозитория задают нижний предел: пятисекундный клип Pro Full HD требует примерно 402 секунды рабочего времени на H100 после прогрева, 854 секунды на RTX 5090 и 1247 секунд на RTX 4090. Дистиллированная контрольная точка — которую в исследовании оценили как паритетную с полной моделью (среднее предпочтение 51% против 49% при отсутствии статистически значимых критериев) — это то, что вы действительно будете развертывать. Для всего, что потребляет менее 72,8 ГиБ пикового выделения памяти, требуется выгрузка блоков (block offloading), а пресет на 16 ГБ квантует текстовый энкодер до NF4. Исследование подтверждает, что это единственное изменение пресета, которое затрагивает сам клип.
Проще говоря: стоимость Wan 2.7 — это строчка в инвойсе, которую можно спрогнозировать. Стоимость Kandinsky 6.0 Video — это железо, которым вы владеете, рендер, занимающий минуты на каждые пять секунд, и возможность (но не обязанность) выполнить дообучение (fine-tuning).
Какое место в этом занимает роутер
OrcaRouter не обслуживает ни Kandinsky 6.0 Video, ни Alibaba Wan 2.7, и таких заявлений здесь не делается. Kandinsky можно скачать и запустить самостоятельно; к Wan 2.7 доступ осуществляется через собственные платформы Alibaba. Всё, что требуется от роутера конвейеру (pipeline), построенному на любой из этих моделей, — это текстовый слой, окружающий рендер: расширение промпта, превращающее описание кадра в длинную или короткую подпись (caption), на обучение которой были ориентированы эти модели; работа с подписями и диалогами, поступающая на вход в проход изображения в видео (image-to-video); а также сводки обзоров, определяющие, какой из нескольких вариантов генерации идет в продакшн. Это обычные текстовые вызовы, которые выполняются на одном OpenAI-совместимом эндпоинте для более чем 200 моделей с переданными по номиналу ценами провайдеров с наценкой 0%, благодаря чему скидка вендора начинает действовать в тот же день, а не по окончании срока действия контракта. Автоматический перезапуск при сбое (failover) здесь ценнее, чем в задаче чата, поскольку вызов генерации подписи, завершившийся сбоем на четвертой минуте сессии вопрос-ответ, должен перенаправляться, а не приводить к потере рендер-сессии.
Решение в одной строке для каждого варианта
Если готовый результат — это финальный клип со звуком, а вы бы предпочли не владеть видеокартой, Wan 2.7 — единственная из двух моделей, которая продает вам именно это, причем ее версия с функцией редактирования является сильнейшей в семействе по имеющимся данным. Проверьте дату вывода из эксплуатации 10 октября, прежде чем брать на себя обязательства по использованию reference-to-video.
Если готовый результат — это контролируемый вами конвейер, если пятисекундные отрезки подходят для вашего списка кадров, и если вы хотите проводить дообучение или работать в офлайне, Kandinsky 6.0 Video — единственная из двух, которая это позволяет. Цена за это — медленный рендер на потребительском «железе» и утверждения о качестве, которые пока полностью исходят от самой лаборатории. Событие, за которым стоит следить в этом случае, просто: Elo.
Перед завершением стоит упомянуть одну асимметрию, поскольку она переживет обе модели. Верхняя планка возможностей Wan 2.7 устанавливается Alibaba — как по контракту, так и технически. Когда варианты из этого набора выводятся из эксплуатации или меняют цены, ваш конвейер наследует это решение. Верхняя планка Kandinsky 6.0 Video ограничена только вашим собственным «железом», а лицензия MIT означает, что форк может пережить дорожную карту лаборатории. Команды, которые обожглись на исчезновении модели из каталога, склонны оценивать эту разницу гораздо выше год спустя, чем в день принятия решения.












