Если у вас уже есть изображение, с которого должно начинаться видео, выбор модели для преобразования изображения в видео сводится к тому, что должно произойти после этого первого кадра. Клип может потребовать завершения на втором точном изображении, длиться дольше нескольких секунд, включать сгенерированный звук или оставаться в рамках определенной цены за секунду.
Видеомодели, которые мы предоставляем, обрабатывают эти требования по-разному. В этой статье рассматриваются четыре линейки моделей: Veo 3.1, Seedance, Kling и Grok Imagine Video. Это не весь каталог моделей для преобразования изображения в видео. Полный список можно найти в коллекции видеомоделей.
Вы вызываете их все через один и тот же API генерации видео. Жизненный цикл отправки, опроса и загрузки одинаков для каждой модели. Однако длительность, разрешение, роли кадров, параметры звука и цены, которые принимает каждая модель, различаются. В этой статье сравниваются эти настройки, а затем показано, как отправить задание на преобразование изображения в видео с помощью TypeScript SDK.
Резюме
- Veo 3.1, Fast и Lite генерируют клипы длительностью 4, 6 или 8 секунд с управлением первым и последним кадром и сгенерированным звуком. Veo 3.1 и Fast поддерживают разрешение до 4K, Lite ограничена 1080p.
- Seedance 2.5 генерирует клипы от 4 до 30 секунд в разрешении 480p или 720p, принимает первый и последний кадры, а также поддерживает до 50 эталонных активов: изображений, видео и аудио. Линейка Seedance 2.0 охватывает диапазон от 4 до 15 секунд.
- Kling v3.0 Standard и Pro генерируют клипы от 3 до 15 секунд в разрешении 720p с управлением первым и последним кадром. Звук является опциональным и влияет на цену.
- Grok Imagine Video 1.5 генерирует клипы от 1 до 15 секунд в разрешении 480p, 720p или 1080p только на основе первого кадра, со сгенерированным звуком.
- Каждая модель в этой статье использует POST /api/v1/videos. GET /api/v1/videos/models возвращает поддерживаемые настройки и ценовые SKU для каждой модели.
Как изображение может быть использовано в запросе на создание видео
Изображение может определять кадр в готовом видео или выступать в качестве справочного материала. Мы обрабатываем эти два случая с помощью двух разных полей запроса.
Текст в видео, изображение в видео и ссылка в видео
При использовании «текст в видео» модель строит сцену только на основе вашего промпта. Вы не контролируете начальный кадр, кроме того, что описано в промпте.
При использовании «изображение в видео» изображение становится первым кадром, последним кадром или тем и другим. Если рекламный ролик продукта должен начинаться с точного снимка продукта, используйте этот режим.
При использовании «ссылка в видео» модель получает исходный материал, не фиксируя его в определенной позиции кадра. Вы можете предоставить несколько изображений одного персонажа, чтобы модель сохраняла его внешний вид при создании нового кадра.
Если изображение должно появиться в определенной точке клипа, используйте «изображение в видео». Если оно должно только направлять результат, используйте «ссылка в видео».
Поля frame_images и input_references
Мы представляем эти два режима как отдельные поля в POST /api/v1/videos.
Каждая запись frame_images содержит frame_type: first_frame или last_frame. Не каждая модель поддерживает обе роли. Массив supported_frame_images в каталоге видеомоделей подскажет вам, какие роли принимает модель.
Если вы отправляете оба поля в одном запросе, frame_images имеет приоритет, и мы обрабатываем задание как «изображение в видео».
Сравнение моделей «изображение в видео»
Эти таблицы охватывают линейки Veo, Seedance, Kling и Grok Imagine Video. Мы также предоставляем другие модели «изображение в видео», а коллекция видеомоделей является актуальным каталогом.
Разрешения, длительность, роли кадров и настройки звука берутся из GET /api/v1/videos/models. Цены берутся с каждой страницы модели. Мы проверили и то, и другое 11 сентября 2026 года. Стоимость видео варьируется в зависимости от разрешения, звука и типа ввода, поэтому рассматривайте эти цифры как сравнение и проверяйте страницу модели перед оценкой стоимости производства.
Настройки вывода
Эталонные входные данные и цена
Три примечания к чтению таблиц.
- Опциональный звук означает, что модель предоставляет параметр запроса generate_audio. Модели Grok Imagine Video его не предоставляют. Описание Grok Imagine Video 1.5 гласит, что модель генерирует звуковые эффекты, атмосферу и диалоги, поэтому в таблице отмечено «Да». Описание более ранней версии Grok Imagine Video не упоминает звук, поэтому в таблице отмечено «Не указано».
- Эталонные входные данные отражают то, что указано в описании модели на ее странице OpenRouter. «Не указано» означает, что в описании не упоминаются эталонные изображения, видео или аудио. Это не означает, что мы тестировали и обнаружили, что ссылки отклоняются. В руководстве по «ссылка в видео» объясняется, как подтвердить поддержку, прежде чем строить на ней решение.
- Цены Seedance указаны за видеотокен, а не за секунду. На страницах моделей Seedance 2.0 указано, что количество токенов равно высоте, умноженной на ширину, умноженной на длительность, умноженной на 24, и деленной на 1024. Цифры за секунду в таблице — это начальные ставки, которые отображаются на страницах моделей для вывода 480p. Seedance 2.5 стоит $10.70 за миллион видеотокенов, Seedance 2.0 стоит $7.00 при 480p и 720p с отдельными тарифами для 1080p и 4K, Fast стоит $4.20, а Mini — $3.50. Запросы с видеовводом используют более низкую ставку за токен.
Поскольку большинство моделей выставляют счета за секунду, длительность также является фактором стоимости. При начальной ставке Seedance 2.5 в $0.1028 за секунду 4-секундный клип стоит около $0.41, а 30-секундный — около $3.08. Стоимость выше при разрешении 720p или другой конфигурации ввода.
Как выбрать
Длительность и управление кадрами в первую очередь сужают список. Как только вы узнаете, какой длины должен быть клип и нужно ли вам фиксировать первый кадр, последний кадр или оба, сравните оставшиеся модели по звуку, разрешению и стоимости.
Клипы до 8 секунд со сгенерированным звуком
Veo 3.1, Veo 3.1 Fast и Veo 3.1 Lite генерируют клипы длительностью 4, 6 или 8 секунд в формате 16:9 или 9:16 с управлением первым и последним кадром и опцией generate_audio. Veo 3.1 и Fast поддерживают 720p, 1080p и 4K. Lite поддерживает 720p и 1080p.
Lite начинается от $0.03 за секунду для 720p без звука, а Veo 3.1 начинается от $0.20 за секунду без звука, поэтому Lite или Fast стоят дешевле, пока промпт и движение все еще меняются. Руководство по «изображение в видео» использует google/veo-3.1-lite именно по этой причине.
В описаниях моделей Veo 3.1 Fast и Lite указан водяной знак, незаметный маркер Google для контента, созданного ИИ. Если в вашем рабочем процессе есть требования к происхождению или водяным знакам, проверьте описание модели для варианта Veo, который вы планируете использовать.
Клипы до 30 секунд и множество эталонных активов
Seedance 2.5 генерирует клипы от 4 до 30 секунд в разрешении 480p или 720p, принимает первый и последний кадры, а также поддерживает до 50 эталонных активов: изображений, видео и аудио. Это единственная модель в данном сравнении, которая создает 20- или 30-секундный кадр за одну генерацию.
Линейка Seedance 2.0 охватывает диапазон от 4 до 15 секунд по более низким начальным ставкам. Seedance 2.0 поддерживает 480p, 720p, 1080p и 4K. Fast и Mini поддерживают 480p и 720p. Все три модели указывают в своих описаниях ссылки на изображения, видео и аудио.
Если вам не нужно 30-секундное окно или поддержка 50 активов, линейка 2.0 охватывает тот же рабочий процесс с первым и последним кадром по более низкой ставке.
Каждая модель Seedance работает только через размещенные API. Мы не нашли опубликованных весов или лицензий моделей ни для одной из них, поэтому ни одна из них не может работать локально или в изолированной среде.
Управление первым и последним кадром от 3 до 15 секунд
Kling v3.0 Standard и Pro создают клипы длительностью от 3 до 15 секунд в разрешении 720p с соотношением сторон 16:9, 9:16 или 1:1, с возможностью управления первым и последним кадром. Аудио является опциональным. Стоимость Standard составляет $0.084 за секунду без аудио и $0.126 с аудио. Стоимость Pro составляет $0.112 и $0.168 соответственно. Kuaishou описывает Pro как уровень с более высоким качеством изображения.
Kling Video O1 создает клипы длительностью 5 или 10 секунд в разрешении 720p с теми же ролями кадров и стоит $0.112 за секунду. Используйте эту модель, если одна из этих двух длительностей уже подходит для вашего кадра.
Один начальный кадр и клипы длительностью до 15 секунд
Grok Imagine Video 1.5 создает клипы длительностью от 1 до 15 секунд в разрешении 480p, 720p или 1080p с семью вариантами соотношения сторон. Его массив supported_frame_images содержит только first_frame, поэтому вы можете зафиксировать начальное изображение, но не конечное. В описании модели указано, что она генерирует звуковые эффекты, фоновые шумы и диалоги.
Более ранняя версия Grok Imagine Video ограничена разрешением 720p и стоит дешевле за секунду. В ее описании указана функция reference-to-video с использованием до семи референсных изображений, о чем не упоминается в описании версии 1.5.
Если клип должен заканчиваться на втором точно заданном изображении, используйте вместо этого Veo, Seedance или Kling.
Отправка задания image-to-video
После выбора модели убедитесь, что исходное изображение доступно по стабильному HTTPS-URL с возможностью прямой загрузки и что модель поддерживает нужную вам роль кадра.
URL может корректно работать в браузере, но выдавать ошибку при попытке провайдера получить его, например, если он зависит от сессионных cookie, перенаправляет через HTML-страницу или защищен проверкой на ботов. Проверьте URL напрямую, прежде чем тратить кредиты на генерацию.
Вам нужен статус 200 и тип контента изображения, такой как image/jpeg, image/png или image/webp.
В примере ниже используется google/veo-3.1-lite для создания 4-секундного клипа в разрешении 720p с предоставленным изображением в качестве первого кадра и отключенным аудио. REST API использует имена полей в формате snake_case, а TypeScript SDK преобразует их в camelCase. frame_images становится frameImages, frame_type — frameType, image_url — imageUrl, а generate_audio — generateAudio. Значения, такие как first_frame и image_url, остаются прежними.
В примере также передается { retries: { strategy: "none" } } в качестве второго аргумента для generate. По умолчанию SDK повторяет запросы, возвращающие статус 5XX, с экспоненциальной задержкой до одного часа. Отправка видео запускает оплачиваемую работу, поэтому, если сервер принимает задание, а затем возвращает временную ошибку до того, как вы получите ID задания, автоматическая повторная попытка отправит второе платное задание, и клиент увидит только второе. При отключенных повторах для отправки неудачная попытка отображается как ошибка, и вы сами решаете, отправлять ли запрос повторно. Опция для конкретного вызова оставляет стандартные повторы для запросов чтения getGeneration, которые безопасно повторять.
Успешная отправка возвращает задание, а не готовый MP4-файл. Сохраните ID задания и опрашивайте GET /api/v1/videos/{jobId}, пока статус не станет completed, затем загрузите видео из массива unsigned_urls задания (который SDK предоставляет как unsignedUrls), указав свой API-ключ в заголовке Authorization. Прекратите опрос при статусе failed, cancelled или expired. Наше руководство по генерации видео рекомендует интервал в 30 секунд между опросами.
Если модель поддерживает предоставленный последний кадр, добавьте вторую запись frameImages с параметром frameType: "last_frame".
Если ваше приложение позволяет пользователям переключать модели, выполните запрос GET /api/v1/videos/models перед созданием запроса. Ответ включает поддерживаемые моделью supported_durations, supported_resolutions, supported_aspect_ratios, supported_frame_images, флаг generate_audio и pricing_skus. Запрос с неподдерживаемой длительностью, разрешением или соотношением сторон вернет ошибку 400 с перечислением поддерживаемых значений.
Часто задаваемые вопросы
Какие модели image-to-video доступны на OpenRouter?
Каталог видео включает Veo 3.1 и его варианты Fast и Lite, Seedance 2.5 и линейку Seedance 2.0, Kling v3.0 Standard и Pro, Kling Video O1, а также Grok Imagine Video 1.5 и его предшественника, среди прочих. Коллекция видеомоделей и запрос GET /api/v1/videos/models содержат текущий набор.
В чем разница между image-to-video и reference-to-video?
Image-to-video использует frame_images. Изображение становится точным первым кадром, последним кадром или обоими сразу. Reference-to-video использует input_references. Модель использует изображения, видео или аудио в качестве руководства, не размещая их на фиксированном кадре. Если запрос включает оба поля, frame_images имеет приоритет, и мы обрабатываем запрос как image-to-video.
Сколько стоит генерация image-to-video?
Большинство видеомоделей тарифицируются за секунду вывода, и ставка может меняться в зависимости от разрешения, генерации аудио и наличия видеовхода в запросе. Модели Seedance тарифицируются за видеотокен. На странице каждой модели указаны текущие тарифы, а GET /api/v1/videos/models возвращает SKU для ценообразования каждой модели.
Сколько времени занимает задание image-to-video?
Генерация видео выполняется асинхронно. POST /api/v1/videos немедленно возвращает задание, а вы опрашиваете GET /api/v1/videos/{jobId} до тех пор, пока статус не станет completed. Наша документация рекомендует интервал в 30 секунд между опросами. Время выполнения зависит от модели, длительности и разрешения.
Что произойдет, если задание по генерации видео завершится неудачей?
Задание может завершиться со статусом failed, cancelled или expired. Прекратите опрос, когда статус достигнет одного из этих значений, и прочитайте поле error. Временная ошибка при самом запросе опроса не означает, что задание провалено, поэтому повторите запрос статуса для того же ID задания, вместо того чтобы отправлять новую платную генерацию.










