Модели Givon AI API
Один контракт для всех моделей: { type, model, input }. У каждой модели — своя схема входа, цена и готовые сниппеты на cURL, Python и JS. Генерация асинхронная.
Видео
26gemini-omni-videoGoogleМультимодальная модель Google: собирает ролик из текста, изображений и видео и правит готовый клип в диалоге. Бери, когда надо трансформировать снятое или смешать разные входы, а не снять кадр с нуля как Veo. Синхронный звук, до 4K.
grok-imagine-videoxAIБыстрое короткое видео с синхронным звуком и точным следованием промпту. Продолжает клип с последнего кадра — удобно склеивать сцены. 480p/720p.
grok-imagine-video-1.5xAIImage-to-video от xAI: оживляет один исходный кадр с синхронным звуком и сильным следованием промпту, тянет клипы до 15 секунд. В топ-3 арены image-to-video.
happyhorse-1.0AlibabaТоповая видео-модель Alibaba: за один проход выдаёт клип с синхронным звуком и речью. Бери для кинематографичных многосценовых роликов с готовой озвучкой — из текста, кадра, набора референсов или правки исходного видео. 720p/1080p.
happyhorse-1.1AlibabaНовый режим для роликов из текста, изображения или референсов: до 15 секунд, до 9 изображений-референсов, 720p/1080p. Звук создаётся автоматически и не выключается отдельно.
heygen-photo-avatarHeyGenГоворящий аватар из одного фото: модель читает тон и ритм голоса и сама лепит живую мимику и жесты рук. Синхронизация по тексту или готовой озвучке.
kling-2.6KlingСинхронный звук одним проходом — речь, эмбиент и эффекты сразу в кадре, без отдельного дубляжа. Бери для бюджетных клипов и говорящих голов, когда несколько сцен не нужны.
kling-2.6-motionKlingДоступный motion-control: переносит движение с видео-референса на твоего персонажа. Бери для несложной моторики, когда не нужна точность тира 3.0.
kling-3.0KlingФлагман Kling: до 15с и 4K с удержанием образа персонажей между сценами, многосценовая режиссура и синхронный многоязычный звук.
kling-3.0-motionKlingПереносит записанное движение, танец или жест с видео-образца на твоего персонажа целиком — с фиксацией лица и захватом сложной моторики. Бери, когда нужен точный повтор хореографии с лучшей консистентностью внешности.
kling-3.0-omniKlingМногосценовое видео с синхронным звуком: переносит образ и голос персонажа с видео-образца в новые сцены, но с этим образцом звук недоступен. Бери для связного нарратива с одним героем.
kling-3.0-turboKlingБыстрый режим для роликов из текста или изображения: до 15 секунд, 720p/1080p. Последний кадр и звук не поддерживаются.
kling-digital-humanKlingОживляет человека с фото по озвучке: синхронизирует речь, мимику и жесты. Подойдёт, когда нужен говорящий или поющий ведущий с одного портрета.
kling-lip-syncKlingПерекладывает движение губ на готовом видео под новую звуковую дорожку. Бери, когда ролик снят и нужен только дубляж, локализация или замена речи.
kling-o1KlingСливает до 7 ракурсов одного субъекта (Elements) и держит его внешний вид строго консистентным через весь клип. Бери для разворотов персонажа, повторяющихся героев и демо продукта.
minimax-h3MiniMax2K-видео со стереозвуком из текста, первого и последнего кадра или набора изображений и аудио-референсов. Бери для выразительного движения, точного текста в кадре и сложных мультимодальных сцен до 15 секунд.
seedance-2.0BytePlusОтвечает на режиссёрские команды — ракурс, движение камеры, смена планов — через описание, со звуком в одном проходе. Бери для кинематографичных кадров по референсам, вплоть до 4K.
seedance-2.0-fastBytePlusТа же кинематографичность и контроль камеры, но заметно быстрее — для итераций и объёма. Синхронный звук и референсы, до 720p.
seedance-2.0-miniBytePlusСамый доступный режим для быстрых генераций из текста, изображения или референсов: 480p/720p, длительность 4–15 секунд. Видео- и аудио-референсы доступны не во всех режимах.
switchx-videoBeebleМеняет в уже снятом видео фон, объект или свет по тексту, одному референсу и опциональной маске, сохраняя субъект — его форму, движение и мимику. Длительность берётся из исходника, на выходе 720p или 1080p.
topaz-astraTopazCreative Video Upscale & Enhancement от Topaz: улучшает уже готовый GenAI-ролик, дорисовывая детали и текстуру при апскейле до 4K. Это workflow исходное видео → улучшенное видео, без текстового промпта.
veo-3.1GoogleФлагман Google для премиальных кинокадров: изображение до 4K с синхронным звуком — диалог, звуки и эмбиенс из коробки. До 3 референсов держат персонажа и стиль стабильными.
veo-3.1-fastGoogleТа же чёткость до 4K и синхронный звук, что у флагмана, но заметно быстрее и дешевле. Рабочая лошадка для итераций и большинства продакшен-задач.
veo-3.1-liteGoogleСамый доступный тир Veo: до 1080p (без 4K) и звук, который можно включать и выключать. Бери, когда нужен большой объём контента для соцсетей, а 4K ни к чему.
wan-2.7-r2vAlibabaБерёт до 5 референсов — изображения, видео или аудио — и фиксирует внешность и голос героев между сценами, чтобы делать сериальный контент с одними и теми же персонажами.
wan-2.7-videoAlibabaГенерация и редактирование видео в одном движке: из текста, из фото, с заданным финальным кадром или правкой готового клипа по описанию. До 1080p.
Изображения
13gpt-image-2OpenAIФлагман OpenAI для сложных изображений: точно держит длинные инструкции, многоэлементную композицию и текст внутри кадра на разных языках. Бери под инфографику, слайды, упаковку и многоязычные постеры; 1K/2K/4K, правки по всей картинке.
grok-imaginexAIБазовый image-тир от xAI: генерация и редактирование всей картинки по тексту без маски, сборка из нескольких референсов. Бери для быстрых концептов и диалоговых правок, когда не нужна точность тира Pro.
grok-imagine-proxAIСтарший тир Grok Imagine: больше детализации и аккуратный текст в кадре, точно держит композицию по подробному описанию. Бери, когда базовому тиру не хватает качества картинки.
nano-bananaGoogleВходной тир семейства Google: самая доступная генерация изображений в 1K. Диалоговое редактирование и слияние референсов — для объёма и быстрых черновиков.
nano-banana-2GoogleУниверсальный Flash-тир Google: до 4K, аккуратный текст, низкая задержка и консистентность по референсам. Бери для быстрых итераций и объёмной генерации, когда нужен сильный результат дешевле Pro.
nano-banana-2-liteGoogleСамый быстрый и лёгкий тир Nano Banana 2 для 1K-черновиков, быстрых визуальных итераций и недорогих правок. Бери для объёмных идей, референсных набросков и маркетинговых вариантов, когда не нужен 2K/4K.
nano-banana-proGoogleПремиальный Google-тир для сложных бренд-сцен: хорошо держит style guide, референсы, свет и фактуры материалов. Бери для отполированных продуктовых и портретных визуалов, многоэлементных композиций и 4K-финалов.
seedream-4.5BytePlusКинематографичный свет и стабильный образ персонажа между генерациями. Бери для продуктовых каталогов, чарактер-сетов и правок по референсу — стабильная рабочая модель: 2K/4K, до 14 референсов.
seedream-5BytePlusЛёгкий Seedream 5.0: рассуждает над сложным промптом и сама ищет в сети — собирает многоэлементные сцены и кадры по актуальной повестке. Правит по примеру-референсу, тянет до 3K.
seedream-5-proBytePlusSeedream для фотореалистичных коммерческих hero-кадров, товарной фотографии и правок по размеченному референсу. Сильна в естественном свете, коже и материалах, хорошо держит явно заданный арт-дирекшн; 1K/2K, до 10 референсов.
switchx-imageBeebleРелайтинг и композитинг от Beeble: переносит на исходное фото объект, фон или свет по тексту, одному референсу и опциональной маске — с физически корректным светом, не генерируя картинку с нуля. 720p и 1080p.
wan-2.7-imageAlibabaУпор на портреты и лица: черты, макияж и причёску задаёшь через референсы. Бери для аватаров, бьюти и консистентных серий персонажей. Разрешение до 2K.
wan-2.7-image-proAlibaba4K-тир Wan с режимом рассуждения над промптом: точнее держит сложные многошаговые инструкции и текст внутри кадра — вплоть до таблиц и формул. Бери для тяжёлых деливериблов вроде постеров и упаковки.