# Модели липсинка и говорящих аватаров: полный справочник по ценам

**Дата сбора данных: 30.07.2026.** Все цены проверены в этот день на официальных страницах поставщиков. Ссылки на источники указаны у каждой цифры.

**Задача, под которую собирались данные:** около 60 роликов в месяц с говорящим виртуальным персонажем, речь на английском языке, вертикальный формат (для Reels, Shorts, TikTok), длина каждого ролика около 10 секунд.

---

## Словарь: что означают термины в этом документе

**Липсинк (lip sync).** Совпадение движения губ персонажа на видео с тем, что он говорит. Хороший липсинк: губы двигаются точно под звук, зритель не замечает подвоха. Плохой липсинк: губы шевелятся не в такт, получается эффект плохого дубляжа старого кино.

**Audio-driven (управление своим голосом).** Вы даёте модели два файла: картинку человека и звуковой файл со своим голосом. Модель оживляет картинку и подгоняет движение губ под ваш звук. Это то, что нужно, если голос уже записан или сгенерирован отдельно (например, через синтез речи). Вы полностью контролируете, что и каким голосом сказано.

**Text-driven (модель придумывает речь сама).** Вы даёте только текстовое описание сцены и реплику. Модель сама придумывает голос и сама озвучивает. Свой голосовой файл подать нельзя. Плюс: не нужен отдельный синтез речи. Минус: голос будет каждый раз новый и чужой, у персонажа не будет постоянного узнаваемого голоса.

**Video-to-video (переозвучка готового видео).** Модель принимает не картинку, а уже готовое видео с лицом, и переклеивает на нём губы под новый звук. Нужна съёмка или ранее сгенерированное видео, из одной фотографии такое не сделать.

**Разрешение (480p, 720p, 1080p, 4k).** Насколько детальная картинка. 720p достаточно для соцсетей, 1080p заметно чётче, 480p выглядит мыльно на большом экране, но в вертикальной ленте телефона часто сходит.

**Вертикальный формат 9:16.** Соотношение сторон для телефона: высокое узкое видео. Противоположность: 16:9, горизонтальное видео как на телевизоре.

**REST API (программный доступ).** Возможность обратиться к модели из скрипта, без ручной работы в браузере. Нужно для автоматизации, то есть для конвейера, который сам генерирует 60 роликов в месяц. Если API нет, придётся всё делать руками через сайт.

**MCP-сервер (подключение для ИИ-агентов).** Особый вид подключения, через который ИИ-помощник вроде Claude может обращаться к сервису напрямую. Полезно, но не обязательно: обычного REST API достаточно для автоматизации.

**Кредиты.** Внутренняя валюта некоторых сервисов. Вы покупаете подписку, получаете пакет кредитов на месяц, каждая генерация списывает кредиты. Чтобы понять реальную цену, надо разделить стоимость подписки на количество кредитов.

**Поставщик (fal.ai, Replicate, BytePlus, Higgsfield).** Посредник, который сдаёт модель в аренду через свой API. Одна и та же модель у разных поставщиков может стоить по-разному, иногда разница в 10 раз. Это важнейший практический вывод этого документа.

**Примечание о том, как собирались цены.** Страницы моделей на fal.ai и Replicate рисуются программно в браузере, поэтому цены брались из машинных данных внутри самих официальных страниц (поля endpointBilling и billingConfig). Это те же самые числа, которые пользователь видит на экране в строке "Your request will cost". Цены Higgsfield взяты из их официального публичного API тарифов, потому что страница тарифов тоже рисуется программно.

---

## 1. Kling AI Avatar (компания Kuaishou)

Специализированная модель именно под говорящую голову: вы даёте фотографию и звук, получаете видео, где человек на фото говорит вашим голосом.

### Цены

| Модель | Поставщик | Цена за секунду | Источник |
|---|---|---|---|
| `fal-ai/kling-video/v1/standard/ai-avatar` | fal.ai | **0,0562 доллара** | https://fal.ai/models/fal-ai/kling-video/v1/standard/ai-avatar |
| `fal-ai/kling-video/v1/pro/ai-avatar` | fal.ai | **0,115 доллара** | https://fal.ai/models/fal-ai/kling-video/v1/pro/ai-avatar |
| `fal-ai/kling-video/ai-avatar/v2/standard` | fal.ai | **0,0562 доллара** | https://fal.ai/models/fal-ai/kling-video/ai-avatar/v2/standard |
| `fal-ai/kling-video/ai-avatar/v2/pro` | fal.ai | **0,115 доллара** | https://fal.ai/models/fal-ai/kling-video/ai-avatar/v2/pro |
| `kwaivgi/kling-avatar-v2`, режим `std` | Replicate | **0,056 доллара** | https://replicate.com/kwaivgi/kling-avatar-v2 |
| `kwaivgi/kling-avatar-v2`, режим `pro` | Replicate | **0,11 доллара** | https://replicate.com/kwaivgi/kling-avatar-v2 |

Точная формулировка на странице fal.ai: "Your request will cost $0.0562 per second", то есть "ваш запрос будет стоить 0,0562 доллара за секунду".

**Важно: версии 1 и 2 на fal.ai стоят одинаково.** Платить за более старую версию 1 смысла нет, берите версию 2 по той же цене.

**Разница между поставщиками минимальная:** Replicate дешевле на копейки (0,056 против 0,0562 в стандартном режиме и 0,11 против 0,115 в режиме pro). Практической разницы нет, выбирайте по удобству.

Минимального оплачиваемого блока нет (в данных стоит `minimumUnits: null`), то есть платите ровно за фактическую длину ролика.

### Характеристики

- **Тип управления: audio-driven, вы подаёте свой голос.** Обязательные входные данные ровно два: `image_url` (ссылка на картинку) и `audio_url` (ссылка на звук). Плюс необязательное текстовое пояснение `prompt`.
- **Разрешение:** выбора нет, параметра разрешения в запросе не существует. По описанию на Replicate: "The model outputs at up to 1080 pixels resolution and 48 frames per second", то есть до 1080 пикселей и 48 кадров в секунду.
- **Максимальная длительность:** определяется длиной вашего звукового файла. Официальная формулировка fal.ai: "Video duration automatically matches your audio length with no manual configuration required", то есть длина видео автоматически равна длине звука, настраивать ничего не нужно. Жёсткое ограничение только на размер файлов: звук до 5 мегабайт, картинка до 10 мегабайт, размер картинки от 300 пикселей, соотношение сторон картинки от 1:2,5 до 2,5:1.
- **Вертикальный формат:** поддерживается через саму картинку. Модель сохраняет пропорции того, что вы загрузили, значит вертикальную фотографию она превратит в вертикальное видео.
- **Форматы файлов:** картинка JPG, JPEG, PNG, WebP, GIF, AVIF. Звук MP3, OGG, WAV, M4A, AAC. Результат: видео MP4.
- **Есть ли версия новее (2.5 или 3.0)?** Нет. Полный каталог Kling на fal.ai (88 адресов) заканчивается на `ai-avatar/v2/*`, опубликован 04.12.2025. Отдельная линейка видеогенерации Kling дошла до версии 3 (`fal-ai/kling-video/v3/turbo/pro/image-to-video`, опубликован 17.06.2026, цена 0,14 доллара за секунду), но аватара версии 3, куда можно подать свой голос, не существует ни у одного поставщика.
- **Родственная новинка, которую стоит знать:** `kwaivgi/kling-v3-omni-video` на Replicate. Описание: "Kling Video 3.0 Omni: Unified multimodal video generation with reference images, video editing, native audio, and multi-shot control", то есть универсальная генерация видео с опорными картинками, монтажом, встроенным звуком и управлением сценами. Цены по уровням: стандарт без звука 0,168 доллара за секунду, стандарт **со звуком 0,224 доллара за секунду**, pro без звука 0,224, pro **со звуком 0,28**, 4k 0,42. Длительность от 3 до 15 секунд, соотношение сторон 16:9, **9:16**, 1:1. Источник: https://replicate.com/kwaivgi/kling-v3-omni-video. Это уже text-driven модель: голос она придумывает сама.

### Цены официального API самой Kling: не найдены

Страница `https://app.klingai.com/global/dev/document-api/apiReference/model/videoTolip` отдаёт код ошибки 446 автоматическим запросам, а в настоящем браузере весь раздел документации для разработчиков перебрасывает на экран входа в аккаунт ("Welcome to Kling AI, Sign in with Google"). Вход в аккаунт не выполнялся. Сам API работает (адрес `https://api-singapore.klingai.com` отвечает "ok"), но цена в кредитах на официальной платформе осталась непроверенной.

### Качество липсинка

- **Английский:** измеримых замеров на официальных страницах нет. Формулировка fal.ai: "Trading general video generation flexibility for specialized lip-sync precision… handles realistic humans, animals, cartoons, and stylized characters with audio-matched facial movements", то есть модель жертвует универсальностью в пользу точности липсинка и работает с реалистичными людьми, животными, мультяшными и стилизованными персонажами.
- **Русский и португальский: данных нет.** Максимально близкая официальная фраза, с Replicate: "Works well for quick turnaround content across different languages", то есть хорошо подходит для быстрого контента на разных языках. Конкретики про русский или португальский нет нигде.

### Стоимость одного вертикального ролика

| Длина | Standard на fal.ai | Pro на fal.ai | Standard на Replicate | Pro на Replicate |
|---|---|---|---|---|
| 8 секунд | **0,45 доллара** | **0,92 доллара** | 0,448 доллара | 0,88 доллара |
| 10 секунд | **0,56 доллара** | **1,15 доллара** | 0,56 доллара | 1,10 доллара |

### Доступ

REST API есть у обоих поставщиков: fal.ai по адресу `https://queue.fal.run/...`, Replicate по адресу `api.replicate.com`. Официальный API самой Kling существует, но документация закрыта входом в аккаунт. Своего MCP-сервера у Kling нет.

---

## 2. Higgsfield Speak и Speak версии 2

Higgsfield продаёт доступ не за секунды, а по подписке с пакетом кредитов. Чтобы понять настоящую цену, нужно два числа: стоимость подписки и сколько кредитов съедает ролик.

### Тарифы (официальный API тарифов, цены в исходных данных указаны в центах)

Источник: https://fnf-api-gw.higgsfield.ai/fnf/subscriptions/compare (именно этими данными наполняется страница higgsfield.ai/pricing)

| Тариф | В месяц | При годовой оплате | Кредитов в месяц | Цена одного кредита |
|---|---|---|---|---|
| Free | 0 долларов | 0 долларов | 0 | нет |
| Pro | **29,00 долларов** | 29,00 долларов | **600** | 0,04833 доллара |
| Ultimate | **49,00 долларов** | 49,00 долларов | **1200** | 0,04083 доллара |
| Creator | **250,00 долларов** | 249,00 долларов | **6000** плюс скидка "15% Credit Discount" | 0,04167 доллара |
| Team (2 рабочих места) | **71,20 доллара** | 62,30 доллара | **3000** | 0,02373 доллара |

Годовая скидка в данных обозначена как `annual_discount: 40`.

В таблице возможностей встречается колонка "Basic" с 150 кредитами, но в списке продаваемых тарифов её нет. Считайте её устаревшей или скрытой.

**Самый выгодный кредит на тарифе Team: 0,02373 доллара, почти вдвое дешевле, чем на Pro.** Team продаётся минимум на 2 рабочих места.

### Расход кредитов на ролик (раздел "Lipsync Studio", тот же источник)

| Модель | Кредитов | За какой отрезок |
|---|---|---|
| **Higgsfield Speak 2.0 720p** | **14 кредитов** | за 5 секунд |
| Wan 2.5 Speak 480p | 6 | за 5 секунд |
| Wan 2.5 Speak 720p | 12 | за 5 секунд |
| Wan 2.5 Speak 1080p | 20 | за 5 секунд |
| Wan 2.5 Speak Fast 720p | 9 | за 5 секунд |
| Wan 2.5 Speak Fast 1080p | 12 | за 5 секунд |
| Kling Speak 720p | 2 | за 2 секунды |
| Kling Speak 1080p | 4 | за 2 секунды |
| Kling Lipsync 720p | 2 | за 5 секунд |
| Infinite Talk 480p | 18 | за 5 секунд |
| Infinite Talk 720p | 12 | за 2 секунды |
| Sync Lipsync 3 4K 30FPS | 18 | за 2 секунды |
| Google Veo 3 Fast со звуком 720p | 22 | за 8 секунд |
| Google Veo 3 со звуком 720p | 58 | за 8 секунд |

Проверка правильности данных: 600 кредитов разделить на 14 равно 42, и в собственной таблице Higgsfield для тарифа Pro напротив Speak 2.0 стоит "42 videos". Числа сходятся, данные достоверны.

### Характеристики

- **Speak версии 1: не найдена.** В текущем каталоге есть только "Higgsfield Speak 2.0 720p". Версия 1, судя по всему, снята с продажи.
- **Разрешение Speak 2.0: только 720p.** Других вариантов в каталоге нет.
- **Максимальная длительность: не найдена.** Ограничение по длине нигде не опубликовано.
- **Тип управления (свой голос или модель придумывает речь сама): не найдено.** Ни страница продукта, ни документация API не описывают, что именно подаётся на вход.
- **Вертикальный формат: не найдено** в официальных данных.
- **Качество липсинка на английском, русском, португальском: данных нет.** Higgsfield вообще не публикует никаких утверждений про языки.

### Стоимость одного ролика на 8 и на 10 секунд (Speak 2.0 720p)

Оплата идёт блоками по 5 секунд, поэтому и 8 секунд, и 10 секунд одинаково стоят 2 блока, то есть **28 кредитов**.

| Тариф | Цена ролика 8 секунд | Цена ролика 10 секунд |
|---|---|---|
| Pro | **1,35 доллара** | **1,35 доллара** |
| Ultimate | **1,14 доллара** | **1,14 доллара** |
| Creator | **1,17 доллара** | **1,17 доллара** |
| Team | **0,67 доллара** | **0,67 доллара** |

Практический вывод: короче 10 секунд делать невыгодно, платите всё равно за 10.

### Отдельно: очень дешёвый вариант внутри Higgsfield

**Kling Speak 720p стоит всего 2 кредита за 2 секунды**, то есть 10 кредитов на ролик длиной 10 секунд. Это 0,41 доллара на тарифе Ultimate и всего **0,24 доллара на тарифе Team**. Шестьдесят таких роликов в месяц съедают ровно 600 кредитов, то есть точно укладываются в тариф Pro за 29 долларов в месяц.

### Есть ли Speak на fal.ai? Нет

Моделей Higgsfield в каталоге fal.ai не существует. Поиск по слову higgsfield выдаёт только посторонние совпадения.

### Доступ

REST API есть: базовый адрес `https://platform.higgsfield.ai`, запрос отправляется методом POST на `/{model_id}`, статус проверяется через GET `/requests/{id}/status`, работа асинхронная (запрос ставится в очередь, результат забирается позже). Официальная библиотека для Python есть, для JavaScript "coming soon", то есть обещана. Источник: https://docs.higgsfield.ai/docs/how-to/introduction

**Но именно Speak как адрес для API в публичной документации не описан.** Документация показывает только примеры для картинок и для оживления картинок в видео, а список моделей закрыт авторизацией (отвечает кодом 401). То есть возможность вызывать Speak программно **не подтверждена**.

MCP-сервера нет (адреса `docs.higgsfield.ai/mcp` и `mcp.higgsfield.ai` отвечают ошибкой 404).

Полезная деталь из их раздела вопросов и ответов: неудавшиеся генерации и генерации, заблокированные проверкой на недопустимый контент, деньги не списывают, кредиты возвращаются автоматически.

---

## 3. OmniHuman и OmniHuman 1.5 (компания ByteDance, владелец TikTok)

### Цены

| Поставщик | Модель | Цена за секунду | Источник |
|---|---|---|---|
| **BytePlus (сам производитель)** | OmniHuman 1.5 | **0,12 доллара**, точная цитата "$0.12 per second", и "Supports native 1080p-resolution video output", то есть родная выдача в 1080p | https://www.byteplus.com/en/product/OmniHuman |
| fal.ai | `fal-ai/bytedance/omnihuman` (версия 1) | **0,14 доллара** | https://fal.ai/models/fal-ai/bytedance/omnihuman |
| fal.ai | `fal-ai/bytedance/omnihuman/v1.5` | **0,16 доллара** | https://fal.ai/models/fal-ai/bytedance/omnihuman/v1.5 |
| Replicate | `bytedance/omni-human` | **0,14 доллара** ("or around 71 seconds for $10", то есть примерно 71 секунда за 10 долларов) | https://replicate.com/bytedance/omni-human |
| Replicate | `bytedance/omni-human-1.5` | **0,16 доллара** ("or around 62 seconds for $10") | https://replicate.com/bytedance/omni-human-1.5 |
| Higgsfield | нет в каталоге | не найдено | нет |

**Разница между поставщиками одной и той же модели: 0,12 доллара у самого производителя BytePlus против 0,16 доллара у посредников fal.ai и Replicate.** Посредники берут на треть дороже. Если планируется поток роликов, идти напрямую в BytePlus выгоднее.

### Где вообще доступна

BytePlus ModelArk (напрямую у производителя, самая низкая цена), fal.ai, Replicate.

Цены Volcengine ModelArk (китайское подразделение того же ByteDance): **не найдены**, страница тарифов рисуется программно и строк с OmniHuman не отдала. Цены через Dreamina или Jimeng: **не найдены**, публичной цены за секунду для API нет. У Higgsfield эта модель не продаётся.

### Характеристики

- **Тип управления: audio-driven, вы подаёте свой голос.** Версия 1 принимает только `image_url` и `audio_url`, с пометкой "Audio must be under 30s long", то есть звук не длиннее 30 секунд.
- Версия 1.5 добавляет параметры: `resolution` (варианты **720p и 1080p, по умолчанию 1080p**), `prompt` (текстовая подсказка для управления движением), `mask_url` (маска, официальное пояснение: "Only the person in the white area of the mask will speak", то есть говорить будет только человек в белой области маски, полезно если на фото несколько людей), `turbo_mode` (быстрее, с небольшой потерей качества).
- **Максимальная длительность версии 1.5:** официальная формулировка "1080p generation is limited to 30s audio and 720p generation is limited to 60s audio", то есть в 1080p звук до 30 секунд, в 720p до 60 секунд. Отдельно любопытно, что в той же документации сказано "720p generation is faster and higher in quality", то есть 720p не только быстрее, но и качественнее.
- **Вертикальный формат:** через пропорции загруженной картинки.
- **Качество липсинка на английском:** описание на fal.ai: "specialized lip-sync precision, the model trained on 18,700 hours of human motion data", то есть модель обучена на 18 700 часах записей человеческих движений, и "this architecture analyzes audio waveforms to drive facial expressions, lip movements, and body language simultaneously", то есть модель разбирает звуковую волну и одновременно управляет мимикой, губами и языком тела.
- **Русский и португальский: данных нет.**

### Стоимость одного вертикального ролика

| Длина | BytePlus напрямую | Версия 1 (fal.ai и Replicate) | Версия 1.5 (fal.ai и Replicate) |
|---|---|---|---|
| 8 секунд | **0,96 доллара** | 1,12 доллара | **1,28 доллара** |
| 10 секунд | **1,20 доллара** | 1,40 доллара | **1,60 доллара** |

### Доступ

У BytePlus есть REST API (на странице продукта ссылка "View API docs"). У fal.ai и Replicate REST API есть. MCP-сервер у BytePlus **не найден**: адрес `docs.byteplus.com/en/mcp` оказался обычной страницей документации, а не рабочим подключением для ИИ-агентов.

---

## 4. InfiniteTalk (разработка MeiGen, открытый исходный код)

**Внимание на написание.** На fal.ai модель называется **Infinitalk**, через одну букву t. Адрес `fal-ai/infinitetalk` не существует и отвечает ошибкой 404.

### Цены

| Адрес | Цена | Источник |
|---|---|---|
| `fal-ai/infinitalk` (свой голос) | **0,20 доллара за секунду**, плюс важная приписка в счёте: **"For 720p price will be doubled"**, то есть за 720p цена удваивается и становится 0,40 доллара за секунду | https://fal.ai/models/fal-ai/infinitalk |
| `fal-ai/infinitalk/single-text` (модель озвучивает сама) | **0,20 доллара за секунду**, за 720p удваивается | https://fal.ai/models/fal-ai/infinitalk/single-text |
| `fal-ai/infinitalk/video-to-video` (переозвучка готового видео) | **0,30 доллара за секунду**, за 720p удваивается до 0,60 | https://fal.ai/models/fal-ai/infinitalk/video-to-video |

Точные машинные данные счёта: `{"endpoint":"fal-ai/infinitalk","billing_unit":"seconds","price":0.2,"provider_type":"fal"}`, отдельное сообщение о счёте: `billingMessage: "For 720p price will be doubled."`

### На Replicate: не найдено

Модели нет в подборке `replicate.com/collections/lipsync`. Проверены и вернули ошибку 404 адреса: `zsxkib/infinitetalk`, `zsxkib/infinite-talk`, `meigen-ai/infinitetalk`, `wan-video/infinitetalk`, `lucataco/infinitetalk`, `fofr/infinitetalk`.

Ближайшие родственные модели на Replicate, если очень нужно именно там:
- `zsxkib/multitalk`, генерация разговора нескольких людей по звуку, оплата не за секунду видео, а за время работы оборудования: **0,001525 доллара за секунду на видеокарте H100**, типичный запуск обходится в **0,59 доллара**.
- `zsxkib/humo`, **0,0122 доллара за секунду** на сборке из 8 видеокарт H100.

### Через Higgsfield

Infinite Talk 480p: 18 кредитов за 5 секунд. Infinite Talk 720p: 12 кредитов за 2 секунды.

### Характеристики

- **Есть оба типа управления.** Основной адрес принимает свой звук. Вариант `single-text` принимает текст (`text_input`) и выбор голоса (`voice`) из 20 вариантов: Aria, Roger, Sarah, Laura, Charlie, George, Callum, River, Liam, Charlotte, Alice, Matilda, Will, Jessica, Eric, Chris, Brian, Daniel, Lily, Bill. **Все голоса с английскими именами, ни русских, ни португальских в списке нет.** Это единственный конкретный языковой признак во всём исследовании.
- **Разрешение: варианты 480p (по умолчанию) и 720p.** Переход на 720p удваивает цену.
- **Максимальная длительность:** задаётся числом кадров `num_frames`, допустимо **от 41 до 721** кадра, по умолчанию 145. Есть параметр `acceleration` (ускорение) со значениями none, regular, high.
- **Вертикальный формат:** через пропорции картинки, с оговоркой из документации, что если картинка не совпадает с выбранными пропорциями, она будет уменьшена и обрезана по центру.
- **Качество липсинка на английском, русском, португальском: данных нет** ни на одной официальной странице.

### Стоимость одного вертикального ролика

| Длина | 480p на fal.ai | 720p на fal.ai | 480p через Higgsfield Ultimate | 720p через Higgsfield Ultimate |
|---|---|---|---|---|
| 8 секунд | **1,60 доллара** | **3,20 доллара** | 1,47 доллара (2 блока, 36 кредитов) | 2,45 доллара |
| 10 секунд | **2,00 доллара** | **4,00 доллара** | **1,47 доллара** (2 блока, 36 кредитов) | **2,45 доллара** (5 блоков, 60 кредитов) |

---

## 5. Wan S2V (модель Wan 2.2 Speech-to-Video, компания Alibaba)

Название S2V расшифровывается как speech-to-video, то есть из речи в видео.

### Цены, и здесь самая большая находка исследования

| Поставщик | Цена | Источник |
|---|---|---|
| fal.ai `fal-ai/wan/v2.2-14b/speech-to-video` | **"$0.20 per video second for 720p, $0.15 per video second for 580p, $0.10 per video second for 480p. Video seconds are calculated at 16 frames per second."** То есть 0,20 доллара за секунду в 720p, 0,15 в 580p, 0,10 в 480p, а секунды считаются при 16 кадрах в секунду | https://fal.ai/models/fal-ai/wan/v2.2-14b/speech-to-video |
| **Replicate `wan-video/wan-2.2-s2v`** | **0,02 доллара за секунду готового видео** ("or 50 seconds for $1", то есть 50 секунд за 1 доллар) | https://replicate.com/wan-video/wan-2.2-s2v |

**Разница в цене между поставщиками десятикратная: 0,02 доллара за секунду на Replicate против 0,20 доллара за секунду на fal.ai за 720p.** При этом на Replicate модель размещена официальным аккаунтом самой Alibaba (`wan-video`), то есть это не какая-то любительская копия. Это самое практически важное наблюдение всего исследования.

### Характеристики

- **Тип управления: audio-driven, вы подаёте свой голос.**
- Входные данные на fal.ai: `image_url` и `audio_url`, плюс `prompt` и `negative_prompt` (что не должно появиться в кадре), `num_inference_steps` (число шагов расчёта, от 2 до 40, по умолчанию 27, больше шагов означает лучше качество и дольше ожидание), `shift` (от 1 до 10), `video_quality` (low, medium, high, maximum), `video_write_mode` (fast, balanced, small, влияет на размер файла), проверки на недопустимый контент по умолчанию выключены.
- Входные данные на Replicate: `audio` с пояснением "Audio file to synchronize the video with", то есть звуковой файл для синхронизации, и `image` с пояснением "First frame image to start the video from", то есть картинка для первого кадра.
- **Разрешение: 480p, 580p, 720p** на fal.ai, каждое со своей ценой.
- **Максимальная длительность: не найдена.**
- **Вертикальный формат:** через пропорции картинки.
- Частота кадров для расчёта счёта: 16 кадров в секунду.
- **Качество липсинка на английском, русском, португальском: данных нет.** На странице Replicate приведён научный текст из статьи Wan-S2V про генерацию персонажей по звуку, но языковых данных там нет.

### Стоимость одного вертикального ролика

| Длина | Replicate | fal.ai 480p | fal.ai 580p | fal.ai 720p |
|---|---|---|---|---|
| 8 секунд | **0,16 доллара** | 0,80 доллара | 1,20 доллара | 1,60 доллара |
| 10 секунд | **0,20 доллара** | 1,00 доллар | 1,50 доллара | 2,00 доллара |

### Более новая закрытая версия Wan 2.5 Speak

Доступна только через Higgsfield. Расход кредитов и цена ролика на 10 секунд на тарифе Ultimate:

| Вариант | Кредитов | Ролик 10 секунд на Ultimate |
|---|---|---|
| Wan 2.5 Speak 480p | 6 за 5 секунд | 0,49 доллара |
| Wan 2.5 Speak Fast 720p | 9 за 5 секунд | 0,74 доллара |
| Wan 2.5 Speak 720p | 12 за 5 секунд | 0,98 доллара |
| Wan 2.5 Speak 1080p | 20 за 5 секунд | 1,63 доллара |

---

## 6. Sonic (модель липсинка)

**Не найдена ни у одного из проверенных поставщиков.**

- **fal.ai:** адрес `fal-ai/sonic` отвечает ошибкой 404. Поиск по каталогу по слову sonic выдаёт только модели `sonilo/*` для генерации музыки и звуковых эффектов, а также `fal-ai/moondream3-preview/segment`. Модели для оживления портретов под названием Sonic там нет.
- **Replicate:** отсутствует в подборке `replicate.com/collections/lipsync`, адреса `zsxkib/sonic` и `chenxwh/sonic` отвечают ошибкой 404.
- Официальной размещённой версии с ценой найти не удалось.

**Цена: не найдена.**

---

## 7. LatentSync

### Цены

| Поставщик | Цена | Источник |
|---|---|---|
| fal.ai `fal-ai/latentsync` | **"$0.2 for videos up to 40 seconds. For longer videos, you will be charged $0.005 per second of output video."** То есть фиксированно 0,20 доллара за видео длиной до 40 секунд, а дальше по 0,005 доллара за каждую секунду. Машинные данные счёта: `billing_unit: seconds, price: 0.005` | https://fal.ai/models/fal-ai/latentsync |
| Replicate `bytedance/latentsync` | **Цены за секунду видео нет вообще** (`billingConfig: null`), оплата идёт за время работы оборудования: **0,000975 доллара за секунду на видеокарте L40S**, типичный запуск (медиана) обходится в **0,10 доллара** | https://replicate.com/bytedance/latentsync |

### Критически важное ограничение

**LatentSync работает только по схеме video-to-video, то есть переозвучивает уже готовое видео.** Из одной фотографии ролик сделать невозможно. Обязательные входные данные на fal.ai: `video_url` (ссылка на видео) и `audio_url` (ссылка на звук). Дополнительно: `guidance_scale` (от 1 до 2, по умолчанию 1), `loop_mode` (режимы pingpong и loop, применяются когда звук длиннее исходного видео), `seed`.

Для задачи "сделать говорящего персонажа из фотографии" эта модель не подходит. Она пригодится только если у вас уже есть отснятое или ранее сгенерированное видео с лицом.

### Характеристики

- **Версии 1.5 или 1.6: не найдены.** Ни fal.ai, ни Replicate не указывают номер версии на странице модели.
- **Тип управления: audio-driven, вы подаёте свой голос.**
- **Разрешение: не найдено,** параметра нет, наследуется от исходного видео.
- **Максимальная длительность:** фиксированный тариф действует до 40 секунд.
- **Вертикальный формат:** наследуется от исходного видео.
- **Качество липсинка:** описание на fal.ai перечисляет применения: "Dubbing… for dubbed content" (дубляж), "Education: Create language learning content with accurate pronunciation visuals" (обучение языкам с правильной визуальной артикуляцией). **Конкретных данных по английскому, русскому, португальскому нет.**

### Стоимость одного ролика на 8 и на 10 секунд

**На fal.ai: 0,20 доллара в обоих случаях.** Из-за фиксированного тарифа до 40 секунд ролик на 8 секунд стоит столько же, сколько ролик на 40 секунд. На Replicate: примерно 0,10 доллара за типичный запуск.

---

## 8. Veo 3 и Veo 3.1 (Google)

Официальные цены Gemini API, все указаны "per second in USD", то есть за секунду в долларах, **звук включён по умолчанию**. Источник: https://ai.google.dev/gemini-api/docs/pricing

| Модель | 720p | 1080p | 4k |
|---|---|---|---|
| **Veo 3.1** `veo-3.1-generate-preview` | **0,40 доллара** | **0,40 доллара** | **0,60 доллара** |
| **Veo 3.1 Fast** `veo-3.1-fast-generate-preview` | **0,10 доллара** | **0,12 доллара** | **0,30 доллара** |
| **Veo 3.1 Lite** `veo-3.1-lite-generate-preview` | **0,05 доллара** | **0,08 доллара** | не поддерживается |
| Veo 3 `veo-3.0-generate-001` (устарела) | 0,40 доллара | 0,40 доллара | нет |
| Veo 3 Fast (устарела) | 0,10 доллара | 0,12 доллара | 0,30 доллара |
| Veo 2 (устарела) | 0,35 доллара | | |

**Veo 3 и Veo 2 отключаются 30 июня 2026 года**, документация направляет всех на Veo 3.1 Preview. Полезная оговорка про оплату: "You will only be charged if your video is successfully generated", то есть деньги списывают только за успешно созданное видео.

### Есть ли у Google что-то новее Veo к июлю 2026? Да

**`gemini-omni-flash-preview`.** Официальное описание: "Our next-generation video generation and editing model", то есть модель генерации и монтажа видео следующего поколения. Цена выдачи: **9,00 долларов за миллион текстовых токенов и 17,50 доллара за миллион видеотокенов, что примерно равно 0,10 доллара за секунду видео в 720p** (пересчёт приведён на самой странице цен Google). Более того, документация Google по видео теперь прямо советует: использовать Gemini Omni Flash по умолчанию, а Veo брать только под особые задачи, а именно продление сцены, управление последним кадром или совместимость со старыми конвейерами.

Источники: https://ai.google.dev/gemini-api/docs/pricing, https://ai.google.dev/gemini-api/docs/models, https://ai.google.dev/gemini-api/docs/video

### Цены Veo на Vertex AI: не найдены

Страница `cloud.google.com/vertex-ai/generative-ai/pricing` теперь отдаёт содержимое про Agent Platform, и таблицы по Veo в полученном тексте не оказалось. Gemini Omni Flash там присутствует, тоже по 0,10 доллара за секунду видео.

### Характеристики

- **Тип управления: text-driven, модель придумывает речь сама.** Подать свой голосовой файл нельзя. Это принципиальное отличие от всех моделей выше.
- **КРИТИЧЕСКОЕ ОГРАНИЧЕНИЕ ДЛИТЕЛЬНОСТИ: доступны только 4, 6 и 8 секунд.** Причём **8 секунд обязательны**, если вы выбираете 1080p, 4k или используете опорные картинки. **Ролик ровно на 10 секунд у Veo сделать невозможно.** Продление существует, но работает только в 720p.
- **Соотношение сторон: "16:9 (default)" и "9:16".** Вертикальный формат поддерживается.
- **Разрешение:** 720p (по умолчанию), 1080p (только при длине 8 секунд), 4k (только при длине 8 секунд).
- **Может ли сделать говорящего человека с внятной репликой?** Частично да. Veo 3.1 описывается как модель с "natively synchronized audio", то есть с встроенным синхронизированным звуком, и инструкция советует "use quoted dialogue for specific speech", то есть писать реплику в кавычках, чтобы получить конкретную речь. **Но ни на одной странице Google не заявлено про точность липсинка**, само слово lipsync там не встречается. Вы получите человека, произносящего заданные слова, но не гарантированную покадровую синхронность, и подать свой голос вы не сможете.
- **Опорные картинки:** "up to three reference images to guide your generated video's content", то есть до трёх картинок для сохранения внешности "a person's, character's, or product's appearance", то есть человека, персонажа или товара.
- **Качество речи на русском и португальском: данных нет.**

### Стоимость одного вертикального ролика 9:16 длиной 8 секунд

| Модель | 720p | 1080p |
|---|---|---|
| Veo 3.1 | **3,20 доллара** | 3,20 доллара |
| Veo 3.1 Fast | **0,80 доллара** | 0,96 доллара |
| Veo 3.1 Lite | **0,40 доллара** | 0,64 доллара |
| Gemini Omni Flash | примерно **0,80 доллара** | нет данных |

**Ролик на 10 секунд одним запросом невозможен.**

### Доступ

REST API есть (Gemini API и Vertex AI). Официального MCP-сервера Google для генерации видео **не найдено**.

---

## 9. Sora 2 и Sora 2 Pro (OpenAI)

Официальные цены: https://developers.openai.com/api/docs/pricing (старый адрес `platform.openai.com/docs/pricing` переадресует туда постоянной переадресацией 301)

| Модель | Разрешение | Обычная цена | Пакетная цена (batch, дешевле, но результат не сразу) |
|---|---|---|---|
| **sora-2** | 720p (720x1280 вертикально, 1280x720 горизонтально) | **0,10 доллара за секунду** | **0,05 доллара за секунду** |
| **sora-2-pro** | 720p | **0,30 доллара за секунду** | 0,15 доллара |
| **sora-2-pro** | 1024p | **0,50 доллара за секунду** | 0,25 доллара |
| **sora-2-pro** | 1080p (1920x1080 или 1080x1920) | **0,70 доллара за секунду** | 0,35 доллара |

### КРИТИЧЕСКОЕ ОГРАНИЧЕНИЕ ДЛИТЕЛЬНОСТИ

**Допустимые значения длины ровно три: 4, 8 и 12 секунд.** В документации это перечислено как `"4"`, `"8"`, `"12"`. Допустимые размеры кадра: `"720x1280"`, `"1280x720"`, `"1024x1792"`, `"1792x1024"`. Источник: https://developers.openai.com/api/docs/api-reference/videos/create

**Ролик ровно на 10 секунд у Sora сделать невозможно, нужно брать 8 или 12 секунд.**

Отдельно на странице руководства упоминаются "16- and 20-second generations", то есть генерации на 16 и 20 секунд, с продлением до 20 секунд за одну операцию. Считайте надёжным именно перечень 4, 8, 12, взятый из описания самого запроса.

### Характеристики

- **Синхронная речь: есть.** Официальные формулировки: "Flagship video generation with synced audio" и "generating videos with synced audio", то есть флагманская генерация видео со синхронизированным звуком.
- **Тип управления: text-driven, модель придумывает речь сама.** Вы описываете, что должно быть сказано, но свой звуковой файл подать нельзя.
- **Можно ли подать своё фото или своего персонажа?** Частично. Можно "guide a generation with an input image, which acts as the first frame of your video", то есть задать входную картинку как первый кадр видео, форматы JPEG, PNG, WebP. Есть механизм многоразовых персонажей через запрос `POST /v1/videos/characters`. **Но действует ограничение: "Character uploads that depict human likeness are blocked by default"**, то есть загрузка персонажей, похожих на настоящих людей, по умолчанию заблокирована, доступ открывается через обращение в поддержку аккаунта. Значит использовать своё лицо как постоянного персонажа просто так не получится.
- **Sora 3 или что-то новее: не найдено** ни на странице цен, ни на странице модели sora-2.
- **Вертикальный формат:** поддерживается напрямую, размер 720x1280 и 1080x1920.
- **Качество речи на русском и португальском: данных нет.**

### Стоимость одного вертикального ролика

| Модель | 8 секунд | 12 секунд (вместо невозможных 10) |
|---|---|---|
| sora-2, 720x1280 | **0,80 доллара** (0,40 в пакетном режиме) | 1,20 доллара |
| sora-2-pro, 720p | **2,40 доллара** | 3,60 доллара |
| sora-2-pro, 1080x1920 | **5,60 доллара** | 8,40 доллара |

### Доступ

REST API есть (адрес `/v1/videos`). Официального MCP-сервера OpenAI для генерации видео **не найдено**.

---

## 10. Vozo AI, Lemon Slice, Decart

### Vozo AI

Источник: https://www.vozo.ai/pricing

- Free: 0 долларов.
- **Creator: "$29 USD /month"**, включает "150 AI points / month", что по их собственной оценке равно примерно **"15 lip sync minutes"**, то есть 15 минутам липсинка.
- **Studio: "$99 USD /month"**, включает "600 AI points / month", примерно **"60 lip sync minutes"**.
- Studio XL, Studio XXL, Enterprise: цена индивидуальная, не опубликована.

Пересчёт в цену за секунду: на Creator около 1,93 доллара за минуту, то есть **0,0322 доллара за секунду**. На Studio около 1,65 доллара за минуту, то есть **0,0275 доллара за секунду**.

**Стоимость ролика: 8 секунд примерно 0,26 доллара (Creator) или 0,22 доллара (Studio). 10 секунд примерно 0,32 доллара (Creator) или 0,28 доллара (Studio).**

Цены за секунду напрямую не публикуются, всё считается через внутренние "AI points". Их собственное объяснение: разные функции потребляют разный объём вычислений, поэтому всё пересчитывается в приблизительные минуты.

Разрешение, максимальная длительность, качество по языкам: **не найдено**.

**Доступ: API только на тарифе Enterprise** ("API Access" указан лишь в колонке Enterprise, ссылки на документацию нет). MCP-сервера нет. Для обычных тарифов это фактически сервис с работой через сайт вручную, для автоматизации 60 роликов в месяц не подходит без перехода на Enterprise.

### Lemon Slice

Источник: https://lemonslice.com/pricing

- Starter: **7 долларов в месяц**, включает "1,000" кредитов, что равно **"41" минуте**.
- Creator: **33 доллара в месяц**.
- Pro: **83 доллара в месяц**.
- Scale: **200 долларов в месяц**.
- Enterprise: индивидуально, "Significant discounts at scale", то есть существенные скидки при больших объёмах.

Базовая модель: **включённая ставка "$0.1640" за минуту, ставка сверх пакета "$0.22" за минуту.** Размещённые аватары стоят дополнительно **"$0.09/min"**, в эту доплату входят модели речи.

**Стоимость ролика на 10 секунд: примерно 0,027 доллара по включённой ставке или 0,037 доллара сверх пакета. На 8 секунд: примерно 0,022 и 0,029 доллара.** Это самая низкая цена за секунду во всём исследовании, но нужно понимать, что это продукт для аватаров в реальном времени, а не кинематографический генератор.

**Доступ: REST API на всех самостоятельно оформляемых тарифах.** Заявлено, что можно "create a real-time avatar from any LLM or AI Voice model", то есть собрать аватара в реальном времени поверх любой языковой модели или модели синтеза голоса. MCP-сервера нет.

Разрешение и качество по языкам: **не найдено**.

### Decart

Источник: https://docs.platform.decart.ai/getting-started/pricing

Режим реального времени, оплата за секунду активной генерации:
- **Lucy 2.5: 0,02 доллара за секунду**, описание "Realtime video editing (latest)", то есть монтаж видео в реальном времени, последняя версия.
- Lucy VTON 3: 0,02 доллара за секунду, "Virtual try-on (latest)", виртуальная примерка одежды.
- **Lucy Restyle 2: 0,01 доллара за секунду**, "Realtime style transfer", смена стиля в реальном времени.
- **Oasis 3 Preview: 0,02 доллара за секунду**, "Realtime world model / driving simulator", модель мира и симулятор вождения.

Видеорежим, оплата за секунду готового видео:
- **Lucy 2.5: 0,04 доллара за секунду (720p)**, "Video editing (latest)".
- Lucy VTON 3: 0,04 доллара за секунду (720p).
- Lucy Restyle 2: 0,01 доллара за секунду (720p).

Картинки: Lucy Image 2, 0,01 доллара за 480p и 0,02 доллара за 720p.

**Mirage: не найдена.** Модели с таким названием в текущей документации по ценам Decart нет.

**Главное предупреждение: это не модели липсинка и не говорящие аватары.** Это монтаж видео в реальном времени, смена стиля, виртуальная примерка и модель мира. Ролик на 10 секунд через Lucy 2.5 обойдётся в 0,40 доллара, но губы под ваш звук эта модель двигать не будет. Для задачи говорящего персонажа Decart не подходит.

**Доступ: REST API плюс Realtime API, и есть официальный MCP-сервер** по адресу `https://docs.platform.decart.ai/mcp`, он отдаёт корректное описание подключения: `{"server":{"name":"Decart API Platform","version":"1.0.0","transport":"http"}}`, работает только на чтение, для поиска по документации.

---

## Бонусный список: более дешёвые варианты, найденные попутно

Все проверены 30.07.2026. Полезно как запас на случай, если основные варианты не устроят по качеству или по цене.

| Модель | Поставщик | Цена | Ролик 10 секунд |
|---|---|---|---|
| `fal-ai/flashtalk` | fal.ai | **0,02 доллара за секунду** | **0,20 доллара** |
| `kwaivgi/kling-lip-sync` (переозвучка готового видео) | Replicate | **0,014 доллара за секунду** | **0,14 доллара** |
| `bytedance/dreamactor-m2.0` | Replicate | **0,05 доллара за секунду** | 0,50 доллара |
| `sync/lipsync-2` | Replicate | **0,05 доллара за секунду** | 0,50 доллара |
| `veed/lipsync/v2` | fal.ai | **0,07 доллара за секунду** | 0,70 доллара |
| `sync/lipsync-2-pro` | Replicate | **0,08325 доллара за секунду** | 0,83 доллара |
| `veed/fabric-1.0` | Replicate | **0,08 и 0,15 доллара за секунду** (два уровня) | 0,80 или 1,50 доллара |
| `fal-ai/heygen/v3/lipsync/precision` | fal.ai | **0,10 доллара за секунду** | 1,00 доллар |
| `fal-ai/sync-lipsync/v3/image-to-video` | fal.ai | **0,1333 доллара за секунду готового видео** | 1,33 доллара |
| `fal-ai/sync-lipsync/v3` | fal.ai | **8 долларов за минуту** | 1,33 доллара |
| `fal-ai/sync-lipsync/v2/pro` | fal.ai | **5 долларов за минуту** | 0,83 доллара |
| `fal-ai/ai-avatar/single-text` | fal.ai | **0,20 доллара за секунду** (за 720p удваивается) | 2,00 доллара |
| `fal-ai/kling-video/lipsync/audio-to-video` | fal.ai | **0,014 доллара за единицу**, звук от 2 до 60 секунд, видео от 2 до 10 секунд, только 720p или 1080p, файл до 100 мегабайт | 0,14 доллара |
| `zsxkib/multitalk` | Replicate | 0,001525 доллара за секунду работы H100 | типичный запуск 0,59 доллара |
| `zsxkib/humo` | Replicate | 0,0122 доллара за секунду на 8 видеокартах H100 | по факту работы |

Из бонусного списка отдельно стоит отметить два пункта. Первый: **`fal-ai/flashtalk` за 0,02 доллара за секунду**, это самая дешёвая модель оживления фотографии по своему звуку на fal.ai. Второй: моделям с пометкой "переозвучка готового видео" нужна исходная видеозапись, из одной фотографии они не работают.

---

## ИТОГОВАЯ СОРТИРОВКА 1: модели, куда мы подаём СВОЙ голос (audio-driven), от самого дешёвого

Оживление фотографии своим звуковым файлом. Это то, что нужно, если голос уже есть и у персонажа должен быть один и тот же узнаваемый голос во всех роликах.

| Место | Вариант | Ролик 8 секунд | Ролик 10 секунд |
|---|---|---|---|
| 1 | **Wan 2.2 S2V на Replicate** | **0,16 доллара** | **0,20 доллара** |
| 2 | Flashtalk на fal.ai | 0,16 доллара | 0,20 доллара |
| 3 | Kling Speak 720p через Higgsfield на тарифе Team | 0,24 доллара | **0,24 доллара** |
| 4 | Kling Speak 720p через Higgsfield на тарифе Ultimate | 0,41 доллара | 0,41 доллара |
| 5 | **Kling AI Avatar v2 Standard на fal.ai или Replicate** | **0,45 доллара** | **0,56 доллара** |
| 6 | Wan 2.2 S2V 480p на fal.ai | 0,80 доллара | 1,00 доллар |
| 7 | Kling AI Avatar v2 Pro на fal.ai | 0,92 доллара | 1,15 доллара |
| 8 | **OmniHuman 1.5 напрямую в BytePlus** | **0,96 доллара** | **1,20 доллара** |
| 9 | Higgsfield Speak 2.0 720p на тарифе Ultimate | 1,14 доллара | 1,14 доллара |
| 10 | OmniHuman версия 1 на fal.ai или Replicate | 1,12 доллара | 1,40 доллара |
| 11 | OmniHuman 1.5 на fal.ai или Replicate | 1,28 доллара | 1,60 доллара |
| 12 | InfiniteTalk 480p на fal.ai | 1,60 доллара | 2,00 доллара |
| 13 | InfiniteTalk 720p на fal.ai | 3,20 доллара | 4,00 доллара |

**Лучшая цена: Wan 2.2 S2V на Replicate. Лучшее сочетание цены и известного качества среди коммерческих моделей: Kling AI Avatar v2 Standard.** У Kling есть плюс: длина видео автоматически равна длине звука, никаких блоков и округлений, платите ровно за то, что получили.

Отдельно стоит помнить: LatentSync (0,20 доллара фиксированно) в этот список не входит, потому что требует готовое видео, а не фотографию.

---

## ИТОГОВАЯ СОРТИРОВКА 2: модели, где речь придумывает САМА модель (text-driven), от самого дешёвого

Свой голос подать нельзя, голос будет каждый раз новый. Считаем ролик длиной 8 секунд, потому что ровно 10 секунд здесь недоступны ни у Veo, ни у Sora.

| Место | Вариант | Ролик 8 секунд | Ближайшая доступная альтернатива 10 секундам |
|---|---|---|---|
| 1 | **Veo 3.1 Lite 720p** | **0,40 доллара** | 10 секунд невозможно, максимум 8 |
| 2 | Veo 3.1 Lite 1080p | 0,64 доллара | 10 секунд невозможно |
| 3 | **Veo 3.1 Fast 720p** | **0,80 доллара** | 10 секунд невозможно |
| 3 | **Gemini Omni Flash 720p** | примерно **0,80 доллара** | нет данных по длительности |
| 3 | **Sora 2, 720x1280 вертикально** | **0,80 доллара** | 12 секунд за 1,20 доллара |
| 6 | Veo 3.1 Fast 1080p | 0,96 доллара | 10 секунд невозможно |
| 7 | Kling 3.0 Omni со звуком, стандарт, Replicate | 1,79 доллара | 10 секунд возможно, 2,24 доллара |
| 8 | Kling 3.0 Omni со звуком, pro, Replicate | 2,24 доллара | 10 секунд возможно, 2,80 доллара |
| 9 | Sora 2 Pro 720p | 2,40 доллара | 12 секунд за 3,60 доллара |
| 10 | Veo 3.1 стандарт 720p и 1080p | 3,20 доллара | 10 секунд невозможно |
| 11 | Sora 2 Pro 1080x1920 | 5,60 доллара | 12 секунд за 7,00 долларов |

**Пакетный режим Sora 2** (результат приходит не сразу, зато вдвое дешевле): ролик на 8 секунд стоит **0,40 доллара**, столько же, сколько Veo 3.1 Lite.

---

## ОГРАНИЧЕНИЯ ПО ДЛИТЕЛЬНОСТИ: запомнить обязательно

Это самое частое место, где ломаются планы.

- **Veo 3 и Veo 3.1: доступны только 4, 6 и 8 секунд.** Больше того, при выборе 1080p, 4k или при использовании опорных картинок длина обязана быть ровно 8 секунд. **Ролик на 10 секунд одним запросом сделать нельзя.** Продление сцены существует, но работает только в 720p.
- **Sora 2 и Sora 2 Pro: доступны только 4, 8 и 12 секунд.** **Ролика ровно на 10 секунд не существует, придётся выбирать 8 или 12.**
- **Kling AI Avatar, OmniHuman, Wan S2V, InfiniteTalk: длина свободная,** определяется длиной вашего звукового файла. Ограничения только сверху: у OmniHuman 1.5 звук до 30 секунд в 1080p и до 60 секунд в 720p, у OmniHuman версии 1 до 30 секунд, у InfiniteTalk от 41 до 721 кадра.
- **Higgsfield: оплата блоками.** Speak 2.0 считает блоками по 5 секунд, поэтому ролики на 8 и на 10 секунд стоят одинаково, оба по 28 кредитов. Делать ролик короче 10 секунд экономически бессмысленно.
- **LatentSync на fal.ai: фиксированная цена 0,20 доллара за всё до 40 секунд.** Ролик на 8 секунд стоит столько же, сколько на 40.

---

## РАЗНИЦА В ЦЕНЕ МЕЖДУ ПОСТАВЩИКАМИ ОДНОЙ И ТОЙ ЖЕ МОДЕЛИ

Практически самый полезный раздел: одна и та же модель может стоить в разы дороже просто из-за выбора посредника.

| Модель | Дешевле всего | Дороже всего | Разница |
|---|---|---|---|
| **Wan 2.2 S2V** | **Replicate, 0,02 доллара за секунду** | fal.ai 720p, 0,20 доллара за секунду | **десятикратная** |
| **OmniHuman 1.5** | **BytePlus напрямую, 0,12 доллара за секунду** | fal.ai и Replicate, 0,16 доллара за секунду | на треть дороже у посредников |
| Kling AI Avatar v2 Standard | Replicate, 0,056 доллара за секунду | fal.ai, 0,0562 доллара за секунду | практически нет |
| Kling AI Avatar v2 Pro | Replicate, 0,11 доллара за секунду | fal.ai, 0,115 доллара за секунду | практически нет |
| OmniHuman версия 1 | fal.ai и Replicate одинаково, 0,14 доллара за секунду | нет разницы | нет |
| LatentSync | Replicate, примерно 0,10 доллара за типичный запуск | fal.ai, 0,20 доллара фиксированно | вдвое |
| Sync Lipsync 2 Pro | Replicate, 0,08325 доллара за секунду | fal.ai (v2/pro), 5 долларов за минуту равно 0,0833 доллара за секунду | практически нет |
| InfiniteTalk 480p | Higgsfield Ultimate, 1,47 доллара за 10 секунд | fal.ai, 2,00 доллара за 10 секунд | на треть |
| Kling AI Avatar внутри чужих сервисов | Higgsfield Team (Kling Speak 720p), 0,24 доллара за 10 секунд | fal.ai (Avatar v2 Pro), 1,15 доллара за 10 секунд | почти пятикратная |

Отдельно про Kling AI Avatar внутри Higgsfield: их позиция "Kling Speak 720p" по 2 кредита за 2 секунды выходит существенно дешевле, чем прямой доступ к Kling Avatar через fal.ai. Однако это не обязательно та же самая версия модели, официального подтверждения соответствия версий нет, поэтому воспринимайте сравнение как ориентир, а не как факт.

---

## ЧЕГО НЕ УДАЛОСЬ НАЙТИ

Раздел важен: чтобы не искать заново то, что уже искали, и чтобы честно понимать пробелы.

1. **Цены официального API самой Kling** в кредитах или единицах. Документация для разработчиков закрыта входом в аккаунт, автоматическим запросам страница отдаёт код ошибки 446.
2. **Цена Higgsfield Speak версии 1.** Её нет в текущем каталоге, модель, судя по всему, снята с продажи.
3. **Адрес Speak для программного вызова через API Higgsfield.** В публичной документации его нет, список моделей закрыт авторизацией.
4. **Тип управления и максимальная длительность у Higgsfield Speak.** Нигде не описано, подаётся ли туда свой звук или модель озвучивает сама.
5. **Модель Sonic** отсутствует и на fal.ai, и на Replicate. Официальной размещённой версии с публичной ценой найти не удалось.
6. **InfiniteTalk на Replicate** отсутствует. Проверено шесть возможных адресов, все отвечают ошибкой 404.
7. **Номер версии LatentSync (1.5 или 1.6).** Ни один поставщик его не указывает.
8. **Таблица цен Veo на Vertex AI.** Страница цен Vertex теперь отдаёт содержимое про другой продукт.
9. **Цены OmniHuman через Volcengine, Dreamina, Jimeng.** Публичных цен за секунду для API нет.
10. **Модель Mirage у Decart.** В текущей документации по ценам её нет.
11. **Sora 3 или что-либо новее Sora 2 Pro.** Упоминаний нет ни на странице цен, ни на странице модели.
12. **Разрешение, максимальная длительность и языковые данные у Vozo AI и Lemon Slice.**
13. **MCP-серверы** у Higgsfield, Kling, BytePlus, Google (для видео), OpenAI (для видео), Vozo, Lemon Slice.

### САМЫЙ ВАЖНЫЙ ПРОБЕЛ: качество липсинка по конкретным языкам

**Ни один поставщик из всех проверенных не публикует данных о качестве липсинка на конкретных языках.** Ни по английскому, ни по русскому, ни по португальскому. Не существует ни таблиц точности, ни замеров, ни даже качественных оценок вида "на русском хуже".

Всё, что нашлось, это общие маркетинговые фразы:

- `sync/lipsync-2` на Replicate: "preserves a speaker's unique style across different languages… Even when translating across languages, it keeps their signature delivery", то есть сохраняет манеру говорящего при переводе на другие языки.
- Kling LipSync на fal.ai: "Sync any audio to any face without pre-training on that specific person, enabling rapid dubbing workflows across multiple speakers and languages", то есть можно синхронизировать любой звук с любым лицом без предварительного обучения, что удобно для быстрого дубляжа на несколько языков.
- Kling Avatar v2 на Replicate: "Works well for quick turnaround content across different languages", то есть хорошо подходит для быстрого контента на разных языках.
- `sync/lipsync-2-pro`: "Multilingual Dubbing: Supports seamless lip-syncing across multiple languages for global content localization", то есть поддерживает бесшовный липсинк на нескольких языках для локализации.

**Единственный конкретный языковой признак во всём исследовании:** у текстового варианта InfiniteTalk (`fal-ai/infinitalk/single-text`) список доступных голосов состоит из 20 позиций, и все они с английскими именами: Aria, Roger, Sarah, Laura, Charlie, George, Callum, River, Liam, Charlotte, Alice, Matilda, Will, Jessica, Eric, Chris, Brian, Daniel, Lily, Bill. Русских и португальских голосов там нет.

**Практический вывод.** Раз данных нет ни у кого, качество липсинка на нужном языке придётся проверять самостоятельно на одном тестовом ролике, прежде чем ставить модель в поток. Хорошая новость для нашей задачи: речь нужна английская, а именно на английском все эти модели обучались в первую очередь, поэтому риск минимальный. Дополнительная страховка: при схеме audio-driven, где вы подаёте свой готовый звук, модель не занимается синтезом речи вообще, она только двигает губы, а значит язык влияет намного меньше, чем при text-driven, где модель сама придумывает произношение.

---

## ПРОГРАММНЫЙ ДОСТУП И ПОДКЛЮЧЕНИЕ ДЛЯ ИИ-АГЕНТОВ: сводка

| Сервис | REST API (автоматизация) | Официальный MCP-сервер | Примечание |
|---|---|---|---|
| fal.ai | Есть (`queue.fal.run`, `fal.run`) | **Есть**, адрес `https://docs.fal.ai/mcp`, только чтение, поиск по документации | |
| Replicate | Есть (`api.replicate.com`) | **Есть**, адрес `https://mcp.replicate.com`, документация на replicate.com/docs/reference/mcp | |
| Higgsfield | Есть (`platform.higgsfield.ai`), библиотека Python, для JavaScript обещана | Нет (адреса отвечают ошибкой 404) | Адрес Speak в документации не описан |
| Kling, Kuaishou | Есть (`api-singapore.klingai.com`) | Нет | Документация закрыта входом в аккаунт |
| BytePlus ModelArk | Есть | Не найден | |
| Google (Gemini API и Vertex AI) | Есть | Не найден для генерации видео | |
| OpenAI (Sora) | Есть (`/v1/videos`) | Не найден для генерации видео | |
| Vozo AI | Только на тарифе Enterprise | Нет | Для обычных тарифов работа через сайт вручную |
| Lemon Slice | Есть, на всех самостоятельных тарифах | Нет | |
| Decart | Есть, плюс Realtime API | **Есть**, адрес `https://docs.platform.decart.ai/mcp` | Не продукт для липсинка |

Для нашей задачи это означает следующее: **автоматический конвейер на 60 роликов в месяц реально построить через fal.ai, Replicate, BytePlus, Google или OpenAI.** Higgsfield под вопросом, потому что нужный адрес не задокументирован. Vozo для самостоятельных тарифов не годится.

---

## ПРИКИДКА МЕСЯЧНОГО БЮДЖЕТА НА 60 РОЛИКОВ

Расчёт: 60 роликов в месяц по 10 секунд, а там где 10 секунд невозможно, по 8 секунд.

Со своим голосом (audio-driven), по 10 секунд:

| Вариант | В месяц |
|---|---|
| Wan 2.2 S2V на Replicate | **12,00 долларов** |
| Flashtalk на fal.ai | 12,00 долларов |
| Kling Speak 720p через Higgsfield, тариф Pro | **29,00 долларов** (60 роликов съедают ровно 600 кредитов, то есть весь пакет тарифа Pro) |
| Kling AI Avatar v2 Standard на Replicate | **33,60 доллара** |
| Kling AI Avatar v2 Standard на fal.ai | **33,72 доллара** |
| Wan 2.2 S2V 480p на fal.ai | 60,00 долларов |
| Kling AI Avatar v2 Pro на fal.ai | 69,00 долларов |
| OmniHuman 1.5 напрямую в BytePlus | 72,00 доллара |
| OmniHuman 1.5 на fal.ai или Replicate | 96,00 долларов |
| InfiniteTalk 480p на fal.ai | 120,00 долларов |
| Higgsfield Speak 2.0 | 1680 кредитов в месяц. Тарифа Ultimate (1200 кредитов) **не хватает**, нужен Creator за **250,00 долларов** либо докупка кредитов сверх Ultimate |

С речью от самой модели (text-driven), по 8 секунд:

| Вариант | В месяц |
|---|---|
| Veo 3.1 Lite 720p | **24,00 доллара** |
| Sora 2 в пакетном режиме | 24,00 доллара |
| Veo 3.1 Fast 720p | 48,00 долларов |
| Sora 2, 720x1280 | 48,00 долларов |
| Gemini Omni Flash 720p | примерно 48,00 долларов |
| Veo 3.1 Fast 1080p | 57,60 доллара |
| Sora 2 Pro 720p | 144,00 доллара |
| Veo 3.1 стандарт | 192,00 доллара |
| Sora 2 Pro 1080x1920 | 336,00 долларов |

Обратите внимание на важную деталь про Higgsfield Speak 2.0: пакета кредитов тарифа Ultimate за 49 долларов на 60 роликов **не хватит**, понадобится тариф Creator за 250 долларов. Это делает Speak 2.0 одним из самых дорогих вариантов именно на нашем объёме, хотя цена одного ролика (1,14 доллара) выглядела умеренной.

---

*Документ составлен 30.07.2026. Все цены и формулировки взяты с официальных страниц поставщиков, ссылки приведены рядом с каждым числом. Цены на такие сервисы меняются часто, перед закупкой имеет смысл перепроверить ключевые позиции по указанным ссылкам.*
