Veo 3 нейросеть: чья разработка, возможности, доступ в России и сравнение с конкурентами

Veo 3 — нейросеть Google DeepMind для генерации видео с синхронным звуком. Разбираем, чья это модель, как работает, где доступна, как пользоваться из России, сравниваем с Sora и другими.

Что такое Veo 3 и кто её создал

Veo 3 — это нейросеть третьего поколения для генерации видео, разработанная подразделением Google DeepMind. Анонс состоялся 20 мая 2025 года на конференции Google I/O. Модель позиционируется как инструмент профессионального уровня для создания коротких видеороликов с синхронизированным звуком: диалогами, музыкой и звуковыми эффектами.

В отличие от предыдущих версий (Veo и Veo 2), которые генерировали только немое видео, Veo 3 нативно создаёт аудиодорожку. Это стало возможным благодаря интеграции технологий Lyria (для музыки) и Chirp (для голоса). Модель использует диффузионно-трансформерную архитектуру, что позволяет достигать высокой детализации изображения и реалистичной физики движения.

Google DeepMind — это исследовательское подразделение Alphabet, известное такими проектами, как AlphaGo, AlphaFold и Gemini. Veo 3 является частью экосистемы Gemini и доступна через приложение Gemini, платформу Flow и облачный сервис Vertex AI.

Ключевые возможности Veo 3

Главная особенность Veo 3 — генерация видео с синхронным звуком. Модель создаёт диалоги, звуковые эффекты и фоновую музыку прямо из текстового описания, без необходимости отдельного монтажа. Это первая модель такого уровня, которая делает это нативно.

Другие важные возможности:

  • Разрешение до 4K — в профессиональном инструменте Flow, в стандартном режиме — до 1080p.
  • Длительность роликов — до 8 секунд за одну генерацию.
  • Управление камерой — поддержка кинематографических команд: «drone shot», «close-up», «tracking shot», «slow zoom».
  • Форматы — 16:9, 9:16, 1:1 для YouTube, TikTok и Instagram.
  • Lip-sync — автоматическая синхронизация движений губ с речью персонажей.
  • Многоязычность — озвучка на разных языках, включая русский, при этом промты пишутся на английском.
  • Понимание контекста — точность выполнения промтов достигает 80–90%, что выше, чем у конкурентов.
  • Реалистичная физика — корректное моделирование движений тканей, воды, дыма, а также правильная анатомия (руки с пятью пальцами).

Также Veo 3 поддерживает несколько режимов генерации: Text to Video (по тексту), Frames to Video (по начальному и конечному кадру) и Ingredients to Video (по референсным изображениям).

Как работает Veo 3: архитектура и принципы

Veo 3 построена на диффузионно-трансформерной архитектуре. Это означает, что модель сначала создаёт «шумное» изображение, а затем постепенно «очищает» его, превращая в финальный видеоряд. Трансформеры отвечают за понимание контекста промта и связывание элементов сцены.

Звук генерируется параллельно с видео, а не добавляется постфактум. Это ключевое отличие от конкурентов, которые часто используют отдельные модели для озвучки. Благодаря этому достигается точная синхронизация губ с речью и естественное звуковое сопровождение.

Модель обучена на огромном массиве видеоданных с субтитрами и аудиодорожками, что позволяет ей понимать не только визуальные сцены, но и эмоциональную окраску, интонации и звуковые эффекты.

Важно отметить, что Veo 3 использует водяной знак SynthID, который невидим для человеческого глаза, но позволяет идентифицировать контент как сгенерированный ИИ. Это часть политики Google по борьбе с дезинформацией.

Где доступна Veo 3 и как получить к ней доступ

Официально Veo 3 доступна только в США и примерно в 70 других странах. Россия, Беларусь, Великобритания и большинство стран Европейского союза в список не входят. Google применяет геоблокировку по IP-адресу и не принимает платежи с российских карт.

Тем не менее, существуют легальные и полулегальные способы доступа:

  1. Приложение Gemini — самый простой способ. Требуется подписка Google AI Pro (19,99 доллара в месяц) или Ultra (249,99 доллара). В тарифе Pro даётся 10 бесплатных генераций Veo 3 (разово, не ежемесячно), после чего система переключается на Veo 2.
  1. Google Flow — профессиональная платформа для ИИ-кинематографа. В тарифе Pro доступно 100 генераций в месяц, в Ultra — без ограничений. Flow предлагает расширенные функции: Camera Controls, Scenebuilder, Asset Management, Flow TV.
  1. Canva — интеграция Veo 3 в популярный сервис дизайна. Доступно 5 генераций в месяц для платных пользователей.
  1. Perplexity AI в X (Twitter) — полностью бесплатный способ. Нужно написать твит с упоминанием @AskPerplexity и описанием видео, бот сгенерирует ролик.
  1. Google Cloud Vertex AI — для разработчиков. Новые пользователи получают 300 долларов бесплатных кредитов на 90 дней. Стоимость — примерно 0,35 доллара за секунду видео.
  1. Сторонние платформы — Pollo AI, Veo3.ai, Replicate, а также российский сервис BotHub, который предоставляет доступ к Veo 3 без VPN.

Сравнение Veo 3 с конкурентами: Sora, Kling AI, Adobe Firefly

Veo 3 — не единственная нейросеть для генерации видео, но она выделяется на фоне конкурентов. Рассмотрим основные отличия.

Sora от OpenAI — главный конкурент. Sora также умеет генерировать видео по тексту, но на момент выхода Veo 3 не поддерживала нативную генерацию звука. Кроме того, Sora имеет ограничения по длительности и разрешению (обычно до 1080p). Veo 3 выигрывает за счёт аудио и более точного понимания промтов.

Kling AI — китайская модель, известная реалистичной физикой и хорошей детализацией. Однако Kling не генерирует звук и имеет меньше кинематографических функций. Veo 3 предлагает более широкий набор инструментов для профессиональной работы.

Adobe Firefly — интегрирован в экосистему Adobe, но его видео-генерация менее продвинута. Firefly ориентирован на дизайнеров, а не на кинематографистов, и не поддерживает сложные сцены с диалогами.

Veo 2 — предыдущая версия от Google. Veo 3 значительно превосходит её по качеству звука, разрешению и точности выполнения промтов. Veo 2 остаётся доступной как запасной вариант в подписке Gemini.

В целом, Veo 3 считается эталоном в области генерации видео с аудио, но уступает конкурентам в доступности (географические ограничения) и цене.

Практические примеры использования Veo 3

Veo 3 уже используется в реальных проектах. Например, компания Jellyfish (часть холдинга The Brandtech Group) интегрировала Veo в свою ИИ-платформу Pencil и применяет её в рекламных кампаниях. Совместно с Japan Airlines Jellyfish создала бортовые развлечения, полностью сгенерированные Veo 3.

Пользователи активно создают:

  • Интервью и влоги — модель генерирует говорящих персонажей с реалистичной мимикой.
  • Экшн-сцены — корректная физика и звуковое сопровождение.
  • Геймплейные видео — ролики в стиле современных игр, включая нейро-стримеров.
  • ASMR-контент — шепот, звуки природы, высокая точность аудио.
  • Рекламные ролики — от продуктовых до имиджевых.

Пример промта для Veo 3: «An elderly woman in a floral headscarf and oversized sunglasses, confidently walking through a typical Soviet courtyard with cracked asphalt and rusty playground swings. She is holding two leashes: on the left a giant brown bear, on the right a heavy gray rhinoceros. Both animals wear hanging wooden signs — the rhino’s says “Review”, the bear’s says “of Veo 3”. The mood is epic and surreal. Cinematic wide shot, morning light, dramatic atmosphere, in the style of a 90s action movie trailer. Camera: slow dolly zoom forward. Sound: tense orchestral music with heavy drums, animals breathing, distant echo of city sounds.»

Результат получается кинематографичным, хотя возможны мелкие артефакты (например, ремень, сливающийся с шерстью медведя).

Как правильно писать промты для Veo 3

Качество результата напрямую зависит от детализации промта. Veo 3 понимает английский язык лучше, чем русский, поэтому промты рекомендуется писать на английском.

Структура эффективного промта:

  1. Персонажи — возраст, пол, внешность, одежда, эмоции. Пример: «A young woman with short red hair, wearing a grey hoodie, looking anxious».
  1. Действие — что происходит, движения, жесты, взаимодействие. Пример: «She walks slowly across a rainy street, then picks up a ringing phone».
  1. Локация — место, время суток, погода, детали. Пример: «At a crowded metro station, in a foggy forest at dawn, inside a dimly lit diner».
  1. Атмосфера — освещение, фоновая музыка, реплики, эмоции. Пример: «Soft piano music in the background, the sound of rain and distant traffic, she says: “I’m not coming back.”»
  1. Камера — тип кадра, движение. Пример: «The camera slowly zooms in, shaky handheld close-up».
  1. Стиль — жанр, эпоха, эстетика. Пример: «In the style of a 90s action movie, anime aesthetic, film noir lighting».

Собирайте промт как короткий сценарий: персонажи → действие → место → атмосфера → ракурс → стиль. Чем больше конкретных деталей, тем точнее результат.

Ограничения и недостатки Veo 3

Несмотря на впечатляющие возможности, Veo 3 имеет существенные ограничения:

  • Максимальная длительность — 8 секунд. Для полноценного контента приходится склеивать несколько роликов.
  • Высокая стоимость — подписка Ultra стоит 250 долларов в месяц (примерно 125 роликов). В пересчёте на один ролик — 150–190 рублей.
  • Географические ограничения — официально недоступна в России, Беларуси, ЕС и Великобритании. Требуется VPN и зарубежные аккаунты.
  • Нестабильность персонажей — при генерации разных сцен один и тот же персонаж может выглядеть по-разному.
  • Ежедневные лимиты — зависят от тарифа. В Flow — 12 500 кредитов, одна генерация стоит 150 кредитов.
  • Блокировка контента — запрещены промты с известными личностями, политиками, насилием и explicit-контентом.
  • Технические сбои — иногда видео генерируется без звука, требуется повторная генерация.
  • Проблемы с текстом — нейросеть допускает ошибки при отображении текстовых элементов в кадре.
  • Многоперсонажные сцены — возможна путаница реплик между персонажами.

Эти ограничения важно учитывать при планировании проектов.

Будущее Veo 3 и развитие генеративного видео

Google продолжает развивать линейку Veo. Руководитель команды Gemini Джош Вудворд обещал постепенное расширение географии сервиса, но точных сроков нет. Ожидается, что в будущих версиях будут увеличены длительность роликов, улучшена стабильность персонажей и добавлена поддержка более сложных сценариев.

Veo 3 уже оказала влияние на индустрию: рекламные агентства, кинематографисты и маркетологи активно внедряют ИИ-генерацию в свои рабочие процессы. Пример с Japan Airlines показывает, что технология готова к коммерческому использованию.

Однако остаются вопросы этики и регулирования. Водяной знак SynthID помогает бороться с дезинформацией, но не решает проблему авторских прав и использования изображений реальных людей. Google блокирует промты с известными личностями, но это ограничение можно обойти.

В целом, Veo 3 — это значительный шаг вперёд, и можно ожидать, что конкуренты (Sora, Kling, Firefly) будут догонять Google в ближайшие годы.

Вопросы и ответы

Veo 3 — чья нейросеть?

Veo 3 разработана Google DeepMind, исследовательским подразделением Alphabet. Она является частью экосистемы Gemini и доступна через приложение Gemini, платформу Flow и облачный сервис Vertex AI.

Можно ли пользоваться Veo 3 в России?

Официально нет. Google ограничила доступ к Veo 3 территорией США и примерно 70 других стран, исключив Россию, Беларусь и большинство стран ЕС. Однако существуют обходные пути: использование VPN с американским IP, сторонние платформы (Pollo AI, BotHub, Replicate) или бесплатный способ через Perplexity AI в X (Twitter).

Сколько стоит Veo 3?

Стоимость зависит от способа доступа. Подписка Google AI Pro — 19,99 доллара в месяц (10 бесплатных генераций Veo 3), Ultra — 249,99 доллара (без ограничений). В Google Cloud Vertex AI — около 0,35 доллара за секунду видео. Canva предоставляет 5 генераций в месяц для платных пользователей. Perplexity AI в X — бесплатно.

Какая максимальная длительность видео в Veo 3?

Максимальная длительность одного ролика — 8 секунд. Для создания более длинного контента необходимо генерировать несколько клипов и склеивать их в видеоредакторе.

Умеет ли Veo 3 генерировать звук?

Да, это ключевая особенность Veo 3. Модель нативно создаёт синхронизированное аудио: диалоги, звуковые эффекты и фоновую музыку. Это первая модель такого уровня, которая делает это без дополнительной обработки.

Чем Veo 3 отличается от Sora от OpenAI?

Veo 3 поддерживает генерацию звука, разрешение до 4K и более точное понимание промтов (80–90%). Sora на момент выхода Veo 3 не имела нативной аудиогенерации и ограничивалась 1080p. Также Veo 3 предлагает больше кинематографических функций, таких как управление камерой и lip-sync.

Какие есть бесплатные способы попробовать Veo 3?

Бесплатные способы: Perplexity AI в X (Twitter) — напишите твит с @AskPerplexity и описанием видео; Google Cloud Vertex AI — 300 долларов бесплатных кредитов для новых пользователей; студенческая программа Google — 15 месяцев бесплатного доступа к AI Premium. Также в подписке Gemini Pro даётся 10 бесплатных генераций Veo 3.