Главное про AI - Вадим Жартун
Русский язык в TTS и STT — отдельный рынок, с лидерами (Сбер, Яндекс, Silero), которых нет в глобальных обзорах. В работе с русской речью локальные модели стабильно выигрывают у глобальных.
СИЛЬНЫЕ СТОРОНЫ ГОЛОСОВОГО AI В 2026 ГОДУ
Транскрибация встреч и интервью: один час аудио превращается в текст за одну-две минуты обработки, качество распознавания русского — 95+ процентов для чистой речи. Озвучка обучающих видео и презентаций: десять минут аудио за пять минут, качество на уровне профессионального диктора. Озвучка IVR (интерактивного голосового меню) и автоответчиков: «живой» голос вместо робота, повышение удовлетворённости клиентов. Голосовые ассистенты в мобильных приложениях: GPT-4o realtime API позволяет говорить с AI голосом и с паузами. Локализация аудио: один актёр озвучивает на десять языков, нет необходимости в десяти переводчиках.
УЗКИЕ МЕСТА ГОЛОСОВОГО AI
Художественное озвучивание: AI не передаёт нюансы актёрской игры, для кино и аудиокниг нужен человек. Юридически значимые записи: расшифровка суда или допроса должна быть проверена человеком, ошибка в одном слове меняет смысл показаний. Шумная запись без шумоподавления: WER растёт до 25 процентов, и качество падает ниже приемлемого. Узкие диалекты и редкие языки: для языков с малым корпусом качество распознавания и синтеза ощутимо хуже, чем для русского и английского из таблиц выше — WER растёт, ударения сбиваются, имена собственные превращаются в кашу.
ГЕНЕРАЦИЯ ЗВУКА И МУЗЫКИ: НОВЫЙ ИНСТРУМЕНТ САУНД-ДИЗАЙНА
Речь и музыка — разные задачи. Речь требует интонации, пауз, эмоций; музыка требует структуры (куплет, припев, бридж), ритма, гармонии. Модели 2026 года закрывают оба класса задач на уровне «достаточно для офиса».
Suno за 2024–2025 годы прошёл три заметных релиза (по пресс-релизам Suno). Suno v4 (конец 2024) поднял планку по качеству вокала и увеличил максимальную длину композиции до четырёх минут. v4.5 (начало 2025) добавил режим «Covers» — возможность загрузить свой трек и попросить модель сделать его в другом жанре — плюс улучшил разборчивость слов в припевах. v5 (осень 2025) дал самый заметный скачок: вокалисты перестали звучать «роботизированно», сведение стало напоминать работу звукоинженера, тексты песен реже уезжают в абсурд.
В деньгах: апрельский обзор Chartlex (2026) оценивает Suno в $2.45 млрд с годовой выручкой около $300 млн и двумя миллионами платных подписчиков. Это уже не эксперимент, а индустрия. Если нужен фоновый трек на шестьдесят секунд для корпоративного видео, Suno закроет задачу за две минуты — и это самая быстрая ниша, где AI-музыка реально заменила стоковые библиотеки.
Udio — конкурент Suno по качеству, а по обзорам AI-музыки 2025–2026 годов он сильнее в длинных композициях и в жанровом разнообразии. Модель умеет «расширять» сгенерированный фрагмент до полного трека — у Suno это работает хуже.
Meta MusicGen и AudioCraft — это альтернативы с открытым исходным кодом. MusicGen обучен на двадцати тысячам часов лицензированной музыки, в основном из внутренних датасетов Meta и Shutterstock. Это принципиальное отличие от Suno и Udio, чьи тренировочные данные стали предметом судебных исков. Лицензия: код открыт под MIT, веса моделей — под собственной лицензией Meta, разрешающей коммерческое использование. MusicGen работает без вокала, идеален для фоновых треков и джинглов. AudioCraft — экосистема: MusicGen плюс AudioGen (звуковые эффекты по описанию, например «дождь по жестяной крыше») плюс EnCodec (кодек для сжатия звука нейросетью). Качество ниже Suno и Udio, но достаточно для подкастов, видеороликов, фоновой музыки на сайте.
Stable Audio (Stability AI) — коммерческая лицензия, генерация до девяноста секунд за раз. Хорош для длинных фоновых треков и саундскейпов.
Юридическая сторона AI-музыки в 2026 году — серая зона с одним большим исключением. В июне 2024 года RIAA (Американская ассоциация звукозаписывающих компаний) от имени Sony Music, Universal Music Group и Warner Music Group подала иски против Suno и Udio за обучение на защищённых копирайтом фонограммах без лицензий — от Мэрайи Кэри (Mariah Carey) до Чака Берри (Chuck Berry). По данным Business Insider (июнь 2024), в иске запрашивалось до $150 000 за каждую из предположительно нарушенных композиций, что давало потенциальную сумму ущерба до $1.65 млрд по каждому ответчику.
В октябре 2025 года Universal Music Group объявила об урегулировании спора с Udio, 25 ноября 2025 года Warner Music Group урегулировала спор с Suno. На ноябрь 2025 года единственным мейджором, оставшимся в суде, оставалась Sony. Forbes (декабрь 2025) формулирует это так: «Запусти, обучи, урегулируй» — модель, при которой стартап сначала обучает на чужом контенте, выходит на рынок, а потом договаривается с правообладателями задним числом.
Практический вывод: для внутреннего использования (корпоративное видео, подкаст) AI-музыка сегодня безопасна. Для коммерческого релиза (песня на Spotify, реклама на ТВ) нужен юридический обзор и резервный план. Юридическая чистота конкретного трека зависит от текущей лицензии конкретного сервиса, а не от того, что «AI-генерация легальна по определению».
Пять сценариев AI-звука с конкретным эффектом:
1: Фоновая музыка для подкаста — MusicGen или Suno (инструментал). Тридцать минут аудио за пять минут генерации, от $0 до $10.
2: Джингл для бренда (5–10 секунд) — Suno или Stable Audio. Бренд-айдентика в звуке, десять вариантов за час.
3: Песня для промо-ролика — Suno v4/v5 или Udio. Двухминутный трек с вокалом, $0.50–2.
4: Звуковые эффекты (дождь, шаги, фон офиса) — AudioGen. Реалистичные эффекты по текстовому описанию.
5: Саундскейп для медитации или ASMR — Stable Audio. Длинные атмосферные треки, коммерческая лицензия.
ГЕНЕРАЦИЯ ВИДЕО
Генерация видео в 2026 году — самая быстрорастущая часть специальных моделей и самая дорогая. Ключевые игроки: Sora 2 (OpenAI, выпуск 30 сентября 2025; синхронизированный звук и физически корректное движение), Veo 3.1 (Google, лето 2025), Runway Gen-3 Alpha и Gen-4 (Runway, 2024–2025), Kling 2.0/2.1 (Kuaishou, 2025), Pika 2.0 (Pika, 2025), Luma Dream Machine (Luma Labs, 2025). Gen-3 Alpha (лето 2024) дал резкий скачок в качестве движения и физики, Gen-4 (весна 2025) сделал первую попытку длинного нарратива с контролируемой стилистикой. По оценкам обзоров (Genesys Growth, февраль 2026), Runway остаётся лидером по контролю: камера, движение, стиль, монтаж. Для задачи «сделать десять вариантов рекламного ролика для A/B-теста» Runway — рабочий инструмент: можно задать раскадровку, указать движение камеры, получить предсказуемый результат.
26 апреля 2026 года OpenAI закрыла потребительское приложение Sora,