# GenVoice > GenVoice — российская платформа для нейросетевого синтеза речи (TTS), клонирования голоса и распознавания речи (ASR). Превращает текст в естественную речь на русском и английском языках. Используется для озвучки видео, подкастов, аудиокниг, IVR, рекламы и e-commerce. Поддерживает озвучку диалогов несколькими голосами, озвучку текстовых файлов целиком и Realtime API для синтеза речи в реальном времени. - Сайт: https://genvoice.ru - Веб-приложение: https://app.genvoice.ru - API-документация: https://docs.genvoice.ru - Тарифы: https://genvoice.ru/pricing - Telegram: https://t.me/genvoice_ru ## Ключевые факты - Клонирование голоса по образцу от 3 секунд - TTS: базовая ставка 5 ₽ за 1000 символов; эффективная цена от 3.00 ₽ за 1000 символов - Гибкая оплата российскими картами: подписки с бонусным балансом или покупка несгораемых кредитов от 200 ₽ - REST API для разработчиков (docs.genvoice.ru) - Realtime API (WebSocket) — синтез речи в реальном времени с низкой задержкой - Озвучка диалогов несколькими голосами (подкасты, интервью, сценарии) - Озвучка текстовых файлов целиком (.txt) одним голосом - Распознавание речи (ASR): базовая ставка 2 ₽/мин, эффективная цена от 1 ₽/мин, точность выше 95% - Очистка аудио от шума (denoise): базовая ставка 2 ₽/мин, эффективная цена от 1 ₽/мин - Языки: русский и английский - 12 форматов аудио: MP3, WAV, PCM, Opus, µ-law, A-law ## Для кого - **Авторы контента** — озвучка видео, подкастов и аудиокниг без записи в студии - **Бизнес и бренды** — озвучка корпоративных видео, рекламы и IVR без дикторов - **Разработчики** — интеграция синтеза речи через REST API - **Образование и e-commerce** — озвучка онлайн-курсов, обучающих материалов и карточек товаров ## Возможности - **Синтез речи (TTS)** — генерация речи из текста с естественной интонацией - **Клонирование голоса** — создание цифровой копии голоса по аудиообразцу от 3 секунд - **Библиотека голосов** — коллекция готовых голосов для озвучки - **Озвучка диалогов** — синтез сценариев несколькими голосами в формате «Спикер: текст». Подходит для подкастов, интервью и диалогов. На выходе — единый аудиофайл с разными голосами и паузами между репликами. Биллинг как у обычного синтеза (по сумме символов всех реплик) - **Озвучка файлов** — загрузка текстового файла (.txt) и озвучка его целиком одним голосом. Доступна с тарифа Старт: до 20 тыс. символов на Старте, до 100 тыс. на Базовом, до 500 тыс. на Продвинутом - **Realtime API** — синтез речи в реальном времени через WebSocket. Текст передаётся потоково (слово за словом, как от LLM), аудио возвращается чанками (~200 мс) по мере генерации. Поддерживает мгновенное прерывание, форматы µ-law/A-law (8 kHz) для телефонии. Для голосовых ботов, IVR и стриминга от языковых моделей - **Распознавание речи (ASR)** — преобразование аудио в текст с автопунктуацией - **Быстрая обработка** — результат за секунды благодаря GPU-ускорению - **Мультиязычность** — русский и английский с высокоточным произношением - **Telegram-бот для озвучки** — текст в голос готовым или собственным тембром прямо в чате - **Telegram-бот для расшифровки** — голосовые сообщения и видеокружки в текст в личке, группах и Guest Mode ## Специализированные инструменты - [Озвучка английского текста](https://genvoice.ru/ozvuchka-teksta-na-anglijskom) — выбор английского голоса, проверка произношения и скачивание MP3/WAV - [Telegram-бот для озвучки текста](https://genvoice.ru/telegram-bot-ozvuchka-teksta) — текст в голос готовым или собственным тембром без выхода из Telegram - [Бот для расшифровки голосовых](https://genvoice.ru/bot-dlya-rasshifrovki-golosovyh) — бесплатный перевод голосовых сообщений и видеокружков в текст без Telegram Premium - [MP3 в текст](https://genvoice.ru/mp3-v-tekst) — загрузка MP3, распознавание речи, пословные таймкоды и экспорт TXT/SRT/VTT - [Голосовое сообщение в текст](https://genvoice.ru/golosovoe-soobshchenie-v-tekst) — расшифровка сохранённых голосовых из Telegram, WhatsApp и VK без доступа к чатам ## Тарифы Платные подписки ежемесячно начисляют баланс с бонусом; неизрасходованный остаток переносится в пределах двух месячных квот. Отдельно можно купить несгораемые кредиты на сумму от 200 ₽ и пользоваться им без платной подписки или сверх её лимита. При оплате подписки за год два месяца предоставляются в подарок: Старт — 1 990 ₽/год, Базовый — 4 990 ₽/год, Продвинутый — 14 990 ₽/год, Проект — 50 000 ₽/год, Команда — 100 000 ₽/год, Масштаб — 200 000 ₽/год. | Тариф | Цена подписки | Баланс каждый месяц | Синтез речи | Клонирование | Символов/запрос | Использование | |-------|------|--------|-------------|-------------|-----------------|---------------| | Бесплатный | 0 ₽ | 10 ₽ каждый месяц (первое начисление — сразу после регистрации) (~2 000 символов) | Да | Да (1 голос) | 500 | Личное | | Старт | 199 ₽/мес | 210 ₽ (~42 тыс. символов) | Да | Да (2 голоса) | 1 000 | Коммерческое | | Базовый | 499 ₽/мес | 550 ₽ (~110 тыс. символов) | Да | Да (5 голосов) | 2 000 | Коммерческое | | Продвинутый | 1 499 ₽/мес | 1 800 ₽ (~360 тыс. символов) | Да | Да (10 голосов) | 5 000 | Коммерческое | | Проект | 5 000 ₽/мес | 6 250 ₽ (~1,25 млн символов) | Да | Да (15 голосов) | 5 000 | Коммерческое | | Команда | 10 000 ₽/мес | 13 000 ₽ (~2,6 млн символов) | Да | Да (20 голосов) | 5 000 | Коммерческое | | Масштаб | 20 000 ₽/мес | 27 800 ₽ (~5,56 млн символов) | Да | Да (30 голосов) | 5 000 | Коммерческое | Стоимость синтеза: базовая ставка 5.00 ₽ за 1000 символов (модель GENVOICE), эффективная цена с учётом бонусного баланса — от 3.00 ₽. Стоимость транскрибации: базовая ставка 2 ₽ за минуту аудио, эффективная цена с учётом бонусного баланса — от 1 ₽. Стоимость очистки аудио от шума: базовая ставка 2 ₽ за минуту аудио, эффективная цена с учётом бонусного баланса — от 1 ₽. Если весь доступный баланс потратить только на одну операцию, его хватит примерно на: | Тариф | Синтез речи | Распознавание или denoise | |-------|-------------|---------------------------| | Бесплатный | 2 000 символов каждый месяц (первое начисление — сразу после регистрации) | 5 минут каждый месяц (первое начисление — сразу после регистрации) | | Старт | 42 000 символов в месяц | 1 ч 45 мин в месяц | | Базовый | 110 000 символов в месяц | 4 ч 35 мин в месяц | | Продвинутый | 360 000 символов в месяц | 15 ч в месяц | | Проект | 1 250 000 символов в месяц | 52 ч 5 мин в месяц | | Команда | 2 600 000 символов в месяц | 108 ч 20 мин в месяц | | Масштаб | 5 560 000 символов в месяц | 231 ч 40 мин в месяц | Баланс общий для всех операций: объёмы синтеза и длительность распознавания или denoise — альтернативные варианты расходования, а не суммируемые лимиты. ## Сравнение с конкурентами | Критерий | GenVoice | Zvukogram | ElevenLabs | Robivox | Яндекс SpeechKit | |----------|----------|-----------|------------|---------|-------------------| | Цена за 1000 символов | от 3.00 ₽ (годовой «Масштаб») | 5 ₽ | ~16-18 ₽ | 6.5 ₽ | ~1.32 ₽ | | Клонирование голоса | Мгновенно (10 сек) | Нет | Мгновенно | Нет | Нет (только Brand Voice) | | Тип оплаты | Подписка или покупка несгораемых кредитов | Токены | Подписка (сгорает) | Подписка / Тарифы | Постоплата (Облако) | | Оплата картами РФ | Да | Да | Нет | Да | Да | ## Как начать 1. Зарегистрируйтесь на app.genvoice.ru — бесплатный тариф даёт 10 ₽ на баланс каждый месяц 2. Выберите голос из библиотеки или клонируйте свой (от тарифа Старт) 3. Введите текст и нажмите «Синтезировать» 4. Скачайте результат в формате WAV/MP3 ## FAQ **Что такое GenVoice?** GenVoice — это онлайн-платформа для нейросетевого синтеза речи и клонирования голоса. Сервис превращает текст в естественную речь на русском и английском языках. **Сколько стоит синтез речи в GenVoice?** GenVoice предлагает бесплатный тариф с 10 ₽ каждый месяц (первое начисление — сразу после регистрации) и шесть подписок: Старт за 199 ₽/мес, Базовый за 499 ₽/мес, Продвинутый за 1 499 ₽/мес, Проект за 5 000 ₽/мес, Команда за 10 000 ₽/мес и Масштаб за 20 000 ₽/мес. Подписки начисляют от 210 ₽ до 27 800 ₽ бонусного баланса каждый месяц; остаток переносится в пределах двух месячных квот. Вместо подписки можно выбрать покупку кредитов от 200 ₽ — купленные кредиты не сгорают. **Как клонировать голос?** Загрузите аудиообразец голоса от 3 секунд, и GenVoice создаст цифровую копию. После этого вы сможете озвучивать любые тексты этим голосом. **Какие языки поддерживает GenVoice?** GenVoice нативно поддерживает русский и английский языки с высокоточным произношением и естественной интонацией. **Можно ли использовать GenVoice для коммерческих проектов?** Да, все платные тарифы включают коммерческую лицензию. Вы можете использовать синтезированную речь для YouTube, рекламы, подкастов, IVR и других коммерческих целей. **Есть ли API для разработчиков?** Да, GenVoice предоставляет REST API для интеграции синтеза речи в приложения, игры и сервисы. Документация доступна на docs.genvoice.ru. **Что такое Realtime API?** Realtime API — это синтез речи в реальном времени через WebSocket. Текст можно отправлять потоково (слово за словом, как от языковой модели), а аудио возвращается небольшими чанками (~200 мс) по мере генерации. Поддерживается мгновенное прерывание синтеза и форматы µ-law/A-law (8 kHz) для телефонии. Подходит для голосовых ботов, IVR и стриминга от LLM. Документация: docs.genvoice.ru/realtime/. **Можно ли озвучить диалог несколькими голосами?** Да. В разделе «Диалог» веб-приложения вы пишете сценарий в формате «Спикер: текст», назначаете каждому спикеру свой голос и получаете единый аудиофайл с разными голосами и паузами между репликами. Стоимость считается как у обычного синтеза — по сумме символов всех реплик. **Можно ли озвучить текстовый файл целиком?** Да. В разделе «Озвучить файл» загрузите .txt файл и озвучьте его целиком одним голосом. Функция доступна с тарифа Старт: до 20 тыс. символов на Старте, до 100 тыс. на Базовом и до 500 тыс. на Продвинутом. --- ## Блог ### Как озвучить текст нейросетью — пошаговая инструкция 2026 Источник: https://genvoice.ru/blog/kak-ozvuchit-tekst-nejrosetyu Вам нужно озвучить ролик, курс или презентацию, а бюджета на диктора нет? Или, может, вы просто не хотите тратить неделю на запись и монтаж? Нейросетевая озвучка решает обе проблемы: вставляете текст, нажимаете кнопку и через несколько секунд получаете аудиофайл с естественной интонацией. #### Что такое нейросетевая озвучка и почему она звучит как живой человек Современные нейросети работают принципиально иначе, чем старые TTS-движки. Модель не «склеивает» куски — она генерирует речь с нуля, опираясь на контекст всего предложения. Поэтому интонации получаются живыми: голос поднимается на вопросах, делает логические паузы перед важными мыслями и не «спотыкается» на длинных словах. Две ключевые технологии: - **Синтез по тексту** — модель берёт ваш текст и озвучивает его выбранным голосом. Можно использовать готовые голоса из библиотеки. - **Клонирование голоса** — загружаете образец своего голоса (достаточно 10 секунд), и нейросеть учится говорить вашим голосом. #### Где это реально используют: 5 сценариев 1. **YouTube и короткие видео** — ютуберы и авторы Shorts/Reels используют нейросетевую озвучку, когда не хотят записывать голос сами. 2. **Онлайн-курсы и обучающие материалы** — создатели курсов на Stepik, GetCourse озвучивают уроки нейросетью. Особенно удобно, когда текст часто обновляется. 3. **Подкасты** — новостные дайджесты, обзоры статей, пересказы. Особенно с клонированием своего голоса. 4. **Аудиокниги** — для самиздата это спасение: профессиональный диктор стоит от 5 000 ₽ за час записи, а нейросеть обойдётся в десятки рублей. 5. **Корпоративный контент** — внутренние инструкции, презентации для клиентов, FAQ и обучающие ролики. #### Как озвучить текст в GenVoice: пошаговая инструкция 1. **Регистрация** — заходите на app.genvoice.ru и создаёте аккаунт. Бесплатный тариф даёт 10 ₽ на баланс каждый месяц; первое начисление приходит сразу. 2. **Выберите голос** — публичные голоса из библиотеки или клонированный свой (от тарифа Старт). 3. **Вставьте текст** — на бесплатном тарифе лимит 500 символов, на Старт 1 000, на Базовом 2 000, на Продвинутом 5 000. 4. **Нажмите «Синтезировать»** — через несколько секунд аудиофайл готов. Можно прослушать или скачать в WAV/MP3. #### 6 советов для лучшей озвучки 1. Пишите «для уха», а не «для глаза» — короткие предложения, простые конструкции. 2. Расставляйте знаки препинания осмысленно — нейросеть ориентируется на пунктуацию для пауз. 3. Числа и сокращения — словами. Вместо «15 ₽» пишите «пятнадцать рублей». 4. Не перегружайте один запрос — озвучивайте по абзацам. 5. Пробуйте разные голоса — один текст может звучать по-разному. 6. Проверяйте ударения — знак `+` перед ударной гласной: `зам+ок`. #### Нейросеть vs живой диктор | Критерий | Нейросеть | Живой диктор | |---|---|---| | Стоимость | 3–5 ₽ за 1000 символов | 500–3 000 ₽ за минуту | | Скорость | Секунды | Дни–недели | | Правки | Бесплатно, мгновенно | Повторная запись, доплата | | Эмоции | Хорошие, но предсказуемые | Полный диапазон | | Масштаб | Любой объём | Ограничен | Нейросеть лучше для: большого объёма текста, частых правок, ограниченного бюджета, срочности. Живой диктор лучше для: эмоционально сложного контента, бренд-голоса, высочайших требований к качеству. #### FAQ по озвучке **Можно ли использовать озвучку в коммерческих целях?** Да, на тарифах Старт, Базовый и Продвинутый. **Какие языки поддерживаются?** Русский и английский. **Можно ли клонировать чужой голос?** Технически да, но использовать чужой голос без согласия неэтично. Рекомендуем клонировать только свой голос. **Что делать, если нейросеть неправильно произносит слово?** Поставьте знак `+` перед ударной гласной: `зам+ок`. **Есть ли API?** Да, API доступен на всех тарифах. Документация на docs.genvoice.ru. --- ### Транскрибация аудио в текст онлайн — инструкция и обзор сервисов 2026 Источник: https://genvoice.ru/blog/transkribaciya-audio-v-tekst Транскрибация — это перевод устной речи в письменный текст. Раньше час записи превращался в 4–6 часов ручной работы. Нейросеть делает то же самое за пару минут. #### Кому нужна транскрибация - Журналисты и редакторы — расшифровка интервью, пресс-конференций - Студенты и учёные — конспекты лекций, расшифровка фокус-групп - Подкастеры и блогеры — текстовые версии выпусков для SEO - Бизнес — протоколы совещаний, расшифровка звонков - Юристы — расшифровка судебных заседаний, показаний #### ТОП-5 сервисов транскрибации в России | Сервис | Цена за минуту | Русский язык | Автопунктуация | Простота | |---|---:|---|---|---| | GenVoice ASR | 2 ₽ базовая / от 1 ₽ эффективная | Оптимизирован | Да | Веб-интерфейс | | Яндекс SpeechKit | 6–10 ₽ | Да | Да | Нужен Yandex Cloud | | Whisper (self-hosted) | Бесплатно / ~6 ₽ | Да | Да | Нужна установка | | Звукограм | 2–3 ₽ | Да | Да | Веб-интерфейс | | AssemblyAI | ~15 ₽ | Ограниченно | Да | Только API | #### Как транскрибировать аудио в GenVoice 1. Зарегистрируйтесь на app.genvoice.ru — бесплатный тариф даёт 10 ₽ каждый месяц (~5 мин транскрибации) 2. Откройте раздел «Распознавание речи» 3. Загрузите аудио- или видеофайл (в web лимит зависит от тарифа: от 500 МБ / 30 мин до 8 ГБ / 8 ч) 4. Нажмите «Распознать» — обычно меньше минуты 5. Получите текст с автопунктуацией и нормализацией чисел #### Стоимость транскрибации | Задача | Длительность | Стоимость в GenVoice | Ручная расшифровка | |---|---:|---:|---:| | Расшифровка интервью | 30 мин | от 30 ₽ | 500–1 500 ₽ | | Конспект лекции | 1,5 часа | от 90 ₽ | 2 000–4 000 ₽ | | Протокол совещания | 1 час | от 60 ₽ | 1 500–3 000 ₽ | | Расшифровка подкаста | 45 мин | от 45 ₽ | 800–2 000 ₽ | Подписки ежемесячно начисляют общий баланс для синтеза, распознавания и denoise: Старт 199 ₽/мес — 210 ₽ (до 1 ч 45 мин), Базовый 499 ₽/мес — 550 ₽ (до 4 ч 35 мин), Продвинутый 1 499 ₽/мес — 1 800 ₽ (до 15 ч), Проект 5 000 ₽/мес — 6 250 ₽, Команда 10 000 ₽/мес — 13 000 ₽, Масштаб 20 000 ₽/мес — 27 800 ₽. Для оплаты без подписки доступна покупка кредитов от 200 ₽. #### FAQ по транскрибации **Какие форматы аудио поддерживаются?** MP3, WAV, OGG, M4A, FLAC, AAC, WebM, а также распространённые видеоконтейнеры. В веб-интерфейсе тарифные лимиты растут от 500 МБ / 30 минут до 8 ГБ / 8 часов. Прямой публичный ASR API сохраняет транспортный предел 200 МБ, а длительность зависит от тарифа. Разделение говорящих доступно в пределах максимальной длительности ASR-файла тарифа. **Насколько точно распознаётся речь?** На чистых записях с одним спикером — выше 95%. С фоновым шумом — 85–90%. **Поддерживается ли английский язык?** Сейчас GenVoice ASR оптимизирован для русского. Английский в планах. **Можно ли транскрибировать видео?** Да, загрузите аудиодорожку из видео. **Расставляет ли сервис знаки препинания?** Да, модель автоматически расставляет пунктуацию. **Есть ли API для транскрибации?** Да, API доступен на всех тарифах. Документация на docs.genvoice.ru.