Вы просили вернуть Suno v5, а мы сделали лучше. Встречайте Grom Zvuk

В мире генеративного ИИ всё меняется стремительно. Этим летом музыкальное ИИ-сообщество столкнулось с сюрпризом: разработчики Suno навсегда отключили полюбившиеся многим старые версии моделей (v4, v4.5, v5 и v5.5).
Пользователи нашей ИИ-платформы GPTunneL (агрегатора нейросетей) массово жаловались: пропал тот самый вайб, а новые алгоритмы стали слишком жесткими. К тому же в Suno всегда была одна фундаментальная проблема, которая бесила многих креаторов – там нельзя было просто взять и поменять текст в уже готовом, сгенерированном треке.
Мы выслушали боль нашей аудитории, посмотрели на то, чего не хватает рынку, и решили сделать свой продукт.
Сегодня, 18 сентября, мы официально запускаем Grom Zvuk – нашу собственную музыкальную ИИ-модель. Она работает на наших серверах, выдает крутое качество, делает невероятные каверы и стоит дешевле западных аналогов. Рассказываем, как она устроена и на что способна.

Что такое Grom Zvuk и как это звучит
Grom Zvuk – это первая музыкальная модель в нашем семействе «Гром». Задача амбициозная: чтобы генерация полноценного трека по вашему промпту стоила копейки, а управлять процессом было проще, чем в существующих аналогах.

Zvuk уже доступен в GPTunnel.
Попробуйте модель здесь:
Модель генерирует треки длительностью до 5 минут (можем расширить лимит до 6 минут), с вокалом или в виде инструментала.
Вместо тысячи слов – лучше послушать, что она умеет делать прямо из коробки:
Ещё примеры
Киллер-фичи: свобода, каверы и работа с готовыми треками
Главная проблема большинства музыкальных нейросетей – вы получаете «черный ящик». С Grom Zvuk мы пошли дальше простой генерации по тексту. Модель умеет работать с уже готовыми треками. Замысел трека живет в партитуре, поэтому песню можно править частями.
Создание каверов (свой текст на готовую музыку). Берём существующую песню, подставляем туда свои собственные стихи и меняем жанр. Музыка и вокальный рисунок остаются узнаваемыми, а слова – ваши.
Смена жанра и стиля. Тот же трек, тот же оригинальный текст, но совершенно другой жанр. Хотите сделать из баллады Артиста кантри в стиле лап-стил или суровый хардкор? Легко.
Отсутствие строгой модерации. Пока западные сервисы закручивают гайки по авторским правам (блокируя всё, что отдаленно напоминает известных артистов), мы даем создателям свободу. Строгой модерации у нас, что открывает огромный простор для экспериментов с каверами и стилизациями.
Под капотом: как устроена генерация
Мы не используем сжатые «черновики». Grom Zvuk сразу отдает результат в 48 кГц, стерео, с настоящей стереопанорамой. (Кстати, сейчас дорабатываем поддержку lossless-форматов, они появятся чуть позже.)
Генерация идет одним проходом. Модель прорабатывает все части трека одновременно. Сначала она заливает шумом всю длину будущей песни и размечает структуру: где встанут куплеты, где припев, а где бридж. Затем в несколько подходов превращает этот шум в звук. Интро, куплеты, припев и финал считаются как одна цельная композиция. Поэтому промежуточного результата не существует: трек появляется, когда досчитан целиком. Зато части не спорят друг с другом, а сведение звучит монолитно на всю длину.

Архитектурно конвейер устроен так: работают два эксперта под общим вниманием (attention). Первый пишет музыку символами, выстраивая композиционную логику, а второй разворачивает эти символы непосредственно в акустический сигнал.

Мультиязычность без акцента. Модель поет на любом языке (включая: русский, английский, китайский, японский, казахский, испанский, немецкий, французский, корейский, итальянский, португальский, турецкий, арабский, хинди и др.). В отличие от многих западных нейросетей, Grom Zvuk отлично понимает русские ударения и фразировку.
Синтетические тесты: бьем Suno v6
Мы провели слепое тестирование на выборке из 150 запросов. Оценивались два параметра: качество звучания (насколько аудио похоже на реальную студийную запись) и точность следования тексту (не путает ли модель слова, поет ли ровно то, что заказали). Названия моделей оценивающим не показывались.

По синтетическим бенчмаркам Grom Zvuk уверенно соревнуется с Suno v6 в балансе между точностью текста (85/100) и качеством звучания (83/100). По точности воспроизведения заданных текстов наша модель входит в первую тройку мирового рынка, обходя популярную Mureka.
Стоимость модели и условия для B2B
Мы сделали модель, которая работает на наших собственных мощностях.
Базовая стоимость генерации трека – 8 рублей, до конца сентября скидка 50%!
Для кого эта модель:
Музыкантам и креаторам: для создания быстрых демо, поиска аранжировок, экспериментов с жанрами и генерации фоновой музыки (например, эмбиент, лоу-фай для видео).
Агрегаторам и бизнесу: готовы предоставить доступ к Grom Zvuk по API. Можем масштабировать кластеры ускорителей под конкретные объемы B2B-клиентов. Для партнеров есть тестовый период.
GPTunneL – это ИИ-платформа. В одном окне без VPN и сложных регистраций мы объединяем более 100 топовых ИИ-инструментов: ChatGPT, Claude, Midjourney, Kling и другие, а также музыкальные Suno, Mureka и MiniMax. На платформе уже 1,5 млн пользователей.
Grom Zvuk пополнил наше проприетарное семейство моделей Grom, куда уже входят:
Grom GPT – флагманская текстовая модель (работает быстро, поддерживает русский, бесплатный в базовый вариант).
Grom Nova и Grom Art – генерация картинок по описанию, а также инпайнтинг, замена объектов и стили.
Grom TV – генерация видеороликов от 3 до 20 секунд.
Grom Pixel – умный апскейл до 100 мегапикселей с восстановлением фактуры.
Grom Zvuk уже доступен в разделе «Музыка» в GPTunneL рядом с Suno и Mureka. Заходите, тестируйте, ломайте жанры и делайте каверы!
Ждем ваших треков и фидбека в комментариях!
Только зарегистрированные пользователи могут участвовать в опросе. Войдите, пожалуйста.
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.