The Jerusalem PostRussians vote in election that Putin sees as barometer of public support for his war in UkraineESPN DeportesRed Sox sorprende a Rangers con jonrón en la octava y evita la barridaESPN'That place was electric': Bills marvel at new stadium after 41-point nightDaily MaverickConsistency proved key in Sinesipho Dambile’s remarkable yearInquirerGatchalian flags P295-M fees paid due to transport project delaysRTP DesportoAdeptos do Torreense falam em vitória históricaוואלהבית המשפט קיבל את עתירת אגם צרפי ומתח ביקורת על שב"סAntara NewsTomorrow, Jakarta to turn off lights for 60 minutes for Ozone DayVanguardLagos youths trained to spot fake news, manipulated contentTVN24W weekend pożegnamy lato. W tej prognozie widać śniegХабрЭволюция пайплайна метрик: как менялась архитектура с ростом нагрузкиn-tvDeutsche Fahne "zurückholen"?: Warum der Kanzler sich besser nichts von Jürgen Klopp abguckt
The Daily Newsstand · Free, Always
Friday, September 18, 2026

Вы просили вернуть Suno v5, а мы сделали лучше. Встречайте Grom Zvuk

Translate

В мире генеративного ИИ всё меняется стремительно. Этим летом музыкальное ИИ-сообщество столкнулось с сюрпризом: разработчики Suno навсегда отключили полюбившиеся многим старые версии моделей (v4, v4.5, v5 и v5.5).

Пользователи нашей ИИ-платформы GPTunneL (агрегатора нейросетей) массово жаловались: пропал тот самый вайб, а новые алгоритмы стали слишком жесткими. К тому же в Suno всегда была одна фундаментальная проблема, которая бесила многих креаторов – там нельзя было просто взять и поменять текст в уже готовом, сгенерированном треке.

Мы выслушали боль нашей аудитории, посмотрели на то, чего не хватает рынку, и решили сделать свой продукт.

Сегодня, 18 сентября, мы официально запускаем Grom Zvuk – нашу собственную музыкальную ИИ-модель. Она работает на наших серверах, выдает крутое качество, делает невероятные каверы и стоит дешевле западных аналогов. Рассказываем, как она устроена и на что способна.

Что такое Grom Zvuk и как это звучит

Grom Zvuk – это первая музыкальная модель в нашем семействе «Гром». Задача амбициозная: чтобы генерация полноценного трека по вашему промпту стоила копейки, а управлять процессом было проще, чем в существующих аналогах.

Zvuk уже доступен в GPTunnel.

Попробуйте модель здесь:

Grom Zvuk

Модель генерирует треки длительностью до 5 минут (можем расширить лимит до 6 минут), с вокалом или в виде инструментала.

Вместо тысячи слов – лучше послушать, что она умеет делать прямо из коробки:

Ещё примеры

Киллер-фичи: свобода, каверы и работа с готовыми треками

Главная проблема большинства музыкальных нейросетей – вы получаете «черный ящик». С Grom Zvuk мы пошли дальше простой генерации по тексту. Модель умеет работать с уже готовыми треками. Замысел трека живет в партитуре, поэтому песню можно править частями.

  1. Создание каверов (свой текст на готовую музыку). Берём существующую песню, подставляем туда свои собственные стихи и меняем жанр. Музыка и вокальный рисунок остаются узнаваемыми, а слова – ваши.

  2. Смена жанра и стиля. Тот же трек, тот же оригинальный текст, но совершенно другой жанр. Хотите сделать из баллады Артиста кантри в стиле лап-стил или суровый хардкор? Легко.

  3. Отсутствие строгой модерации. Пока западные сервисы закручивают гайки по авторским правам (блокируя всё, что отдаленно напоминает известных артистов), мы даем создателям свободу. Строгой модерации у нас, что открывает огромный простор для экспериментов с каверами и стилизациями.

Под капотом: как устроена генерация

Мы не используем сжатые «черновики». Grom Zvuk сразу отдает результат в 48 кГц, стерео, с настоящей стереопанорамой. (Кстати, сейчас дорабатываем поддержку lossless-форматов, они появятся чуть позже.)

Генерация идет одним проходом. Модель прорабатывает все части трека одновременно. Сначала она заливает шумом всю длину будущей песни и размечает структуру: где встанут куплеты, где припев, а где бридж. Затем в несколько подходов превращает этот шум в звук. Интро, куплеты, припев и финал считаются как одна цельная композиция. Поэтому промежуточного результата не существует: трек появляется, когда досчитан целиком. Зато части не спорят друг с другом, а сведение звучит монолитно на всю длину.

Процесс превращения шума в структурированный аудиосигнал

Процесс превращения шума в структурированный аудиосигнал

Архитектурно конвейер устроен так: работают два эксперта под общим вниманием (attention). Первый пишет музыку символами, выстраивая композиционную логику, а второй разворачивает эти символы непосредственно в акустический сигнал.

Упрощенная схема: от символьной партитуры к полноценному звучанию

Упрощенная схема: от символьной партитуры к полноценному звучанию

Мультиязычность без акцента. Модель поет на любом языке (включая: русский, английский, китайский, японский, казахский, испанский, немецкий, французский, корейский, итальянский, португальский, турецкий, арабский, хинди и др.). В отличие от многих западных нейросетей, Grom Zvuk отлично понимает русские ударения и фразировку.

Синтетические тесты: бьем Suno v6

Мы провели слепое тестирование на выборке из 150 запросов. Оценивались два параметра: качество звучания (насколько аудио похоже на реальную студийную запись) и точность следования тексту (не путает ли модель слова, поет ли ровно то, что заказали). Названия моделей оценивающим не показывались.

Сравнение Grom Zvuk с другими музыкальными моделями

Сравнение Grom Zvuk с другими музыкальными моделями

По синтетическим бенчмаркам Grom Zvuk уверенно соревнуется с Suno v6 в балансе между точностью текста (85/100) и качеством звучания (83/100). По точности воспроизведения заданных текстов наша модель входит в первую тройку мирового рынка, обходя популярную Mureka.

Стоимость модели и условия для B2B

Мы сделали модель, которая работает на наших собственных мощностях.

  • Базовая стоимость генерации трека – 8 рублей, до конца сентября скидка 50%!

Для кого эта модель:

  • Музыкантам и креаторам: для создания быстрых демо, поиска аранжировок, экспериментов с жанрами и генерации фоновой музыки (например, эмбиент, лоу-фай для видео).

  • Агрегаторам и бизнесу: готовы предоставить доступ к Grom Zvuk по API. Можем масштабировать кластеры ускорителей под конкретные объемы B2B-клиентов. Для партнеров есть тестовый период.

GPTunneL – это ИИ-платформа. В одном окне без VPN и сложных регистраций мы объединяем более 100 топовых ИИ-инструментов: ChatGPT, Claude, Midjourney, Kling и другие, а также музыкальные Suno, Mureka и MiniMax. На платформе уже 1,5 млн пользователей.

Grom Zvuk пополнил наше проприетарное семейство моделей Grom, куда уже входят:

  • Grom GPT – флагманская текстовая модель (работает быстро, поддерживает русский, бесплатный в базовый вариант).

  • Grom Nova и Grom Art – генерация картинок по описанию, а также инпайнтинг, замена объектов и стили.

  • Grom TV – генерация видеороликов от 3 до 20 секунд.

  • Grom Pixel – умный апскейл до 100 мегапикселей с восстановлением фактуры.

Grom Zvuk уже доступен в разделе «Музыка» в GPTunneL рядом с Suno и Mureka. Заходите, тестируйте, ломайте жанры и делайте каверы!

Ждем ваших треков и фидбека в комментариях!

Только зарегистрированные пользователи могут участвовать в опросе. Войдите, пожалуйста.

View the original on Хабр

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.