Yue Studio: попытка сделать нейромузыку, от которой не мутит (по крайней мере меня)

Альбом из треков, которые я собрал в этом инструменте, у каждого трека своя страница, где написано, как делалось и есть примеры было - стало: Static and Gold.
Зачем я это навайбкодил
Нейрослоп он сейчас везде. На работе в таск трекере задачи которые пишет ИИ и комментарии которыми отвечает ИИ. Куча картинок в интернете - ИИ (они могут быть хорошими, но кому надо хорошее). Нейромузыка, которой сейчас полно в интернете, от которой …
Знакомые часто дают послушать свои треки из Suno, и у меня от них просто горит. И не скажешь же человеку, что это говно, как-то обидно. Да, музыка - дело субъективное, но это некачественное сгенерированное… ну вы поняли.
Недавно знакомый показал YuE2 и сказал, что она делает не хуже Suno и локлаьно. Мне стало интересно: смогу ли я сделать что-то, от чего у меня не будут отваливаться уши и не будет тошнить?
Первые варианты чуть не поставили крест на идее - это было отвратительно. Но мне нравится что-то делать и пытаться.
Шаг 1. Генератор с заданным жанром, голосом и инструментами. Первым делом создал продвинутый генератор - жанр, ритм, гитары, голос, настроение — форма собирает из этого строку тегов для модели. Это уже можно было слушать, но звук был однородный и плоский, а весь трек игрался примерно в одном ритме.
Вероятно, это всё есть в Suno, но у меня даже идеи не было платить за то, что я слышал.
Шаг 2. Драматургия. Добавил форму трека: ровно, нарастание, волна и взрыв. Стало чуть лучше, но пластиковость и плоскость звука остались.
Шаг 3. Студия. Начал думать, чего мне не хватает, и добавлять: барабанную сбивку, провал, примочки на голос (и сами голоса). Так получилась “студия” для треков. В неё добавил:
волну громкости и спектр — видно, где что звучит;
разделение на дорожки. [Claude: делит не сама YuE2, а отдельная программа demucs, и дорожек всего четыре: голос, барабаны, бас и «всё остальное». Гитары и клавиши — в одной дорожке, отдельно их не вытащить. Живём с тем, что есть. (ремарка от меня)]
Шаг 4. Овердаб. Загрузил свой трек и переиграл его по-другому. [Claude: модель играет новую партию по нотам трека в другом стиле, а приложение смешивает её с оригиналом. Настоящий овердаб поверх живой записи модель не умеет.]
Шаг 5. Дыхание и мастеринг.
Дыхание. Нейросеть отдаёт трек «кирпичом»: всё одинаково громко, тихих мест почти нет, от этого (отваливаются уши) слух быстро устаёт. «Дыхание» мягко опускает тихие места и не трогает громкие - у трека появляется разница между куплетом и припевом. Не совсем идеально, но разброс громкости заметно растёт.
Мастеринг. Последний шаг перед “релизом” трека: «дыхание» + громкость через лёгкий перегруз, немного «песка» на верхах и ограничитель пиков, чтобы ничего не хрипело.
Шаг 6. Подстановка голоса — эксперимент. Модель каждый раз поёт новым голосом (даже фиксированный seed не исправляет ситуацию). Я пробовал подставлять один голос во все треки (через Seed-VC), чтобы не было случайного разброса. Но там свои проблемы, поэтому функция осталась с пометкой «экспериментальная»:
Голос дрожит, «как будто стесняется петь». Seed-VC сделан скорее под речь, чем под пение: не помогли ни настройки, ни дообучение на голос, ни другой разделитель дорожек.
Портится сам трек. Сначала голос нужно вырезать из готового трека, а demucs режет неидеально: в дорожке голоса остаются куски гитар и барабанов. Они тоже проходят через замену голоса, и внутри фраз музыка начинает звучать хуже. Хотя, не исключаю, что зависит о тмузыки, для чего-то простого может и сработает.
Шаг 7. MCP — работа через ИИ. Руками всё делать можно, но доработки трека проще делать с ИИ. Поэтому оформил MCP-сервер: он рассказывает ИИ-агенту, что умеет приложение, и дальше в диалоге можно просить ИИ, что нужно сделать и сразу проверять, что получилось. [Claude: MCP — протокол, через который ИИ-агент (Claude, Codex) вызывает инструменты программы. Агент сам генерирует, слушает метрики, режет, накладывает эффекты — а решение «нравится / переделай» за тобой.]
Шаг 8. Интерфейс. С UI я тоже заморочился. Это вкусовщина, но мне нравится. За основу взял Winamp2, подтянув для 2026 года. Плюс добавил светлую тему. Winamp2 это не потому что я так стар, а потому что он четко ассоциируется у меня с музыкой. [TODO: 2–3 скриншота: форма, студия с волной и роллом, список треков с версиями]
Что получилось
В итоге я сделал альбом из того, что получилось: Static and Gold.
Музыка - субъективщина, и я делаю для себя, поэтому там мои вкусы: что-то от Joy Division, Interpol, Jack White. В целом это ближе к современному инди, и в целом мне нравится результат. Правда, если включить настоящий живой трек, понятно, что ещё очень далеко до живого звука.
Тут не буду дублировать, но у каждого трека есть своя страница с описанием, как я его делал и внизу несколько примеров было-стало.
Как это устроено
Воркер на компьютере с видеокартой NVIDIA (от 16 ГБ видеопамяти): держит модель YuE2, очередь генераций, разделение на дорожки, распознавание текста.
Приложение на обычном ПК (Linux/Windows/macOS): интерфейс, эффекты считаются локально (ffmpeg), с воркером общается по сети. Можно всё на одном компьютере.
MCP-сервер — та же логика для ИИ-агента.
Код открыт: https://github.com/Zazza/yue-studio
Интерфейс: путь одного трека
Думаю, путеводитель по интерфейсу не нужен, сейчас у всес есть ИИ, она скажет что где и как пользоватся. Вставлю несколько скринов:


Установка
Что нужно: NVIDIA с CUDA и 16 ГБ видеопамяти; ~20 ГБ на диске под воркер и веса; необязательно — whisper (+3 ГБ, распознавание текста) и Seed-VC (+11 ГБ, эксперимент с голосом).
Два сценария: всё на одном ПК (обычный случай) или видеокарта на отдельной машине (у меня рабочий комп с игровой видеокартой днем загружен debian и работает для моих экспериментов c GPU).
Самый простой путь - попросить ИИ-агента установить. MCP умеет
install_workerс сухим прогоном (показывает план и место на диске, ничего не ставит) иdoctorдля проверки.Руками — команды из README. Честно - не проверял.
Честные ограничения
Модель не делит трек на инструменты: только четыре дорожки demucs.
Поправить середину трека нельзя без пересборки: модель играет слева направо. Есть «продолжение с места» и вклейки, но на стыке бывают швы. Иногда, если получается что-то совсем не так, проще сделать заново, тем более ABC есть -просто рендерим по ABC-плану.
Характер голоса конкретного исполнителя не задать — только манеру. Живость голоса делается мелодией в нотах, а не словами «с надрывом» в стиле. Плюс есть экспериментальная функция в “студии”. И дополнительно эффекты: рупор, перегруз, слепбек и телефон.
Удачная генерация — лотерея: приходится перебирать сиды. Иногда лучше делать не так: ищем основу, а дальше дополняем ее до трека. Дольше муторнее, но так и не попсу генерируем )
Итог
В общем, мне нравится, игрушка занятная, мой нераскрытый музкальный потенциал от этой игрушки в восторге. Буду писать новые альбому для себя ))
KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.