CNN TürkÇocukların 5'te 1'i sanal dünya mağduru! UNICEF Türkiye Temsilcisi Paolo Marchi CNN TÜRK'teThe Jerusalem PostThailand revokes citizenship of Israeli businessman six years after naturalizationESPN DeportesMauricio Pochettino: "La rivalidad con México me da lo mismo"RTP DesportoJorge Jesus disponível para falar com Cristiano RonaldoESPNNorthwestern opens 'electric' Ryan Field with upset of Penn StateInquirerPisay Ilocos scholar shares top spot in 2026 PMA entrance examPunchBUA chair Rabiu visits Tinubu with son, celebrates Nigeria @66CBS NewsTrump vows Iran war to end "very quickly" as more troops head to MideastGlobal NewsEyes on AI as factor in Alberta referendumn-tvVierter Keeper im Einsatz?: Klopp setzt bei Revanchespiel wohl auf DebütantenIl Fatto Quotidiano“Mio figlio è un bambino farfalla, ci sono solo 4 casi come lui al mondo. Quando ti dicono che tuo figlio ha una malattia rara ti crolla il mondo addosso, è uno choc.Collider8 Genuinely Perfect Netflix Miniseries, Ranked
The Daily Newsstand · Free, Always
Saturday, October 3, 2026

Yue Studio: попытка сделать нейромузыку, от которой не мутит (по крайней мере меня)

Translate

Альбом из треков, которые я собрал в этом инструменте, у каждого трека своя страница, где написано, как делалось и есть примеры было - стало: Static and Gold.

Зачем я это навайбкодил

Нейрослоп он сейчас везде. На работе в таск трекере задачи которые пишет ИИ и комментарии которыми отвечает ИИ. Куча картинок в интернете - ИИ (они могут быть хорошими, но кому надо хорошее). Нейромузыка, которой сейчас полно в интернете, от которой …

Знакомые часто дают послушать свои треки из Suno, и у меня от них просто горит. И не скажешь же человеку, что это говно, как-то обидно. Да, музыка - дело субъективное, но это некачественное сгенерированное… ну вы поняли.

Недавно знакомый показал YuE2 и сказал, что она делает не хуже Suno и локлаьно. Мне стало интересно: смогу ли я сделать что-то, от чего у меня не будут отваливаться уши и не будет тошнить?

Первые варианты чуть не поставили крест на идее - это было отвратительно. Но мне нравится что-то делать и пытаться.

Шаг 1. Генератор с заданным жанром, голосом и инструментами. Первым делом создал продвинутый генератор - жанр, ритм, гитары, голос, настроение — форма собирает из этого строку тегов для модели. Это уже можно было слушать, но звук был однородный и плоский, а весь трек игрался примерно в одном ритме.

Вероятно, это всё есть в Suno, но у меня даже идеи не было платить за то, что я слышал.

Шаг 2. Драматургия. Добавил форму трека: ровно, нарастание, волна и взрыв. Стало чуть лучше, но пластиковость и плоскость звука остались.

Шаг 3. Студия. Начал думать, чего мне не хватает, и добавлять: барабанную сбивку, провал, примочки на голос (и сами голоса). Так получилась “студия” для треков. В неё добавил:

  • волну громкости и спектр — видно, где что звучит;

  • разделение на дорожки. [Claude: делит не сама YuE2, а отдельная программа demucs, и дорожек всего четыре: голос, барабаны, бас и «всё остальное». Гитары и клавиши — в одной дорожке, отдельно их не вытащить. Живём с тем, что есть. (ремарка от меня)]

Шаг 4. Овердаб. Загрузил свой трек и переиграл его по-другому. [Claude: модель играет новую партию по нотам трека в другом стиле, а приложение смешивает её с оригиналом. Настоящий овердаб поверх живой записи модель не умеет.]

Шаг 5. Дыхание и мастеринг.

  • Дыхание. Нейросеть отдаёт трек «кирпичом»: всё одинаково громко, тихих мест почти нет, от этого (отваливаются уши) слух быстро устаёт. «Дыхание» мягко опускает тихие места и не трогает громкие - у трека появляется разница между куплетом и припевом. Не совсем идеально, но разброс громкости заметно растёт.

  • Мастеринг. Последний шаг перед “релизом” трека: «дыхание» + громкость через лёгкий перегруз, немного «песка» на верхах и ограничитель пиков, чтобы ничего не хрипело.

Шаг 6. Подстановка голоса — эксперимент. Модель каждый раз поёт новым голосом (даже фиксированный seed не исправляет ситуацию). Я пробовал подставлять один голос во все треки (через Seed-VC), чтобы не было случайного разброса. Но там свои проблемы, поэтому функция осталась с пометкой «экспериментальная»:

  • Голос дрожит, «как будто стесняется петь». Seed-VC сделан скорее под речь, чем под пение: не помогли ни настройки, ни дообучение на голос, ни другой разделитель дорожек.

  • Портится сам трек. Сначала голос нужно вырезать из готового трека, а demucs режет неидеально: в дорожке голоса остаются куски гитар и барабанов. Они тоже проходят через замену голоса, и внутри фраз музыка начинает звучать хуже. Хотя, не исключаю, что зависит о тмузыки, для чего-то простого может и сработает.

Шаг 7. MCP — работа через ИИ. Руками всё делать можно, но доработки трека проще делать с ИИ. Поэтому оформил MCP-сервер: он рассказывает ИИ-агенту, что умеет приложение, и дальше в диалоге можно просить ИИ, что нужно сделать и сразу проверять, что получилось. [Claude: MCP — протокол, через который ИИ-агент (Claude, Codex) вызывает инструменты программы. Агент сам генерирует, слушает метрики, режет, накладывает эффекты — а решение «нравится / переделай» за тобой.]

Шаг 8. Интерфейс. С UI я тоже заморочился. Это вкусовщина, но мне нравится. За основу взял Winamp2, подтянув для 2026 года. Плюс добавил светлую тему. Winamp2 это не потому что я так стар, а потому что он четко ассоциируется у меня с музыкой. [TODO: 2–3 скриншота: форма, студия с волной и роллом, список треков с версиями]

Что получилось

В итоге я сделал альбом из того, что получилось: Static and Gold.

Музыка - субъективщина, и я делаю для себя, поэтому там мои вкусы: что-то от Joy Division, Interpol, Jack White. В целом это ближе к современному инди, и в целом мне нравится результат. Правда, если включить настоящий живой трек, понятно, что ещё очень далеко до живого звука.

Тут не буду дублировать, но у каждого трека есть своя страница с описанием, как я его делал и внизу несколько примеров было-стало.

Как это устроено

  • Воркер на компьютере с видеокартой NVIDIA (от 16 ГБ видеопамяти): держит модель YuE2, очередь генераций, разделение на дорожки, распознавание текста.

  • Приложение на обычном ПК (Linux/Windows/macOS): интерфейс, эффекты считаются локально (ffmpeg), с воркером общается по сети. Можно всё на одном компьютере.

  • MCP-сервер — та же логика для ИИ-агента.

  • Код открыт: https://github.com/Zazza/yue-studio

Интерфейс: путь одного трека

Думаю, путеводитель по интерфейсу не нужен, сейчас у всес есть ИИ, она скажет что где и как пользоватся. Вставлю несколько скринов:

Главное окно

Главное окно

Студия трека

Студия трека

Установка

  • Что нужно: NVIDIA с CUDA и 16 ГБ видеопамяти; ~20 ГБ на диске под воркер и веса; необязательно — whisper (+3 ГБ, распознавание текста) и Seed-VC (+11 ГБ, эксперимент с голосом).

  • Два сценария: всё на одном ПК (обычный случай) или видеокарта на отдельной машине (у меня рабочий комп с игровой видеокартой днем загружен debian и работает для моих экспериментов c GPU).

  • Самый простой путь - попросить ИИ-агента установить. MCP умеет install_worker с сухим прогоном (показывает план и место на диске, ничего не ставит) и doctor для проверки.

  • Руками — команды из README. Честно - не проверял.

Честные ограничения

  • Модель не делит трек на инструменты: только четыре дорожки demucs.

  • Поправить середину трека нельзя без пересборки: модель играет слева направо. Есть «продолжение с места» и вклейки, но на стыке бывают швы. Иногда, если получается что-то совсем не так, проще сделать заново, тем более ABC есть -просто рендерим по ABC-плану.

  • Характер голоса конкретного исполнителя не задать — только манеру. Живость голоса делается мелодией в нотах, а не словами «с надрывом» в стиле. Плюс есть экспериментальная функция в “студии”. И дополнительно эффекты: рупор, перегруз, слепбек и телефон.

  • Удачная генерация — лотерея: приходится перебирать сиды. Иногда лучше делать не так: ищем основу, а дальше дополняем ее до трека. Дольше муторнее, но так и не попсу генерируем )

Итог

В общем, мне нравится, игрушка занятная, мой нераскрытый музкальный потенциал от этой игрушки в восторге. Буду писать новые альбому для себя ))

View the original on Хабр →

KioskNews shows a cleaned-up reading view extracted from the publisher’s page — the original always lives on their site, not ours.