← Блог Гайд

Vocal remover: как отделить вокал от музыки нейросетью

· · 6 минут чтения
Vocal remover: звуковая волна разделяется на дорожку голоса и дорожку музыки

Коротко. Vocal remover — это не фильтр и не «вычитание каналов», как было двадцать лет назад, а нейросеть, обученная узнавать в общем миксе голос, барабаны, бас и остальное. Она возвращает несколько отдельных файлов: минус без вокала, а капеллу, иногда ударные и бас по дорожкам. Работает это хорошо, но не идеально, и качество результата упирается в две вещи — плотность аранжировки и качество исходника. Ниже: как разделить трек, где звук ломается, что лучше скачивать, а что делать онлайн, и как быть с правами.

Как работает разделение дорожек

Старые «убиралки вокала» работали грубо: голос в большинстве миксов расположен по центру, поэтому если вычесть левый канал из правого, центр исчезнет. Вместе с вокалом пропадали бочка, бас и малый барабан — то есть половина песни. Именно от этого приёма осталась репутация «минус звучит как из ведра».

Современный voice remover устроен иначе. Нейросеть учили на тысячах многодорожечных записей, где заранее известно, как звучит каждый инструмент отдельно и как — их сумма. Модель работает не со стерео, а со спектрограммой: она предсказывает, какая доля энергии в каждой точке «частота × время» принадлежит голосу, а какая — всему остальному, и по этой маске собирает отдельные файлы. Такие дорожки называют стемами, а сам процесс — source separation. Отсюда и возможность получить не два файла, а четыре-шесть: вокал, ударные, бас, остальное.

Практический вывод один: модели всё равно, где в стереополе стоит голос. Она узнаёт вокал по тембру и по тому, как он ведёт себя во времени, поэтому справляется и с бэками, и с моно-записями, где старый метод не работал вообще.

Как отделить вокал от музыки: по шагам

Порядок одинаковый и в браузерном сервисе, и в программе.

  • Возьмите лучший исходник. WAV или FLAC, а если только MP3 — то максимального битрейта. Всё, что кодек уже выбросил, нейросеть не вернёт.
  • Выберите режим разделения. «Вокал / минус» — для караоке и репетиции. Разделение на четыре стема — если нужны барабаны или бас отдельно, например для сэмпла.
  • Проверьте результат в наушниках на тихих местах. Артефакты слышны не в припеве, а в паузах, на затухании реверберации и на длинных нотах.
  • Прогоните повторно другой моделью, если остались следы голоса: разные модели ошибаются по-разному, и вторая попытка часто чище первой.
  • Сохраняйте результат без сжатия. Минус, сразу сжатый в MP3, дальше редактировать уже больно.

Что реально получится

Качество предсказуемо зависит от материала. Ориентир по типам записей:

ИсходникМинусА капеллаЧто мешает
Поп, современная студияХорошийХорошаяПлотный бэк-вокал
Рок, живые барабаныХорошийСредняяТарелки лезут в голос
Акустика, голос и гитараОтличныйОтличнаяПочти ничего
Хип-хоп с плотным битомСреднийХорошаяЧитка в тех же частотах
Старая запись, много реверберацииСлабыйСлабаяХвосты эха тянут голос
Классика, симфонияНепредсказуемоМодель училась на другом

Общее правило: чем разреженнее аранжировка, тем чище разделение. И наоборот — стена звука, где всё замешано в одном диапазоне, даёт либо призрак голоса в минусе, либо провал в середине аранжировки.

Нужен не минус, а свой трек

Шесть музыкальных моделей, которые пишут музыку и поют по-русски, — в одном окне с текстовыми. Из России, за рубли, без подписки.

Открыть Умку →

Онлайн или скачать программу

Браузерных сервисов десятки, и большинство построено на одних и тех же открытых моделях разделения — Demucs и её родственниках. Разница между ними чаще в лимитах и в том, сколько стоит скачивание результата, а не в качестве звука.

Ставить программу на компьютер — Ultimate Vocal Remover и подобные — имеет смысл в трёх случаях: треков много и выгружать каждый вручную долго; нужен выбор конкретной модели и тонкая настройка; материал нельзя отдавать на чужой сервер, например это чужая неизданная запись. Во всех остальных ситуациях онлайн быстрее: разделение трёхминутного трека занимает меньше минуты, а тяжёлые вычисления идут не на вашем ноутбуке.

Отдельно про телефон: приложения «vocal remover» из магазинов почти всегда обёртка над тем же облачным сервисом. Ничего плохого в этом нет, просто не ждите, что оно работает офлайн.

Альтернатива: сделать минус с нуля

Если минус нужен не для караоке под конкретную песню, а как подложка под ролик, подкаст или собственный текст, разделение — лишний шаг. Нейросеть-композитор напишет инструментал сразу: без вокала, нужной длины и настроения, и главное — без чужих прав.

В Умке собрано 350 моделей в одном интерфейсе, из них шесть музыкальных: они пишут трек по текстовому описанию и поют по-русски. Подписки нет — списываются токены за конкретную генерацию, и цену модели сервис показывает до запуска, а не после. При регистрации дают 60 токенов в подарок, восемь моделей из 350 бесплатны, так что первую попытку можно сделать, не доставая карту. Как формулировать запрос под музыку, разобрано в статье «Нейросеть музыка: как создать трек с ИИ», а про самый известный сервис — в разборе «Suno: нейросеть для музыки и песен».

Пополнение — пакетами: 290 ₽ за 725 токенов, 690 ₽ за 1 811, 1 490 ₽ за 4 172 и 3 900 ₽ за 11 700 токенов, где токен выходит примерно на пятую часть дешевле. Для сравнения, развёрнутый ответ умной текстовой модели — 33 токена, а простой — 1 токен: написать текст песни к готовому минусу стоит копейки. Как это считается, подробно разобрано в статье «Токены и кредиты».

Права: главное, о чём забывают

Vocal remover не создаёт новое произведение — он разбирает чужое. Права на музыку, аранжировку и текст остаются у правообладателей оригинала, и минус из хита остаётся тем же хитом. Для личного использования, репетиции, школьного разбора или выступления в узком кругу это обычно не проблема. Для публикации на площадках, коммерческого ремикса, караоке-канала или фона в рекламном ролике нужна лицензия — иначе ролик снимут по жалобе автоматической системы, которая узнаёт трек в том числе по минусу.

Частые вопросы

Можно ли полностью убрать вокал из песни?

Полностью — почти никогда. Нейросеть разделяет дорожки статистически, и там, где голос и инструменты занимают одни и те же частоты, остаётся или призрак вокала, или дырка в аранжировке. На плотном миксе с реверберацией следы слышны почти всегда, на разреженной записи с чистым голосом результат может быть неотличим от студийного минуса.

Нужно ли скачивать vocal remover или хватит онлайн-версии?

Для одного-двух треков хватает онлайн-сервиса: загрузили файл, через минуту забрали дорожки. Программу вроде Ultimate Vocal Remover ставят, когда треков десятки, нужны нестандартные модели разделения или файлы нельзя выгружать на чужой сервер. Качество разделения у десктопной версии обычно то же самое — отличается удобство и контроль.

В каком формате загружать трек, чтобы минус вышел чище?

В максимальном качестве, какое есть: WAV или FLAC. Нейросеть не восстанавливает то, что уже потерял кодек, поэтому минус из MP3 128 кбит/с шипит на тарелках и звенит на верхах. Разделять звук, вытащенный из видео с потоковой платформы, — худший исходник из возможных.

Можно ли выложить минус или а капеллу, которые получились?

Права на музыку и текст остаются у авторов оригинала: разделение дорожек новым произведением вас не делает. Для себя, репетиции или учебного разбора — вопросов нет, для публикации, коммерческого ремикса или караоке-канала нужна лицензия. Безопасный путь, если трек нужен для публикации, — сгенерировать собственный.

Своя музыка — без чужих прав

Опишите настроение и жанр текстом — модель напишет инструментал или споёт по-русски. Оплата рублями, VPN не нужен.

Открыть Умку →