Separar stems de áudio não é mais um saco de dores com essa ferramenta
Eu passei anos quebrando a cabeça com separação de áudio. Plugin por plugin, alguns funcionavam razoavelmente para vocais, outros melhor para baixo, mas sempre sobrava alguma frequência contaminada. Quando conheci carro transformers, a coisa mudou de figura. É um modelo de deep learning desenvolvido pela Carro para isolamento de fontes sonoras, e ele funciona de forma bem diferente do que as soluções tradicionais oferecem. O processo básico é simples. Você pega um arquivo de áudio, passa pelo modelo, e ele devolve faixas separadas: vocal, bateria, baixo, instrumentos. A arquitetura por trás usa uma rede neuronal do tipo transformer combinada com um encoder-decoder, algo que captura contextos temporais muito melhor do que modelos convolucionais antigos como o Demucs v1 ou o Spleeter da Deezer.
Como usar carro transformers na prática
Você precisa ter Python instalado. Roda na versão 3.8 ou superior. Instale via pip com o comando padrão do repositório no GitHub. Depois de clonado, segue a instalação das dependências listadas no requirements.txt. Recomendo usar um ambiente virtual para não bagunçar o resto do sistema. O modelo em si precisa ser baixado. Ele fica disponível no Hugging Face ou no repositório oficial. São cerca de 300 MB para a versão padrão, mas existe uma versão larger que entrega melhor separação e ocupa quase 1 GB. Se o seu hardware permite, vai de larger.
Para rodar a separação, o comando é direto. Aponte para o arquivo de entrada, escolha os stems que quer extrair, e defina o diretório de saída. Processamento leva de 30 segundos a 2 minutos para uma música de 4 minutos, dependendo da GPU. Sem GPU, pode levar 10 minutos ou mais. A diferença de qualidade entre CPU e GPU não é só velocidade, também tem relação com o batch size que você consegue usar. Eu tive um problema específico com uma mixagem que tinha sintetizadores sobrepostos ao vocal principal. O modelo separou o vocal, mas deixou uma quantidade absurda de artefatos na faixa instrumental. A solução que funcionou foi aplicar uma máscara espectral simples no stem do vocal usando um soft threshold de -12 dB antes de exportar. Isso removeu os resíduos sem prejudicar a inteligibilidade. Não é um passo que a documentação menciona, mas resolve noventa por cento dos casos parecidos.
Informações técnicas que importam
O modelo foi treinado com dados do Spotify, então ele lida muito bem com produções pop, hip-hop e eletrônica. Faixas gravadas ao vivo, especialmente com bateria acústica e ambiência de sala, são mais difíceis. O modelo tende a tratar reverberação como parte do vocal e Isolar mal o espaço acústico. Isso não é falha do modelo, é limitação do training data. Se você trabalha com jazz ou folk gravado em estúdio com microfones compartilhados, espera resultados abaixo do esperado. Um detalhe que poucos mencionam: a taxa de amostragem do arquivo de entrada interfere diretamente na qualidade. O modelo foi treinado em 44,1 kHz. Se você passar um arquivo em 48 kHz ou 96 kHz, ele faz upsample interno, mas isso pode introduzir pequenas distorções nas bordas espectrais. O ideal é resamplear para 44,1 kHz antes de processar. Perde cerca de dois minutos do trabalho e ganha clareza nas frequências altas dos stems.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Outro ponto negligenciado é a normalização de volume. Se a faixa de entrada está muito alta, acima de menos 1 dBTP, o modelo pode saturar internamente e gerar clipping nos stems de saída. Normalize para cerca de menos 6 dBFS antes de processar. Leva cinco segundos e evita dor de cabeça.
Limitações reais que você precisa saber antes de decidir usar
Carro transformers não é bala de prata. Ele falha catastroficamente em faixas com produção lo-fi intencional, como gravações caseiras com ruído de fundo, vinil crackle, ou compressão excessiva de masterização. O modelo tenta separar o ruído como se fosse um instrumento e distribui o artefato entre todos os stems. O resultado é pior do que não separar nada. Também não funciona bem com conteúdo que tenha silêncios longos entre frases ou partes instrumentais muito espaçadas. A arquitetura transformer depende de contexto temporal, e silêncios de mais de três segundos seguidos confundem a rede. Cortar a faixa em segmentos de dois minutos e processar separadamente resolve, mas aumenta o tempo total de processamento em cerca de 40 por cento.
Se o seu objetivo é apenas isolar vocais para karaokê, existem alternativas mais rápidas e com menos artefatos para gêneros específicos. O Ultrabeats, por exemplo, é mais leve e roda em tempo real. Mas se você precisa de separação multi-stem de alta fidelidade para remixagem ou masterização, carro transformers ainda é uma das melhores opções disponíveis gratuitamente. A instalação inicial dá trabalho. A primeira vez que configurei o ambiente, gastei duas horas resolvendo conflitos de dependência entre PyTorch e algumas bibliotecas de áudio. A segunda vez levou quinze minutos. Prepare o terreno antes de começar, atualize o driver da GPU se tiver NVIDIA, e verifique se o CUDA corresponde à versão do PyTorch que você vai instalar. Erros nessa etapa são os que mais aparecem nos fóruns e ninguém explica direito.
O download do modelo pode demorar se sua conexão for instável. São arquivos grandes. Se possível, baixe uma vez e guarde em um local permanente. Rebaixar toda vez que for processar uma nova música é perda de tempo desnecessária. Resultados finais precisam de revisão manual. Nenhum modelo de separação atual entrega stems prontos para uso profissional sem pelo menos uma olhada. Verifique cada faixa separadamente, especialmente as de instrumentos harmônicos como piano e guitarra acústica, que costumam vazar conteúdo entre si. Um equalizador simples ou um gate de ruído aplicado manualmente em cada stem resolve a maioria dos vazamentos restantes.
O repositório oficial está no GitHub da Carro. Procure por carro transformers no site deles ou no Hugging Face. A licença é aberta para uso educacional e pessoal, mas tem restrições comerciais. Se for usar em um projeto pago, leia o arquivo de licença com atenção antes de começar.