Como criar uma foto do Kakashi realista usando geração por IA
A ideia básica é usar um modelo de geração de imagem como o Stable Diffusion ou o Midjourney e dar prompts bem específicos. Comece com o que você sabe que aparece na referência: máscara cobrindo metade do rosto, cabelo prateado espetado, venda nos olhos, uniforme da Konoha, Sharingan visível em determinado momento. O prompt precisa ser detalhado o suficiente para que o gerador não alucine coisas absurdas. Um prompt tipo "realistic photo of Kakashi Hatake, silver spiky hair, face mask covering lower half, hitai-ate headband, Konoha ninja uniform, visible red Sharingan eye, cinematic lighting, photorealistic, 8k" já dá um resultado razoável. O problema é que esses modelos têm um viés forte. A maioria dos treinos veio de conteúdo artístico e anime, então quando você pede algo realista, ele tende a entregar uma versão meio animescida, com texturas de pele que parecem plástico. Eu demorei uns três dias até encontrar a combinação certa de parâmetros que evitava esse efeito. O segredo é usar um checkpoint baseado em fotografia real, não o modelo padrão. Checkpoints como Realistic Vision ou ESD realistic x1.5 fazem diferença absurda. Sem isso, seu Kakashi parece um boneco de silicone com cara de desenho.
Gerando foto do kakashi realista com controle fino
Depois de escolher o checkpoint, entra o fase de refinamento. Aqui é onde a maioria das pessoas desiste porque acha que generate once e esperar é suficiente. Não é. Você precisa de iterations. Comece com 28 a 32 steps de CFG scale entre 7 e 9. Steps demais só introduz ruído e artefatos. CFG alto demais deixa a imagem rígida, com excesso de nitidez artificial. A minha configuração padrão hoje é 30 steps, CFG 8, com um sampler DPM++ 2M Karras. Resultado limpo em cerca de dois minutos por imagem numa GPU RTX 4090. Uma coisa que quase ninguém menciona: o uso de LoRAs. Se você quer fidelidade ao design original do personagem, um LoRA treinado especificamente no Kakashi ajuda muito. Achei um no CivitAI chamado "Kakashi Hatake LoRA v2" que pega a proporção facial dele, o estilo dos olhos e a pose característica. A questão é que LoRAs mal calibrados estragam a consistência. Eu testei aquele LoRA com weight 0.7 e funcionou bem, mas em 0.9 a máscara ia embora e aparecia um rosto completamente diferente. Ajuste sempre em camadas, partindo de 0.5 e subindo aos poucos até ver o ponto certo.
Outro problema que eu encontrei na prática: a mão. Quase todo modelo errou a mão esquerda quando o Kakashi está fazendo selos ou segurando o livro. Isso acontece porque mãos são um ponto fraco geral em geração por IA, não só nesse personagem. A solução mais rápida que encontrei foi usar inpainting. Gera a imagem inteira, identifica a área da mão com um mask brush, e redefine só aquela região com um prompt focado em "realistic hand, detailed fingers". Leva mais cinco minutos, mas evita ter que gerar trinta vezes procurando uma que não tenha dedos fundidos. Se você não quer depender de Stable Diffusion local, o Midjourney v6 tem resultados satisfatórios com menos esforço. O comando base seria algo como "/imagine prompt: hyper realistic photo of Kakashi Hatake from Naruto, silver hair, face mask, headband with leaf symbol, visible redSharingan eye, Konoha flak jacket, standing in forest at golden hour, cinematic composition, photorealistic, shot on 85mm lens" --ar 16:9 --style raw. A vantagem do Midjourney é que o processamento é feito na nuvem e a qualidade de pele é melhor por padrão, mesmo sem checkpoints customizados. A desvantagem é custo e falta de controle fino sobre cada elemento da composição.
👉 Clique no botão abaixo para saber mais sobre o assunto!
Quanto tempo leva do zero até um resultado utilizável? Na minha experiência, cerca de 30 a 45 minutos para quem já tem o ambiente configurado e os modelos baixados. Inclui ajustes de seed, testes de LoRA, inpainting de áreas problemáticas e upscale final. Para quem está começando do zero, considere que precisa primeiro instalar tudo, baixar pesos, configurar o espaço de trabalho. Isso pode levar uma tarde inteira se for a primeira vez. Após configurado, o fluxo de geração propriamente dito é rápido. Recomendações finais: tenha paciência com seeds. Uma seed diferente com o mesmo prompt pode dar resultados completamente distintos. Teste entre -1 e -1000 para encontrar variações interessantes. Upscale sempre com um modelo específico como Real-ESRGAN ou SwinIR em vez de simplesmente aumentar a resolução nativa. E não confie na primeira geração. O que sai no primeiro tiro raramente é a melhor opção disponível.
Onde fazer download dos modelos e recursos
Os checkpoints e LoRAs ficam na maior parte das vezes no CivitAI. É o repositório mais direto. Baixe o checkpoint Realistic Vision v5.1, o LoRA do Kakashi, e os modelos de upscaling. Todos gratuitos. Para Stable Diffusion web UI, o Automatic1111 é a interface mais usada, e o ComfyUI é uma alternativa mais modular se você quer controle granular sobre o fluxo de nós. Ambos funcionam em Windows e Linux. O link oficial para o Automatic1111 é o repositório no GitHub dela: github.com/AUTOMATIC1111/stable-diffusion-webui. Para o CivitAI, onde estão os modelos: civitai.com. Midjourney funciona apenas através do Discord e exige assinatura a partir do plano básico de US$ 10 mensais.
Se o seu objetivo é só ver a imagem pronta sem configurar nada, existem várias páginas que já geram resultados prontos com templates. Mas se você quer qualidade consistente e personalização, o caminho é construir o setup local ou semi-local mesmo. Vale o esforço a longo prazo.