Neste teste, utilizei o LTX 2.3 no ComfyUI, com uma NVIDIA RTX 3060 de 12 GB de VRAM. Experimentei cinco propostas diferentes de geração de vídeo, incluindo fantasia, anime, uma cena realista na praia, fala em português e uma sequência cinematográfica com imagem de referência.
Minha conclusão é que o LTX 2.3 ainda é funcional para vários projetos, mas os resultados variam bastante dependendo do tipo de cena. Algumas gerações apresentam qualidade aceitável, enquanto outras sofrem com distorções, problemas de movimento e limitações na representação dos personagens.
Neste artigo, vou mostrar os prompts utilizados, o tempo de cada geração e minha avaliação sincera dos resultados. A ideia não é mostrar apenas o que funcionou, mas também as limitações que encontrei durante os testes.
Configuração utilizada
Interface: ComfyUI
Modelo: LTX 2.3
Placa de vídeo: NVIDIA RTX 3060 de 12 GB
Testes: cinco gerações com diferentes prompts
1. Vídeo de fantasia: mulher voando nas costas de um dragão
O primeiro teste foi uma cena de fantasia cinematográfica. A proposta era gerar um dragão negro voando entre as nuvens, carregando uma mulher de biquíni amarelo nas costas.
Prompt utilizado:
A woman wearing a bright yellow bikini rides on the back of a large black dragon flying through the blue sky above the clouds. The dragon flaps its wings as it flies forward. The woman holds onto the dragon's back. Cinematic fantasy, realistic visuals, side view, continuous flight.
Minha avaliação
O resultado não ficou muito realista. Um dos problemas mais evidentes foi a aparência do pé da mulher, que acabou adquirindo características semelhantes às do dragão. Esse tipo de deformação prejudica a naturalidade da cena e mostra que o modelo ainda tem dificuldades para manter todos os detalhes anatômicos consistentes durante o movimento.
Apesar disso, considero que a qualidade é aceitável para diversos objetivos. Dependendo do projeto, a cena pode funcionar como material de referência, conteúdo experimental, fantasia estilizada ou um clipe que será combinado com outras imagens em uma edição.
Veredito: resultado imperfeito, mas aproveitável dependendo da finalidade. Para uma produção que exige realismo elevado, eu esperaria mais consistência nos detalhes.
2. Anime: jogador de futebol marcando um gol
No segundo teste, utilizei um prompt de anime japonês. A ideia era mostrar um jogador chutando a bola em direção ao gol, passando pelo goleiro e acertando a rede.
Prompt utilizado:
Japanese anime style. A young adult male soccer player wearing a blue and white uniform kicks a soccer ball toward the goal. The ball flies past the goalkeeper and hits the back of the net. The player scores a goal. Dynamic soccer animation, colorful anime visuals, stadium background, smooth natural movement, side view, continuous shot.
Minha avaliação
Esse foi o pior resultado dos cinco testes. O vídeo ficou totalmente distorcido, com problemas evidentes de física e movimentos que não pareciam naturais. A cena não conseguiu representar o lance de futebol de maneira convincente.
Uma hipótese é que a duração de aproximadamente cinco segundos, combinada com a quantidade de ações solicitadas no mesmo prompt, tenha contribuído para a dificuldade de manter a continuidade temporal. Minha impressão foi de que os quadros ficaram visualmente sobrepostos ou acumulados, dando a sensação de que o modelo empilhou os frames.
Isso é uma interpretação visual do resultado, não uma confirmação técnica da causa. Seria necessário repetir o teste com uma duração maior e uma ação mais simples para verificar se o problema se repete.
Veredito: resultado insatisfatório. É um exemplo de que o LTX 2.3 não consegue garantir movimentos coerentes em todas as situações, especialmente em cenas com ações rápidas e vários elementos em movimento.
3. Vídeo realista de uma mulher caminhando na praia
No terceiro teste, utilizei um prompt curto para gerar uma mulher adulta caminhando em direção à câmera na praia. A intenção era observar como o modelo lidaria com uma cena realista e um movimento humano relativamente simples.
Prompt utilizado:
A fully naked, realistic-looking adult woman walks slowly toward the camera along the beach, taking two natural steps.
Minha avaliação
O modelo gerou o vídeo sem aplicar censura à nudez solicitada. Entretanto, isso não significa que tenha reproduzido todos os detalhes anatômicos de maneira realista.
As partes íntimas não foram detalhadas. Na região inferior, o resultado ficou com uma aparência artificial, semelhante à de uma boneca sem detalhes anatômicos. Portanto, embora o modelo tenha atendido à proposta geral de uma pessoa nua caminhando, a representação não ficou totalmente realista.
Esse teste mostra uma diferença importante entre gerar uma cena sem censura e conseguir produzir uma representação visual anatomicamente convincente. São aspectos distintos, e um resultado pode atender ao primeiro sem necessariamente atender ao segundo.
Veredito: o modelo conseguiu gerar a cena solicitada, mas apresentou limitações na anatomia e nos detalhes do corpo. Para avaliar realismo, esses defeitos precisam ser considerados.
4. Vídeo com fala em português brasileiro
Neste teste, utilizei uma imagem como referência para gerar um vídeo de uma mulher adulta em uma praia tropical. Ela deveria olhar para a câmera, sorrir e dizer uma frase específica em português brasileiro.
Diferentemente de uma geração feita apenas a partir de texto, este teste parte de uma imagem e busca transformá-la em uma cena em movimento.
A realistic video of an adult woman wearing a bright pink bikini, standing on a tropical beach with the ocean behind her. She looks directly at the camera, smiles naturally, and speaks to the viewer. Medium shot, steady camera, gentle breeze moving her hair, natural daylight. She speaks in Brazilian Portuguese, with a natural Brazilian accent, saying exactly: "Não esquece de deixar o like!"
Minha avaliação
Esse foi o teste com a melhor qualidade visual entre os resultados que obtive. A geração a partir da imagem de referência produziu um resultado mais convincente, mostrando que esse tipo de fluxo pode ser interessante para quem já possui uma imagem e deseja transformá-la em vídeo.
Entretanto, o resultado não apresentou o lip-sync que eu esperava. A personagem deveria falar diretamente com a câmera, mas o movimento da boca não ficou sincronizado com a fala como eu gostaria.
Acredito que isso possa ter relação com a especificação do prompt, que poderia descrever de maneira mais explícita a sincronização labial e os movimentos da boca correspondentes a cada palavra. Ainda assim, não é possível afirmar que esse foi o único motivo: a configuração do workflow e as capacidades do modelo também podem influenciar o resultado.
Veredito: foi a geração com melhor qualidade visual. O principal ponto negativo foi a ausência de um lip-sync convincente, algo importante quando a intenção é criar personagens que falam diretamente com o espectador.
5. Cena cinematográfica com imagem de referência
O quinto teste foi uma cena de ação cinematográfica. Utilizei uma imagem de referência de um homem em uma cidade destruída. Ele deveria colocar os óculos escuros e, em seguida, disparar verticalmente para o céu, levantando poeira e destroços.
Prompt utilizado:
The man in the reference image stands silently in a desolate, ruined city street. He calmly puts on his dark aviator sunglasses and briefly holds his pose. Suddenly, he launches vertically into the sky at incredible speed. A powerful shockwave erupts beneath his feet, blasting dust and small pieces of rubble across the street. The camera pulls back as he rapidly ascends, leaving a trail of dust and heat distortion behind him. The ruined city remains visible below as he rises into the sky. Cinematic realism, desaturated colors, dramatic lighting, realistic debris physics, smooth continuous motion. Preserve the man's appearance and identity from the reference image. No dialogue, no speaking, no voice, no subtitles, no scene cuts.
Minha avaliação
Essa foi a melhor geração no conjunto dos aspectos que eu estava buscando, embora o resultado ainda não tenha ficado exatamente como eu gostaria.
O ponto positivo foi a fidelidade ao prompt. A sequência proposta era relativamente complexa: o personagem precisava colocar os óculos, manter a pose por um instante e depois subir rapidamente, com poeira e destroços sendo lançados para longe.
Mesmo sem atingir completamente a minha expectativa, o resultado conseguiu seguir a proposta geral da cena. Isso é importante porque demonstra que o modelo pode ser útil para criar sequências cinematográficas específicas a partir de uma imagem de referência, mesmo quando ainda há espaço para melhorar o resultado.
Veredito: minha geração favorita dos cinco testes. Não ficou perfeita, mas foi fiel ao que solicitei e demonstrou potencial para projetos de ação e efeitos visuais.
Comparativo dos cinco testes
| Teste | Tempo | Minha avaliação |
|---|---|---|
| Dragão | 4:34 | Qualidade aceitável, com defeitos anatômicos. |
| Anime de futebol | 5:53 | Distorções graves e física pouco convincente. |
| Praia | 5:23 | Sem censura, mas com anatomia artificial. |
| Fala em português | 5:10 | Melhor qualidade visual, mas sem lip-sync convincente. |
| Homem voando | 6:21 | Melhor resultado geral e boa fidelidade ao prompt. |
Quanto tempo levou para gerar os cinco vídeos?
Somando os tempos registrados, as cinco gerações levaram aproximadamente 27 minutos e 21 segundos.
O menor tempo foi o da cena com o dragão, com 4 minutos e 34 segundos. Já a cena cinematográfica com o homem voando levou 6 minutos e 21 segundos, sendo a geração mais demorada deste teste.
Esses números representam os tempos de processamento registrados no meu computador com uma RTX 3060 de 12 GB. Os resultados podem variar conforme a GPU, a resolução, o número de quadros, as configurações de geração e o workflow utilizado.
Minha opinião: o LTX 2.3 ainda vale a pena?
Sim. Na minha opinião, o LTX 2.3 ainda é funcional para vários projetos, mas é importante saber o que esperar dele.
Os cinco testes mostram bem os dois lados da geração de vídeos com IA. Em algumas cenas, o modelo produziu resultados aproveitáveis. Em outras, apresentou problemas evidentes de anatomia, física, continuidade visual e sincronização labial.
Minha impressão é que ele funciona melhor quando o objetivo é criar uma cena específica, experimentar uma ideia visual ou produzir um trecho para complementar um vídeo maior. Quando a exigência é uma sequência complexa, com vários movimentos precisos e consistência absoluta, os defeitos ficam mais evidentes.
Também é importante não confundir fidelidade ao prompt com qualidade perfeita. No teste do homem voando, por exemplo, gostei de como o modelo seguiu a proposta, embora o resultado não tenha atingido totalmente a minha expectativa.
Outro ponto é o tempo. Com a RTX 3060 de 12 GB, cada geração levou entre quatro e seis minutos. Isso não é ideal para quem precisa produzir centenas de vídeos rapidamente, mas pode ser perfeitamente aceitável para quem está desenvolvendo cenas selecionadas e não quer depender exclusivamente de serviços online.
Portanto, eu não descartaria o LTX 2.3. Ele ainda tem utilidade, especialmente para quem gosta de experimentar, aceita trabalhar com as limitações atuais e consegue aproveitar os melhores resultados dentro de um projeto maior.
RTX 3060 de 12 GB para geração de vídeos com IA
Todos os tempos apresentados neste artigo foram obtidos utilizando minha RTX 3060 de 12 GB. A quantidade de VRAM é importante para trabalhar com modelos generativos, mas o desempenho também depende das configurações utilizadas e da complexidade de cada geração.
Se você está pensando em montar ou atualizar um computador para trabalhar com ComfyUI, geração de imagens e vídeos com IA, vale comparar a quantidade de memória de vídeo, o desempenho e o preço das placas antes de comprar.
Conclusão
O LTX 2.3 não acertou tudo nos meus testes, mas também não considero que seja uma ferramenta sem utilidade. A geração do anime de futebol ficou bastante distorcida, enquanto a cena com o dragão teve uma qualidade aceitável para determinados objetivos. O teste de praia mostrou limitações anatômicas, e o vídeo com fala não apresentou a sincronização labial esperada.
Já a cena cinematográfica com imagem de referência foi a minha favorita: apesar de não ter ficado exatamente como eu queria, seguiu bem a proposta do prompt.
No fim, minha avaliação é simples: o LTX 2.3 ainda vale a pena para vários projetos, desde que você conheça suas limitações e não espere perfeição em todas as gerações. Com uma RTX 3060 de 12 GB, consegui testar diferentes ideias localmente, sem precisar recorrer a uma plataforma online para cada tentativa.
Sansão Seara
Tutoriais sobre inteligência artificial, ComfyUI, ferramentas locais e criação de conteúdo.


0 Comentários