¿Cómo conseguís mantener una voz consistente entre varios clips?
¡Hola! Estoy creando mis primeros vídeos con Vega y, como cada generación está limitada a 10 segundos, estoy probando a producir varias escenas con continuidad para unirlas después.
He conseguido mantener bastante bien su identidad y la voz coincide en los dos primeros clips, pero en el tercero empieza la lotería: a veces cambia la voz, otras falla la pronunciación o la interpretación queda poco natural.
También he probado Voice Change de Higgsfield utilizando siempre la misma voz. En algunas frases funciona muy bien, pero en otras introduce errores que ya estaban en el audio original o genera una pronunciación extraña. Seguramente todavía no controlo bien el proceso; llevo muy poco tiempo aprendiendo.
¿Cómo lo hacéis vosotros para conservar exactamente la misma voz en vídeos diferentes? ¿Generáis primero el audio y después hacéis lip-sync, utilizáis una voz clonada o trabajáis siempre con un vídeo anterior como referencia?
Cualquier consejo sobre vuestro flujo de trabajo me vendría genial. ¡Gracias!