Guion etiquetado → escenas → video, por API directa (Kling + Higgsfield)
Narrador: still + audio → video con lip-sync, una sola llamada (Kling Avatar).
Collage: guion + descripción visual → video final ensamblado, una sola llamada (Higgsfield + ffmpeg propio).
Guion etiquetado
Volver a parsear reemplaza todas las escenas actuales, incluido cualquier video ya generado en ellas.