15 septembre 2026

DomoAI : créer un clip musical IA avec Omni Reference

Un vrai clip de rap sans caméra, sans tournage et sans équipe : le chanteur, c'est Greg dessiné façon jaquette de jeu vidéo, la ville n'existe pas. Une photo, une chanson, un prompt, et la fonction Omni Reference de DomoAI propulsée par MiniMax H3. La méthode complète, la règle d'or du lip-sync et le verdict honnête sur les crédits.

🎁Bonus gratuit avec cette vidéoLa méthode complète, les paroles d'« Open World » et les 6 prompts du clipRécupérer
🚀Tester DomoAI · En cliquant sur le lien, vous générez une vidéo gratuitementLien affilié : ça soutient ma chaîne et vous permet de bénéficier de la meilleure offreOuvrir →

DomoAI et Omni Reference : on ne décrit plus une vidéo, on fournit des preuves

Un clip musical, normalement, c’est un réalisateur, un cadreur, un monteur, des décors et des milliers d’euros. Cette vidéo en fabrique un avec une photo, une chanson et un prompt. L’outil : DomoAI, la plateforme historique des créateurs anime et vidéo, et sa nouvelle fonction Omni Reference (« Référence Omni » dans l’interface). Le principe tient en une phrase : au lieu de décrire une vidéo avec des mots, vous fournissez des preuves. Une image pour le personnage, une image pour le décor, un fichier audio pour la musique, et le modèle combine tout en respectant chaque référence.

Pourquoi MiniMax H3 pour un clip

Omni Reference tourne au choix sur Seedance 2.5 ou sur MiniMax H3, le modèle multimodal de MiniMax : jusqu’à 15 fichiers de référence (9 images, 3 vidéos, 3 audios), une sortie en 2K, et surtout une image générée en restant calée sur le son. C’est ce qui permet un lip-sync propre en français, le point sur lequel la plupart des modèles vidéo échouent. Le clip de la vidéo, « Open World », est un morceau G-funk écrit à la main, maquette générée par IA, dont le refrain est décliné dans trois univers sans retoucher une seule référence.

La méthode, du personnage au clip monté

  1. Les paroles d’abord : l’IA fait les images, jamais le message. C’est l’étape la plus importante du clip.
  2. Un personnage illustré, pas un deepfake : Greg dessiné façon jaquette de jeu vidéo, à partir de sa photo, avec la consigne de tracer ses traits exacts puis de tout redessiner sans copier le réalisme. Un style illustré tient bien mieux sur la durée.
  3. Omni Reference : la key art en Image 1, le refrain en Audio 1, un rôle donné à chaque fichier dans le prompt, les paroles écrites pour verrouiller le lip-sync, et un vrai découpage de clip (un cut toutes les 2 à 3 secondes). 295 crédits pour 14 secondes en 2K.
  4. La règle d’or : la durée de génération doit être exactement celle de l’extrait audio, sinon le modèle hallucine la fin.
  5. Trois univers, mêmes références : le refrain au coucher de soleil, puis la nuit néon, puis le pont en manga noir et blanc. Seul le paragraphe des plans change dans le prompt.
  6. La danse et le montage : décrire une danse en prose donne un robot ; nommer la chorégraphie (step touch, body wave, chest pop) donne un vrai déhanché. Chaque génération sort déjà montée, il reste à poser les blocs sur la chanson.

Le verdict honnête : crédits, formules et limites

Chaque génération de 14 secondes en 2K coûte environ 300 crédits, et le clip complet, ratés et relances compris, 2 000 à 2 500 crédits : MiniMax H3 consomme des crédits à chaque essai, il faut générer court et en 768P avant de passer en 2K. DomoAI propose quatre formules (Basique, Standard, Pro, Équipe) et, sur Standard, Pro et Équipe, certaines fonctions passent en mode Relax avec génération vidéo illimitée et gratuite ; MiniMax H3 n’en fait pas encore partie. Les autres limites : 15 secondes par génération (un clip de trois minutes, c’est douze blocs), le texte à l’écran à incruster au montage plutôt qu’à demander au modèle, et la plus importante : l’IA donne les images, pas le concept, ni les paroles, ni le goût. Pour un clip stylisé, cohérent et synchronisé en un après-midi, il n’y a en revanche rien d’équivalent aujourd’hui.

La méthode et la règle d’or sont en accès libre ci-dessous ; les 6 prompts du clip, les paroles complètes et la fiche de dépannage contre votre email. 👇


La méthode complète, les paroles d'« Open World » et les 6 prompts du clip

La méthode en 4 étapes et la règle d'or du lip-sync en accès libre. Puis contre votre email : le prompt de la key art, le prompt du refrain sur Omni Reference, les deux autres univers (nuit néon, manga noir et blanc), le couplet et la danse (la version ratée, puis la bonne), les paroles complètes et la fiche de dépannage quand le rendu n'est pas bon.

💡 À lireLa méthode en 4 étapes, et la règle d'or

Réglages utilisés pour chaque bloc du clip : mode Référence Omni, modèle MiniMax H3, 16:9, 2K, audio activé, durée réglée sur la durée exacte de l'extrait audio (14 s pour le refrain). Coût constaté : 295 crédits par génération de 14 s en 2K, 180 en 768P. MiniMax H3 accepte jusqu'à 15 références : 9 images, 3 vidéos, 3 audios.

Étape 1 · La chanson d'abord

Les paroles se vivent avant les images : l'IA fera les images à votre place, elle ne décidera jamais ce que vous avez à dire. Écrivez le texte, générez une maquette avec une IA musicale, puis découpez les extraits de 14 s maximum (refrain, couplet, pont), chacun coupé 0,2 s plus long que le bloc visé pour éviter les frames noires.

Étape 2 · Le personnage, illustré, jamais photoréaliste

Un style illustré tient beaucoup mieux sur la durée d'un clip qu'un deepfake. Donnez votre photo et demandez de tracer vos traits exacts (crâne, lunettes, barbe) puis de vous redessiner dans le style choisi sans rien copier du réalisme de la photo. Cette key art devient la référence canonique du personnage ET du style.

Étape 3 · Omni Reference : on fournit des preuves

Dans Vidéos IA, mode Référence Omni, modèle MiniMax H3 : déposez la key art (Image 1) et l'extrait audio (Audio 1), et donnez un rôle à chaque fichier dans le prompt. L'Image 1 est le personnage et le style, l'Audio 1 la bande-son, avec les paroles écrites noir sur blanc pour verrouiller le lip-sync. Demandez un vrai clip : un cut toutes les 2 à 3 secondes, gros plans et plans moyens.

La règle d'or · durée audio = durée vidéo

La durée de génération doit être EXACTEMENT celle de l'extrait audio. 13,4 s d'audio se génèrent en 13 s, jamais en 15 : sinon le modèle hallucine la fin, musique et gestes compris.

Étape 4 · Le montage

Chaque génération sort déjà montée en plans cutés. Il reste à poser les blocs bout à bout sur la chanson originale en alignant les formes d'onde. Générez court et en 768P pour valider, ne repassez en 2K que sur les prises gardées : H3 consomme des crédits à chaque essai (pas de mode Relax).

Encore 6 blocs à débloquer

Recevez la ressource complète

Laissez votre email : vous débloquez tout immédiatement et vous recevez chaque semaine mes nouvelles vidéos et ressources IA. Désinscription en 1 clic.

Double confirmation par email · Jamais revendu · confidentialité