Pexo
Pexo/Blog/Génération de vidéos par IA/Comment créer des vidéos avec OpenAI Codex: guide étape par étape

Comment créer des vidéos avec OpenAI Codex: guide étape par étape

Camille Moreau avatarCamille Moreau
·Dernière mise à jour : 29 sept. 2026
Résumer avec :ChatGPTChatGPTPerplexityPerplexityClaudeClaudeGeminiGeminiGrokGrok
Comment créer des vidéos avec OpenAI Codex: guide étape par étape
Summary

Pour créer des vidéos avec OpenAI Codex, installez le skill Pexo dans le répertoire des skills de Codex et décrivez la vidéo en langage courant ; l’agent renvoie une vidéo finalisée en plusieurs plans. Pexo sélectionne automatiquement le modèle adapté à chaque plan parmi Seedance 2.0, Kling 3.0, Veo 3.1 et Sora 2, mixe une bande-son à trois couches et exporte aux formats 9:16, 16:9 ou 1:1. Le guide présente les prérequis, les étapes exactes d’installation et de rédaction de la demande, les entrées image, URL, script et audio, le dépannage et une FAQ de 11 questions.

Créez des vidéos IA en discutant.

Pour créer des vidéos avec OpenAI Codex, installez le skill vidéo Pexo, décrivez en langage courant la vidéo souhaitée et l’agent vous renvoie un résultat finalisé. Aucun logiciel de montage, aucune ingénierie de prompt et aucun choix de modèle ne sont nécessaires. À partir d’une seule instruction, Pexo produit une vidéo finalisée composée de plusieurs plans : installez le skill, décrivez la vidéo, laissez Pexo répartir chaque plan entre des modèles tels que Seedance 2.0, Kling 3.0, Veo 3.1 et Sora 2, puis vérifiez et exportez le résultat. Codex ne comporte pas de bouton unique « créer une vidéo », car la bonne méthode dépend du skill que vous ajoutez. Codex lui-même, qui s’appuie sur les derniers modèles GPT-5 d’OpenAI, constitue le cerveau qui planifie la demande et la transmet, mais il ne génère pas de vidéo à lui seul. C’est le skill Pexo installé qui lui apporte cette capacité. Comme le même standard de skill fonctionne aussi dans Claude Code et OpenClaw, le processus appris ici s’applique également à ces agents.

Ce dont vous avez besoin

Deux éléments suffisent pour commencer en quelques minutes:

ExigenceQu'est-ce que c'est
Codex OpenAIOutil de codage agent d'OpenAI, disponible via la CLI Codex, l'extension IDE et l'application sur macOS et Windows. Il fonctionne sur les modèles de génération GPT-5 d'OpenAI, y compris la dernière famille GPT-5.6 (Sol, Terra, Luna) en cours de déploiement. Un forfait ChatGPT payant (Plus, Pro, Business ou Enterprise) vous donne accès.
Une compétence de génération vidéoCapacité qui permet à l'agent de générer de la vidéo. Ce guide utilise Pexo. Codex charge les compétences d'agent à partir d'un fichier SKILL.md, le même standard ouvert utilisé par Claude Code et OpenClaw.

Codex ne génère pas lui-même les images vidéo. GPT-5.6 est un modèle de langage et de raisonnement, pas un modèle vidéo. Le skill Pexo ajoute cette capacité. Une fois celui-ci installé, tout le processus se déroule dans la conversation.

Étape 1: installer le skill vidéo Pexo dans Codex

Ajoutez la compétence Pexo à votre agent Codex. Une compétence d'agent dans Codex est un répertoire contenant un SKILL.md, chargé depuis votre parcours de compétences. Le répertoire de portée utilisateur est ~/.agents/skills, un référentiel conserve les compétences .agents/skills, et Codex lit également un chemin d'administration sous /etc/codex/skills. Pour installer Pexo:

  • Connectez-vous à pexo.ai et copiez votre clé API depuis les paramètres du compte.

  • Ajoutez la compétence Pexo à votre répertoire de compétences Codex. Vous pouvez placer le dossier de compétences sous ~/.agents/skills, ou utilisez le programme d'installation intégré pour le dérouler.

  • Définissez votre clé API Pexo là où la compétence l'attend, puis démarrez une nouvelle session Codex afin qu'elle récupère la nouvelle compétence.

# Create the user skills directory if it does not exist
mkdir -p ~/.agents/skills

# Inside Codex, the skill installer can fetch a skill by reference
$skill-installer

# Browse what Codex has loaded
/skills

La compétence Pexo fournit ses scripts d'assistance ainsi qu'un SKILL.md qui indique au Codex comment se comporter, y compris une règle pour transmettre fidèlement votre demande plutôt que de la réécrire. Codex charge automatiquement les compétences en fonction de leur description. Ainsi, une fois la compétence connectée et votre clé API définie, l'agent est prêt à générer.

Étape 2: décrire la vidéo souhaitée

C'est toute l'interface: dites au Codex ce que vous voulez en langage simple. Vous ne choisissez pas de modèle et ne rédigez pas de message technique. Éléments utiles à préciser:

  • De quoi s'agit-il "une vidéo produit pour ces écouteurs sans fil"

  • Durée et plans "15 secondes, trois plans"

  • Humeur « cinématographique et premium », « rapide pour TikTok »

  • Musique « électronique ambiante », ou laissez l'agent choisir

  • Rapport hauteur/largeur "9:16 pour Reels", "16:9 pour YouTube"

Une première requête complète ressemble à ceci:

> Make a 15-second cinematic product video for these wireless headphones,
  three shots, a slow orbit on the first, premium feel, with ambient music. 9:16.

Cela suffit. Codex analyse la demande et la transmet à la compétence Pexo à partir de là.

Étape 3: laisser Codex et Pexo générer la vidéo

Une fois la demande envoyée, Codex l'envoie à Pexo, qui gère l'intégralité de la production. Pexo écrit un scénario de tournage, puis sélectionne automatiquement le meilleur modèle pour chaque prise de vue parmi plus de 10 options. Un gros plan de produit peut être dirigé vers Kling 3.0, une scène de mouvement vers Seedance 2.0, une cinématique vers Veo 3.1 et un rythme narratif vers Sora 2. Il génère chaque plan, ajoute des transitions, compose une partition originale et mélange une bande sonore à trois couches de voix off, de musique et d'effets sonores Foley.

Une vidéo de 15 secondes en trois plans dure environ 8 à 10 minutes bout à bout. C'est beaucoup plus rapide que de choisir des modèles, d'écrire des invites par modèle et d'assembler des clips à la main. Pendant son exécution, Codex interroge Pexo pour connaître les progrès et rend compte. Vous n'avez rien à faire jusqu'au retour du fichier terminé.

Étape 4: vérifier le résultat et demander des modifications

Lorsque la vidéo revient, vous la visionnez et demandez des modifications de la même manière que vous l'avez décrite, dans un langage simple. Il n'y a pas de chronologie à modifier:

> Make the second shot slower, and swap the music for something more upbeat.

Codex transmet la révision à Pexo et renvoie une coupe mise à jour. Étant donné que la requête reste conversationnelle, vous effectuez une itération en parlant, et non en restituant quoi que ce soit vous-même. L'agent maintient l'apparence cohérente de la marque entre les révisions au cours de la même session.

Étape 5: exporter et utiliser la vidéo

La vidéo terminée revient au format MP4 standard, masterisée et prête à être publiée. La production étant multiformat, vous pouvez demander le même contenu dans différents formats. Pexo exporte 9:16 pour TikTok, Reels Instagram et YouTube Shorts, 16:9 pour YouTube standard et 1:1 pour les publications de flux, sans régénérer à partir de zéro. Téléchargez-le et publiez-le.

Conseils pour obtenir de meilleurs résultats

Quelques habitudes permettent d'obtenir des vidéos nettement meilleures à partir de la même compétence:

  • Décrivez l'ambiance, pas le modèle. « Premium et cinématographique » ou « rapide et ludique » guide mieux le routage de Pexo que de nommer un modèle. La couche de routage est conçue pour traduire l'intention en modèle approprié pour chaque plan, de sorte qu'une description simple surpasse les instructions techniques.

  • Nommez la plateforme. Dire « pour TikTok » ou « pour un pré-roll YouTube » définit automatiquement le rapport hauteur/largeur, la longueur et les conventions de rythme, vous n'avez donc pas besoin de spécifier chacun d'entre eux.

  • Donnez 2 à 4 images de référence pour les produits. Lorsque la précision est importante, concernant un produit, un logo ou un emballage spécifique, remettez quelques photos claires en 1080p ou plus. L'agent les utilise pour garder le produit fidèle d'une prise de vue à l'autre.

  • Soyez explicite sur le nombre de coups et le rythme. « Trois plans, coupes rapides » versus « un mouvement lent et continu » produit des montages très différents. Plus vous spécifiez la structure, plus le premier résultat se rapproche.

  • Générez des variantes dans la même conversation. Demander des alternatives, comme "maintenant une version plus percutante de 9 secondes", au cours de la même session permet de conserver une apparence cohérente à la marque et est plus rapide que de lancer une nouvelle demande.

Autres points de départ: image, URL, script ou audio

Le texte n'est qu'une seule entrée. Pexo en accepte cinq, afin que Codex puisse démarrer la vidéo à partir de ce que vous avez déjà:

EntréeComment démarrerExemple
TexteDécrire la vidéo"une publicité cinématographique pour ma marque de café"
ImageRemettre les photos du produittransformez vos prises de vue en studio en une vidéo de produit animée
URLColler une page produitl'agent extrait les images, le texte et le prix dans une annonce
ScriptFournir un script écritl'agent le segmente en scènes
AudioFournir une piste ou une voix offl'agent génère des visuels correspondant

Pexo comprend également un studio d'images qui achemine automatiquement Midjourney, Flux et Ideogram, afin que vous puissiez d'abord générer les images fixes, puis les transformer en vidéo dans le même flux. À partir des photos de produits, vous suivez le même chemin de description, de génération et de révision avec des images en entrée.

Résoudre les problèmes courants

Si quelque chose ne fonctionne pas du premier coup, la cause est généralement simple:

SymptômeCause probableCorrection
Codex ne voit pas la compétenceLe dossier de compétences ne se trouve pas dans un chemin chargé ou la session a démarré avant l'installation.Confirmez que le dossier se trouve sous ~/.agents/skills, puis exécutez /skills dans une nouvelle session
La génération ne démarre pasClé API Pexo manquante ou non valideRecopier la clé de pexo.ai et définissez-le là où SKILL.md attend
Le résultat ignore votre briefDemande réécrite ou trop vagueReformulez explicitement l'ambiance, la durée, le nombre de plans et le rapport hauteur/largeur dans un seul message.
Rapport hauteur/largeur incorrectRapport non spécifiéAjoutez "9:16", "16:9" ou "1:1" à la requête et réexécutez
Vous voulez un look différentPremière coupe proche mais pas exacteItérer en langage clair: "second plan plus lent, couleur plus chaude"

Passer d’une vidéo à une chaîne de production

Une fois qu'une seule vidéo fonctionne, la même compétence passe à la production par lots. Vous pouvez générer des dizaines de variantes d'annonces à partir d'un ensemble d'entrées ou d'une vidéo par SKU, le tout dans la conversation. Étant donné que Codex est un agent de codage, vous pouvez intégrer la compétence dans un script qui alimente les données produit et prépare les créations multiplateformes terminées pour examen. La boucle de description, de génération et de révision reste la même. Seul le volume change.

À lire également

  • Comment créer des vidéos avec Claude Code: un guide étape par étape

  • Meilleures compétences en génération vidéo pour les agents de codage

  • Comment transformer des photos en vidéo IA: guide image-vidéo

  • Comment créer un pipeline de publicités vidéo IA avec un agent de codage

Ressources

RessourceURLQu'est-ce que c'est
Pexopexo.aiLa compétence vidéo utilisée dans ce guide
Compétences Pexo (GitHub)github.com/pexoai/pexo-skillsCompétences open source pour les agents de codage
Codex OpenAIopenai.com/codexOutil de codage agent d'OpenAI
Documents sur les compétences des agents de Codexdevelopers.openai.com/codex/skillsComment Codex charge et exécute les compétences

Type your thoughts here...

Pexo

Créez des vidéos IA avec Pexo

Transformez chaque idée en vidéo prête à publier. Une phrase suffit pour commencer.

Questions fréquentes (FAQ)

Comment créer une vidéo avec OpenAI Codex?

Installez une compétence de génération vidéo telle que Pexo, puis décrivez la vidéo souhaitée en langage simple dans la conversation Codex. Pexo écrit un script de prise de vue, sélectionne automatiquement les modèles, génère les prises de vue, ajoute des transitions et de la musique, et renvoie un MP4 terminé, généralement en 8 à 10 minutes pour une vidéo de 15 secondes en trois plans. Codex lui-même ne génère pas de vidéo. Il planifie la requête et la transmet à la compétence installée. Vous ne choisissez pas de modèle ni ne modifiez de chronologie. Vous décrivez le résultat et l’examinez.

OpenAI Codex peut-il générer lui-même une vidéo?

Non. Codex fonctionne sur les modèles de génération GPT-5 d'OpenAI, y compris la dernière famille GPT-5.6, qui sont des modèles de langage et de raisonnement, et non des modèles vidéo. Codex planifie et répartit le travail, mais la vidéo réelle est générée par la compétence que vous installez. Avec la compétence Pexo ajoutée, Codex peut transmettre votre demande et renvoyer une vidéo finalisée à plusieurs plans. Sans compétence vidéo, Codex peut écrire du code et automatiser un pipeline, mais il ne peut pas produire de séquences par lui-même.

Comment installer la compétence Pexo dans Codex?

Connectez-vous sur pexo.ai et copiez votre clé API, puis ajoutez le dossier de compétences Pexo à votre répertoire de compétences Codex. Le chemin de portée utilisateur est ~/.agents/skills, un dépôt conserve les compétences sous .agents/skills, et Codex lit également un chemin d'administration. Définissez votre clé API là où SKILL.md l'attend, puis démarrez une nouvelle session Codex et exécutez /skills pour confirmer que Pexo est chargé. Codex sélectionne automatiquement les compétences en fonction de leur description.

Quels modèles Codex utilise-t-il pour générer la vidéo?

Avec la compétence Pexo, l'agent sélectionne automatiquement par plan parmi plus de 10 modèles, dont Seedance 2.0, Kling 3.0, Veo 3.1, Sora 2 et Runway Gen-4.5. Il achemine un produit en gros plan vers un modèle et une cinématique large vers un autre. Vous ne nommez jamais un modèle. La couche de routage sélectionne la meilleure solution pour chaque plan. Ce routage par plan est ce qui différencie un agent vidéo IA d'un générateur à modèle unique, puisque la couche de modèle est remaniée toutes les quelques semaines.

Dois-je savoir comment éditer une vidéo ou rédiger des prompts?

Non. L'objectif du flux de travail basé sur les compétences est que vous décrivez le résultat en langage simple, l'ambiance, la durée, les plans, la musique, et l'agent gère la sélection du modèle, les prompts et l’assemblage en interne. Il n'y a pas d'éditeur de chronologie ni de syntaxe de prompt par modèle à apprendre. Vous répétez en demandant des changements de mots, comme « ralentir le premier plan ». Cela est vrai que vous exécutiez Pexo dans Codex, Claude Code ou OpenClaw.

Combien de temps faut-il pour réaliser une vidéo avec Codex?

Une vidéo de 15 secondes en trois plans avec sélection automatique du modèle et mixage audio dure environ 8 à 10 minutes de bout en bout. Un seul clip brut d'un modèle revient plus rapidement, environ 1 à 3 minutes, mais il n'est pas assemblé et n'a pas de bande sonore. Le temps varie en fonction de la durée, du nombre de plans et si vous souhaitez un montage fini ou un seul clip.

Puis-je créer une vidéo à partir de photos de produits ou d'une URL au lieu de texte?

Oui. Pexo accepte cinq types d'entrée: texte, image, URL du produit, script et audio. Vous pouvez remettre des photos de produits, coller une URL Shopify ou Amazon pour que l'agent extrait les images et le texte, fournisse un script écrit ou fournisse une piste audio. Pexo dispose également d'un studio d’images qui assure le routage entre Midjourney, Flux et Ideogram, afin que vous puissiez d'abord générer des images fixes, puis les transformer en vidéo dans la même conversation.

Cela fonctionne-t-il dans Claude Code et OpenClaw, ou uniquement dans Codex?

Cela fonctionne sur les trois. Étant donné que Agent Skills est un standard ouvert construit sur un fichier SKILL.md, la même compétence Pexo s'exécute dans OpenAI Codex, Claude Code et OpenClaw. L'emplacement d'installation diffère légèrement selon l'agent, Codex utilise ~/.agents/skills tandis que Claude Code utilise son propre répertoire de compétences, mais le workflow de description, génération, révision, exportation est identique.

Ai-je besoin d'une carte de crédit pour commencer à utiliser la compétence Pexo?

Aucune carte de crédit n'est nécessaire pour commencer. Les nouveaux comptes incluent une allocation de crédit de départ afin que vous puissiez générer vos premières vidéos, et vous n'avez pas besoin d'une configuration distincte de jonglage de clé API au-delà de la copie de votre clé Pexo dans la compétence. La génération au-delà de l'allocation de départ fonctionne avec des crédits Pexo et son coût évolue en fonction de la quantité de vidéo que vous générez. Votre accès à Codex provient de votre forfait ChatGPT payant existant.

Puis-je créer plusieurs vidéos à la fois avec Codex?

Oui. Une fois qu'une seule vidéo fonctionne, la même compétence passe à la génération par lots, à plusieurs variantes publicitaires à partir d'un ensemble d'entrées ou à une vidéo par produit, le tout dans une seule conversation. Étant donné que Codex est un agent de codage, vous pouvez également intégrer la compétence dans un script afin que les données produit soient entrées et que les créations multiplateformes terminées soient préparées pour examen. C’est la base d’un pipeline publicitaire vidéo automatisé par l’IA.

Puis-je créer des vidéos verticales pour TikTok, Reels ou Shorts avec Codex?

Oui. Lorsque vous décrivez la vidéo, spécifiez le rapport hauteur/largeur. Utilisez 9:16 pour TikTok, Reels Instagram et YouTube Shorts, 16:9 pour YouTube standard ou 1:1 pour les publications de flux et les exportations Pexo dans ce format. Vous pouvez demander la même vidéo dans plusieurs ratios à la fois, de sorte qu'une seule demande peut produire à la fois une coupe sociale verticale et une version grand écran sans avoir à repartir de zéro.

Camille Moreau avatar
Camille Moreau

Camille Moreau s’intéresse à ce qui donne une identité à une vidéo : une histoire, un rythme et une direction artistique. Elle explore les possibilités de l’IA pour concevoir des univers visuels, construire des storyboards et affiner l’ambiance d’un film. Son fil conducteur : mettre la technologie au service d’une intention créative.

Recommandations Pexo