1. Présentation du projet

Titre de la vidéo : Comment fonctionne ChatGPT ?
Format : vidéo explicative courte
Orientation : paysage
Sujet : fonctionnement simplifié d’un modèle d’intelligence artificielle conversationnelle
Objectif : expliquer de manière claire et accessible comment une question est transformée en réponse par ChatGPT.

La vidéo devait pouvoir être comprise par une personne ne disposant d’aucune connaissance particulière en intelligence artificielle. Le choix a donc été fait de limiter les informations techniques et de présenter le fonctionnement de ChatGPT sous la forme d’un parcours visuel simple.

Le déroulé retenu est le suivant :

Question → Tokenisation → Modèle de langage → Traitement → Réponse


2. Répartition entre le travail humain et l’intelligence artificielle

L’intelligence artificielle a été utilisée comme un outil d’aide à la création, mais la conception et la finalisation de la vidéo ont été réalisées manuellement.

Éléments réalisés par moi

J’ai pris en charge :

  • la définition du sujet ;
  • la recherche de l’angle pédagogique ;
  • la sélection des informations à présenter ;
  • la simplification du fonctionnement de ChatGPT ;
  • l’écriture du déroulé de la vidéo ;
  • la construction du storyboard ;
  • la rédaction des indications données aux outils d’IA ;
  • la sélection des visuels générés ;
  • l’organisation des différentes scènes ;
  • le montage de la vidéo ;
  • le choix de la durée de chaque plan ;
  • l’ajout des textes à l’écran ;
  • les transitions entre les séquences ;
  • la synchronisation des images avec la musique ;
  • l’harmonisation générale des visuels ;
  • le rythme et la finalisation de la vidéo.

Le montage final n’a donc pas été généré automatiquement. Les séquences ont été choisies, découpées et assemblées manuellement afin de construire une vidéo cohérente et compréhensible.

Éléments générés ou assistés par IA

L’intelligence artificielle a été utilisée pour :

  • proposer une première structure narrative ;
  • reformuler les explications de manière plus simple ;
  • créer les descriptions des différentes scènes ;
  • rédiger les prompts de génération ;
  • générer les visuels futuristes ;
  • créer certaines animations ou séquences vidéo ;
  • représenter graphiquement des notions abstraites comme les tokens, le modèle de langage ou le traitement de l’information ;
  • produire plusieurs variantes visuelles avant la sélection finale.

Les visuels générés par IA ont ensuite été retravaillés et intégrés au montage. Ils n’ont pas été utilisés directement sans sélection ou modification.


3. Construction du concept

Le principal défi était de représenter visuellement un processus invisible.

Le fonctionnement d’un modèle de langage ne peut pas être filmé comme une action réelle. J’ai donc choisi d’utiliser une métaphore visuelle reposant sur :

  • des flux lumineux pour représenter la circulation des données ;
  • des fragments de texte pour représenter les tokens ;
  • un réseau de connexions pour symboliser le modèle de langage ;
  • des serveurs et des interfaces numériques pour évoquer la puissance de calcul ;
  • une reconstruction progressive du texte pour montrer la création de la réponse.

L’univers graphique futuriste permet de rendre le sujet plus dynamique, tout en restant directement associé à l’intelligence artificielle.


4. Élaboration du storyboard

Avant de générer les images, j’ai découpé la vidéo en plusieurs scènes simples.

Scène 1 — La question

Un utilisateur écrit une question dans une interface de conversation.

Cette première scène permet de partir d’une situation connue du public : l’utilisation quotidienne de ChatGPT.

Scène 2 — La tokenisation

La phrase se décompose en plusieurs mots ou fragments de mots.

L’objectif est de montrer que l’intelligence artificielle ne traite pas immédiatement la phrase dans son ensemble. Elle la transforme d’abord en petites unités exploitables.

Scène 3 — Le modèle de langage

Les fragments de texte circulent à travers un réseau numérique composé de connexions, de données et de serveurs.

Cette scène représente le modèle de langage et les nombreuses relations qu’il établit entre les éléments de la question.

Scène 4 — Le traitement

Le système analyse le contexte de la demande et évalue les suites de mots possibles.

Le traitement est volontairement représenté de manière simplifiée, afin de ne pas surcharger la vidéo avec des notions trop techniques.

Scène 5 — La réponse

Les informations se réorganisent progressivement pour former une phrase complète, qui apparaît finalement dans l’interface de conversation.

Cette dernière scène permet de refermer visuellement le parcours commencé avec la question de l’utilisateur.


5. Création des prompts

Pour obtenir des résultats cohérents, les demandes adressées à l’IA ont été rédigées scène par scène.

Chaque prompt précisait notamment :

  • le sujet principal de la scène ;
  • l’action à représenter ;
  • le type de cadrage ;
  • le mouvement de caméra ;
  • l’ambiance lumineuse ;
  • le style futuriste et cinématographique ;
  • les éléments qui devaient rester lisibles ;
  • les éléments à ne pas ajouter ;
  • le format paysage ;
  • la continuité visuelle avec les scènes précédentes.

Exemple de prompt utilisé

Interface de conversation futuriste affichant une question simple. La phrase se transforme progressivement en petits blocs de texte lumineux. Les blocs circulent ensuite dans un réseau numérique composé de connexions et de serveurs. Style cinématographique, technologique et épuré, lumière douce, mouvements lents, format paysage, aucun texte illisible, scène claire et facile à comprendre.

Les premiers prompts étaient parfois trop détaillés. Les résultats contenaient alors trop d’informations et rendaient la vidéo difficile à comprendre.

J’ai donc simplifié les instructions afin que chaque scène ne présente qu’une seule idée principale.


6. Génération et sélection des visuels

Plusieurs propositions ont été générées pour chaque étape.

Toutes les générations n’ont pas été conservées. Certains visuels présentaient :

  • trop d’éléments à l’écran ;
  • des interfaces peu lisibles ;
  • des textes déformés ;
  • des mouvements trop rapides ;
  • des changements de style entre les scènes ;
  • des représentations trop complexes du fonctionnement de l’IA.

J’ai sélectionné les séquences les plus simples et les plus cohérentes avec le storyboard.

Lorsque certains éléments ne correspondaient pas au résultat attendu, j’ai modifié les prompts puis relancé une génération. Cette étape d’itération a été importante pour obtenir un univers visuel homogène.


7. Montage de la vidéo

Une fois les visuels générés, j’ai réalisé le montage manuellement.

Le travail de montage a notamment consisté à :

  • importer et organiser les différentes séquences ;
  • supprimer les parties inutiles des générations ;
  • ajuster la durée des plans ;
  • ralentir ou accélérer certaines animations ;
  • organiser les scènes dans un ordre logique ;
  • créer une continuité entre les séquences ;
  • ajouter les titres et les mots-clés ;
  • intégrer les transitions ;
  • synchroniser les changements de scène avec la musique ;
  • vérifier la lisibilité des informations ;
  • équilibrer le rythme général de la vidéo.

J’ai également veillé à laisser suffisamment de temps au spectateur pour comprendre chaque étape avant de passer à la suivante.

La musique électronique accompagne l’univers technologique, mais elle reste en arrière-plan afin de ne pas détourner l’attention du contenu visuel.


8. Choix pédagogiques

La vidéo ne présente pas une explication scientifique complète du fonctionnement de ChatGPT. Elle propose une représentation simplifiée destinée à faciliter la compréhension.

Plusieurs choix ont été faits dans cette logique :

  • présenter seulement cinq étapes ;
  • employer des mots accessibles ;
  • éviter les formules mathématiques ;
  • limiter le nombre d’informations affichées simultanément ;
  • utiliser une métaphore visuelle pour les données ;
  • répéter le parcours de manière linéaire ;
  • privilégier des animations lentes et lisibles.

Le mot « raisonnement » a été utilisé dans un sens simplifié pour désigner le traitement de la demande. Il ne signifie pas que le modèle raisonne exactement comme un être humain.


9. Limites rencontrées

L’utilisation de l’IA générative présente plusieurs limites.

Les outils peuvent notamment :

  • produire des textes déformés dans les images ;
  • ajouter des éléments non demandés ;
  • modifier l’apparence d’une interface entre deux plans ;
  • créer des mouvements incohérents ;
  • représenter de manière approximative certaines notions techniques ;
  • générer des scènes trop chargées ;
  • manquer de continuité visuelle.

La génération par IA nécessite donc une supervision humaine. Le résultat final dépend beaucoup de la qualité des instructions, du nombre d’essais réalisés et du travail de sélection effectué après la génération.


10. Apports de l’intelligence artificielle

L’IA m’a permis de représenter rapidement des environnements difficiles à produire avec des moyens de tournage classiques.

Elle a notamment facilité :

  • la création d’un univers futuriste ;
  • la visualisation de concepts abstraits ;
  • la production de plusieurs propositions graphiques ;
  • l’exploration de différentes ambiances ;
  • la création de mouvements et d’effets numériques ;
  • la réalisation d’une vidéo sans disposer de décors ou de matériel de tournage spécialisé.

Elle a toutefois été utilisée comme un outil de production et non comme un remplacement du travail créatif. Le concept, la sélection des informations, la direction artistique et le montage final sont le résultat de décisions humaines.


11. Bilan

Ce projet montre que l’intelligence artificielle peut faciliter la création de contenus audiovisuels, notamment lorsqu’il faut représenter des sujets abstraits ou technologiques.

La principale difficulté n’a pas été de générer des images, mais de construire une explication claire, de conserver une cohérence entre les scènes et de sélectionner uniquement les éléments utiles à la compréhension.

L’IA a permis de produire la matière visuelle, tandis que mon travail a consisté à imaginer le concept, guider les générations, sélectionner les résultats et transformer l’ensemble en une vidéo structurée et compréhensible.

Lien vers l'article : https://blog.mbadmb.com/comment-fonctionne-chatgpt/