IA. IA. Du classement à la conversation

Plus loin dans le prompt ingeniering…

Plus loin dans le prompt ingeniering…

L'évolution des modèles tend de plus en plus souvent vers une forme multimodale. La même IA peut générer texte, image, son et tout cela grâce à la voix via une interface ultra simplifiée.

Il n'en reste pas moins vrai que l'utilisation conjointe de plusieures IA spécialisée reste (encore) souvent requise.

L'interface utilisateur qui s'impose de plus en plus est la voix.

Speach to Text

Un grand classique de l'IA, popularisé notamment par Siri (2011) ou Alexa (2014) pour les instructions par reconnaissance vocale, la reconnaissance de la voix.

Le traitement automatique du langage permet aux systèmes informatiques d'analyser et de produire du langage humain. Les approches ont évolué des systèmes fondés sur des règles vers l'apprentissage statistique puis les réseaux de neurones et les grands modèles de langage.

GoSpeech

L'application GoSpeech permet de générer le texte d'un fichier audio enregistré (limité à 3 fichiers de 10 minutes chacun en version gratuite).

goSpeech

source : Paul Éluard (1895-1952). L'Amour la poésie

app.gospeech.comapp.gospeech.com

Amazon Transcribe Medical

Amazon Transcribe Medical est un outil permettant aux professionnels de la santé d'enregistrer rapidement et efficacement des conversations cliniques dans des systèmes de dossiers de santé électroniques à des fins d'analyse. Par exemple, dans le secteur bancaire, la synthèse vocale est utilisée via un service client activé par la voix. Dans le secteur de la santé, la synthèse vocale contribue à améliorer l'efficacité en fournissant un accès immédiat aux informations et en saisissant des données.

aws-amazon-com

Taille des fichiers

Il est possible de procéder à la reconnaissance de texte d'un fichier audio directement dans une IA.

La taille des fichiers est souvent limitée, moins de 25 Mo et le nom ne doit pas comprendre d'espace.

Si le fichier fait plus de 25 Mo, vous pouvez le reduire via audacity en l'enregistrant avec les paramètres de qualité minimaux et/ou en le découpant en morceaux (même chose mais sur les sélections).

Turboscribe

Le site turboscribe.ai permet la transcription de 3 fichiers de 30 minutes maximum par jour.

prompt Procède à la reconnaissance de texte de ce fichier audio.

Un exemple de fichier transcrit sur le droit des robots.

Au format PDF

Ce fichier peut ensuite être analysé, résumé, etc.

Dict IA

Dicet.ai est un assistant de réunion IA souverain.

Dicte crée des comptes-rendus automatiques sur la base des échanges enregistrés en réunion ou de notes vocales personnelles.

Dicte offre un enregistrement, une transcription et un traitement fluides des discussions en réunion, rendant chaque réunion plus productive et accessible, le tout avec identification des intervenants, .

120 min / mois gratuites.

www.dicte.ai/

Text to Speach

elevenlabs
Murf

Processus inverse, il s'agit de faire parler la machine en lui soumettant un texte. Rire et voix d'enfants sont les plus difficile à reproduire.

Les résultats sont de plus en plus convaincants.

Voici le texte qui est proposé, ensuite enregistré via un téléphone.

Que la force…

Naturalreaders
La meilleure interface testée. Efficace.
Google
Offre gratuite variable — vérifier les conditions actuelles du service.
Murf
Interface sobre, quota gratuit de 10 minutes.
Elevenlabs
333 caractères gratuits.

Dans la série des outils d'OpenAI, Whisper est un système de reconnaissance vocale automatique passé en opensource (ASR) formé sur 680 000 heures de données supervisées multilingues et multitâches collectées sur le Web.

Whisper est le nom du réseau de neurones utilisé. Il est proposé sur github pour les codeurs.

Dans le même esprit, assemblyAI propose une API très simple aux codeurs. Avec quelques lignes de code, par exemple en Python avec vos élèves, un fichier son peut lui être fournit en entrée pour disposer de sa transcription en sortie.

Voir également elevenlabs.io/.

Ecouter un exemple

Exemple d'utilisation

Tales audio

Dans l'exemple ci-dessous, les voix ont été entrainées à partir d'échantillons divers notamment en chinois. Le plus difficile, reproduire les voix des enfants ou les rires. Un comédien peu donc produire tout seul toutes les voix.

Entrainer les modèles de voix à partir des échantillons nécessite de grosses puissances de calculs (confiées aux cartes graphiques) ou via la location d'une instance de machine virtuelle en ligne. L'écriture du scénario est assistée par un moteur de développement de jeux vidéos.

Whisper va générer automatiquement les sous-titres.

Les voix, notamment, mais aussi les illustrations sont générées par l'IA et/ou des "Modificateur de voix".

Le résultat peut être "écouté" en cliquant sur l'image ci-dessous. Tales Audio propose des fictions audios immersives sur le thème du fantastique, de l'horreur et de la SF.

Podcast automatique

Perplexity propose désormais un podcast sur les derniers développements en matière de technologie, de science et de culture. Discover Daily vous tient informé des tendances et des idées qui façonnent notre avenir en s'appuyant sur la recherche de Perplexity et la voix IA d'ElevenLabs.

lienwww.perplexity.ai/podcast

Text to Music

Voicemod
Soundraw
Mubert
Aiva

Le site voicemod permet de générer une musique à partir de n'importe quel texte en sélectionnant une voix, un style etc.

tuna.voicemod.net/text-to-song/

Nous sommes les patates ducoup on a créé une musique sur les patates ! :) ( ps : on n'est pas des pros )

Il est donc désormais possible de faire de la musique générative à partir de :

  • paroles
  • mélodie
  • instrumentation
  • voix
  • arrangement
  • transformation d'un morceau
  • génération à partir d'une image ou d'une description

Voir également

Soundraw
Mubert
Aiva

Extraire l'audio

Une IA qui extraie les instruments, voix et sons d'un fichier sonore.

https://www.lalal.ai/

Text to Image

Certains modèles peuvent encore produire des résultats différents selon la langue du prompt. L'anglais peut parfois être avantageux pour certains modèles ou styles, mais il n'est plus pertinent d'en faire une règle générale.

La technique évolue, les déceptions restent. Deux exemples.

L'on précisera donc pour un prompt image :

  • Le type d'image : paysage, rue, macro, mode, art, portrait, illustration etc.
  • Le sujet : Ville, fleur, montagne, enfant etc.
  • Le type : Elegant, abstrait, futuriste, joyeux etc.
  • Le décor : Forêt tropicale, désert, jungle, banquise etc.
  • L'ambiance' : Eclairage doux venant de droite, nuit, plein soleil etc.
  • Technique : 4/3, 8K, ISO 100, objectif NIKON AF-S DX, etc.
Dall-e-2

En plus de ChatGPT,openai.com/propose également une application plus ancienne, Dall-e-2.

nightcafe

Le sitenightcafepropose des crédits gratuits pour réaliser des images à partir de différents modèles Stable Diffusion, SDXL.

Text to Image avec stablecog
stablecog

Le sitestablecogpermet de générer de générer des images à partir de nombreux filtres.

Text to Image avec Canva
Canva

Le sitecanvapropose d'intégrer une appli qui génère des images.

Text to Image avec craiyon
Craiyon

Craiyon, anciennement DALLE mini, plutôt à destination des plus jeunes.

Text to Image avec dream.ai
dream.ai

L’approche guidée par CLIP avecdream.aiest un réseau de neurones open source créé par l’équipe de recherche d’OpenAI.

Text to Image avec dream.ai
clipdrop

Un sérieux concurrent de Midjourney, 100 images gratuites par jour au moment de la rédaction.

Text to Image avec dream.ai
deepai

Style d'images, cyberpunk, abstraites, anciennes…

Text to Image avec lensgo
Lensgo

Vidéos animées, transfert de style

Text to Image avec lensgo
Civitai

Open source, prompting négatif, galerie d'images…

Les images peuvent également être retouchées, et cela même uniquement par la voix pour certaines IA.

Note. Le cours de bourse était faux à la date de génération.

Spam et Slop

Le slop est un média de mauvaise qualité, comprenant des textes , des sons et des images, réalisé à l'aide d'une technologie d'intelligence artificielle générative. Inventé dans les années 2020, le terme a une connotation péjorative proche de celle de « spam ».

“Contrairement à un robot conversationnel”, affirme The Guardian, le slop n’est pas interactif et il est rarement destiné à répondre aux questions des internautes ou à leurs besoins.
“Au lieu de cela, précise le quotidien, il existe principalement pour donner l’apparence d’un contenu créé par l’humain, générer des revenus publicitaires et orienter l’attention des moteurs de recherche vers d’autres sites.”

Wikipedia

Text to vidéo

Tome

Tome permet de faire une présentation assistée par ordinateur. Après avoir sélectionné un "template", une série de "slides" préremplies sont proposées. Vous pouvez y adjoindre des vidéos, du texte à l'instar de toute autre présentation assistée (genially, Google slide, Power point, Prezi ou Beautiful.ai par exemple).

Offre gratuite variable — vérifier les conditions actuelles du service.

tome.app/

Vidéo automatique

Les vidéos ci-dessous sont générées à partir du script suivant :

"Ile de La Réunion. Une Mercedes SLK des années 70 blanche roule à toute allure sur la route du littoral. Une femme brune conduit. Elle porte des lunettes de soleil et un grand chapeau. A côté d'elle un homme se protège du soleil et tient une ombrelle. Sur le siège arrière un chien type bulldog anglais. La route du littoral a la forme d'un chemin de terre escarpé entouré de pins sur une pente montagneuse abrupte qui donne sur la mer. La poussière s'élève des pneus, la lumière du soleil éclaire la voiture d'une lumière douce de fin de journée. Le chemin de terre s'incurve doucement vers le lointain, sans qu'aucune autre voiture ou véhicule ne soit en vue. Les arbres de chaque côté de la route sont des séquoias, des cocotiers, avec des taches de verdure éparpillées et de petites rivières qui vont jusqu'à la mer. Au loin, un volcan en éruption. La voiture est vue de l'arrière et suit la courbe avec facilité, ce qui donne l'impression qu'elle roule sur un terrain accidenté. Le chemin de terre lui-même est entouré de collines et de montagnes escarpées, avec un ciel bleu clair au-dessus duquel s'agitent des nuages. Un vieil avion biplan semble rouler à la même allure et suivre la voiture. Dans le biplan un lama observe la situation avec des jumelles."

Vidnoz

Pictori

Bon ! Tel que cela a surtout le mérite d'être drôle.

Dans la réalité, comme pour un vrai film, il faut découper une histoire en plans, prévoir un storybord, donner des indications de lumières etc. Si l'IA peut aider, l'on n'en est pas encore -pour l'instant- à placer une caméra à l'endroit que l'on souhaite, avec l'angle que l'on choisit etc.

Ce premier scenario est enrichi.

Comment générer des vidéos ?

Les personnnages

Les images de deux personnes et deux animaux ont été générées et servent de modèles.

Les scènes

DESCRIPTION DES SCÈNES

Iatu : femme élégante, cheveux bruns ondulés courts, lunettes rondes, allure très maîtrisée façon espionne sophistiquée des années 50.

Iago : homme aux cheveux poivre-et-sel, moustache fine, costume trois pièces impeccable, présence calme et froide d’un agent des services secrets des années 50.

Taille : même taille, démarche assurée, duo parfaitement synchronisé.

Le Lama : adorable… mais l’air clairement un peu bête, regard vide mais enthousiaste, talent olympique du crachat.

Le poulet : c'est le pilote du biplan. Un poulet à plumes, un peu rigolo avec des lunettes de soleil.

Scène 1
Iago et Iatu marchent côte à côte le long des quais de la Seine à Paris, tenus droits comme deux espions en mission. Ils portent tous les deux des vêtements inspirés des agents secrets des années 50 : costumes sombres, silhouettes élégantes, allure sérieuse. Entre eux, un lama tenu en laisse avance en zigzaguant, l’air vaguement stupide, les oreilles molles. À intervalles réguliers, il s’arrête pour cracher au pied des arbres, sans aucune forme de respect pour la capitale. La lumière du matin se reflète sur la Seine, ambiance calme… sauf pour le lama.

Scène 2
Soudain arrive un avion, un vieux biplan des années 30 qui pétarade. Un vieux biplan des années 30, brinquebalant et pétaradant, arrive en rase-mottes au-dessus du quai. Aux commandes : un poulet, un vrai, affublé d’énormes lunettes d’aviateur rondes et d’une écharpe flottant au vent. Le moteur tousse, l’avion tremble, mais le pilote semble… terriblement concentré pour un gallinacé.

Scène 3
Voyant le biplan approcher, le lama relève soudain la tête, plisse ses yeux mi-idiots mi-déterminés, prend une grande inspiration… et tente de cracher en direction de l’avion. Le jet rate bien sûr. Le poulet, vexé (probablement), ouvre la trappe latérale du biplan et jette un œuf en piqué. L’œuf traverse l’air comme un projectile parfaitement calculé, frappe le lama en pleine tête et éclate. De la coquille jaillit un petit papier roulé qui s’envole. Sur le billet : “iago.re” écrit à la main.

Scène 4
Danse de victoire du poulet sur l'aile de biplan.

Scène 5
Gros plan sur la tête du Lama avec l'oeuf écrasé. Les restes d'œuf dégoulinent lentement sur son poil. Il fulmine et prépare sa réaction. Son expression hésite entre la surprise totale et le vide intersidéral. Un moment de cinéma.

Scène 6
Le poulet revient, le lama crache une boule rouge dans l'hélice, l'avion s'écrase, le poulet nage vers la berge.

Scène 7
Les deux personnages marchent le long de la Seine, vue de dos, IaTu tient le Lama en laisse IaGo le poulet. Au loin c'est Paris plage.

VideoGen

VideoGen génère 7 plans avec un avion qui n'a rien d'un biplan et plein de faux raccorts…

Canva

Canva est assez généreux en vidéos grauites (50) et génère 1 plan de biplan…

KlingAI

KlingAI génère un joli plan de 10 secondes en intégrant l'avatar de IaGo et un biplan…

Effets spéciaux

higgsfield.ai permet d'ajouter des effets spéciaux…

Sketch to image

source : Copie d'écran dewww.youtube.com/

Ou comment créer une image à partir d'un simple dessin au crayon, ci-dessous avec un hamac (désolé pour la piètre qualité du dessin original, mais après tout il s'agit d'un test).

A partir d'un simple dessin au crayon, il est possible de générer des intérieurs complets, par exemple une cuisine, un salon, ou alors des paysages et de les faire varier à l'infini.

Pour tous ces sites un compte est obligatoire, à part pour canva, ils ne font aucune propositon "éducation", ce sont donc les tests gratuits qui ont été utilisés.

Maintenant si le hamac n'est pas le sujet, vous pouvez également le générer dans n'importe quel contexte.

Coder

Outre les solutions dédiées aux codeurs et désormais intégrables dans les éditeurs de code, par exemple Github Copilot ou codium ou même les solutions de type "nocode" type Zapier.com, n8n ou make, il est toujours possible de demander une sortie en code (html, javscipt, python).

Claude la propose d'ailleurs directement.

prompt Génère le code html de cette maquette

Un dessin style maquette de page

version 1 (mistral)

version 2 (ChatGPT)

Illustrer un texte

Des outils de type Napkin permettent d'insérer directemt une illustration à partir d'un texte. Cette illustration est modifiable.

napkin

app.napkin.ai

app.napkin.ai

Autre exemple avec canva (edu) qui génère à la fois un texte mais aussi un shéma.

De la machine de Turing à l’intelligence artificielle
Tout commence en 1936, lorsque le mathématicien Alan Turing imagine une machine capable d’exécuter n’importe quel calcul à partir d’instructions simples. Cette invention, la machine de Turing, pose les fondations de l’informatique moderne et de la réflexion sur la pensée mécanique.
Quelques années plus tard, Turing se demande si une machine peut penser comme un humain. Son célèbre test de Turing, proposé en 1950, devient le point de départ de l’intelligence artificielle (IA) : une quête visant à reproduire la logique, la perception et l’apprentissage humains.
Les débuts de l’IA reposent sur des systèmes de règles et de logique, mais ces approches atteignent vite leurs limites. Le véritable tournant survient avec l’apprentissage automatique, où les machines n’obéissent plus seulement à des instructions : elles apprennent à partir des données. Inspirée du cerveau humain, cette méthode ouvre la voie à des progrès spectaculaires.
Aujourd’hui, grâce au deep learning et aux réseaux de neurones, l’IA reconnaît des visages, traduit des langues, conduit des véhicules et crée même des œuvres d’art. De la machine de Turing aux algorithmes modernes, l’humanité poursuit un même rêve : comprendre l’intelligence pour mieux la recréer.

www.canva.com/

Analyse émotionnelle

prompt Procède à l'analyse émotionnelle de cette photo

La photo montre une salle de classe remplie d'élèves, principalement jeunes, assis à leurs pupitres en bois. L'ambiance générale semble sérieuse et studieuse.

Un enfant au premier plan, regardant vers le haut et légèrement à droite, semble pensif ou concentré. D'autres enfants semblent attentifs au cours, tandis que certains ont une expression neutre. Il n'y a pas d'indications claires d'émotions fortes comme la joie exubérante, la tristesse ou la colère.

L'environnement suggère un cadre éducatif formel.

Peut-on vraiment analyser les émotions ?

Une IA multimodale peut produire une interprétation d'une expression faciale ou d'une scène. Mais cette description ne constitue pas une mesure fiable de l'état émotionnel d'une personne.

En effet, « semble triste », « paraît concentré » ou « semble en colère » sont des inférences, pas des observations directes de l'émotion.

Une expression faciale n'est pas une preuve de l'état émotionnel.

Le règlement européen sur l'intelligence artificielle (AI Act) du 13 juin 2024 prévoit des obligations pour les fournisseurs de systèmes d'IA à des fins générales (GPAI) et interdit certains systèmes d'IA attentatoires aux droits fondamentaux.

La reconnaissance des émotions sur le lieu de travail et les établissements d'enseignement, sauf pour des raisons médicales ou de sécurité est interdite.

https://www.vie-publique.fr/

Générateurs d'Art

Prompt testé : "femme, intérieur années 30, style art déco, tableaux de miro au mur".
Text to Art avec dreamlike-art
Dreamlike
Text to Art avec Picsart
Picsart
Text to Art avec
stablediffusion
Starryai
Starryaiest un générateur d'art (5 œuvres gratuites par jour).

PhantasIA. Le magazine de la création IA

Ce nouveau rendez-vous mensuel explore la création IA et questionne ses limites, usages et conséquences.

Les deux premiers épisodes ci-dessous.

écrire
Partie 5 mise à jour le 25 septembre 2026 (1èreversion 2023)
Droits afférents
Licence Creative CommonsÉléments pour l'IA de F. Trillard, D. Weiss est mis à disposition selon les termes la Licence Creative Commons : Attribution - Pas d'Utilisation Commerciale - Partage dans les mêmes conditions.
Crédits images
Les images, photos, icones :
- IA
Mention d'édition
Frédérique Trillard, Denis Weiss