JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Geek & Gadgets
  • Véhicules & e-Mobilité
  • Bons plans & promos
  • Plus
    • Blockchain & Crypto
    • Web & Internet
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
Tech & Innovations

OpenAI AI Voices : Trois nouveaux modèles pour la transcription et les voix synthétiques

Darell Mertens
Published: 23 mars 2025
Last updated: 23 mars 2025
Partager
openai audio model

Trois nouvelles voix IA signées OpenAI sont là. Ça fait un moment qu’ils bossent dessus, et malgré quelques petits scandales, ils n’ont pas ralenti la cadence.

OpenAI a lancé gpt-4o-transcribe, gpt-4o-mini-transcribe et gpt-4o-mini-tts. Des noms qui ne font pas rêver, mais des technos qui promettent. Ces outils servent à la transcription et à la génération vocale via API, donc surtout pour les développeurs et leurs applis tierces. Les curieux peuvent aussi tester sur OpenAI.fm, un site démo où on peut jouer avec les voix sans coder une seule ligne.

La vraie nouveauté : il est possible de personnaliser ces voix selon ses envies. Un accent anglais bien posé ? Une intonation dramatique ? Une voix apaisante façon prof de yoga zen ? Tout ça se règle d’un simple prompt texte.

Jeff Harris, ingénieur chez OpenAI, a montré en live à VentureBeat comment une même voix pouvait passer du savant fou au coach méditatif rien qu’avec quelques instructions écrites. L’idée derrière tout ça : éviter que quelqu’un puisse dire que l’IA copie une voix existante… même si l’affaire Johansson a prouvé que le sujet reste sensible.

A lire également

Rendu conceptuel du stellarator Infinity One de Type One Energy, première centrale à fusion nucléaire commerciale aux États-Unis
Première licence commerciale de fusion nucléaire : le Tennessee ouvre la voie avec le stellarator de Type One Energy
Le réacteur à fusion SPARC de Commonwealth Fusion Systems, tokamak compact en cours d'assemblage dans son hall industriel, anneau de plasma visible
Fusion nucléaire : SPARC atteint 80% d’achèvement, CFS empoche 1 milliard de plus et bouscule le calendrier
Tesla solar panels installes sur le toit d une maison, avec une Tesla garee dans l allee
Tesla enterre le Solar Roof et parie 10,1 milliards de dollars sur une usine solaire texane

Plus précis que Whisper

Ces modèles reprennent la base du GPT-4o sorti en mai 2024 mais ont été entraînés spécifiquement pour exceller dans tout ce qui touche à la parole et sa transcription. Le but est clair : remplacer Whisper, le précédent modèle open source lancé par OpenAI il y a deux ans.

Les améliorations sont notables :

  • Moins d’erreurs dans les retranscriptions
  • Meilleure reconnaissance des accents
  • Fonctionne mieux dans le bruit ambiant

Un graphique publié par OpenAI montre que gpt-4o-transcribe descend jusqu’à un taux d’erreur de seulement 2,46% en anglais sur un large panel de tests industriels.

Harris précise aussi que ces modèles détectent mieux quand quelqu’un termine une phrase grâce à un « détecteur d’activité sémantique ». Dit autrement, il en sera fini des coupures hasardeuses ou les phrases tronquées lors des retranscriptions automatiques.

Mais petite limite quand même : ils ne savent pas différencier plusieurs intervenants dans une conversation (« diarization » absente). Si plusieurs personnes parlent en même temps ou se relaient rapidement… eh bien ce sera pris comme une seule grande phrase continue.

Si vous gérez un service client automatisé ou voulez juste éviter de prendre des notes en réunion, ces nouveaux outils ont clairement leur place. L’intégration est facile : neuf lignes de code suffisent pour ajouter ces fonctionnalités vocales aux applis basées sur GPT-4o classique.

Prix & accès immédiat

Pas besoin d’attendre pour essayer ces nouveaux outils :

  • gpt-4o-transcribe → $6 / million de tokens audio (~$0.006/minute)
  • gpt-4o-mini-transcribe → $3 / million (~$0.003/minute)
  • gpt-4o-mini-tts → $0.60 / million tokens texte & $12 / million tokens audio (~$0.015/minute)

Côté rapports qualité/prix face aux concurrents comme ElevenLabs ou Hume AI… disons que chacun a ses avantages selon l’usage recherché , certains préfèreront payer moins cher quitte à perdre légèrement en précision ou fonctionnalités spécifiques comme le multi-haut-parleur.

Et afin de rendre le lancement plus fun, OpenAI organise aussi un petit concours autour du site démo OpenAI.fm. Ceux qui partageront les créations vocales les plus originales sur X (@openai) pourraient gagner… une radio customisée Teenage Engineering. Pas sûr que ça change votre vie mais … il n’y en aurait que trois exemplaires au monde.

Sources :OpenAI
Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

Audacity 4.0, logo officiel et nouvelle interface audio
Audacity 4 : l’éditeur audio gratuit le plus téléchargé au monde entre dans une nouvelle ère
Web & Internet
Apple Watch affichant watchOS 27 avec les nouvelles apps natives Siri et Find My
watchOS 27 : trois fonctions disparaissent de l’Apple Watch avant la mise à jour de septembre
Geek & Gadgets
Sacre Jedi bleu plante dans le desert face a un temple au double coucher de soleil, concept Star Wars New Jedi Order
Star Wars New Jedi Order : le retour de Rey sort enfin du purgatoire de pré-production
Films & Séries
Logo WordPress fissuré ciblé par un réticule rouge, cadenas brisé et base de données compromise, faille All-in-One WP Migration
Une injection SQL dans All-in-One WP Migration expose plus de trois millions de sites WordPress
Informatique & Cybersécurité Web & Internet

Tendance

Logo Anthropic avec le nom Claude au centre, concept de systèmes multi-agents IA sur fond techno sombre, illustration du rapport sur les sabotages entre agents
Les IA ont des réflexes de survie, mentent et falsifient les données : Anthropic révèle l’ampleur des sabotages dans les systèmes multi-agents
IA & Robotique
GTA 6, artwork officiel de Rockstar avec les protagonistes Lucia et Jason
GTA 6 : des vidéos de gameplay et la carte on fuité. Cette fois c’est pas de l’IA
Consoles & Jeux Vidéo
Concept d'une montre connectée Garmin mesurant la glycémie non invasive au poignet grâce à un capteur optique
Garmin dévoile un brevet pour mesurer la glycémie au poignet et relance la course contre Apple
Geek & Gadgets
Rendu concept de la première smartwatch transparente Nothing
Nothing prépare sa première smartwatch transparente pour septembre 2026, sous les 300 dollars
Geek & Gadgets
Robot humanoïde type Tesla Optimus dans un hall industriel futuriste, production à grande échelle
Tesla Optimus : premières ventes repoussées à 2027, la mue spectaculaire de Fremont s’accélère
IA & Robotique

Vous allez aussi aimer

Tesla Semi, camion électrique de Tesla sur autoroute
Tech & Innovations

Einride commande 500 Tesla Semi et s’offre la plus grande flotte de camions électriques au monde

19 août 2026
XPeng P7+, berline électrique, image officielle du constructeur
Tech & Innovations

XPeng franchit le cap des 6 000 livraisons en France et pulvérise ses records à l’export

18 août 2026
Photo officielle de la Xiaomi SU7, berline électrique du constructeur chinois, face à la mer
Tech & Innovations

Xiaomi SU7 : 500 000 berlines électriques livrées en 28 mois, un record qui masque des turbulences

17 août 2026
BYD Qin Max EV, photo officielle du constructeur, berline électrique vue de trois quarts arrière
Tech & Innovations

BYD Qin Max : la berline électrique à environ 14 000 € qui humilie la Tesla Model 3 sur le prix et la recharge

17 août 2026
Snap Specs - Smart glass AR
Geek & GadgetsTech & Innovations

Snap Specs : La smart glass AR à 2 295 € qui veut enterrer l’ère du smartphone

11 août 2026
Logo officiel AMD avec le nom, sur fond clair, illustrant le rachat de Taalas
Tech & Innovations

AMD rachète Taalas, la startup qui grave les modèles d’IA directement dans le silicium

8 août 2026
Samsung Galaxy S26 FE, rendu concept sur fond techno abstrait
Tech & Innovations

Samsung Galaxy S26 FE : la certification FCC trahit une puce Qualcomm que personne n’attendait

7 août 2026
iPhone 18 pro concept
Mobiles & AppsTech & Innovations

Apple préparerait trois nouveaux iPhone pour le printemps 2027 : changement de calendrier historique ?

18 juin 2026

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

Logo Solana et canaux de paiement pour agents IA avec Alibaba Cloud, concept robot et cloud
Solana lance ses canaux de paiement pour agents IA : 80 milliards de transactions par jour, Alibaba Cloud en première ligne
Blockchain & Crypto
TikTok Voice Comments, fil de commentaires vocaux sur smartphone
TikTok transforme ses commentaires en salon de discussion avec les vocaux, sondages et carrousels photo
Réseaux Sociaux & Influence
Fusée SpaceX sur son pas de tir face à Paris, quatre sièges vides autour d'une table de sommet
SpaceX et Blue Origin boycottent le sommet spatial de Macron à Paris sous pression de Washington
Sciences & Espace
Logo Google Chrome fissuré avec bouclier d'alerte, faille zero-day CVE-2026-85046
Chrome corrige en urgence la faille zero-day CVE-2026-85046 qui permet l’exécution de code via V8
Informatique & Cybersécurité

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?