JDWJDW
Font ResizerAa
  • Tech & Innovations
  • Mobiles & Apps
  • IA & Robotique
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Plus
    • Web & Internet
    • Geek & Gadgets
    • Informatique & Cybersécurité
    • Sciences & Espace
    • Réseaux Sociaux & Influence
    • e-Business & Webmarketing
    • Fintech & Néobanques
    • Streaming & P2P
Font ResizerAa
JDWJDW
Rechercher
  • Web & Internet
  • Tech & Innovations
  • Mobiles & Apps
  • Consoles & Jeux Vidéo
  • Films & Séries
  • Animes & Mangas
  • Blockchain & Crypto
  • Geek & Gadgets
  • Informatique & Cybersécurité
  • Streaming & P2P
Avez-vous déjà un compte ? Sign In
Suivez-nous
Tech & Innovations

OpenAI AI Voices : Trois nouveaux modèles pour la transcription et les voix synthétiques

Darell Mertens
Published: 23 mars 2025
Last updated: 23 mars 2025
Partager
openai audio model

Trois nouvelles voix IA signées OpenAI sont là. Ça fait un moment qu’ils bossent dessus, et malgré quelques petits scandales, ils n’ont pas ralenti la cadence.

OpenAI a lancé gpt-4o-transcribe, gpt-4o-mini-transcribe et gpt-4o-mini-tts. Des noms qui ne font pas rêver, mais des technos qui promettent. Ces outils servent à la transcription et à la génération vocale via API, donc surtout pour les développeurs et leurs applis tierces. Les curieux peuvent aussi tester sur OpenAI.fm, un site démo où on peut jouer avec les voix sans coder une seule ligne.

La vraie nouveauté : il est possible de personnaliser ces voix selon ses envies. Un accent anglais bien posé ? Une intonation dramatique ? Une voix apaisante façon prof de yoga zen ? Tout ça se règle d’un simple prompt texte.

Jeff Harris, ingénieur chez OpenAI, a montré en live à VentureBeat comment une même voix pouvait passer du savant fou au coach méditatif rien qu’avec quelques instructions écrites. L’idée derrière tout ça : éviter que quelqu’un puisse dire que l’IA copie une voix existante… même si l’affaire Johansson a prouvé que le sujet reste sensible.

Plus précis que Whisper

Ces modèles reprennent la base du GPT-4o sorti en mai 2024 mais ont été entraînés spécifiquement pour exceller dans tout ce qui touche à la parole et sa transcription. Le but est clair : remplacer Whisper, le précédent modèle open source lancé par OpenAI il y a deux ans.

A lire également

iPhone 18 pro concept
Apple préparerait trois nouveaux iPhone pour le printemps 2027 : changement de calendrier historique ?
crowdstrike
CrowdStrike et AWS poussent la sécurité cloud dopée à l’IA : vers des SOC plus automatisés ?
nvidia
Nvidia contre une prise de participation de l’État américain dans les entreprises IA : Jensen Huang dit non

Les améliorations sont notables :

  • Moins d’erreurs dans les retranscriptions
  • Meilleure reconnaissance des accents
  • Fonctionne mieux dans le bruit ambiant

Un graphique publié par OpenAI montre que gpt-4o-transcribe descend jusqu’à un taux d’erreur de seulement 2,46% en anglais sur un large panel de tests industriels.

Harris précise aussi que ces modèles détectent mieux quand quelqu’un termine une phrase grâce à un « détecteur d’activité sémantique ». Dit autrement, il en sera fini des coupures hasardeuses ou les phrases tronquées lors des retranscriptions automatiques.

Mais petite limite quand même : ils ne savent pas différencier plusieurs intervenants dans une conversation (« diarization » absente). Si plusieurs personnes parlent en même temps ou se relaient rapidement… eh bien ce sera pris comme une seule grande phrase continue.

Si vous gérez un service client automatisé ou voulez juste éviter de prendre des notes en réunion, ces nouveaux outils ont clairement leur place. L’intégration est facile : neuf lignes de code suffisent pour ajouter ces fonctionnalités vocales aux applis basées sur GPT-4o classique.

Prix & accès immédiat

Pas besoin d’attendre pour essayer ces nouveaux outils :

  • gpt-4o-transcribe → $6 / million de tokens audio (~$0.006/minute)
  • gpt-4o-mini-transcribe → $3 / million (~$0.003/minute)
  • gpt-4o-mini-tts → $0.60 / million tokens texte & $12 / million tokens audio (~$0.015/minute)

Côté rapports qualité/prix face aux concurrents comme ElevenLabs ou Hume AI… disons que chacun a ses avantages selon l’usage recherché , certains préfèreront payer moins cher quitte à perdre légèrement en précision ou fonctionnalités spécifiques comme le multi-haut-parleur.

Et afin de rendre le lancement plus fun, OpenAI organise aussi un petit concours autour du site démo OpenAI.fm. Ceux qui partageront les créations vocales les plus originales sur X (@openai) pourraient gagner… une radio customisée Teenage Engineering. Pas sûr que ça change votre vie mais … il n’y en aurait que trois exemplaires au monde.

Sources :OpenAI
Partager cet article
Facebook Whatsapp Whatsapp LinkedIn Reddit Telegram Copy Link

Derniers articles

ollama
Qu’est-ce qu’Ollama ? Tout savoir sur ce moteur d’IA locale
IA & Robotique
GTA 6
GTA 6 : comment Leonida repousse les lois de la géométrie vidéoludique sans recourir à l’intelligence artificielle
Consoles & Jeux Vidéo IA & Robotique
Claude Fable 5 vs GPT-5.6 Sol : le duel des deux LLM frontière décortiqué benchmark par benchmark
IA & Robotique
CyberGhost VPN
CyberGhost VPN casse son prix à 1,59 €/mois : 88 % de remise et 2 mois offerts
Informatique & Cybersécurité

Tendance

ios 27
iOS 27 bêta publique : date probable, iPhone compatibles et faut-il l’installer ?
Mobiles & Apps
gpt-5.6
GPT‑5.6 aurait “triché” pendant ses tests : faut-il encore croire aux benchmarks IA ?
IA & Robotique
ios 27
iOS 27 en bêta publique : Siri dopé à l’IA arrive enfin sur iPhone
Mobiles & Apps
GTA 6
GTA 6 : le gameplay se rapproche et Rockstar a déjà semé des indices partout
Consoles & Jeux Vidéo
Windows 11
Windows 11 démembre Phone Link : la synchronisation Android s’installe au cœur du système
Informatique & Cybersécurité Mobiles & Apps

Vous allez aussi aimer

ia vole propriété intellectuelle
IA & RobotiqueTech & Innovations

L’intelligence artificielle a-t-elle volé les créateurs ? Le procès du copyright s’enflamme

16 juin 2026
OpenAI
Tech & Innovations

ChatGPT : OpenAI présente le mode « incognito » pour améliorer la confidentialité des utilisateurs

30 avril 2023
Microsoft Autodev
Tech & Innovations

Microsoft dévoile Autodev, un framework de développement entièrement autonome

22 mars 2024
Grok 4
Tech & Innovations

Grok 4 : derrière les benchmarks prometteurs, la déception

16 juillet 2025
claude anthropic paresseux
Tech & Innovations

Claude poussé à la paresse ? Le leak qui révèle comment Anthropic bride son service aux utilisateurs

9 avril 2026
iPhone 14 design concept
Mobiles & AppsTech & Innovations

iPhone 14 : Apple prévoirait une fonction SOS d’urgence par satellite

14 avril 2022
OpenAI o1
Tech & Innovations

OpenAI met à jour son modèle API o1 et réduit les coûts pour l’audio en temps réel

18 décembre 2024
Reformulation de texte par IA
Tech & Innovations

Top 5 des meilleurs sites IA pour reformuler un texte / paraphraser

19 février 2025

Infos légales

  • Mentions légales
  • Politique de confidentialité
  • Nous contacter
  • Partenaires

Maj récentes

xiaomi 18 pro
Xiaomi 18 Pro : la fuite promet double capteur 200MP, batterie 7000mAh et puce Snapdragon en 2nm
Mobiles & Apps
apple
Apple attaque OpenAI et io en justice pour vol de secrets industriels sur l’iPhone
IA & Robotique
Oneplus
OxygenOS c’est fini : Oppo efface OnePlus en fondant sa marque dans ColorOS
Mobiles & Apps
galaxy unpacked
Galaxy Unpacked du 22 juillet 2026 à Londres : le Z Fold 8, un « Wide » inédit et la Watch 9 attendus
Geek & Gadgets Mobiles & Apps

Qui sommes nous ?

Le Journal du Web alias JDW a été fondé et est édité par des passionnés par l’univers web, nouvelles technologies et de la culture populaire.

Newsletter
Inscrivez-vous à notre newsletter pour recevoir nos derniers articles!
Suivez-nous
Welcome Back!

Sign in to your account

Username or Email Address
Password

Mot de passe oublié ?