Mise à jour du 2026-05-20. OpenAI a annoncé GPT-Realtime-Whisper, un modèle de reconnaissance vocale conçu pour transcrire la parole pendant qu’elle est prononcée.

Ce qu’il faut retenir

  • Le streaming réduit l’attente par rapport au traitement d’un fichier complet.
  • Le modèle fait partie d’un ensemble de nouvelles briques audio destinées aux développeurs.
  • Les applications visées incluent sous-titrage, réunions et agents vocaux.
  • La qualité dépend du bruit, du microphone, de la langue et du vocabulaire spécialisé.

Pourquoi c’est important

Une transcription incrémentale peut rendre les interfaces vocales plus réactives et offrir plus rapidement des sous-titres accessibles.

Les limites à connaître

La voix peut contenir des données sensibles. Le consentement, la rétention, la sécurité et les obligations locales doivent être définis avant l’enregistrement.

Conseil pratique

Testez avec les accents et environnements réels, affichez l’incertitude et prévoyez une correction humaine pour les usages critiques.

Source officielle

OpenAI — Advancing voice intelligence