OpenAI a ouvert le 13 août un aperçu limité d’Ultrafast, un nouveau palier de service de son interface de programmation. Le principe tient en une ligne : le même GPT-5.6 Sol, la même intelligence, mais servi jusqu’à 14 fois plus vite que le traitement standard, soit jusqu’à 750 unités de texte générées chaque seconde. Rien de neuf côté modèle, donc. Tout se joue sur le matériel qui le fait tourner.
Une puce de la taille d’une assiette pour supprimer l’attente
Le tour de force vient de Cerebras, un fabricant américain qui grave ses processeurs sur une galette de silicium entière plutôt que de les découper en puces individuelles. Résultat : un modèle complet tient sur un seul composant, au lieu d’être réparti sur des armoires de cartes graphiques qui passent leur temps à s’échanger des données. Ce sont ces allers-retours internes qui créent la latence, cette poignée de secondes entre la question et la réponse. En les supprimant, on gagne du temps sans toucher à la qualité du raisonnement.

La démonstration mise en avant par OpenAI a le mérite d’être parlante. À partir d’une seule consigne écrite, le modèle génère un simulateur d’entrepôt logistique en trois dimensions, l’entreprise faisant tourner l’exercice en parallèle dans les deux modes pour rendre l’écart visible. Produire une application complète n’a rien à voir avec répondre à une question : le modèle écrit du code en continu, et chaque unité de texte gagnée se convertit directement en attente en moins. Précisons tout de même que le facteur 14 reste une mesure maison, sans vérification externe publiée à ce jour.
Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed.
Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows. pic.twitter.com/a5dleofiDJ
— OpenAI (@OpenAI) August 13, 2026
Concrètement, qui va en profiter (et quand) ?
Ultrafast démarre côté (API), celle que les développeurs branchent sur leurs propres outils, et l’accès reste réservé à quelques clients le temps que la capacité suive. Parmi les premiers testeurs figurent des maisons de la finance comme Jane Street, mais aussi des acteurs de la relation client et de la comptabilité. OpenAI vise explicitement les métiers où une réponse en retard ne vaut plus rien : réponse aux incidents informatiques, débogage, recherche financière, détection de fraude, support client en temps réel, applications vocales et commerce en ligne. Autrement dit : si vous utilisez ChatGPT ou Codex, vous n’êtes pas concernés.
L’entreprise donne aussi l’exemple de ses propres équipes, ce qui reste la meilleure façon de comprendre l’intérêt. Pendant un incident technique, ses développeurs font analyser en direct les journaux d’activité, les traces et les échanges internes, puis préparer et valider des correctifs, la décision finale restant humaine. Côté recherche, des boucles d’expérimentation qui tournaient toute la nuit permettent désormais plusieurs itérations dans une seule journée de travail. Un testeur résume la bascule à sa manière : la vitesse « change complètement l’expérience d’appel pour le travail complexe ».
Reste la question qui fâche, celle du prix. OpenAI n’a annoncé aucun tarif, mais sa grille actuelle donne une idée assez nette de la direction. L’entreprise vend déjà sa vitesse : son mode rapide, rebaptisé fin juillet et poussé jusqu’à deux fois et demie la cadence standard, est facturé au-dessus du tarif normal. À l’inverse, les formules qui acceptent d’attendre, en traitement différé ou à latence variable, coûtent moitié moins cher. Chaque seconde gagnée a donc déjà son étiquette, et Ultrafast va près de six fois plus vite que ce mode rapide, lui-même vendu en supplément.
Pour Cerebras, l’affaire tombe à pic : le fabricant, entré en Bourse cette année, cherchait précisément à prouver que ses puces géantes servaient à autre chose qu’à des démonstrations. Au passage, OpenAI s’offre un peu d’air face à sa dépendance à Nvidia. Pour l’utilisateur que vous êtes, le changement se verra ailleurs et plus tard : dans les assistants vocaux qui cessent de laisser des blancs, dans les services clients qui répondent à la vitesse d’une conversation. La course à l’intelligence n’est pas terminée, mais celle au temps de réponse vient officiellement de commencer.
👉🏻 Suivez l’actualité tech en temps réel : ajoutez 01net à vos sources sur Google, et abonnez-vous à notre canal WhatsApp.
Source : OpenAI

