OpenAI publie les premiers résultats de Jalapeño, sa puce d'inférence maison
OpenAI a rendu publics le 25 août les premiers chiffres de Jalapeño, le processeur qu'elle a conçu spécifiquement pour l'inférence, c'est-à-dire l'exécution des modèles déjà entraînés. L'entreprise revendique à la fois une latence plus faible et un débit plus élevé que les solutions actuellement disponibles, deux caractéristiques qui s'opposent habituellement : servir un utilisateur très vite se paie normalement en nombre d'utilisateurs servis simultanément. Richard Ho, vice-président matériel, décrit la puce comme offrant « le meilleur des deux mondes ».
Les mesures avancées s'appuient sur InferenceX, le banc d'essai de SemiAnalysis, sur lequel Jalapeño affiche davantage de tokens par utilisateur et davantage de débit par kilowatt que l'état de l'art commercial. Ce second indicateur est le plus significatif : l'énergie consommée par token est aujourd'hui le principal poste de coût d'un service d'IA à grande échelle, et le facteur qui limite ce qu'un centre de données peut absorber.
Deux réserves s'imposent. Les résultats sont publiés par le concepteur de la puce et n'ont pas encore été reproduits par un tiers indépendant ; et OpenAI ne communique pas de calendrier de déploiement en production. Si les gains se confirment, l'intérêt pour OpenAI est d'abord stratégique : réduire sa dépendance à un fournisseur unique d'accélérateurs et reprendre la main sur le coût unitaire de ses propres services.