Découvrez S1-mini : le normalisateur de texte à poids ouverts de 462 Mo développé par Superwhisper, qui transforme les transcriptions brutes issues de la reconnaissance vocale en texte écrit propre.

Voici une information qui pourrait bien avoir un impact durable sur le secteur.

Découvrez S1-mini : le normalisateur de texte à poids ouverts de 462 Mo développé par Superwhisper, qui transforme les transcriptions brutes issues de la reconnaissance vocale en texte écrit propre.

Superwhisper a lancé la gamme de modèles S1 : S1-Voice, S1-Language et S1-mini. S1-Voice est un modèle cloud de reconnaissance vocale, tandis que S1-Language est un modèle cloud permettant de suivre des instructions pour le nettoyage et la mise en forme. Celui qui présente un intérêt particulier en dehors de l’application est le S1-mini, dont les poids ont été publiés en open source sur Hugging Face. Le S1-mini est un normaliseur de texte de 0,6 milliard de paramètres ; il ne s’agit ni d’un transcripteur ni d’un modèle de chat. Il intervient après la reconnaissance vocale automatique et reformule les transcriptions brutes en un texte écrit soigné : les mots de remplissage sont supprimés, les autocorrections sont ramenées à ce que le locuteur a finalement dit, la ponctuation et les majuscules sont ajoutées, et les chiffres, dates, devises et adresses e-mail prononcés sont transcrits sous leur forme écrite. Il est optimisé à partir de Qwen/Qwen3-0.6B, ne couvre que l’anglais dans la version v1 et est entièrement piloté par une ligne de contrôle à trois axes placée au-dessus de la transcription. Superwhisper affiche une précision de 94,8 % au niveau des tokens sur un ensemble de validation de 7 519 cas, mesurée selon une approche gloutonne sur la version quantifiée.

D’un autre côté, oui, mais uniquement S1-mini. S1-mini est publié sur Hugging Face sous licence Apache 2.0, assortie d’une clause relative à la dénomination. S1-Voice et S1-Language sont des services hébergés par Superwhisper ; ils sont donc accessibles en ligne, cependant ne peuvent pas être hébergés en local.

S1-mini est un normalisateur de texte, ni un transcripteur ni un modèle de chat. Il intervient en aval de la reconnaissance vocale automatique :

En complément, audio → reconnaissance vocale (Whisper, Parakeet, …) → S1-mini → texte épuré

Il supprime les mots de remplissage, corrige les faux départs et les autocorrections pour conserver la formulation finale choisie par le locuteur, applique la ponctuation et les majuscules, et transcrit sous forme écrite les chiffres, dates, heures, devises et adresses e-mail prononcés. Dites « support at superwhisper dot com » et vous obtiendrez [email protected].

Le modèle est un modèle d’IA optimisé à partir de Qwen/Qwen3-0.6B. Il comporte 596 millions de paramètres uniques (0,44 milliard hors embeddings), 28 couches, 16 têtes de requête et 8 têtes clé/valeur avec GQA, ainsi que des poids au format BF16. La barre latérale de Hub indique 0,8 milliard car l’embedding lié est stocké deux fois ; la fiche explique explicitement cet écart. La version v1 ne couvre que l’anglais, et la longueur d’entrée recommandée est d’environ 1 000 tokens.

S1-mini prend d’abord une invite mécanisme fixe, puis une ligne de contrôle, puis la transcription brute :

Le style peut être « décontracté », « semi-décontracté », « semi-formel » ou « formel ». La structure peut être « en prose » ou « sous forme de liste ». Le contexte peut être « général » ou « e-mail ». Ces trois axes sont indépendants, et toutes les combinaisons ont été entraînées. Si vous envoyez des valeurs ne figurant pas dans ces ensembles ou si vous reformulez l’invite du système, le résultat peut être de qualité inférieure ou incompréhensible. À noter une légère divergence qu’il est bon de connaître : l’application Superwhisper propose un curseur de tonalité à cinq niveaux qui ajoute un préréglage « équilibré », tandis que le document sur les poids ouverts répertorie quatre valeurs de « Styling » apprises.

Une chose est sûre : le secteur continue d’avancer à grande vitesse.

À découvrir aussi :


Reportage initial : MarkTechPost : MarkTechPost