Le corpus a été enrichi puis élagué. Une langue dont le dictionnaire est vide n’est pas une langue prise en charge : dix d’entre elles quittent la publication jusqu’à ce qu’elles atteignent le seuil.
L’enrichissement porte le fonds à 36 713 entrées lexicales réparties sur seize langues, contre 10 225 sur quatorze au 1er juillet. Ce gain vient de la relecture des documents que la première extraction n’avait pas su ouvrir, notamment des planches composées avec des polices antérieures à Unicode.
Le volume seul ne fait pas un service. Un seuil a donc été appliqué : une langue n’est publiée que si elle a de quoi être consultée et de quoi être lue. Six langues le franchissent — fɔngbè, ajagbe, baatɔnum, dendi, yorùbá et saxwɛ. Les dix autres restent dans le fonds, hors catalogue, et reviendront dès qu’elles auront la matière.
Deux corrections tenaient au même principe. Les alphabets ne sont plus déduits de ce que le corpus contient mais repris des documents qui les énoncent, citation à l’appui : quatre langues en ont un à ce jour. Et 1 692 fragments de manuels, découpés au hasard des paragraphes, ont été retirés de la bibliothèque plutôt que recollés — les recoller aurait supposé une continuité que le dépouillement n’établit pas.
Le fonds documentaire a été traité et intégré. L’ensemble des entrées porte le statut « à confirmer » : la relecture par des locuteurs commence maintenant.
L’extraction automatique des lexiques et des transcriptions du fonds documentaire est terminée. Elle produit 10 225 entrées lexicales réparties sur quatorze langues, ainsi qu’un ensemble de contes et de proverbes transcrits.
Aucune de ces entrées n’a été relue par un locuteur référent. Elles sont donc toutes publiées avec le statut « à confirmer », visible sur chaque fiche. Cette transparence est un choix : elle permet d’utiliser le corpus tout en sachant ce qu’il vaut.
La prochaine étape est la relecture langue par langue. Elle dépend entièrement de la disponibilité de locuteurs habilités, et sa vitesse ne sera pas la même pour toutes les langues.
La cascade de traduction s’arrête et affiche « corpus insuffisant » lorsque le lexique validé ne couvre pas la phrase, au lieu de composer une formulation plausible.
La cascade suit cinq étapes : mémoire de traduction relue, lexique et règles, modèle spécialisé lorsqu’il existe et a été évalué, modèle contraint par le corpus avec citation des sources, puis réponse « à confirmer ».
À aucune de ces étapes une phrase n’est fabriquée pour éviter un résultat vide. Lorsque rien ne permet de répondre, l’interface propose trois issues concrètes : vérifier mot à mot dans le dictionnaire, demander une relecture à un locuteur référent, ou contribuer la formulation juste.
La reconnaissance vocale et la synthèse vocale restent désactivées : aucun modèle évalué n’existe pour ces langues, et un modèle non évalué corrigerait à tort des prononciations correctes.
Les 96 couples texte/fond des thèmes clair, sombre et contraste élevé sont contrôlés automatiquement à chaque construction du site.
Un script recalcule la luminance relative de chaque couple selon la formule normative de WCAG 2.2 et échoue si un seul couple passe sous le seuil applicable — 4,5 pour du texte, 3 pour un composant d’interface.
Ce contrôle ne remplace pas un audit : il garantit seulement qu’aucune régression de contraste ne peut être livrée sans être détectée. L’état complet, points non conformes compris, figure sur la page Accessibilité.