01 // LE PROJET EN BREF
RUSH 2
CDeviner la langue d'un texte à partir de sa seule statistique de lettres.
Deuxième rush de week-end en équipe : le programme reçoit un texte et doit déterminer dans quelle langue il est écrit, sans dictionnaire. L'idée est que chaque langue a une signature statistique — la fréquence de ses lettres — assez stable pour être reconnue. Le programme ne prouve donc jamais sa réponse : il parie sur la plus probable, ce qui change complètement la manière de juger s'il a raison.
Analyse fréquentielle des caractères d'un texte, comparaison à des profils de langues de référence et sélection du plus proche.
PRINCIPALC
RÉALISATIONPROJET D’ÉQUIPE
VÉRIFICATIONmake
SOURCEINSPECTOR READY
03 // APPORTS CLÉS
- Reconnaissance de langue sans dictionnaire, uniquement par statistiques
- Même principe que le cassage de chiffrement par analyse fréquentielle
AU-DELÀ DU SUJET
- Trois langues au-delà de celle demandée : français, allemand et espagnol, chacune dans son propre fichier
- Les irrégularités du français (soixante-dix, quatre-vingts) et de l'allemand (ordre inversé des unités et dizaines) sont traitées
04 // ARBORESCENCE DU CODE
LECTURE DES SOURCES…