PROJECT DOSSIER // [RUSH 2]VOIR LA SOURCERETOUR AUX PROJETS →

01 // LE PROJET EN BREF

RUSH 2

C

Deviner la langue d'un texte à partir de sa seule statistique de lettres.

Deuxième rush de week-end en équipe : le programme reçoit un texte et doit déterminer dans quelle langue il est écrit, sans dictionnaire. L'idée est que chaque langue a une signature statistique — la fréquence de ses lettres — assez stable pour être reconnue. Le programme ne prouve donc jamais sa réponse : il parie sur la plus probable, ce qui change complètement la manière de juger s'il a raison.

Analyse fréquentielle des caractères d'un texte, comparaison à des profils de langues de référence et sélection du plus proche.

PRINCIPALC
RÉALISATIONPROJET D’ÉQUIPE
VÉRIFICATIONmake
SOURCEINSPECTOR READY
PIÈCES JOINTES (Images, Photos, Videos)

03 // APPORTS CLÉS

  • Reconnaissance de langue sans dictionnaire, uniquement par statistiques
  • Même principe que le cassage de chiffrement par analyse fréquentielle

AU-DELÀ DU SUJET

  • Trois langues au-delà de celle demandée : français, allemand et espagnol, chacune dans son propre fichier
  • Les irrégularités du français (soixante-dix, quatre-vingts) et de l'allemand (ordre inversé des unités et dizaines) sont traitées

04 // ARBORESCENCE DU CODE

LECTURE DES SOURCES…