Leur IA marocaine TinyML, publiée le 27 septembre dans la revue Discover Artificial Intelligence, ne pèse que 229 Ko. Elle tient sur un microcontrôleur, une puce de quelques dollars, et analyse les images sur place, sans envoyer de vidéo d’élèves vers un serveur distant.
Le sujet m’a d’abord intéressé pour sa prouesse technique. Il m’a retenu davantage pour la question qu’il pose : peut-on observer une classe avec l’intelligence artificielle sans faire de la surveillance de masse ? Les auteurs tentent de répondre par l’architecture même de leur système. Je vais détailler ce qu’ils ont réalisé, ce que les chiffres disent, et ce qu’ils ne disent pas.
Une équipe d’Oujda derrière le projet
L’étude est signée par Chaymae Yahyati, Ismail Lamaakal, Khalid El Makkaoui et Ibrahim Ouahbi. Tous travaillent au laboratoire MIASI de la Faculté des sciences appliquées de Nador, rattachée à l’Université Mohammed Premier d’Oujda.
Ce n’est pas un détail. On associe encore trop souvent l’innovation en intelligence artificielle aux grands pôles universitaires ou aux géants du numérique. Ici, le travail vient d’un laboratoire régional, sur un sujet à la croisée de l’éducation, de l’embarqué et de la protection de la vie privée.
Ce que sait reconnaître le système
Le modèle identifie vingt catégories. Toutes ne sont pas des comportements, et cette nuance compte. Il détecte des actions d’élèves : lire, écrire, lever la main, discuter, applaudir, bâiller ou utiliser un téléphone. Il repère aussi des personnes et des objets : l’enseignant, l’écran, le tableau, l’ordinateur.
Ce mélange s’explique par la base d’images utilisée pour l’entraînement, SCB-Dataset5. Elle rassemble 7 428 images et 106 830 annotations. Autrement dit, chaque photographie de classe y est étiquetée en détail, élève par élève et objet par objet. Le modèle apprend à localiser ce qu’il voit avant de le classer, ce qui relève de la détection d’objets.
Pour vérifier que le système ne se contente pas de réciter ses leçons, les chercheurs l’ont confronté à deux autres bases, UK_Dataset et SiTBehavior. Le but est de mesurer sa capacité à fonctionner sur des scènes différentes de celles de l’entraînement. C’est un test de robustesse indispensable, car une salle de classe marocaine ne ressemble pas nécessairement à celles qui ont servi à construire ces bases.
Le pari du TinyML
Le TinyML désigne les techniques permettant de faire tourner un modèle d’apprentissage automatique sur des appareils très contraints en mémoire et en énergie. Un smartphone ou un ordinateur n’entrent pas dans cette catégorie. On parle de microcontrôleurs, ces petites puces qu’on trouve dans les objets connectés.
Pour y parvenir, l’équipe a combiné deux opérations :
- L’élagage : 40 % des canaux du réseau de neurones ont été supprimés. C’est comme retirer les branches qui contribuent le moins à la décision finale.
- La quantification INT8 : les calculs passent de nombres décimaux à des entiers sur 8 bits, bien plus légers à stocker et à traiter.
Résultat, le modèle est passé de 742,6 à 228,9 Ko, soit une réduction de 69,2 %. Il a ensuite été installé sur une carte NXP équipée d’un processeur Arm Cortex-M4F cadencé à 120 MHz, avec 1 Mo de mémoire Flash et 256 Ko de mémoire vive. Pour donner une idée, ces chiffres sont ceux d’un appareil très éloigné d’un téléphone actuel.
Sur cette carte, le système traite 15,43 images par seconde, détection et filtrage compris. Pour une classe, où l’on ne cherche pas à suivre un mouvement rapide, ce débit est confortable.
Que valent les scores annoncés
Les chercheurs annoncent 95,64 % en mAP@0.5 sur leur principale base d’images. Cet indicateur mesure la capacité du modèle à localiser et classer correctement les éléments observés, en acceptant un chevauchement modéré entre la boîte prédite et la boîte réelle. Avec un critère de localisation plus exigeant, le score descend à 78,86 %.
Cet écart n’a rien d’anormal. Il indique que le modèle sait très bien dire ce qui se passe et où, mais qu’il est moins précis lorsqu’on lui demande de dessiner des contours exacts. Je m’en tiendrais à cette lecture. Ces résultats proviennent de bases existantes, sur des images de test, dans des conditions maîtrisées. Ils ne disent rien de ce que donnerait le système dans une classe réelle, avec sa lumière changeante, ses élèves serrés au fond de la salle et ses angles de caméra imparfaits.
Un apprentissage fédéré pour protéger les images
Le point qui m’a le plus frappé est ailleurs : dans l’apprentissage fédéré. Dans une approche classique, on rassemble toutes les images sur un serveur central pour entraîner le modèle. Ici, cinq clients entraînent localement le modèle à partir de leurs propres images. Ils ne transmettent au serveur que les mises à jour mathématiques produites, pas les photos ni les vidéos.
Une fois entraînée et compressée, l’IA fonctionne directement sur l’appareil, sans envoyer de flux vidéo. C’est précisément la seconde faiblesse que les auteurs voulaient corriger : la centralisation d’images montrant des élèves. Cela concerne des mineurs, ce qui rend la question particulièrement sensible.
Il faut toutefois rester prudent. L’apprentissage fédéré réduit l’exposition des données brutes, il ne l’annule pas totalement. Les mises à jour échangées peuvent, dans certains cas, révéler des informations sur les données d’origine. Les chercheurs en sont conscients : ils prévoient de renforcer la protection des échanges par l’agrégation sécurisée et la confidentialité différentielle. Ces deux techniques visent justement à empêcher qu’on remonte aux données individuelles à partir des mises à jour partagées.
Un prototype, pas un outil déployé
Il faut le dire clairement : aucun élève marocain n’a participé à l’expérience et aucune nouvelle donnée personnelle n’a été collectée. Les travaux reposent exclusivement sur des bases déjà existantes. Le système reste donc un prototype de recherche.
Cette précision est essentielle dans le contexte national. Le ministère marocain de l’Éducation avait déjà évoqué l’utilisation de caméras dotées d’intelligence artificielle dans les établissements scolaires. Je ne suis pas en mesure de dire, à partir de cette étude, si ces projets et ce prototype ont un lien. Rien n’indique une collaboration. Mais le rapprochement est inévitable : une technologie légère, peu coûteuse et respectueuse de la vie privée est exactement ce que réclameraient les partisans comme les critiques de ces caméras.
Et les auteurs eux-mêmes se montrent mesurés. Ils ne présentent pas leur système comme un outil de vidéosurveillance continue. Sa mémoire limitée le destine plutôt à l’analyse périodique, événementielle ou en basse résolution. On imagine davantage un dispositif qui prend des instantanés à intervalles réguliers qu’une caméra qui scrute chaque élève en permanence.
Les enjeux et les débats à venir
Deux lectures s’opposent, et je les trouve toutes deux légitimes.
D’un côté, les promoteurs de ce type d’outil y voient un moyen d’aider les enseignants : mesurer l’engagement d’un groupe, repérer les moments où l’attention chute, adapter le rythme d’un cours. Le fait que l’analyse se fasse localement, sans stockage de vidéos, est un argument sérieux en sa faveur.
De l’autre, les sceptiques rappellent qu’un système qui détecte un bâillement ou un téléphone peut vite servir à évaluer, voire à sanctionner, élèves et enseignants. Reconnaître qu’un élève bâille ne dit rien de la raison : fatigue, ennui, cours mal conçu ? Et même quand les images ne quittent pas la salle, la question de la finalité demeure. La protection technique ne remplace pas un cadre juridique et éthique sur ce que l’on a le droit de mesurer, et pourquoi.
Enfin, il y a l’enjeu de souveraineté technologique. Concevoir des modèles frugaux, capables de tourner sur du matériel bon marché, est un atout pour un pays qui souhaite déployer l’IA sans dépendre d’infrastructures cloud coûteuses. Sur ce point, l’étude de Nador envoie un signal encourageant.
Les prochaines étapes annoncées
Les chercheurs veulent maintenant tester leur système dans des classes plus diverses et sur davantage d’appareils. Ils comptent aussi durcir la protection des échanges par l’agrégation sécurisée et la confidentialité différentielle. C’est la bonne feuille de route : la valeur de ce travail se jouera moins sur le score de 95,64 % que sur la démonstration, en conditions réelles, que la vie privée des élèves peut être préservée.
Ma conclusion est simple. Cette IA de 229 Ko ne résout pas le débat sur l’IA à l’école, mais elle le déplace. La question n’est plus seulement de savoir si l’on peut observer une classe avec une machine. Elle est de savoir qui décide de ce que la machine observe, et ce qu’on fait de ce qu’elle voit.
FAQ
Que sait détecter cette IA marocaine ?
Vingt catégories : des actions d’élèves (lire, écrire, lever la main, discuter, applaudir, bâiller, utiliser un téléphone) ainsi que des personnes et objets comme l’enseignant, l’écran, le tableau et l’ordinateur.
Sur quel appareil fonctionne-t-elle ?
Sur une carte NXP dotée d’un processeur Arm Cortex-M4F à 120 MHz, avec 1 Mo de mémoire Flash et 256 Ko de mémoire vive. Le modèle y traite 15,43 images par seconde.
Les images des élèves sont-elles envoyées quelque part ?
Non, selon les auteurs. Pendant l’entraînement fédéré, seules des mises à jour mathématiques sont transmises, et une fois déployée, l’IA fonctionne sur l’appareil sans envoyer de flux vidéo.
Le système est-il déjà utilisé dans des écoles marocaines ?
Non. Aucun élève marocain n’a participé à l’expérience : les tests reposent uniquement sur des bases d’images existantes. C’est un prototype de recherche.