Les Developpeurs

Apprentissage automatique : introduction pour non-initiés

Et si on arrêtait le jargon pour enfin comprendre l'apprentissage automatique ? De l'anti-spam aux 3 grandes familles d'algorithmes, voici l'explication simple que j'aurais aimé lire en débutant.

Apprentissage automatique : introduction pour non-initiés

La première fois que j'ai essayé d'expliquer ce qu'est l'apprentissage automatique à ma mère, je me suis planté. J'ai sorti les mots « modèle », « features », « gradient »... et je l'ai perdue à la deuxième phrase. Depuis, j'ai compris une chose : si vous ne pouvez pas expliquer un algorithme avec un exemple de la vie quotidienne, c'est que vous ne l'avez pas vraiment compris vous-même. Voici ma tentative — celle que j'aurais aimé lire quand je débutais.

Points clés à retenir

  • L'apprentissage automatique (machine learning) est une branche de l'IA où la machine apprend à partir d'exemples plutôt qu'à partir de règles écrites à la main.
  • Trois grandes familles existent : supervisé, non supervisé, par renforcement. Chacune répond à un problème différent.
  • Un modèle n'est pas « intelligent » au sens humain. Il trouve des régularités dans des données, puis les applique à de nouvelles données.
  • Le cœur du travail n'est presque jamais l'algorithme. C'est la qualité des données et la formulation du problème.
  • Vous pouvez déjà toucher à tout ça sans écrire une ligne de maths, avec des outils comme Teachable Machine ou Scikit-learn.

Apprentissage automatique : c'est quoi, vraiment, sans le jargon ?

Une définition simple tient en une phrase : au lieu de programmer toutes les règles, on montre à l'ordinateur une grande quantité d'exemples, et il devine lui-même la règle qui les relie.

Prenons le filtre anti-spam. Dans les années 1990, il fallait écrire des règles du genre « si le message contient "gagné" en majuscules, alors spam ». Problème : les spammeurs changeaient une lettre, et la règle tombait. Aujourd'hui, on ne code plus la règle. On donne à la machine 500 000 messages déjà étiquetés « spam » ou « pas spam », et elle découvre toute seule les signaux qui les distinguent. C'est ça, l'apprentissage automatique.

Le mot « automatique » est un peu trompeur, avouons-le. Rien ne se fait tout seul. Quelqu'un a dû collecter les messages, les étiqueter un par un, choisir un algorithme, puis vérifier que ça marche. « Automatique » veut juste dire « la règle se déduit des données », pas « personne n'a rien fait ».

Intelligence artificielle et machine learning, c'est la même chose ?

Non, et la confusion est courante. L'intelligence artificielle est la grande catégorie : tout ce qui fait faire à une machine des tâches qu'on réservait aux humains. L'apprentissage automatique en est une sous-partie — celle qui apprend à partir de données. Un moteur de règles « si ceci alors cela » est de l'IA, mais pas de l'apprentissage automatique.

Bref : tout machine learning est de l'IA, l'inverse n'est pas vrai. C'est la distinction que je répète le plus souvent en formation, parce qu'elle évite 80 % des quiproquos.

Les trois grandes familles d'apprentissage, avec un exemple concret

Voilà la partie que j'aurais aimé qu'on m'explique d'emblée. Il n'y a pas « un » apprentissage automatique, il y a trois grandes façons d'apprendre. Et le choix de la méthode découle directement de la question que vous vous posez.

L'apprentissage supervisé : apprendre avec un professeur

Vous avez des exemples dont vous connaissez déjà la bonne réponse. On appelle ça des données étiquetées. On fournit à la machine 10 000 photos de courriers, chaque photo étiquetée « chat » ou « chien », et le modèle apprend à distinguer les deux. Une fois entraîné, on lui montre une photo inédite — il prédit.

Deux usages couvrent la majorité des cas réels :

  • La classification : ranger dans une catégorie (spam ou pas, malade ou sain, fraude ou pas).
  • La régression : prédire un nombre (le prix d'un appartement, la consommation demain).

En pratique, c'est la méthode que vous utiliserez 8 fois sur 10. Le hic ? Il faut des données étiquetées — et les étiqueter coûte cher en temps humain.

L'apprentissage non supervisé : trouver ce qu'on ne cherchait pas

Ici, pas d'étiquettes. On donne des données brutes et on demande à la machine : « trouve-moi des groupes, des structures, des ressemblances ». C'est ce qu'on appelle aussi l'apprentissage non supervisé — ou clustering quand la tâche est de regrouper des choses similaires.

Exemple que j'ai testé sur un petit fichier client : on donne à l'algorithme les habitudes d'achat de 4 000 clients, sans rien lui dire de plus. Il ressort trois groupes distincts. À nous de les regarder et de comprendre : « tiens, c'est les acheteurs du week-end », « ça, les gros paniers occasionnels », « et voilà les petits réguliers ». Aucune réponse « juste » à l'avance — juste une structure utile.

L'apprentissage par renforcement : essayer, se tromper, recommencer

Le plus intuitif à raconter, le plus difficile à mettre en œuvre. Un programme agit, reçoit une récompense ou une punition, et ajuste sa stratégie pour maximiser les récompenses. C'est l'école des jeux : AlphaGo a battu des champions de Go en apprenant par essais, avec un simple signal « gagné » ou « perdu » en fin de partie.

Hors des jeux, ça sert là où la décision doit s'enchaîner sur la durée : un bras robotique qui apprend à saisir un objet, un système d'optimisation énergétique d'un bâtiment. C'est puissant, gourmand en essais, et souvent réservé à des équipes qui ont le temps.

Type Données nécessaires Exemple concret Effort
Supervisé Étiquetées par un humain Filtrer le spam, prédire un prix Étiquetage long, algorithme accessible
Non supervisé Brutes, sans étiquette Segmenter des clients, détecter des anomalies Pas d'étiquetage, mais résultat à interpréter
Par renforcement Aucune au départ — l'agent génère les essais Robot, jeu, pilotage d'un système Très gourmand en entraînement

Comment ça marche concrètement, de la donnée à la prédiction

On imagine toujours un moment magique où la machine « comprend ». En réalité, le processus est une chaîne d'étapes assez austères, et c'est là que tout se joue.

Comment ça marche concrètement, de la donnée à la prédiction

Les cinq étapes d'un projet type

  1. Collecter et nettoyer les données. C'est 60 à 70 % du temps réel, dans mon expérience. Données manquantes, doublons, erreurs de saisie : c'est le nettoyage, pas l'algorithme, qui décide du résultat final.
  2. Séparer en deux jeux : une partie pour entraîner le modèle, une autre pour le tester. Jamais la même donnée des deux côtés.
  3. Choisir un algorithme et l'entraîner sur le jeu d'entraînement.
  4. Évaluer sur le jeu de test — la partie que le modèle n'a jamais vue.
  5. Si le résultat est bon, déployer ; sinon, recommencer en amont. C'est presque toujours là qu'on retourne.

L'erreur du débutant : croire que ça marche du premier coup

La première fois que j'ai entraîné un modèle de classification sur des données clients, j'ai obtenu du 98 % de précision. J'étais fier. Puis j'ai compris que mes deux jeux — entraînement et test — contenaient en fait des lignes qui se recoupaient. Le modèle ne prédisait pas, il se souvenait. Ce phénomène porte un nom, le sur-apprentissage, et il m'a coûté une bonne semaine à débusquer.

Morale : un score trop beau est un signal d'alarme, jamais une bonne nouvelle.

Par où commencer quand on n'y connaît rien

Vous n'avez pas besoin d'un doctorat en maths pour toucher à tout ça. Franchement, l'ordre que j'ai suivi — et que je referais — ressemble à ceci :

  • Commencez par jouer. Teachable Machine de Google vous laisse entraîner un petit modèle de reconnaissance d'images en dix minutes, sans coder.
  • Ensuite, un peu de Python avec la bibliothèque Scikit-learn, qui cache les maths derrière des fonctions courtes.
  • Ne lisez pas un cours de maths en premier. Vous allez décrocher. Faites d'abord, comprenez après.
  • Un jeu de données réel vous apprendra plus qu'un mois de théorie. Prenez-en un petit, que vous comprenez.

J'ai perdu trois mois, au tout début, à vouloir maîtriser les maths avant de toucher au code. Erreur classique. Le déclic est venu quand j'ai lancé mon premier modèle bête sur un fichier de 200 lignes.

Est-ce que ça peut se tromper, un modèle ?

Constamment. Un modèle apprend des régularités dans les données qu'on lui donne — il ne connaît rien du monde. Si vos données sont biaisées, le résultat le sera aussi. Un système entraîné uniquement sur des dossiers d'embauche masculins reproduira ce déséquilibre, sans aucune « intention » de discriminer. La donnée d'entrée est la vraie source de presque tous les dérapages que j'ai vus.

Une idée à garder en tête

L'apprentissage automatique n'est ni magique, ni inaccessible. C'est un ensemble de méthodes qui, à partir d'exemples, devinent des règles que personne n'a écrites. La partie difficile n'est presque jamais l'algorithme — c'est de choisir un bon problème, de rassembler des données propres, et d'accepter qu'un résultat trop parfait cache souvent une erreur quelque part.

Et si vous ne retenez qu'une chose : la prochaine fois qu'un outil vous vend « de l'IA qui apprend tout seul », posez une question. Avec quelles données ? Étiquetées par qui ? Ce sont les réponses à ces deux questions — pas le nom de l'algorithme — qui vous diront si le projet est sérieux ou pas.

Franck Lefèvre

Franck Lefèvre

Franck Lefèvre est un expert reconnu en sécurité des réseaux, en cryptographie et en tests d'intrusion. Il accompagne depuis plusieurs années des organisations dans la protection de leurs infrastructures et la détection de vulnérabilités. Passionné par la transmission, il partage volontiers son savoir-faire avec rigueur et pédagogie.

Voir tous les articles →

Articles similaires