Produit·9 min de lecture·

« CV anonymisé » et « IA européenne » : deux promesses plus étroites qu'elles n'en ont l'air

Anonymisé ne veut pas dire ce que vous croyez, et « IA européenne » recouvre deux questions différentes. Ce que donne la lecture de 32 politiques de confidentialité, et celle que nous avons dû corriger chez nous.

En France, « CV anonyme » est une expression que tout le monde a déjà entendue. Une loi de 2006 a rendu la pratique obligatoire, aucun décret d'application n'est jamais paru, et le texte a été abrogé en 2015. Il en reste une idée familière : retirer le nom et la photo d'un CV suffirait à le rendre anonyme.

Dans le vocabulaire du RGPD, ce n'est pas le cas. Et c'est la première de deux expressions que les outils de CV assistés par IA utilisent plus largement que leur définition ne le permet. La seconde est « IA européenne ».

Anonymisé, ou pseudonymisé

Le RGPD distingue deux choses que le marketing confond.

Une donnée anonyme ne se rapporte plus à une personne identifiable, par aucun moyen raisonnablement susceptible d'être utilisé, par qui que ce soit. Considérant 26. Elle sort entièrement du champ du règlement. Le seuil est très haut.

Une donnée pseudonymisée, article 4(5), a vu ses identifiants remplacés mais le lien reste possible. Elle demeure une donnée personnelle et reste intégralement soumise au règlement.

Appliquons ça à un CV. Plusieurs outils retirent nom, email, téléphone et adresse avant tout envoi à un modèle. C'est un bon dispositif, et c'est plus que ce que fait la majorité de la catégorie. Mais regardez ce qui reste : les employeurs, les intitulés de poste, les dates, la ville, l'école, les certifications. Ce n'est pas un document anonyme. Un parcours professionnel daté est une empreinte. L'avis 05/2014 du G29 pose trois tests, l'individualisation, la corrélation et l'inférence, et une liste d'employeurs avec leurs dates échoue aux trois sans difficulté.

Retirer les identifiants reste utile. C'est de la minimisation réelle : ça réduit ce qu'un prestataire pourrait journaliser et ce qui peut apparaître dans une trace d'erreur. Ce n'est simplement pas de l'anonymisation, et employer le mot promet un statut juridique que la technique ne délivre pas.

Nous faisions la même chose, corrigée le jour où nous l'avons vue

Notre page de statistiques annonçait des pages vues « anonymisées ». L'empreinte visiteur était un SHA256 de l'adresse IP, du navigateur et de la date, sans sel cryptographique. L'espace IPv4 fait environ quatre milliards d'adresses et les chaînes de navigateur portent très peu d'entropie : toute personne disposant de cette table pouvait remonter aux adresses par énumération. La CNIL et le CEPD le disent tous les deux, hacher un identifiant est une pseudonymisation.

Nous avons salé l'empreinte, ce qui ferme cette porte à quiconque n'a que les données, puis nous avons remplacé le mot par « pseudonymisé » dans les quatorze langues du site, parce que nous détenons le sel et pourrions encore l'inverser nous-mêmes. La version honnête est une phrase moins flatteuse et une phrase vraie.

La deuxième expression : « IA européenne »

« Notre IA tourne en Europe » ressemble à une affirmation. C'en est deux.

La première question est de savoir où tourne l'inférence et qui exploite le point d'accès. Votre CV part quelque part, ce quelque part relève d'une juridiction, une entreprise le contrôle. C'est la question dont s'occupe la protection des données.

La seconde est de savoir qui a entraîné le modèle. Pas qui le sert. Qui l'a construit, sur quelles données, avec quelle idée de ce qu'est une bonne réponse.

Pendant longtemps les deux se confondaient, parce que les bons modèles n'étaient disponibles que chez les laboratoires qui les fabriquaient. Appeler GPT, c'était appeler OpenAI.

Les poids ouverts ont cassé ça. Llama chez Meta, Qwen chez Alibaba, DeepSeek, et gpt-oss publié par OpenAI sous licence Apache 2.0 en août 2025. Une fois les poids publics, l'hébergement se sépare de l'origine : un fournisseur français peut servir un modèle américain depuis un datacentre parisien, et le laboratoire qui l'a entraîné ne voit jamais la moindre requête.

Ce n'est pas une astuce. C'est un résultat réel et significatif : aucune donnée ne quitte l'Europe, aucune société américaine ne traite votre CV, aucun mécanisme de transfert n'est nécessaire. Un outil européen peut donc écrire en toute sincérité que tous ses modèles tournent en France, chez des fournisseurs européens, et décrire un système dont le modèle principal a été entraîné en Californie.

Les deux moitiés de la phrase sont vraies. Aucune n'est complète.

Ce qui découle vraiment de l'origine, et ce qui n'en découle pas

Soyons précis, parce que l'argument est souvent gonflé.

Pour la protection des données, l'origine ne change presque rien. Si les poids tournent sur du matériel européen et que rien ne part vers le laboratoire d'origine, vos données valent ce que vaut l'hébergeur. Le RGPD demande où vont les données personnelles et qui les traite, pas qui a entraîné les multiplications de matrices. Qui vous présente un modèle américain hébergé en Europe comme un problème de confidentialité vous vend quelque chose.

Trois autres choses en découlent, en revanche.

Un modèle transporte les conventions sur lesquelles il a été entraîné, et pour un outil de CV ce n'est pas abstrait. Un modèle entraîné majoritairement sur de l'anglais a intégré l'idée américaine du CV : pas de photo, pas de date de naissance, pas de situation familiale, une page, les résultats en tête. Un CV français porte couramment une photo et une rubrique « Profil recherché ». Demandez à un modèle entraîné aux États-Unis d'améliorer un CV français et son réflexe sera de l'américaniser, discrètement, en cent petites retouches que personne n'a présentées comme des choix.

Vous détenez ce qui a été publié, et rien de plus. Des poids Apache 2.0 déjà téléchargés ne peuvent pas vous être retirés, donc la continuité d'une version donnée est réellement acquise. Ce sur quoi vous n'avez aucun droit, c'est la suivante. Un laboratoire qui cesse de publier ne vous doit rien, et la trajectoire d'un outil bâti sur les publications ouvertes d'un tiers est une trajectoire décidée par ce tiers.

Et il y a la question industrielle, qui relève de l'opinion plutôt que du fait, donc prenez celle-ci pour ce qu'elle est, la nôtre. Si la réponse européenne à la souveraineté consiste à faire tourner des modèles américains sur des serveurs européens, l'Europe est une couche d'hébergement. L'argent va aux GPU et aux datacentres, et la partie qui capitalise, la recherche, les entraînements, les gens, se passe ailleurs. Une infrastructure souveraine sans modèles souverains, c'est une position de propriétaire foncier.

Ce que donne la lecture de 32 outils

Nous sommes allés chercher une politique de confidentialité sur tous les outils de CV assistés par IA que nous avons pu trouver, en quatre langues, en notant ce que chaque texte dit réellement plutôt que ce que le site met en avant. Trente-deux outils. Tous n'en ont pas une.

Sur le lieu d'exécution du modèle :

  • 15 nomment un fournisseur américain sans mentionner la moindre région européenne
  • 13 ne nomment aucun fournisseur de modèle dans tout ce qu'ils publient
  • 1 nomme un fournisseur américain et précise une région européenne
  • 3 passent par des fournisseurs européens

Sur l'origine des poids :

  • 16 utilisent des laboratoires américains
  • 13 n'en disent pas assez pour trancher
  • 2 utilisent un laboratoire européen
  • 1 utilise les deux

Les deux listes ne coïncident pas, et cet écart est tout le sujet de cet article. Un outil se trouve à la fois dans la colonne « fournisseur européen » et dans la colonne « laboratoire américain », ce qui est une position parfaitement cohérente et parfaitement invisible tant qu'on ne dispose que d'une colonne.

Cet outil publie d'ailleurs la documentation technique la plus détaillée de tout l'échantillon. Il nomme chaque modèle avec sa version exacte, décrit son pipeline étape par étape, et signale de lui-même les limites de son propre nettoyage, ce que personne d'autre ne fait. Il n'esquive rien. Le vocabulaire n'existe pas, voilà tout, et la version honnête de l'affirmation n'a nulle part où se loger.

Treize outils ne disent rien du tout. Ça reste le constat principal, et aucune nuance sur l'origine des poids ne le déplace.

Ce que nous faisons, et ce que ça coûte

Job-Agent utilise des modèles Mistral, fournis par Mistral, servis par Scaleway à Paris. Européen sur les deux questions. Sur les 32 outils lus, deux le sont.

Autant être direct sur le prix. La frontière ouverte est aujourd'hui largement américaine, et les plus gros modèles européens ne sont pas les plus gros modèles. Choisir des poids européens revient à accepter un modèle plus petit que le meilleur disponible, et nous dépensons un véritable effort d'ingénierie à combler l'écart : le pipeline d'analyse répartit le travail entre de nombreux appels courts et ciblés au lieu de demander à un seul très grand modèle de tout faire, et une chaîne de vérifications déterministes rattrape ce qu'un petit modèle rate. C'est une contrainte que nous avons choisie, pas un repas gratuit que nous aurions trouvé.

Nous pensons que ça les vaut. Vous pouvez penser autrement, et si vous voulez le modèle le plus puissant possible en assumant sa provenance, c'est une position défendable et il existe de bons outils pour ça.

Une règle simple

Pour les deux expressions, la question à poser est la même : qui devrait être dans l'incapacité de faire quelque chose pour que le mot soit mérité ?

Pour « anonymisé » : si l'entreprise peut encore déterminer qui vous êtes, c'est pseudonymisé, quel que soit le terme employé sur la page. Le plus souvent, la personne qui devrait en être incapable est justement celle qui écrit la phrase.

Pour « IA européenne » : demandez si c'est l'inférence qui est européenne, le modèle, ou les deux. Les trois réponses sont défendables. Une seule est actuellement posée.

Posez la question.

Arrêtez de réécrire votre CV à chaque fois

Job-Agent analyse chaque offre à laquelle vous postulez, en extrait les mots-clés ATS exacts et réécrit votre CV en conséquence, en moins de 60 secondes par candidature.