● Contexte
Gartner estime qu'une mauvaise qualité des données coûte aux organisations 12,9 M$ par an en moyenne. Ce chiffre m'a toujours paru abstrait, jusqu'à ce qu'on audite le HubSpot de Tellent. Quarante pour cent de leurs contacts n'étaient plus dans l'entreprise indiquée sur leur fiche. Les commerciaux appelaient des gens qui avaient quitté ces postes des mois plus tôt, parfois des années. Les rapports de pipeline avaient l'air sains. Le pipeline réel relevait de la fiction.
Si votre base HubSpot a dépassé les 50 000 fiches et que personne n'a fait de nettoyage en règle au cours des 12 derniers mois, vous avez presque certainement une version de ce problème. Peut-être pas 40 %, mais assez pour éroder la confiance dans chaque rapport que sort votre équipe revenue.
Ce guide détaille exactement comment nous nettoyons les bases HubSpot pour des clients comme Tellent et Uptoo. Pas de théorie. Le workflow réel, les outils, l'enchaînement, et les erreurs à éviter.
Pourquoi les données HubSpot se salissent
HubSpot est flexible par conception. Cette flexibilité est aussi ce qui transforme votre base en chantier. Voici les cinq coupables les plus fréquents que nous voyons au fil des audits clients :
Sources d'import multiples. Le marketing importe une liste issue d'un webinaire. Les ventes importent un CSV de prospection. Un partenaire envoie un tableur. Chaque source utilise ses propres conventions de nommage. « United States » dans l'une, « US » dans une autre, « USA » dans une troisième. Personne n'impose de standard parce que personne n'est responsable des données.
Aucune règle de validation sur les formulaires ou les imports. HubSpot vous laisse créer des champs en texte libre par défaut. Résultat : « VP Sales », « VP of Sales », « Vice President, Sales » et « vp sales » coexistent comme valeurs distinctes dans votre propriété intitulé de poste. Multipliez ça sur chaque champ texte et vous obtenez des milliers d'incohérences.
Saisie manuelle par les commerciaux. Les commerciaux tapent vite, abrègent avec créativité et vérifient rarement l'existence d'une fiche avant d'en créer une nouvelle. Ce n'est pas leur faute. Leur métier, c'est de vendre. Mais chaque saisie manuelle est un doublon ou une incohérence en puissance.
Fusions de bases lors de M&A. Quand des entreprises fusionnent, leurs CRM aussi. Deux portails HubSpot n'en font plus qu'un, ou une base Salesforce est importée dans HubSpot. Ces fusions sont des désastres pour la qualité des données si elles ne sont pas gérées avec soin.
Aucune politique de rafraîchissement de l'enrichissement. Les gens changent de poste tous les 2,7 ans en moyenne. Si vous avez enrichi votre base en 2024 sans la rafraîchir depuis, une part importante de ces données est déjà fausse.
L'effet cumulé : les données B2B se dégradent d'environ 2,1 % par mois. Soit 22,5 % par an. Une base que vous avez constituée il y a deux ans ? Près de la moitié des fiches pourraient être inexactes aujourd'hui.

● Explications
Le workflow de nettoyage en 4 phases
Nous avons nettoyé des bases HubSpot allant de 15 000 à plus de 300 000 fiches. Le workflow reste toujours ces quatre mêmes phases. L'ordre compte plus que la plupart des gens ne l'imaginent.
Phase 1 : audit et sauvegarde
Avant de toucher à quoi que ce soit, figez l'état actuel.
Exportez tout : contacts, entreprises, deals et tout objet personnalisé. Utilisez l'export natif de HubSpot ou l'API pour les bases plus volumineuses. Stockez ces exports en lieu sûr, en dehors de HubSpot. Google Drive, S3, ou là où votre équipe conserve ses sauvegardes.
Ensuite, auditez. Vous devez savoir avec quoi vous travaillez avant de commencer à corriger :
- Le nombre total de fiches par type d'objet
- Le taux de doublons (HubSpot l'affiche dans Qualité des données, sous Paramètres)
- Le taux de champs vides pour les propriétés critiques (e-mail, téléphone, intitulé de poste, nom de l'entreprise)
- Les fiches sans entreprise associée
- Les fiches sans aucune activité depuis plus de 12 mois
- Les propriétés aux formats incohérents (texte libre là où il faudrait des listes déroulantes)
C'est ce que nous détaillons dans notre guide d'audit CRM. L'audit vous donne un point de référence et vous aide à prioriser. Si 80 % de vos problèmes de qualité viennent de noms d'entreprises incohérents et d'intitulés de poste manquants, c'est par là qu'on commence.
Quand nous avons audité le HubSpot d'Uptoo, nous avons évalué 130 000 fiches et fini par en signaler 45 000 à supprimer. Sans la phase d'audit, nous aurions perdu du temps à nettoyer des fiches qui auraient dû être purement et simplement supprimées.
Phase 2 : standardisez avant de dédoublonner
C'est l'erreur que tout le monde commet. On saute directement à la déduplication.
Voici pourquoi ça échoue. Votre outil de dédoublonnage compare les fiches pour trouver des correspondances. Si une fiche dit « Acme Corp », une autre « ACME Corporation » et une troisième « Acme », un dédoublonnage basique par correspondance de chaînes voit trois entreprises sans rapport. Vous ne fusionnez rien. Les doublons survivent.
Standardisez d'abord. Dédoublonnez ensuite. L'ordre n'est pas négociable.
Ce qu'il faut standardiser :
Les noms d'entreprises. Retirez les suffixes juridiques (Inc, LLC, Ltd, SAS, GmbH) ou standardisez-les. Normalisez la casse. Décidez si « McKinsey & Company » et « McKinsey » sont la même chose (oui). C'est le plus difficile car les noms d'entreprises sont brouillons par nature. Nous combinons des workflows Operations Hub et des automatisations n8n sur mesure avec une étape LLM pour gérer le fuzzy matching à grande échelle.
Les intitulés de poste. Faites correspondre les titres en texte libre à une liste contrôlée. Vous n'avez pas besoin de 400 variantes de « Directeur commercial ». Créez une taxonomie standardisée : C-Level, VP, Directeur, Manager, Contributeur individuel. Rattachez chaque titre à l'un de ces niveaux de séniorité et à une fonction standardisée (Sales, Marketing, Finance, etc.).
Les champs pays et région. Choisissez les formats ISO et tenez-vous-y. « United States » devient « US ». « Ile-de-France » devient la version cohérente attendue par votre équipe.
Les numéros de téléphone. Format E.164. À chaque fois. +33612345678, pas « 06 12 34 56 78 » ni « (612) 345-678 ». Operations Hub peut en gérer une partie avec des workflows de formatage.
Les champs secteur. Si vous avez 150 valeurs de secteur et que la moitié sont des variantes des 30 mêmes secteurs, regroupez-les. Là encore, des listes déroulantes plutôt que du texte libre pour la suite.
Les outils que nous utilisons pour la standardisation : HubSpot Operations Hub (bon pour les règles de formatage simples), des workflows n8n sur mesure (meilleurs pour la logique complexe et la normalisation propulsée par un LLM), et Insycle pour les opérations de rechercher-remplacer en masse sur les valeurs de champs.
Phase 3 : dédoublonnez contacts et entreprises
Vos données sont désormais standardisées. « Acme Corp », « ACME Corporation » et « Acme » sont tous « Acme » maintenant. Votre outil de dédoublonnage peut réellement les retrouver.
HubSpot intègre une déduplication qui détecte les correspondances évidentes. Pour les contacts, elle se base sur l'adresse e-mail. Pour les entreprises, sur le nom de domaine. C'est le minimum vital. Ça attrape peut-être 30 à 40 % des vrais doublons.
Le reste nécessite du fuzzy matching. Même personne, adresses e-mail différentes (perso vs pro). Même entreprise, domaine légèrement différent (acme.com vs acme.io). Même contact saisi deux fois par deux commerciaux qui ont tapé le nom un peu différemment.
Pour le dédoublonnage en masse, nous superposons plusieurs outils :
- HubSpot Manage Duplicates (Paramètres > Qualité des données) : bon pour passer en revue et fusionner une par une. Pénible à grande échelle, mais utile pour des vérifications ponctuelles.
- Insycle : fusions en masse avec des règles de correspondance flexibles. Vous pouvez faire correspondre sur nom + entreprise, domaine d'e-mail + nom de famille, numéro de téléphone, et plus encore. Supporte la planification pour lancer un dédoublonnage hebdomadaire.
- Dedupely : intégration HubSpot directe entièrement dédiée au dédoublonnage. Bonne interface pour revoir les correspondances potentielles avant de fusionner.
- Workflows n8n sur mesure : pour les scénarios complexes où les outils clés en main atteignent leurs limites. Nous avons construit des workflows qui utilisent GPT-4 pour évaluer si deux fiches aux données proches mais non identiques renvoient à la même personne ou entreprise.
Créez une matrice de fusion avant de commencer à fusionner. Pour chaque paire de doublons, il vous faut des règles : quelle fiche est la fiche maître ? Quelles valeurs de champs survivent à la fusion ? En général, la fiche maître est celle avec l'activité la plus récente, le plus d'associations, ou celle créée par le marketing (car elle a souvent des données plus riches). Mais vous devez le décider explicitement, pas laisser l'outil choisir au hasard.
Chez Tellent, nous sommes passés de 90 000 contacts à 31 000 après dédoublonnage et suppression des fiches invalides. Soit une réduction de 65 %. Les 31 000 contacts restants avaient des données complètes, exactes et standardisées.
Phase 4 : enrichissez ce qui manque
Après le nettoyage, vous avez une vision claire de ce qui manque exactement. Vous savez quels contacts n'ont pas de numéro de téléphone, quelles entreprises n'ont pas d'effectif ou de chiffre d'affaires, quelles fiches n'ont pas de classification sectorielle.
C'est à ce moment-là que vous enrichissez. Pas avant.
Enrichir avant de nettoyer, c'est payer pour compléter des fiches qui pourraient être des doublons, être invalides, ou finir supprimées au cours du nettoyage. Nous avons vu des entreprises dépenser des milliers d'euros en crédits d'enrichissement pour des fiches qu'elles ont fini par fusionner ou supprimer une semaine plus tard.
Côté outils d'enrichissement, le paysage évolue vite. Apollo, FullEnrich et Kaspr sont ceux que nous utilisons le plus fréquemment en 2026. Chacun a ses points forts selon votre marché (géographie, taille d'entreprise, type de persona).
La passe d'enrichissement comble généralement 60 à 80 % des champs manquants, selon votre marché cible et la couverture de l'outil sur ce segment. Les données des PME européennes, par exemple, sont plus difficiles à enrichir que celles des grands comptes américains. Calibrez vos attentes en conséquence.
Les outils que nous utilisons pour le nettoyage HubSpot
Tous les outils ne conviennent pas à tous les cas. Voici ce que nous utilisons réellement, et quand.
HubSpot Operations Hub. L'option native. Bon pour : les workflows de formatage (normalisation des téléphones, casse du texte), le dédoublonnage simple par e-mail/domaine, les alertes automatisées sur la qualité des données. Limité quand : vous avez besoin d'opérations en masse sur des dizaines de milliers de fiches, d'une logique de correspondance complexe, ou d'une normalisation propulsée par un LLM. Nécessite la formule Professional ou Enterprise.
Insycle. Notre référence pour les opérations en masse. Permet : la fusion de masse selon des règles flexibles, la standardisation de champs en masse, les nettoyages récurrents planifiés, le nettoyage à l'import CSV. La fonction de planification est sous-estimée. Programmez-la pour lancer des contrôles de doublons hebdomadaires et vous évitez l'accumulation. Tarifs à partir d'environ 200 $/mois pour l'intégration HubSpot.
n8n. Outil d'automatisation de workflows open source que nous auto-hébergeons. Nous l'utilisons pour des pipelines de nettoyage sur mesure qui n'entrent dans aucun outil SaaS. Exemple : récupérer des fiches HubSpot via l'API, les passer dans un LLM pour classer les intitulés de poste, puis réécrire les valeurs standardisées. Plus d'effort d'ingénierie, mais ça gère des cas limites qu'aucun autre outil ne traite.
Cargo. Constructeur de workflows visuel pour les opérations de données. Se situe entre la simplicité d'Insycle et la flexibilité de n8n. Bon pour orchestrer des workflows de nettoyage multi-étapes impliquant des appels d'API d'enrichissement, de la logique conditionnelle et des écritures dans HubSpot. Nous l'utilisons quand l'équipe du client doit maintenir les workflows elle-même après notre départ.
● Conclusion
Avant/après : des résultats concrets
Tellent
Tellent est venu nous voir avec un portail HubSpot qui avait grossi de façon organique sur plusieurs années. Plusieurs équipes avaient importé des listes. Les formulaires n'avaient aucune validation. L'enrichissement avait été fait une fois, deux ans plus tôt.
Les chiffres :
- 300 000 fiches entreprise auditées
- 90 000 contacts ramenés à 31 000 après dédoublonnage et suppression
- 40 % des contacts avaient des associations d'entreprise obsolètes
- Les commerciaux ont déclaré économiser ~6 heures par semaine auparavant passées à rechercher des contacts qui s'avéraient être des impasses
La réaction de l'équipe commerciale a été le vrai indicateur. Avant le nettoyage, les commerciaux avaient cessé de faire confiance à HubSpot et s'étaient construit leurs propres tableurs en parallèle. En deux semaines après le nettoyage, l'usage des tableurs est tombé à quasiment zéro. Quand les commerciaux font confiance au CRM, ils l'utilisent vraiment.
Tous les détails dans l'étude de cas Tellent.
Uptoo
Le défi d'Uptoo était différent. C'est un cabinet de recrutement commercial, donc leur HubSpot fait à la fois office de CRM et de base de candidats. Le problème, c'était le volume.
- 130 000 fiches auditées
- 45 000 fiches supprimées (invalides, injoignables ou gravement obsolètes)
- Boutons d'enrichissement HubSpot sur mesure construits pour que leurs commerciaux rafraîchissent les données à la demande
- Fiches restantes standardisées et enrichies avec les informations professionnelles actuelles
Nous avons construit des boutons d'enrichissement sur mesure directement dans HubSpot pour que leurs recruteurs puissent rafraîchir le profil d'un candidat en un clic, en récupérant des données actuelles depuis plusieurs sources. Cela a maintenu la base fraîche dans la durée, et pas seulement au moment du nettoyage.
Tous les détails dans l'étude de cas Uptoo.
Garder une base propre : la maintenance continue
Un nettoyage ponctuel a de la valeur. Une base qui reste propre, c'est transformateur. Voici la cadence de maintenance que nous mettons en place pour nos clients.
Chaque semaine : détection automatisée des doublons. Lancez le dédoublonnage planifié d'Insycle ou construisez un workflow Operations Hub qui signale les nouveaux doublons potentiels pour revue. De nouveaux doublons apparaissent en permanence via les soumissions de formulaires, les imports et la création manuelle. Les attraper chaque semaine empêche l'accumulation.
Chaque mois : revue des fiches dormantes. Sortez une liste des fiches sans activité depuis plus de 90 jours. Décidez : enrichir et garder, ou archiver. HubSpot n'a pas de fonction d'archivage native, donc nous utilisons généralement une propriété personnalisée (« Statut de la fiche ») avec des valeurs comme Active, Dormante, Archivée. Filtrez-les hors des listes et rapports actifs.
Sur chaque formulaire : des règles de validation. Exigez une validation du format e-mail. Utilisez des listes déroulantes plutôt que du texte libre pour le pays, le secteur et la fonction. Utilisez le profilage progressif pour collecter les données sur plusieurs soumissions plutôt que de tout demander d'un coup (et de récolter du n'importe quoi parce que la personne expédie le formulaire).
Chaque trimestre : un audit léger. Vérifiez les scores globaux de qualité des données. Passez en revue les nouvelles propriétés créées sans gouvernance. Regardez les journaux d'import pour voir si quelqu'un a chargé un CSV sans le standardiser au préalable. Pas besoin d'un audit complet. Trente minutes avec le bon tableau de bord attrapent l'essentiel des dérives.
Désignez un responsable. Quelqu'un doit être responsable de la qualité des données. C'est généralement une personne RevOps, parfois un lead marketing ops. Sans responsable, chacune de ces tâches de maintenance sera oubliée en moins de deux mois.
● Tips
Votre base HubSpot est soit un atout, soit un fardeau. Il n'y a pas vraiment d'entre-deux. Si votre équipe commerciale a cessé de faire confiance aux données du CRM, si vos rapports semblent déconnectés de la réalité, ou si vous êtes sur le point d'investir dans des outils d'enrichissement, nettoyer d'abord est le geste au meilleur ROI que vous puissiez faire.
Nous menons ces projets régulièrement. Si vous voulez un diagnostic avant de vous engager dans un nettoyage complet, commencez par notre cadre d'audit CRM, ou contactez-nous directement pour une évaluation cadrée.
● Questions fréquentes
C'est possible. Avant de fusionner, auditez quels workflows référencent les fiches concernées. HubSpot conserve les associations et l'historique d'activité sur la fiche survivante, mais l'historique d'inscription aux workflows de la fiche supprimée est perdu. Les rapports basés sur le nombre total de contacts vont évidemment changer. Construisez vos rapports sur les contacts actifs et qualifiés plutôt que sur le total, et le problème disparaît.
Nettoyer d'abord. Toujours. Enrichir une base sale, c'est payer des crédits sur des fiches que vous allez ensuite fusionner ou supprimer. Et votre outil d'enrichissement risque de ne pas associer la bonne fiche, parce que les données existantes qu'il utilise pour la correspondance (nom d'entreprise, domaine d'e-mail) sont incohérentes. Nettoyez, standardisez, dédoublonnez, puis enrichissez. Les quatre phases existent dans cet ordre pour une raison.
Quantifiez le gaspillage. Sortez un rapport sur les deals perdus ou bloqués où le contact avait des informations obsolètes. Calculez les heures que les commerciaux passent chaque semaine à vérifier des données en dehors de HubSpot. Multipliez par leur coût horaire. Chez Tellent, le chiffre de 6 heures par commercial et par semaine a rendu l'argumentaire évident. Même une estimation prudente de 2 à 3 heures par commercial et par semaine, sur une équipe de 20 personnes, représente plus de 2 000 heures par an de productivité perdue à cause de mauvaises données.