Les tableaux de bord proposés par les réseaux sociaux ont deux défauts pour une entreprise qui publie régulièrement. Le premier est leur horizon court : au delà de quelques mois, l'historique devient inaccessible ou se réduit à des totaux inexploitables. Le second est leur rigidité : on obtient les croisements que la plateforme a prévus, jamais ceux dont on aurait besoin. Récupérer ses propres données et les analyser dans un outil que l'on maîtrise résout les deux problèmes à la fois, pour un effort bien plus modeste que ce que la plupart des équipes imaginent. Nous décrivons ici les moyens d'extraction disponibles, la structure des fichiers obtenus, les analyses qui apportent réellement quelque chose et les précautions à prendre sur les données personnelles.

Ce que l'on peut récupérer, et par quels moyens

Trois voies coexistent, avec des niveaux de complétude et de complexité très différents. La plus simple consiste à utiliser l'export prévu par la plateforme dans ses paramètres, généralement présenté comme une demande de copie de ses informations. Cette fonction, imposée par la réglementation sur la portabilité des données, produit une archive complète que l'on reçoit par courriel sous quelques heures à quelques jours. Le cadre juridique de ce droit et ses implications pour une entreprise sont détaillés dans notre article sur le RGPD et ses obligations.

La deuxième voie est l'export de statistiques proposé dans les espaces professionnels. Il fournit des tableaux directement exploitables, avec les mesures d'impression, d'interaction et de portée par publication. Sa limite est temporelle : la plupart des plateformes ne permettent d'exporter qu'une fenêtre glissante, de trois mois à un an selon les cas. Cette limite constitue précisément la raison pour laquelle il faut exporter régulièrement plutôt qu'au moment où l'on en a besoin. Un export mensuel archivé quelque part suffit à constituer un historique complet en deux ans. Les plateformes ne préviennent pas de ces limites et beaucoup d'entreprises ne les découvrent qu'au moment où elles cherchent à comparer une année à la précédente. À ce stade, les données manquantes ne peuvent plus être reconstituées par aucun moyen.

La troisième voie passe par les interfaces de programmation, qui permettent de récupérer les données automatiquement. Elle offre la plus grande souplesse et elle demande des compétences techniques, une inscription en tant que développeur et le respect de quotas d'appel. Elle se justifie sur les comptes à fort volume ou lorsque plusieurs comptes doivent être suivis ensemble. Pour une entreprise publiant quelques fois par semaine sur deux ou trois réseaux, l'export manuel régulier reste largement suffisant et bien plus économique en temps. L'automatisation devient rentable au delà d'une dizaine de comptes ou lorsqu'un tableau de bord doit être alimenté quotidiennement. Elle impose en contrepartie une maintenance, les interfaces évoluant régulièrement et cassant les scripts existants. Cette maintenance est souvent sous estimée au moment de la décision.

Quelle que soit la voie retenue, il faut distinguer deux natures de données. Les données de contenu regroupent les publications, leurs textes, leurs médias et leurs dates. Les données de mesure regroupent les impressions, les interactions, les clics et les caractéristiques agrégées du public. Les premières se conservent indéfiniment et constituent une archive utile en soi. Les secondes sont celles qui disparaissent, et ce sont donc elles qu'il faut extraire en priorité. Les données de contenu présentent malgré tout un intérêt propre, notamment pour retrouver un visuel produit trois ans plus tôt ou pour justifier d'une antériorité de publication. Une archive annuelle complète, conservée sans traitement, remplit cette fonction pour un coût de stockage négligeable.

Colonnes utiles d’un fichier d’export de statistiques sociales

La structure des fichiers obtenus

Les archives complètes arrivent généralement sous forme d'un fichier compressé contenant des dossiers thématiques et des fichiers de données structurées. Ces fichiers se lisent avec un éditeur de texte et ils sont conçus pour être traités par un programme plutôt que lus directement. Un tableur ne les ouvre pas correctement en l'état, ce qui décourage beaucoup d'utilisateurs au premier essai. Une conversion préalable est nécessaire, et elle se fait avec des outils en ligne gratuits ou avec quelques lignes de script. Attention toutefois aux outils de conversion en ligne : déposer une archive contenant des messages privés sur un service inconnu revient à en confier le contenu à un tiers. Sur ce type de fichier, la conversion doit rester locale, ce qui plaide pour un petit script exécuté sur son propre poste. Un assistant de programmation produit ce script en quelques minutes pour qui ne sait pas l'écrire.

Les exports de statistiques, eux, arrivent au format tabulaire et s'ouvrent directement dans un tableur. Deux pièges classiques les attendent à l'ouverture. Le premier concerne les dates, souvent écrites dans un format anglo-saxon que le tableur interprète à l'envers, transformant le 3 avril en 4 mars. Le second concerne les nombres décimaux, dont le séparateur diffère selon la langue du fichier et celle du tableur. Vérifier ces deux points sur les premières lignes avant toute analyse évite des conclusions absurdes. La méthode la plus sûre consiste à passer par l'assistant d'importation du tableur plutôt que par un double clic sur le fichier, ce qui permet de désigner explicitement le format de chaque colonne. Un troisième piège concerne les identifiants de publication, longues suites de chiffres que le tableur convertit en notation scientifique et arrondit, rendant la déduplication impossible. Forcer ces colonnes au format texte à l'importation règle définitivement la question.

Les colonnes utiles se ramènent à une poignée, quelle que soit la richesse du fichier. La date et l'heure de publication, le type de contenu, le texte ou son début, le nombre d'impressions, le nombre d'interactions et le nombre de clics vers le site suffisent à mener l'essentiel des analyses. Les dizaines d'autres colonnes proposées se révèlent rarement décisives et elles compliquent la lecture. Créer un onglet de travail ne contenant que ces colonnes, alimenté par formule depuis les données brutes, simplifie considérablement la suite. Cette séparation entre données brutes et données de travail présente un second avantage : elle permet de remplacer les données brutes par un export plus récent sans refaire les formules. L'onglet de travail devient alors un outil réutilisable mois après mois. Y ajouter deux ou trois colonnes calculées, comme le taux d'interaction ou le jour de la semaine, achève de le rendre autonome.

Un point mérite une attention particulière : la définition exacte de chaque mesure varie d'une plateforme à l'autre et parfois d'une version à l'autre de l'export. Une impression peut compter un affichage partiel ou un affichage d'au moins une seconde, une interaction peut inclure ou exclure les clics sur le nom du compte. Comparer directement les chiffres de deux plateformes n'a donc aucun sens. Comparer l'évolution d'une même mesure sur une même plateforme, en revanche, reste parfaitement légitime, et c'est précisément ce dont on a besoin. Il faut cependant rester attentif aux changements de définition annoncés par les plateformes, qui produisent des ruptures dans les séries. Noter la date de ces changements dans le carnet de bord évite d'interpréter une rupture méthodologique comme un effondrement de performance.

Les analyses qui apportent réellement quelque chose

Une fois les données rassemblées, la tentation est de produire beaucoup de graphiques. L'expérience montre que cinq analyses concentrent l'essentiel de la valeur, et qu'elles se mènent toutes avec des tableaux croisés dynamiques élémentaires. Elles s'inscrivent dans la démarche plus large exposée dans notre article sur la stratégie social media et l'importance de la régularité.

La première consiste à mesurer le taux d'interaction rapporté aux impressions, publication par publication, puis à classer les résultats. Le taux brut d'interactions favorise mécaniquement les publications qui ont été beaucoup diffusées, alors que le taux rapporté aux impressions mesure la qualité intrinsèque du contenu. Le classement obtenu surprend presque toujours : les publications qui ont le plus fait réagir en valeur absolue ne sont pas celles qui ont le mieux fonctionné en proportion. Cette lecture change la façon de choisir les sujets. Elle met souvent en évidence des contenus de niche, peu diffusés mais très bien reçus par ceux qui les ont vus, qui méritaient une seconde publication ou un budget de diffusion. Elle relativise aussi les publications qui font du bruit sans convaincre, typiquement les contenus polémiques dont le taux d'interaction rapporté aux impressions reste médiocre.

La deuxième analyse porte sur le type de contenu. Regrouper les publications par format et comparer les taux moyens fait apparaître des écarts souvent considérables, de un à trois entre le format le plus efficace et le moins efficace sur un même compte. Ce résultat est propre à chaque compte et à chaque public, ce qui interdit de se fier aux moyennes sectorielles publiées un peu partout. Il faut simplement disposer d'un volume suffisant, une quinzaine de publications par format au minimum, pour que la comparaison ait un sens. Il faut également vérifier que les formats comparés portent sur des sujets comparables, faute de quoi la mesure attribue au format ce qui revient au contenu. Lorsque le doute subsiste, publier délibérément un même sujet sous deux formats différents tranche la question en quelques semaines.

La troisième analyse examine le moment de publication. Croiser le jour de la semaine et la tranche horaire avec le taux d'interaction moyen produit une grille de lecture directement actionnable. Les résultats contredisent fréquemment les recommandations générales, qui sont établies sur des publics américains ou sur des secteurs différents. Il faut se méfier d'un biais : si toutes les publications du mardi matin ont été faites par la même personne sur les mêmes sujets, la grille mesure le sujet plutôt que l'horaire. Un second biais tient au volume inégal des cases : une tranche horaire ne comptant que trois publications ne dit rien de fiable, même si sa moyenne est spectaculaire. Afficher le nombre d'observations à côté de chaque moyenne, dans la même grille, évite cette lecture trompeuse.

La quatrième analyse suit l'évolution dans le temps de la portée moyenne par publication, rapportée au nombre d'abonnés. Cette mesure révèle les évolutions de diffusion de la plateforme, indépendamment de la qualité des contenus. Une baisse régulière sur plusieurs mois, alors que les taux d'interaction restent stables, indique un changement de diffusion plutôt qu'une baisse de qualité, comme l'explique notre article sur l'algorithme de TikTok. Cette distinction évite de remettre en cause un travail éditorial qui n'est pas en cause. Elle fournit aussi un argument précieux lors des points de suivi, où la baisse mécanique de la portée organique est régulièrement attribuée à l'équipe qui produit les contenus. Le graphique combinant portée relative et taux d'interaction met les choses au clair en une image.

La cinquième analyse relie les publications au trafic reçu sur le site. Elle demande de croiser les données sociales avec celles de l'outil de mesure d'audience, en s'appuyant sur les paramètres de suivi ajoutés aux liens. Cette analyse est la seule qui rattache l'activité sociale à un résultat commercial. Elle est aussi la plus souvent absente, faute d'avoir marqué les liens dès le départ. Mettre en place ce marquage prend dix minutes et il conditionne toute mesure de retour ultérieure. La convention de marquage doit être décidée une fois et respectée ensuite, sous peine d'obtenir une multitude de sources qui désignent la même chose. Trois paramètres suffisent : la plateforme, le type de campagne et un identifiant de publication. Consigner cette convention dans un document partagé évite qu'elle ne se perde au premier changement de personne.

Analyse Données nécessaires Volume minimal Fréquence utile
Taux d'interaction par publication Impressions et interactions 30 publications Mensuelle
Comparaison par format Type de contenu 15 par format Trimestrielle
Grille jour et horaire Date et heure exactes 60 publications Semestrielle
Portée rapportée aux abonnés Portée et effectif 6 mois d'historique Mensuelle
Trafic vers le site Liens marqués et audience 3 mois Mensuelle
Analyse des sujets Texte et classement manuel 50 publications Semestrielle
Profondeur d'historique accessible selon le moyen d'extraction
Tableau de bord natif
3 mois
Export de statistiques
12 mois
Archive complète du compte
depuis la création
Interface de programmation
24 mois
Exports mensuels archivés
illimité en pratique

Ordres de grandeur constatés sur les principales plateformes, susceptibles d'évoluer avec leurs conditions d'utilisation.

Organiser la collecte dans la durée

L'erreur la plus coûteuse consiste à vouloir extraire les données le jour où l'on décide de les analyser. À ce moment, l'historique est déjà perdu et il ne se reconstitue pas. La discipline utile est simple : un export mensuel, à date fixe, déposé dans un dossier organisé par année et par plateforme. Quinze minutes par mois suffisent, et cette routine constitue en deux ans une base de données que la plateforme elle même ne peut plus fournir. Inscrire ce rendez-vous dans un agenda partagé, avec un responsable nommé, est ce qui fait la différence entre une bonne intention et une pratique effective. Il vaut mieux un export sommaire fait tous les mois qu'un export exhaustif fait une seule fois.

La consolidation demande un peu de méthode. Les exports successifs se chevauchent, un même contenu apparaissant dans plusieurs fichiers avec des valeurs différentes puisque les mesures continuent d'évoluer après la publication. Retenir la valeur la plus récente pour chaque publication, en s'appuyant sur son identifiant unique, produit une base cohérente. Cette déduplication se fait par formule dans un tableur ou par un script de quelques lignes. Il faut veiller à ce que l'identifiant reste bien au format texte tout au long de la chaîne, faute de quoi deux publications différentes peuvent être fusionnées à tort. Un contrôle simple consiste à vérifier que le nombre de lignes uniques correspond au nombre de publications réellement effectuées sur la période.

Un point souvent négligé concerne la stabilisation des mesures. Une publication continue de recevoir des impressions pendant plusieurs jours, parfois plusieurs semaines sur certains formats. Analyser une publication de la veille revient à mesurer un phénomène inachevé. La règle pratique consiste à n'intégrer dans les analyses que les publications de plus de quatorze jours, ce qui couvre la quasi totalité de la diffusion sur la plupart des plateformes. Certains formats vidéo continuent d'être diffusés bien plus longtemps, parfois plusieurs mois, ce qui impose un délai plus long pour cette catégorie. Observer la courbe d'accumulation des impressions sur quelques publications suffit à déterminer le bon délai pour son propre compte.

La structure de stockage mérite d'être décidée une fois pour toutes. Un dossier par plateforme, un sous dossier par année, un fichier par mois nommé selon une convention explicite : cette organisation triviale évite de perdre des heures à retrouver un export deux ans plus tard. Y ajouter un fichier de notes, consignant les changements de stratégie, les campagnes payantes et les événements exceptionnels, rend les analyses futures bien plus lisibles. Une chute inexpliquée trouve souvent son explication dans une ligne de ce carnet. Y consigner également les incidents techniques, les changements d'outil de publication et les périodes de congés donne un contexte que les chiffres seuls ne fournissent jamais. Ce carnet prend deux minutes par entrée et il devient irremplaçable après un an.

Les précautions sur les données personnelles

Une archive complète contient des données personnelles au sens de la réglementation : identifiants des personnes ayant commenté, contenus de messages privés, listes d'abonnés. Ces données ne sont pas librement exploitables du simple fait qu'on les détient. Leur conservation doit répondre à une finalité déterminée, leur durée doit être limitée et leur sécurisation doit être proportionnée. Le fait que ces personnes aient publié un commentaire sur un espace public ne rend pas leurs données librement réutilisables pour un autre usage. Constituer un fichier de prospection à partir des personnes ayant interagi avec un compte, par exemple, sort nettement du cadre de la simple analyse de performance.

En pratique, la précaution la plus efficace consiste à supprimer, dès la réception de l'archive, tout ce qui n'est pas nécessaire à l'analyse envisagée. Les statistiques agrégées et les métadonnées de publication suffisent aux analyses décrites plus haut, sans qu'aucune donnée nominative ne soit requise. Ne conserver que ces éléments réduit considérablement le risque et simplifie les obligations. Le tri prend une dizaine de minutes à la réception de l'archive et il évite de conserver pendant des années des données dont on n'a aucun usage. Documenter ce tri, ne serait-ce que par une note indiquant ce qui a été supprimé et à quelle date, complète utilement la démarche.

Le stockage doit se faire sur un espace professionnel maîtrisé plutôt que sur un ordinateur personnel ou un service grand public. L'accès doit être limité aux personnes qui en ont l'usage. Ces mesures paraissent lourdes pour un fichier de statistiques et elles deviennent tout à fait proportionnées dès que l'archive contient des messages privés ou des listes de contacts.

Nous ne sommes pas juristes et ce paragraphe ne constitue pas un avis juridique. Sur un usage dépassant la simple analyse de performance de ses propres publications, notamment le rapprochement avec une base clients ou l'exploitation de données de personnes tierces, l'avis d'un conseil spécialisé est nécessaire. Le principe de minimisation, qui consiste à ne conserver que le strict nécessaire, protège efficacement dans la plupart des situations courantes.

Les erreurs d'interprétation les plus fréquentes

La première consiste à comparer des chiffres qui ne mesurent pas la même chose. Le taux d'interaction d'une plateforme et celui d'une autre reposent sur des définitions différentes, tant pour le numérateur que pour le dénominateur. Un écart de un à cinq entre deux réseaux peut n'être qu'un artefact de définition. Chaque plateforme doit être suivie séparément, avec ses propres séries.

La deuxième consiste à conclure sur des volumes insuffisants. Sur dix publications, la différence entre deux formats relève du hasard bien plus que d'un effet réel. Attendre d'avoir une trentaine d'observations par catégorie avant de tirer une conclusion évite de réorienter toute une ligne éditoriale sur un accident statistique. Cette patience est difficile et elle est indispensable.

La troisième consiste à confondre corrélation et causalité sur les horaires. Constater que les publications du jeudi soir fonctionnent mieux ne signifie pas que l'horaire est la cause : il se peut que les sujets traités ce jour là soient simplement plus porteurs. Vérifier en croisant avec le type de contenu désamorce cette confusion. La méthode rigoureuse consiste à tester délibérément un même type de contenu à des horaires différents.

La quatrième consiste à ignorer les publications payantes dans l'analyse. Une publication ayant bénéficié d'un budget de diffusion affiche des chiffres sans commune mesure avec les autres, et elle fausse toutes les moyennes. Isoler ces publications dans une catégorie séparée est indispensable. Le fichier d'export ne l'indique pas toujours, ce qui rend nécessaire un marquage manuel au moment de la publication.

La dernière erreur consiste à produire un rapport et à ne rien en faire. Une analyse n'a de valeur que si elle débouche sur une décision : changer un format, déplacer un horaire, abandonner un sujet, ou au contraire confirmer une orientation qui fonctionne. Une décision de ne rien changer, prise en connaissance de cause, vaut mieux qu'un changement décidé sur une impression. Terminer chaque analyse par deux ou trois décisions écrites, puis vérifier leur effet lors de l'analyse suivante, transforme un exercice de reporting en un mécanisme d'amélioration. C'est la différence entre mesurer et piloter.