La curation de données

Comme Monsieur Jourdain faisait de la prose sans le savoir, tout le monde fait aujourd’hui de la curation de données – on dit aussi de la curation de contenu – sans le savoir. Sur les grandes plateformes de médias sociaux comme Facebook, Twitter, Pinterest ou Instagram, mais aussi dans une multitude d’applications en ligne plus spécialisées comme Evernote, Scoop.it ou Diigo, les utilisateurs font référence à des données (textes, images, vidéos, musique…) qu’ils accompagnent de commentaires, de hashtags classificateurs et de diverses formes d’évaluations et d’émoticons. Ces posts s’accumulent dans des collections personnelles ou communautaires, apparaissent sur les fils d’autres utilisateurs et sont réexpédiées ad libitum avec d’éventuels changements de commentaires, de hashtags et d’appréciations émotionnelles. Les posts deviennent eux-mêmes des données qui peuvent à leur tour faire l’objet de références, de commentaires, de marquage affectif, de recherche et d’analyse. Les médias sociaux nous proposent des outils perfectionnés de gestion de base de données, avec des algorithmes de fouille, d’apprentissage machine, de reconnaissance de forme et de filtrage collaboratif qui nous aident à naviguer parmi la masse du contenu et les foules d’utilisateurs. Mais l’alimentation de la base tout comme la catégorisation et l’évaluation des données sont à notre charge.

labyrinthe-livres.jpg

Le mot curation, employé d’abord en anglais pour désigner l’activité d’un commissaire d’exposition dans l’univers des galeries d’art et des musées, a été récemment généralisé à toutes les activités de collection d’information. L’étymologie latine du mot évoque le soin médical (la cure) et plus généralement le souci. S’il est vrai que nous entrons dans une société datacentrique, le souci des données, l’activité qui consiste à collectionner et organiser des données pour soi et pour les autres devient cruciale. Et puisque la société datacentrique repose sur une effervescente économie de la connaissance, au sens le plus vaste et le plus « écologique » de la notion d’économie (voir à ce sujet La Sphère sémantique 1, Chp. 6.) l’enjeu ultime de la curation de données n’est autre que la production et le partage des connaissances.

Je vais maintenant évoquer un certain nombre de sphères d’activité dans lesquelles la maîtrise de la curation collaborative de données commence à s’imposer comme une compétence essentielle : la conservation des héritages, la recherche en sciences humaines, l’apprentissage collaboratif, la production et la diffusion des nouvelles, le renseignement à sources ouvertes et la gestion des connaissances.

url.jpg

La conservation des héritages

Les responsables des archives, bibliothèques, médiathèques et musées collectionnent depuis des siècles des artefacts porteurs d’information et les organisent de telle sorte que leur public puisse les retrouver et les consulter. C’est dans ce milieu professionnel qu’est d’abord apparue la distinction entre données et métadonnées. Du côté des données, les documents physiques sont posés sur des étagères. Du côté des métadonnées, un fichier permet de rechercher les documents par auteurs, titres, sujets, disciplines, dates, etc. Le bibliothécaire fabrique une fiche, voire plusieurs fiches, pour chaque document qui entre dans la bibliothèque et le lecteur fouille dans les fiches pour explorer le contenu de la bibliothèque et savoir où se trouvent placés les livres qu’il veut lire. Sans l’appareillage des métadonnées et les principes d’organisation qui les sous-tendent il serait impossible d’exploiter les informations contenues dans une bibliothèque. Depuis la fin du XXe siècle, le monde des archives, des bibliothèques et des musées connaît une grande transformation. La numérisation fait converger toutes les informations dans le médium algorithmique et cette unification met cruellement en évidence la disparité et l’incompatibilité des systèmes de classification en usage. De plus, les principaux systèmes de métadonnées ont été conçus et utilisés à l’époque de l’imprimerie, ils n’exploitent donc pas les nouvelles possibilités de calcul automatique. Finalement, les flots d’information ont tellement crû qu’ils échappent à toute possibilité de catalogage classique par un petit nombre de professionnels. Depuis quelques années, les musées et bibliothèques numérisent et mettent en ligne leurs collections en faisant appel au crowdsourcing, c’est-à-dire à l’intelligence collective des internautes, pour catégoriser les données. Cette curation collaborative de données brouille la distinction entre curateurs et utilisateurs tout en manifestant la diversité des points de vue et des intérêts du public. Par ailleurs, une multitude de sites puisant leurs données dans le Web ouvert, et souvent indépendants des institutions classiques de préservation des héritages culturels, permettent aux amateurs d’art ou aux bibliophiles de partager leurs goûts et leurs trouvailles, de se regrouper par sensibilité et par centres d’intérêts.

La recherche en sciences humaines

La numérisation des archives et des héritages culturels, l’accessibilité des données et statistiques compilées par les gouvernements et les institutions internationales, les communications et transactions des internautes recueillies par les grandes plateformes du Web, toutes ces nouvelles sources offrent aux sciences humaines une matière première dont l’abondance défie l’imagination. Par ailleurs les blogs de chercheurs, les plateformes collaboratives spécialisées dans la collection d’articles (comme Academia.edu, Researchgate, Mendeley, CiteULike…) et les bases de données partagées transforment profondément les pratiques de recherche. Enfin, une frange croissante des professionnels des sciences humaines s’initie à la programmation et à l’usage avancé des algorithmes, produisant et partageant le plus souvent des outils open source. L’édition scientifique traditionnelle est en crise puisque la communication entre chercheurs n’a plus besoin de journaux imprimés. Chaque plateforme en ligne propose ses propres méthodes d’appréciation des publications, basées sur un traitement automatisé des interactions sociales, ce qui remet en question les modes classiques de filtrage et d’évaluation des articles. Certes, le problème posé par l’incompatibilité des plateformes et des systèmes de catégorisation reste à résoudre. Il subsiste donc quelques obstacles à franchir, mais tout est en place pour que la curation collaborative de données s’impose comme l’activité centrale de la recherche en sciences humaines… et de son évaluation.

L’apprentissage collaboratif

La curation collaborative de données émerge également comme une pratique essentielle dans le domaine de l’éducation. A l’époque du médium algorithmique, les connaissances évoluent vite, presque toutes les ressources d’apprentissage sont disponibles gratuitement en ligne et les étudiants sont déjà plongés dans le bain des médias sociaux. Le vieux modèle des communautés d’apprentissage s’organisant autour d’une bibliothèque ou d’un entrepôt physique de documents est donc obsolète. L’apprentissage doit être de plus en plus pensé comme partiellement délocalisé, collaboratif et continu. L’ensemble de la société acquiert une dimension d’apprentissage. Cela n’implique pas que les institutions d’enseignement classiques, école et université, ne soient plus pertinentes, bien au contraire. C’est précisément parce que l’apprentissage va puiser dans un stock de ressources pratiquement infini qu’aucune autorité transcendante ne peut plus organiser et hiérarchiser a priori que l’école a l’obligation d’entraîner les jeunes gens à l’apprentissage collaboratif et critique par le biais des médias sociaux. La fameuse littéracie numérique ne repose pas principalement sur l’acquisition de compétences techniques en informatique (qui changent rapidement), mais plutôt sur un savoir-faire socio-cognitif orienté vers la curation collaborative de données : filtrer les contenus pertinents pour tel ou tel groupe, les catégoriser, les évaluer, consulter les données, rédiger de courtes synthèses… Ainsi les enseignants utilisent des plateformes de social bookmarking (partage de signets) comme Diigo pour animer leurs cours, les MOOCs connectivistes font appel aux étudiants pour alimenter leurs ressources d’apprentissage, on trouvera une multitude de hashtags reliés à l’éducation et à l’apprentissage sur Twitter et les groupes Facebook abritent de plus en plus de classes…

Les nouvelles

La production et la dissémination des nouvelles participe du même type de mutation que celles qui viennent d’être évoquées. Du côté de la production, les journalistes s’initient à l’exploitation statistique des bases de données ouvertes pour en retirer les synthèses et les visualisations qui vont alimenter leurs articles. Ils suivent leurs collègues ainsi qu’une foules de sources sur Twitter afin de rester à jour sur les thèmes dont ils s’occupent. Par ailleurs, ce ne sont plus seulement les agences de presse et les journalistes professionnels qui produisent les nouvelles mais également les acteurs culturels, économiques, politiques et militaires par l’intermédiaire de leurs sites et de leurs agents dans les médias sociaux. N’oublions pas non plus les citoyens ordinaires qui prennent des photos et des vidéos grâce à leurs téléphones intelligents, qui diffusent ce qu’ils voient et ce qu’ils pensent sur toutes les plateformes et qui réagissent en temps réel aux nouvelles diffusées par les médias classiques. Du côté de la réception, la consommation des nouvelles se fait de plus en plus en ligne par le biais de Facebook, de Twitter, de Google news et d’autres plateformes sociales. Puisque chacun peut accéder directement aux sources (les messages émis par les acteurs eux-mêmes), les médias classiques ont perdu le monopole de l’information. Sur les sujets qui m’intéressent, je suis les experts de mon choix, j’écoute tous les sons de cloche et je me fais ma propre idée sans être obligé de m’en remettre à des synthèses journalistiques simplificatrices et forcément tributaires d’un agenda ou d’un maître-récit (« narrative ») politique ou national. En somme, aussi bien les professionnels de l’information que le nouveau public critique en ligne pratiquent assidûment la curation collaborative de données

L’intelligence open-source

Le domaine du renseignement économique (« business intelligence »), politique ou militaire échappe progressivement à l’ancienne logique de l’espionnage. Désormais, l’abondance des sources d’information en ligne rend de moins en moins judicieux l’entretien d’un personnel spécialement chargé de recueillir des informations sur place. En revanche, les compétences linguistiques, culturelles et scientifiques, l’érudition en sciences humaines, la capacité à extraire les renseignements pertinents du flot des données, le monitoring des médias sociaux et le savoir-faire collaboratif deviennent indispensables. A part les noms et adresses des agents doubles et le détail des plans d’attaque, tout est désormais disponible sur internet. A qui sait chercher en ligne et lire entre les mots, les images des satellites, les sites médiatiques, académiques, diplomatiques et militaires, sans oublier les rapports des « think tanks » en pdf, permettent de comprendre les situations et de prendre des décisions éclairées. Certes, les agents d’influence, trolls, utilisateurs masqués et robots logiciels tentent de brouiller les cartes, mais ils révèlent à la longue les stratégies des marionnettistes qui les manipulent. Dans le domaine en pleine expansion de l’open source intelligence les agences de renseignement – comme la nuée de leurs fournisseurs d’information, d’analyse et de synthèse – coopèrent dans la production, l’échange et l’évaluation des données. Ici encore, la curation collaborative de contenu est à l’ordre du jour.

La gestion des connaissances

Une équipe de travail, une entreprise quelconque – qu’elle soit publique, privée ou associative – se trouve dans la nécessité de « gérer ses connaissances » pour atteindre ses buts. Le terme de gestion des connaissances a commencé à être utilisé vers le milieu des années 1990, au moment même où naissait le Web et alors que l’idée d’une économie basée sur les savoirs et l’innovation commençait à s’affirmer. L’un des principaux fondateurs de cette nouvelle discipline, Ikujiro Nonaka (né en 1935), s’est attaché à décrire le cycle de création des connaissances dans les entreprises en insistant sur la phase d’explicitation des savoir-faire pratiques. A la suite de Nonaka, de nombreux chercheurs et praticiens ont tenté de déterminer les meilleures méthodes pour expliciter les savoirs tacites – nés de l’expérience – afin de les conserver et de les diffuser dans les organisations. Les premiers outils de gestion des connaissances étaient assez rigides et centralisés, à l’image de l’informatique de l’époque. On met en place aujourd’hui (2016) de véritables médias sociaux d’entreprise, dans lesquels les collaborateurs peuvent repérer mutuellement leurs compétences, créer des groupes de travail et des communautés de pratique, accumuler des ressources et partager des données. Indépendamment des outils techniques utilisés, la gestion des connaissances est une dimension transversale de toute entreprise. Cette épistémologie appliquée inclut la conservation des savoirs et savoir-faire, le développement des compétences et des ressources humaines, l’art de créer et de diffuser les connaissances. De fait, en observant les pratiques contemporaines dans les médias sociaux d’entreprise qui supportent la gestion des connaissances, on découvre que l’une des principales activités se trouve être justement la curation collaborative de données.

Il existe donc une pratique commune à de nombreux secteurs de la culture mondiale contemporaine, pratique dont les cloisonnements sociaux et la disparité des jargons professionnels dissimulent l’unité et la transversalité. Je fais l’hypothèse que la curation collaborative de données est le support techno-social de l’intelligence collective à l’époque du médium algorithmique : écrire et lire… sur des flots de données.

Pour en savoir plus sur les compétences en curation collaborative de données, lisez-donc le post qui suit!