Synthèse de l’enquête « Évaluation du dispositif CERCLES »

CERCLES_pencils_by_art_sourse

Le dispositif CERCLES (Corrections et Enrichissements par le Réseau de Corpus de l’Enseignement Supérieur) a été lancé en 2015.
Depuis, 17 chantiers ont été lancés, dont 9 encore en cours.

Avec le double objectif d’évaluer les modalités de fonctionnement actuelles et de réfléchir à l’évolution du dispositif, une enquête a été menée, en février 2018, auprès des 18 responsables de chantiers CERCLES.

Voici un résumé de leurs opinions sur le dispositif.

Taux de participation : 77,7 %

18 responsables de chantier ont été sollicités, 14 ont validé le questionnaire. Cela constitue le corpus de réponses complètes et exploitables.
Ceux qui n’ont pas répondu appartiennent à des chantiers co-gérés ; à chaque fois, leurs binômes ont validés leurs réponses, de telle sorte qu’on peut affirmer que, si l’enquête ne reflète pas la totalité des établissements CERCLES, elle reflète en revanche la totalité des chantiers.

Sur l’organisation mise en place par le responsable de chantier :

  • le plus souvent, une petite équipe est mise en place, sans organisation très formelle (échanges sans réunions systématiques et planifiées), mais avec un document collaboratif.
  • s’il n’y a qu’1 agent sur le chantier, l’organisation se met en place en tenant compte de ces moyens limités ; la conduite solitaire d’un chantier n’entrave pas sa réalisation.
  • tous les responsables évoquent la difficulté à faire du « reporting » auprès de leur direction, par manque de document modèle.
  • chacun ressent le besoin de créer des documents spécifiques (procédures, scripts).
  • il semble difficile de prévoir en amont la durée du chantier :
    • le travail en mode projet (estimation, contrôle, révision) n’est pas systématiquement appliqué ;
    • les tâches d’organisation, de coordination ne sont pas quantifiées, au départ, dans le temps estimé nécessaire pour le chantier ;
    • il faut gérer des aléas et des charges de travail imprévues.
  • par contre, le travail CERCLES reste souvent prioritaire, en cas d’aléas.

Sur la reconnaissance de la fonction de responsable de chantier :

  • le plus souvent, un chantier est lancé à l’initiative de l’équipe de catalogage.
  • le travail CERCLES est davantage lié à l’agent (la personne) qu’à sa fonction (la fiche de poste). Ainsi :
    • il n’y pas d’objectifs et d’indicateurs associés dans la fiche de poste des agents responsables de chantier ;
    • aucune pérennité du chantier n’est assurée si l’agent quitte l’établissement.

Sur les enrichissements apportés par le chantier :

  • les axes d’enrichissements s’avèrent toujours plus importants que ceux prévus au départ.
  • les difficultés rencontrées pour les corrections sont liées aux difficultés du traitement des documents électroniques, pas au dysfonctionnement du dispositif CERCLES.
  • la collaboration avec l’éditeur du corpus, au sein du chantier, est utile, mais pas obligatoire.

Sur l’apport de l’ABES :

  • les services sont appréciés, à part l’espace de travail collaboratif, perfectible dans sa forme et dans son usage.

Sur la reconnaissance du réseau :

  • les responsables de chantier n’ont pas vraiment d’avis sur la question. Mais ignorer si on est reconnu ne veut pas dire qu’on ne l’est pas. Cela signifie simplement qu’on n’a jamais eu le moyen de mesurer cette reconnaissance (par exemple, l’ABES n’ pas inclut cette question dans l’enquête 2017 sur les usages professionnels du Sudoc).

Sur les évolutions du dispositif CERCLES :

  • les responsables actuels n’envisagent pas forcément de nouveaux chantiers, puisque la charge de travail est déjà importante.
  • le besoin de lancer des chantiers liées aux données d’autorités de leurs corpus n’apparait pas comme une priorité.
  • les chantiers à venir devraient être d’une volumétrie moins importante, pour attirer d’autres bibliothèques.

 

CERCLES_crayonsEt maintenant… ?

L’équipe de l’ABES en charge de coordonner le dispositif CERCLES analyse ces résultats pour formuler une série de préconisations, qui seront ensuite communiquées au réseau.

La synthèse complète et détaillée des résultats est disponible  ICI.

Publicités

Univ-Droit et IdRef : une coopération ambitieuse et réciproque

Retours sur une coopération fructueuse entre  l’équipe IdRef de l’Abes et l’équipe d’Univ-Droit dans le cadre de l’UNJF – Université Numérique Juridique Francophone, dont Gilles Dumont, professeur de droit public, est le directeur.

Le portail Univ-Droit

univ-droit_logoUniv-Droit, site dédié au Droit et aux Sciences Politiques, porté par la Conférence des doyens des Facultés de droit, est un outil incontournable pour aborder le champ juridique national. On y trouve des informations sur l’ensemble des formations juridiques universitaires, des structures de recherche et des instances professionnelles ainsi qu’une offre conséquente de ressources pédagogiques (cours en ligne).

Deux annuaires sont également disponibles, qui consacrent une page propre aux entrées de type :

enseignants

structure

Conçus pour la diffusion des informations autant que pour leur bonne gestion interne et relationnelle, ces annuaires s’appuient sur des listes contrôlées et des référentiels, une démarche indispensable pour assurer les liens entre ressources et acteurs. Initiée dès l’origine du portail, cette étape d’identification concerne les données de type  :

  • Structures : la quasi-totalité des entrées s’appuie sur un référentiel national (RNSR pour les laboratoires, UAI pour les structures d’enseignement, Numéro national pour les Ecoles doctorales). Ce travail d’identification a été effectué en coopération avec l’équipe ScanR, et est donc sécurisé.
  • Personnes : certaines pages d’enseignants-chercheurs comportent déjà des renvois vers leur notice d’autorité dans IdRef (exemple : https://univ-droit.fr/universitaires/24364-alain-supiot) sans toutefois que cette identification ne soit exhaustive.

noticeidref

Coopération avec l’Abes

A l’automne dernier, suite à une présentation d’IdRef dans le cadre du groupe de travail “Moteur de recherche” de  SupNumérique, initiative ministérielle destinée à la valorisation des Ressources Pédagogiques Numériques, l’Abes a été sollicitée par l’équipe d’Univ-Droit afin de généraliser l’identification fiable et pérenne des données de type Personnes. En effet, disposer d’identifiants fiables, pérennes et partagés pour l’ensemble des acteurs recensés – personnes physiques ou morales – est une garantie pour l’interopérabilité des données.

Alignement des enseignants-chercheurs

La première opération, similaire à celle détaillée ici, a consisté à identifier automatiquement plus de 90 % des 3 728 enseignants-chercheurs recensés dans Univ-Droit. Et cette fois encore, les alignements produits par l’algorithme se sont révélés très fiables. Enfin, pour les alignements considérés moins sûrs, les données inscrites dans les notices d’autorité sont venues valider les candidats.

Comme à l’accoutumée, cette opération d’alignement a mis en évidence bon nombre d’anomalies dans les données de type Personnes (coquille dans les noms, doublons…), ce qui a donné lieu à autant de corrections, étape importante pour l’amélioration qualitative des données.

Au final, c’est maintenant l’ensemble de la communauté des juristes et politologues français qui dispose désormais d’une identification fiable !

Enrichissements réciproques

Côté IdRef : seront intégrées au sein des notices IdRef, les URL des pages personnes d’Univ-Droit ainsi que des données disciplinaires ou d’affiliation qui en seront extraites pour enrichir et consolider le contenu des autorités. Concrètement, pour ceux qui « parlent Unimarc », le résultat sera l’ajout d’une zone 035 – numéro source dans Univ-Droit, ajout/modification d’une zone 340 – note sur la biographie et les activités.

Côté Univ-Droit : dans les pages Personnes d’Univ-Droit, les renvois vers les notices d’autorité IdRef ont été systématisés. Il en sera probablement de même avec les renvois vers les pages Personnes de theses.fr : https://www.theses.fr/027151808.

Cette démarche double permet à la fois de multiplier les rebonds web et le référencement réciproque, de désambiguïser les personnes d’Univ-droit et de consolider les notices autorités parce qu’elles sont maintenant reliées “physiquement” à Univ-Droit.

Récupération par Univ-Droit des données bibliographiques liées

L’affichage des publications dans les pages d’enseignants-chercheurs va pouvoir évoluer. Pour ce faire, Univ-Droit a l’intention d’exploiter le nouveau web service d’IRef – «References », disponible depuis la V2 d’IdRef (octobre 2017) : pour un identifiant IdRef donné, le webservice renvoie l’ensemble des documents associés dans les différents catalogues ou sources de données bibliographiques connus d’IdRef, à savoir le catalogue Sudoc bien entendu mais aussi theses.fr, Calames, Persée et d’autres.

Jusqu’à présent, dans Univ-Droit, les publications Sudoc proviennent d’une interrogation de HAL – le plus souvent suite à une requête forgée du nom-prénom croisé avec le labo de rattachement – pour aller chercher les rares ISBN dans les résultats de la recherche HAL de type “ouvrage”, qui sont ensuite croisés avec le web service “ISBNtoPPN” pour aboutir, enfin,  à la notice Sudoc.

Prenons l’exemple de Véronique Champeil-Desplats. Cette méthode permet de remonter comme résultats 3 monographies dotées d’un ISBN. En interrogeant le web service « references » d’IdRef avec comme seul paramètre l’identifiant IdRef de Véronique Champeil-Desplats – http://www.idref.fr/services/references/05505563X – on obtient 27 monographies ainsi que son rôle dans chacune. C’est plus simple et plus complet !

L’Abes espère que cette nouvelle exposition des données Sudoc dans Univ-Droit engendrera des retours des enseignants-chercheurs qui constateront que des intrus figurent parmi la liste de leurs ouvrages.

Une nouvelle rubrique pour les thèses

En plus des rubriques déjà présentes, une nouvelle rubrique Thèses va voir le jour puisque le web service “references” utilise theses.fr comme source.
thesesEn conclusion, parce qu’Univ-Droit connaît les identifiants IdRef, l’exposition et la moisson des publications des enseignants-chercheurs en droit et sciences politiques est sécurisée. Parce qu’IdRef connaît Univ-Droit, les notices de ces enseignants-chercheurs sont enrichies et les liens aux données bibliographiques des catalogues sources fiabilisées.

Cette coopération fructueuse entre l’Abes et Univ-Droit démontre, si besoin est, que les chantiers de mise en interopérabilité des données – ici l’identification fiable et pérenne des enseignants-chercheurs – constituent un moteur puissant pour l’amélioration concrète de leur qualité, et conforte l’ambition de construire progressivement un véritable “réseau numérique de confiance” au service  des ressources de l’ESR.

François Mistral, responsable IdRef

 

Calames : les statistiques 2017

calamesEn ce début d’année, voici venu la traditionnelle épiphanie en chiffres du réseau Calames. Le présent billet se propose de fournir aux établissements déployés dans Calames des éléments complémentaires aux statistiques accessibles via Webstats : jauges quantitatives des données produites via l’outil de catalogage ; répartition actualisée des niveaux descriptifs indexés dans la base de données et exposées sur le web ; étiage du trafic sur le catalogue en ligne.

Mais au-delà de ces aspects quantitatifs, c’est la qualité des données qui est au cœur des préoccupations de l’équipe Calames. Si en 2017, les contrôles qualité ont été concentrés sur les inventaires dont l’encodage a été co-financé par l’Abes dans le cadre de sa mission d’encouragement aux rétroconversions, d’autres sondages, plus globaux, ont été effectués : une inspection des liens vers les numérisations (éléments <dao> et <daogrp>) a par exemple permis une correction générale de centaines de liens au cours de l’été 2017. La remise en place progressive d’une cellule nationale de l’EAD en bibliothèques, le (ré-)examen de diverses consignes de catalogage et la poursuite d’une homogénéisation des bonnes pratiques, laissent espérer que ce travail de monitoring et d’aide à une production de qualité s’amplifiera en 2018.

Nota bene : les termes « composants » et « niveaux descriptifs » se trouvent souvent assimilés dans la présentation de ces statistiques. Ils ne sont pourtant pas strictement synonymes, puisque les hauts niveaux d’inventaires (dont les identifiants Calames commencent par le préfixe « FileId-« , en reprenant le numéro interne de chaque instance EAD dans la base de données), qui ne correspondent donc pas à des composants <c>, représentent 1446 des 873 504 niveaux descriptifs comptabilisés.

État de la base publique Calames au 31 décembre 2017

Répartition  des niveaux descriptifs publiés dans Calames : par établissement

repartition-c-publies-fin-2017-par-RCR_png

Répartition des niveaux descriptifs publiés dans Calames : par tranches chronologiques de production

OriginesDonneesCalames2017_png

Répartition  des composants publiés dans Calames : par cercles de déploiement (1er cercle déployé en 2008, 10ème cercle début 2018)

repartition-c-publies-fin-2017-par-cercles_png

Nouvelles données publiées dans Calames

La catalogue public Calames a soufflé sa 10ème bougie en décembre 2017 en approchant des 875 000 niveaux descriptifs publiés :

evolution-c-publies-2007-2017_png

La quantité de données nouvellement publiées a connu un léger tassement en 2017. Elle est largement due à trois grands « publiants » : la BDIC, l’INHA et la BIU Sorbonne. Ces tendances viennent en écho direct aux travaux d’encodage de l’année (cf. infra).

surcroit-c-pub-2017-par-RCR_png

Travaux de catalogage dans l’outil Calames Prod

Pour la cinquième année consécutive, le nombre d’identifiants nouvellement attribués par l’outil Calames Prod au cours de l’année est resté au-dessus de la barre des 100 000 composants, quasiment tous créés en base de production (et non de formation, dont l’usage doit être cantonné à des tests techniques ou à des exercices pédagogiques).
Cependant la majorité de cette production n’est pas aussi également répartie que les années précédentes : la BDIC (qui sera rebaptisée « La Contemporaine » en mars 2018) tient très nettement le haut du pavé avec un tiers des niveaux descriptifs créés dans l’année. Situation dont le seul point de comparaison est 2010 (le Muséum ayant alors produit près de 45% des <c>), alors que le réseau Calames était moins développé.
Viennent ensuite six établissements ayant produit 6 à 7% des <c> de l’année 2017 : Muséum National d’Histoire Naturelle, École Centrale Supélec, BIU Sorbonne, Bibliothèque Littéraire Jacques Doucet, Bibliothèque Mazarine, et Institut National d’Histoire de l’Art.
Le palmarès des 5 établissements ayant créé la plus grande quantité (env. 60%) de niveaux descriptifs dans Calames depuis son origine reste inchangé par rapport à 2016 : Muséum National d’Histoire Naturelle (165 955 <c> créés dans l’outil depuis 2008), BDIC (146176), Institut de France (906 56), Bibliothèque Littéraire Jacques Doucet (73 151) et Académie de Médecine (640 870).

catalogage-dans-calames-2017_png

Pour compléter un peu ce paysage très métrique et brossé à grands traits, le graphique ci-dessous tente de nous en dire plus sur le temps et la fréquence d’usage de l’outil de catalogage Calames Prod. Ainsi, s’il est vrai que la BLJ Doucet a produit un peu plus de 7400 <c> en 2017, elle l’a fait au prix d’un recours plus important à l’outil d’encodage que les autres établissements, effectuant 698 interventions quotidiennes sur fichiers EAD unitaires (soit près de 700 « jours-fichiers »). L’École Centrale, qui est essentiellement intervenue sur deux à trois inventaires distincts au cours de l’année, présente logiquement ici des chiffres plus bas (127 « plages journalières d’interventions sur inventaire » en 2017, et ce quelque soit la durée ou la qualité de l’intervention en question). Au-delà de toute possibilité d’analyse plus précise des modifications effectuées sur des <c> déjà existants, de leur nature et de leur ampleur, un ratio se dégage depuis trois ans : pour une session quotidienne de catalogage sur fichier EAD, compter un vingtaine de <c> nouvellement créés et identifiés.

temps-frequence-catalogage-calames-2017_png

Ventilation des résultats de 10 années de catalogage dans Calames (en production et en publication/indexation)

c-publies-produits-2008-2017_png

Le décalage entre ces deux représentations des composants créés via l’outil Calames (<c> publiés / <c> créés) tient au fait qu’on dénombre en permanence dans la base, et ce depuis quelques années, environ 100 000 composants présents mais n’ayant jamais connu de première publication (fin 2017, en effet, on frôle le million de composants présents en base de production). L’étiage des chantiers d’encodage étant assez stable depuis 2012, on doit aussi lire ce double histogramme en se rappelant qu’une (petite) proportion de niveaux descriptifs sont soit ré-identifiés au fil du temps (ce qui peut se justifier en cas de restructuration des descriptions), soit créés pour en remplacer d’autres (versions multiples d’un même inventaire par exemple).

Statistiques de consultation 

De même qu’en 2015 et en 2016, la hausse continue de la quantité de données exposées, ainsi que plusieurs épisodes de popularité liés aux recherches ponctuelles de certains mots-clés sur les moteurs de recherche généralistes, se sont soldés par un nombre de visites sur le catalogue public en accroissement.

La moyenne du trafic se situe à environ 25 000 visites/mois (soit 8 000 de plus qu’en 2016, ce qui est lié notamment à un important épisode de popularité du site en mars 2017). Le phénomène de « zapping » des internautes reste cependant très sensible, les deux tiers de visites étant « courtes » voire « très courtes ».

Jean-Marie Feurtet, responsable Calames

Chantier Qualité des données de thèses : bilan 2017

En février 2017, l’Abes annonçait via les listes de diffusion des réseaux Sudoc et Thèses que les établissements intéressés pouvaient demander des  traitements automatiques sur les notices de thèses du Sudoc. Ce billet fait le point sur les modifications réalisées entre février et novembre,  ce à l’initiative soit des établissements, soit de l’Abes.

Rappel

thesestheses.fr, moteur de recherche des thèses de doctorat, a pour objet d’afficher les thèses soutenues en France depuis 1985 ainsi que les thèses en préparation ( depuis 10 ans au maximum). Il s’agit donc de données en provenance des applications nationales STEP et STAR et du Sudoc.
Pour les thèses soutenues, le parti pris de theses.fr consiste à regrouper en une seule page l’œuvre « thèse »,  quelle que soit la variété de ses supports matériels et en mettant en avant sa version de soutenance, estampillée d’un tampon «validée par le jury ». Il s’agit donc d’une FRBRisation des données de thèses de doctorat présentes dans le Sudoc.
Dans un monde parfait, les données du Sudoc  trouvent naturellement leur place  dans theses.fr. Hélas, les données du Sudoc ne sont pas parfaites. Grâce au programme de FRBRisation AlgoSudoc, les principales erreurs empêchant le versement dans theses.fr ont été détectées et, depuis le printemps 2015, les établissements ont accès à ces erreurs et peuvent y remédier.

Opérations menées

En 2017, l’Abes a eu l’opportunité de travailler à nouveau sur cette question.  Grâce au renfort d’un collègue contractuel recruté pour cette activité et à un nouvel outillage technique – développé à l’Abes  et à usage strictement interne, ces travaux sont venus en complément des outils traditionnels d’administration des données fournis par OCLC.

Ainsi, de février à novembre 2017, plus de 160 000 notices Sudoc ont été modifiées en utilisant ce nouvel outil d’administration de données. Pendant l’été 2017, une part importante des corrections a été traitée « à la main », principalement des fusions de notices et des corrections de liens erronés entre notices bibliographiques. L’objectif était double :

  • charger dans theses.fr des notices en provenance du Sudoc n’ayant pu être chargées du fait de leur médiocre qualité

Il s’agissait de corriger des erreurs manifestes et, à cette occasion, d’enrichir les notices originelles, notamment celles dépourvues de numéro national de thèses (zone 029), de note de thèse structurée (328$bDiplôme$cDiscipline $eEtablissement de soutenance$dDate de soutenance) ou de code domaine TEF (zone 686).
Des lots ont été constitués établissement par établissement, afin de permettre un versement des modifications dans les SIGB et de compléter les points d’accès 712 à l’établissement de soutenance.

  •  mettre de l’ordre dans les données déjà visibles dans theses.fr

En 2013, lors du versement des données Sudoc dans theses.fr, des choix devaient être faits  – tout verser ou ne verser que les notices de meilleurs qualité ? C’est une voie médiane qui a été retenue : les données Sudoc chargées dans theses.fr comportaient les zones essentielles, même si le contenu de ces zones était parfois peu exploitable ou non conforme aux recommandations du Guide Méthodologique.
Ainsi, par exemple, chaque occurrence distincte d’une zone 328$eEtablissement de soutenance dans une notice de thèse en provenance du Sudoc a créé une entrée au niveau de la facette « Établissements » dans theses.fr. Cette facette n’aurait dû contenir qu’environ 200 entrées puisqu’il existe une liste fermée des libellés des établissements de soutenance …. cependant, le recours à cette liste n’étant pas contrôlé dans WinIBW, n’importe quoi peut en réalité être saisi en 328$e, ce qui a parasité le fonctionnement de la facette « Etablissements » dans theses.fr.

Dans d’autres cas, le désordre dans theses.fr n’était pas dû à des consignes de catalogage non respectées mais à l’évolution des consignes de catalogage. Par exemple, longtemps il n’a pas été possible – dans le Sudoc (alors que STAR le permettait) – de qualifier finement les rôles de personnes en relation avec la thèse (membre du jury, président, rapporteur) ou les rôles des organismes (établissement de cotutelle, école doctorale, autre partenaire de recherche…). Fin 2014, l’Abes a créé  de nouveaux codes de fonction dans le Sudoc et a incité les catalogueurs à s’en servir (cf J.e-cours du 14/12/2014 « Description des thèses de doctorat » ). Évidemment, une grande partie des données rétrospectives du Sudoc étaient à corriger. Même si toutes les données n’ont pu être traitées en 2017, cela a constitué un axe majeur des modifications réalisées.

Résultats

Quantitativement, le nombre de page décrivant des thèses soutenues a fortement augmenté en 2017 [ie : nombre de thèses soutenues en 2016 et 2017  et signalées pour la première fois dans theses.fr au cours de l’année 2017]. Ainsi, alors qu’en 2016, le taux d’accroissement était de 4,04%, de février à décembre 2017, le nombre de pages de thèses soutenues dans theses.fr a connu un accroissement de 10,88%.

Qualitativement, les efforts ont principalement portés sur les organismes liées à la thèse, ce qui a permis de nettoyer les facettes ainsi que les pages dédiées aux organismes. Voici par exemple une copie d’écran de la facette «Établissements» réalisé le 10/02/2017. On y voit, surlignées en jaune, les entrées erronées (faculté),  autant d’éléments aujourd’hui corrigés.

 

 

 

 

 

 

 

 

 

 

Dans la mesure du possible, les zones de texte libre présentes dans la note de thèse – indiquant par exemple la discipline – ont été harmonisées.

Par ailleurs, suite à l’appel lancé via les listes de diffusion, quelques établissements ont sollicité l’Abes pour corriger des lots de données. Parmi les cas les plus fréquents : les notices de reproduction ou les versions électroniques de thèse versées dans une archive institutionnelle locale, pour lesquelles l’URL de diffusion dans la zone 856 devait être corrigée.

Conclusion

Malgré ces forces supplémentaires qui ont permis d’améliorer la qualité des données de thèses dans le Sudoc, ce dossier n’est hélas pas clos. En effet, le programme AlgoSudoc de FRBRisation des données du Sudoc en vue de leur chargement dans theses.fr détecte encore des milliers d’erreurs et les rend publiques.

Afin  que le slogan de theses.fr «Signaler l’ensemble des thèses de doctorat soutenues en France depuis 1985 » devienne réalité, l’Abes invite les établissements qui ne se sont pas encore emparés de ce dossier à prendre en main les données qui leur incombent.

IMR

Déploiement d’OATAO dans IdRef : une nouvelle visibilité sur le web

logo_oatao      idrefOSM

OATAO – l’archive institutionnelle et mutualisée des établissements Toulouse INP (Institut National Polytechnique de Toulouse), ENVT (École Nationale Vétérinaire de Toulouse), ISAE-SUPAERO (Institut Supérieur de l’Aéronautique et de l’Espace) et ENSFEA (École Nationale Supérieure de Formation de l’Enseignement Agricole) – et IdRef – application qui permet d’attribuer des identifiants fiables et pérennes, notamment aux membres de la sphère ESR – viennent de réussir leur connexion.  Autrement dit, les dépôts dans OATAO s’accompagnent désormais d’un liage des auteurs à leur autorité dans IdRef ; corrélativement, le cercle des contributeurs IdRef s’élargit pour accueillir en production une Archive Institutionnelle, une première !

Côté IdRef, les notices des quelques 500 auteurs de l’archive institutionnelle OATAO sont désormais enrichies d’un encart bibliographique supplémentaire. Deux modalités d’accès à leurs dépôts sont proposées dans les notices IdRef des auteurs concernés : accès par source dans la page dynamique et accès par rôle dans la page pérenne.

Ainsi, dans la notice « dynamique » d’IdRef (termes de recherche : « Merlina, Georges »), on peut consulter toutes les ressources émanant de l’archive pour cet auteur :

image1

De la même façon, dans la notice « pérenne » d’IdRef https://www.idref.fr/081940807, on accède à l’ensemble des ressources liées à cette personne en fonction de son rôle dans le dépôt, en l’occurrence auteur :image2

Dans les deux cas, on peut rebondir sur le full text des articles en cliquant sur l’identifiant numérique de la ressource. Toute la production de recherche des 4 établissements toulousains est ainsi propagée sur le web via IdRef.

De plus, dans l’application OATAO, il est désormais possible d’effectuer une recherche à l’aide d’un identifiant IdRef. On obtient ainsi pour résultat toutes les ressources liées à un auteur :

Image OATAO 1

La boucle est bouclée puisque sur la page d’une publication, le rebond est possible depuis les auteurs alignés vers leur notice IdRef correspondante via l’icone idoine.Image OATAO 2

Autre exposition, les identifiants IdRef seront poussés dans les exports notamment via le serveur OAI-PMH. Enfin, l’utilité de l’index des identifiants IdRef -index nouvellement créé et dédié aux gestionnaires OATAO, va au-delà puisqu’il permettra de proposer un index limité aux chercheurs des 4 établissements, demande récurrente des instances d’OATAO.

Workflow OATAO de connexion à IdRef

Pour initialiser l’interconnexion des bases, OATAO a eu recours au service d’identification des Personnes proposé par l’Abes. Les algorithmes d’identification ont une nouvelle fois rendu un fier service afin d’aligner les auteurs OATAO présents dans plus de 3 000 articles déjà en base.

  • Signalement des métadonnées d’un article : liste des auteurs

image5

  • Interrogation du moteur Solr d’IdRef :

image6

  • Si la requête SolR ne remonte pas de résultat, on bascule sur l’iframe d’IdRef :

image7

  • Dans IdRef, on retrouve alors la possibilité de « lier une notice » existante ou de créer une notice :

Image8

Retour dans l’interface de dépôt, l’identifiant Idref a été rapatrié dans la colonne « ppn » : les 2 auteurs sont alignés au sein des 2 applications.

image9

Éléments de politique documentaire

Côté politique documentaire, le recours aux autorités lors du dépôt d’un article est désormais une obligation pour les bibliothécaires-administrateurs de l’archive sur le périmètre des auteurs OATAO. Cette évolution, facilitée par la fluidité de l’interconnexion à IdRef, n’en représente pas moins une charge de travail supplémentaire. Si le jeu de l’interopérabilité en vaut la chandelle, il s’agira de mesurer plus finement dans les mois à venir l’impact sur le temps de traitement d’un dépôt dans l’archive, des nécessaires vérifications dans IdRef pour être sûr de lier à la bonne autorité ainsi que des éventuelles créations de notices d’autorité.

Par chance, l’équipe d’administrateurs OATAO peut compter sur l’aide du Correspondant Autorités de l’INP, qui œuvre depuis plusieurs années dans l’archive. Si le rappel des consignes et le traitement des anomalies (ex : doublons) ont augmenté sa charge de travail, sa « casquette » au sein de l’équipe est également plus affirmée et cette expertise est un plus au quotidien pour toute l’équipe. De plus, les cas d’investigation avancée sont l’occasion de « reprendre » contact avec les chercheurs afin d’assurer des attributions bibliographiques ou des informations dans l’autorité.

Autre heureuse perspective : IdRef offre une fonctionnalité de pré-remplissage des notices d’autorité dont OATAO peut escompter un gain important pour fluidifier son workflow. Déjà activée dans STAR pour la création des notices de docteurs, OATAO pourra ainsi pousser des données bibliographiques de l’article en traitement pour éviter aux administrateurs de ressaisir des informations déjà enregistrées dans l’archive.

Et plus loin encore, les chercheurs-déposants pourront-ils aussi se lier à leur notice ? Les auteurs extérieurs se verront-ils également liés ? A suivre !

D’ici là, un grand merci à Jean-Marie Le Bechec et à Yann Sérot, pour une coopération agréablement et rondement menée.

François Mistral, responsable IdRef

Si vous êtes intéressé par ce service pour votre Archive institutionnelle, n’hésitez pas à contacter : idref@abes.fr

 

 

 

Quand ScanR et IdRef s’associent pour identifier les acteurs de la recherche et de l’innovation

ScanR, moteur de la Recherche et de l’Innovation, outil désormais bien connu dans la sphère ESR, propose à la réutilisation de nombreux jeux de données sous licence ouverte. Ces données, également accessibles via la plateforme OpenData du MESRI sont synchronisées avec data.gouv.fr, plateforme des données publiques françaises mis à disposition par Etalab.

 

S’inscrivant dans la logique d’ouverture portée par ScanR, l’Abes a utilisé les données IdRef et ses algorithmes d’identification afin de lier 3 jeux de données exposés et utilisés dans ScanR via son référentiel auteurs.

 

Lauréat-e-s du trophée « Les Étoiles de l’Europe »

Sur 48 entrées, 42 personnes (soit 87, 5 %) ont été identifiées de façon certaine La recherche n’a pas été poussée plus avant pour les 6 personnes manquantes, les résultats fournis par l’algorithme étant estimés satisfaisant. Les identifiants sont disponibles dans le jeu de données.

Finalistes et lauréats du concours « Ma Thèse en 180 secondes »

Sur 71 entrées, seulement 13 (soit 18, 3%) ont été identifiés en tant que « thèses soutenues ». Un taux de rappel très faible qui s’explique  du fait du délai de signalement des thèses (360 jours en moyenne). En effet, vérification faite de la présence des données dans theses.fr,  la très grande majorité d’entre elles sont effectivement signalées mais en tant que « thèses en préparation ».

Membres de l’Institut Universitaire de France (IUF)

Ce corpus, dont l’historique remonte à 1991, possède le volume le plus conséquent : après dédoublonnage, les 2041 entrées renvoient à 1 700 personnes distinctes. Les opérations d’alignement comportent 2 dimensions complémentaires :

  • la couverture (ou taux de rappel) : toutes les personnes ont été identifiées, avec une fourniture de 1 700 identifiants IdRef distincts. La couverture pour ce corpus est donc totale. Les membres de l’IUF figurent bien tous dans IdRef.
  • la fiabilité  (ou taux de précision) : l’identification se doit d’être évaluée, notre parti pris étant de fournir des identifications à la fiabilité très élevée, ce que dénote le choix des algorithmes utilisés.

D’un point de vue méthodologique, le programme de liage a confronté les données du jeu de données en entrée avec le contenu des notices d’autorité IdRef, enrichies du contenu des notices bibliographiques Sudoc liées. Plusieurs heuristiques ont été exploitées :

  • cocontrib : si deux personnes ont des noms très proches et des co-contributeurs aux noms très proches
  • collectivités + Dewey : si deux personnes ont des noms identiques et sont associées à une même collectivité (laboratoire ou université) et que la thématique de recherche correspond à un indice Dewey connu pour la personne
  • laboratoire : si deux personnes ont des noms identiques et sont associés à un même laboratoire
  • université : si deux personnes ont des noms identiques et sont associées à une même université

Précisions que, bien qu’absente de cette fourniture,  l’heuristique Unica est également régulièrement utilisée : si deux personnes ont des noms identiques et qu’il n’y a aucune autre autorité candidate dont le nom est approchant, on peut conclure qu’il s’agit de la même personne.

Tableau de ventilation des matchs par heuristique

Heuristique                     Nombre de match
 Cocontrib                           782
 Collectivé+Dewey                    184
 Laboratoire                         248
 Université                          381
 Vérifié                             446
 Total général                      2041

A l’aune des évaluations précédemment réalisées, on sait que Cocontrib possède un taux de précision moyen de 98% (estimé supérieur à un catalogage « pressé »). Pour les heuristiques associant des collectivités, le corpus IUF a servi de premier test. A défaut d’une évaluation systématique, les sondages réalisés – dont témoignent les matchs en statut « vérifié », nous permettent d’accorder une confiance de niveau « très élevé » à Collectivités + Dewey et Laboratoire, et une confiance de niveau « élevée » à Université.

Au vu de ces règles, chaque réutilisateur peut déterminer son propre seuil de confiance. Si le risque d’erreur existe, dans le cas présent avec le corpus IUF, de façon très concrète, les données fournies sont considérées comme fiables par l’Abes. Elles seront donc intégrées au jeu de données sur les IUF lors de sa prochaine actualisation.

Pour conclure la relation de cette fructueuse coopération associant l’équipe du Département des outils d’aide à la décision du MESRI et l’Abes, il nous semble important de mettre en exergue deux bénéfices en particulier :

  • l’enrichissement des données publiques
  • la démonstration que l’ouverture des données à tous contribue à améliorer leur qualité – ici leur interopérabilité – grâce à une identification fiable et pérenne !

François Mistral, pour l’équipe IdRef

Remerciements à l’équipe du Département des outils d’aide à la décision du MESRI

CERCLES OPENEDITION : UN ALGORITHME POUR AUTOMATISER LES LIENS 7XX

Le chantier CERCLES OpenEdition

CERCLES_Sarah8Klocars_Clauser_via_OpenPhoto

Sarah Klocars Clauser (via OpenPhoto)

Lancé en 2015 par le SCD de l’Université François Rabelais de Tours – l’un des établissements ayant activement milité pour la création du dispositif –   le chantier CERCLES OpenEdition consiste principalement à l’enrichissement des notices bibliographiques du corpus OpenEdition (3959 notices au 01/07/2017), un travail réalisé par une équipe de catalogueurs du SCD, sous la responsabilité de Véronique Lacan, coordinatrice Sudoc.

Étapes à la loupe

Pour le traitement des notices d’e-books, il convient de  procéder dans un premier temps à la visualisation de 2 notices : celle de l’e-book à enrichir et celle de la manifestation imprimée, quand celle-ci existe. Pour cela, l’option « multifenêtrage » de WinIBW est activée.

Image1

Menu Fenêtre > Mosaïque verticale

En plus de la relecture complète, l’attention est ensuite portée sur les zones à vérifier et/ou enrichir particulièrement :

  • 035 : vérification du code source à partir du site Open Edition Books (OEB)
  • 010 : vérification de l’ISBN à partir du site OEB
  • 1XX : vérification des données codées, dont les dates
  • 200 : vérification du titre et des mentions de responsabilité (nombreux contributeurs reportés en 314)
  • 307 : ajout de la pagination de l’édition imprimée (si elle existe)
  • 310 : vérification des modalités d’accès et mise en cohérence de cette information dans les zones 856 ou 859
  • 452 : lien vers la notice de l’édition imprimée et lien réciproque
  • 6XX : complétude de l’indexation matière
  • 70X : lien à la notice d’autorité du contributeur (le plus souvent :  zones 701)

C’est principalement  l’enrichissement de cette zone 70X qui peut s’avérer complexe : soit la notice d’autorité n’existe pas encore, soit un choix doit être effectué entre plusieurs notices d’autorité, en cas d’homonymie par exemple :

  CERCLES_doublon_autorite

De plus, ce traitement peut s’avérer long et fastidieux, les notices d’e-books proposant de nombreux contributeurs, comme par exemple  :

CERCLES_contributeurs

Une vingtaine de contributeurs pour cette notice : autant de liens à créer

L’intérêt du traitement automatique

CERCLES_hula_hoop_by_Lars_Plougmann_via_Flickr_CC_BY_SA_2_0

Un algorithme au service du CERCLE…

Menée au SCD de l’université Picardie Jules Verne dans le cadre d’un autre chantier CERCLES comportant également de nombreux accès Auteurs à créer (voir le billet à ce sujet), une première expérimentation a démontré la capacité du programme de traitement automatique mis au point par les équipes de l’Abes.  A l’aide de cet algorithme conçu pour rechercher puis lier automatiquement les points d’accès 70X aux notices d’autorité correspondantes, un lien 7XX a été ajouté automatiquement à 749 notices sur 987, soit un taux d’erreur d’à peine 0,5 %. Une expérimentation globalement positive dont l’Abes a fait la promotion, notamment lors de l’atelier  « Aligner, le signalement augmenté » présenté par Yann Nicolas lors des Journées Abes 2017.

Saisissant cette opportunité, le SCD de Tours a sollicité les équipes de l’Abes pour bénéficier d’un traitement similaire sur le corpus OpenEdition, expérimentation lancée lors de la rencontre de travail avec un membre de l’équipe OpenEdition. Ainsi, en juin dernier, l’algorithme a  tourné sur le dernier fichier d’import de notices OpenEdition chargé dans le Sudoc. Les résultats  sont tout aussi satisfaisants : le programme est parvenu à lier automatiquement 733 sur 977 points d’accès, soit 75 % de réussite. Ce sont donc des notices avec des zones 7XX liées et validées qui ont été importées dans le Sudoc, facilitant considérablement le travail du SCD de Tours et bénéficiant à tous les établissements du réseau.

L’aide à la décision

Autre avantage de ce traitement :  pour les notices n’ayant pu bénéficié du traitement automatiquement, un rapport d’aide à la décision – résultat d’une analyse et d’un décryptage – est fourni au responsable du chantier CERCLES,  coupe de pouce bien utile pour organiser le travail de correction et témoignage que l’Abes respecte son engagement dans le dispositif CERCLES : « contribuer aux enrichissements, par un travail d’expertise préalable, par la fourniture d’outils automatisés et enfin par l’analyse et le conseil pour organiser le travail d’enrichissement« .

Ainsi, la responsable du chantier OpenEdition a disposé d’une grille de corrections à effectuer sur une partie des 244 points d’accès non traités,  pour lesquels des suggestions de liens ont été exprimées :

  • sur la base de rapprochement avec des titres similaires (73 cas)
  • sur la base de rapprochement avec des éditeurs similaires (33 cas)
  • sur la base de rapprochement avec des co-contributeurs similaires (2 cas)

Dans 10 cas seulement, aucune proposition n’a pu être opérée par le programme, les notices d’autorités potentiellement liables comportant des erreurs de catalogage, à corriger au préalable.

Image2

Extrait de l’analyse du traitement et sa grille de lecture

A partir de ce traitement automatisé, les catalogueurs du chantier CERCLES OpenEdition disposent donc d’un guide de corrections, de listes de PPN toutes prêtes sur lesquels ils peuvent intervenir. Ainsi, l’essentiel de leur travail peut se concentrer sur l’analyse et le choix de liens « problématiques », plutôt que sur la tâche purement technique et répétitive, de liages « indiscutables » aux autorités.

C’est en effet dans ce travail d’analyse et de choix complexes que s’exercent véritablement les compétences des catalogueurs, et non dans l’acte technique de simple liage qui peut être, sans remords, délaissé aux machines.