Ressources numériques en sciences humaines et sociales OpenEdition Nos plateformes OpenEdition Books OpenEdition Journals Hypothèses Calenda Bibliothèques OpenEdition Freemium Suivez-nous

Sonal, pour analyser des entretiens

Aperçu dans la description du logiciel Sonal, que je découvre en lisant la newsletter de l’AFS jusqu’au bout :

Sonal est également sur Hypothèses depuis fin 2009. Je n’en ferai rien car le logiciel ne tourne que sur Windows et exporte dans des formats propriétaires, mais longue vie au projet et bravo pour l’esprit, car les logiciels payants sont nombreux sur le créneau de l’analyse textuelle ou lexicométrique, ce qui limite drastiquement les possibilités.

Comment ne rien comprendre aux marges d’incertitude du vote des jeunes

Dans la série “sondages”, cette intéressante correspondance que publie Le Monde dans ses pages intérieures, après avoir titré aussi gros que possible sur le vote d’extrême-droite chez les jeunes il y a quelques jours :

(source : Vincent Glad, tweeteur influent ; via Éric Dupin, journaliste)

Joël a déjà évoqué le sujet, et ici encore, l’erreur porte sur la méthodologie de l’enquête. Un échantillon d’environ 200 personnes est en effet tout à fait suffisant pour estimer une proportion comme celle du vote des jeunes si l’échantillon est normalement distribué. Le problème vient, encore et toujours, de la composition de l’échantillon, pas de sa taille.

… Mais bon, la messe étant dite, à quoi bon pinailler sur les sources des évangiles :

Sur la quantification du football

Il y a plusieurs mois, un étudiant qui avait suivi mon cours de statistiques introductives m’avait signalé le film Moneyball, qui donne un aperçu de ce que sont les sabermetrics aux États-Unis, c’est-à-dire les statistiques appliquées au baseball. Cette pratique est devenue plus qu’une lubie : contrairement au trainspotting, elle a rapidement trouvé des applications commerciales et scientifiques.

L’émission “Place de la toile”, facile à suivre grâce à Twitter via #pdlt et @thibnton, consacrait sa dernière émission à l’introduction des statistiques dans le football. L’émission évoque quelques mécanismes généraux de la quantification du sport, comme la cotation des équipes et des matches ou l’indexation des salaires et des transferts. Les invités évoquent aussi l’introduction des statistiques dans les carnets des entraîneurs et dans les jeux video, le conflit d’autorité avec les mesures qualitatives dans les milieux professionnels du sport (entraîneurs, consultants, médias…). On retrouve beaucoup d’éléments de boundary-work entre amateurs et professionnels.

Je m’en tiens à ce résumé très bref, l’émission se terminant à l’instant. Et c’est probablement mon dernier billet sur le football, mais pas le dernier sur la quantification.

Un indicateur de saillance du travail parlementaire

Histoire d’apprendre à jouer avec la commande getURL de la librairie RCurl, j’ai écrit quelques lignes de code pour récupérer une bonne partie du travail législatif accompli à l’Assemblée nationale à partir des projets et propositions de loi. J’ai aussi extrait quelques-unes des caractéristiques pour chaque dossier, et notamment le nombre de débats organisés en séance publique. Les données couvrent deux législatures (2002-2012).

Mon script n’a pas réussi à capturer l’intégralité des travaux à cause des erreurs de codage sur le site de l’Assemblée nationale, mais j’ai réussi à recueillir 405 projets de loi et 261 propositions de loi, introduits soit à l’Assemblée nationale, soit au Sénat. La catégorie modale est le projet de loi introduit à la chambre basse. Les deux législatures sont grossièrement identiques sur l’ensemble des critères étudiés1.

Je vais me servir du nombre de séances publiques tenues sur un même texte comme d’un indicateur de saillance au sein du travail parlementaire. La distribution du nombre de séances est très asymétrique : la plupart des lois ne dépassent pas une à trois séances 2. Les valeurs extrêmes sont tenues par les lois de finances et par certains textes anormalement saillants dans l’agenda parlementaire, pour des raisons qui restent à expliquer :

 [1] "reforme_hopital"                     "reforme_collectivites_territoriales"
 [3] "nomination_audiovisuel_public"       "modernisation_economie"             
 [5] "loi_finances_2012"                   "loi_finances_2011"                  
 [7] "loi_finances_2010"                   "loi_finances_2009"                  
 [9] "loi_finances_2008"                   "internet"                           
[11] "grenelle_environnement2"             "defenseur_droits"                   
[13] "articles_34-1_3944"                  "temps_travail_entreprise"           
[15] "prevention_delinquance"              "loi_finances_2007"                  
[17] "immigration_integration"             "engagement_national_logement"       
[19] "egalite_chances"                     "eau_milieux_aquatiques"             
[21] "031206"                              "0200240203"

Dans les 3% des textes les plus programmés en séance publique, donc : le temps de travail des entreprises, la loi “ENL”, la réforme des collectivités territoriales, celle de la prévention de la délinquance, puis les nominations dans l’audiovisuel, le Grenelle de l’environnement… On y retrouve la plupart des projets emblématiques du gouvernement. On y trouve aussi, à mon grand plaisir, HADOPI, et même la loi précédente, DADVSI. Le record, avec trente séances, est tenu par la loi HPST.

En séparant les fonctions de répartition empirique par législature, chambre d’introduction et type d’initiative, on obtient les courbes suivantes (zoomables en PDF : cliquer sur l’image). Les points sur les courbes rouges et bleues correspondent respectivement aux lois DADVSI (12e législature) et HADOPI (13e législature). Chaque courbe utilise un minimum de 104 points.

On peut apercevoir des nuances entre les législatures ou entre les critères institutionnels, mais en réalité, je ne pense pas que la distinction par chambre d’introduction résiste à l’examen, dans la mesure où les règles d’introduction spécifique des textes sont noyées dans des centaines de projets alloués aux deux tiers à la chambre basse. Une fois cette simplification admise, on observe quelques différences entre les critères restants :

  • La 13e législature organise une séance et demi de plus en moyenne par texte examiné3. Cet effet concerne prioritairement les projets de loi, pour lequel le nombre moyen de séances publiques a plus que doublé après 2007, de 2.2 à 4.74.
  • L’augmentation des séances sur les propositions de loi est moins importante en volume mais identique en taux de croissance. S’il y a un effet post-2007, il s’exerce sur les projets et propositions de manière égale.
  • Une régression logistique indique que chaque organisation de séance double la probabilité d’aboutir à la promulgation d’une loi5. L’effet persiste si l’on contrôle par le type (projet/proposition), mais cesse d’être significatif quand on corrige les erreurs standard à l’intérieur de chaque législature6.

Cet indicateur de saillance est tout aussi valable qu’un autre, et ses résultats préliminaires sont fiables : le haut de la distribution est occupé par des lois à forte charge symbolique, où les députés ont soit été très sollicités ou très mobilisés par défaut ; et l’augmentation sous la 13e législature peut s’expliquer de beaucoup de manières.

Mon échantillon est perfectible, tout comme mon code, qui laisse quelques lignes en erreur dans la base. Je ne sais pas si quelqu’un au GEVIPAR ou ailleurs a déjà extrait cette information. Je ne sais pas non plus si ces indicateurs sont mesurés comparativement. La suite : étendre au Sénat, et trouver un manuel d’analyse de corpus législatif, si je parviens à extraire les débats DADVSI et HADOPI de manière satisfaisante.

  1. Je ne tiens pas compte des changements de codage qui font disparaître les rapports publics d’information et d’autres missions sur d’autres pages que je ne souhaitais pas capturer pour ce projet. []
  2. Pour rendre compte de la distribution, on va utiliser une fonction “ECDF” de répartie empirique, plus lisible qu’une estimation de densité par noyau sur une distribution asymétrique dont on souhaite conserver les unités naturelles (ici, le nombre de séances publiques). []
  3. Estimation significative sur un t-test à p < .05, intervalle de confiance [-2.3, -.64]. []
  4. L'intervalle à 95% de confiance sur le sous-ensemble à N = projets de loi est [-3.7, -1.1]. []
  5. La moitié des projets ou propositions ne donne pas lieu à la promulgation d’une loi dans mon échantillon. Je n’ai pas vérifié le codage, mais n’ai aucune raison de ne pas le croire jusque-là. []
  6. Pour être précis, l’effet est significatif à p < 0.1 en contrôlant par le type (projet/proposition), mais reperd en significativité quand on supprime les lois de finance, qui biaisent le modèle. []

Quelques notes sur la diffusion des campagnes sur Internet

Hier soir, “Place de la toile” sur France Culture faisait son bilan provisoire de la “web campagne”. J’ai noté, rapidement et sans intention d’être exhaustif avec les impressions des journalistes présents :

  • Les sites de vitrine et les sites de mobilisation sont découplés. Les équipes reflètent la rigidité des hiérarchies partisanes, souples (amateurs, militants) ou rigides (élus, conseillers). C’est une manière de redécouvrir les “machines” partisanes, leurs inégalités de ressources et l’importance qu’ils allouent à leur colonne dorsale de permanents et d’élus.
  • À travers les “timelines” citées, celles de Nicolas Sarkozy et d’Humour de droite, on redécouvre le principe de la chronique parodique, façon “shorter Patrick Rambaud”, ou son ancêtre, le roman-feuilleton. Les réseaux sociaux apportent l’immédiateté, la concision et la compétition autour du “fact-checking”, qui laissent les journalistes professionnels naturellement assez mitigés.
  • Le “participatif”, façon “Désirs d’avenir” (qui s’auto-parodiait en partie), est très limité, et les effectifs mobilisés par Internet (en tant que “fans”, “likes”, etc.) restent faibles. L’un des invités fait une comparaison rapide avec l’Italie, mais j’aimerais voir des comparaisons systématiquement rapportées à la population ; son analyse est néanmoins crédible, dans la mesure où les partis français sont aussi loin d’être des partis de masse.

Une grande partie de tout ça naît du plagiat entre partis, et aussi de l’imitation avec ce que l’équipe de campagne de Barack Obama avait organisé pour l’élection de novembre 2008, plagié entre-temps par le site Internet de l’Élysée. Cette nouvelle vague de mimétisme est assez amusante, dans la mesure où l’équipe de Barack Obama est en train de tout remettre à plat de son côté pour novembre 2012, avec des modifications très importantes dans sa stratégie “MyBO” (vidéo, mobile, etc.).

Je me tiens au courant de ces changements en observant le suivi des propositions sur Hadopi, qui reste le dossier le plus saillant de la “politique numérique” des partis. Les groupes sociaux qui ont organisé la mobilisation contre les lois DADVSI et HADOPI ont réussi à conserver ce statut d’exception sur Internet au fil du temps, aidés dans ce travail par les rédactions des médias en ligne1.

Pour terminer un billet sur la communication politique, quoi de mieux que cette sublime illustration de l’échange de biens matériels et symboliques autour du vote ? Ça me rappelle les étudiants de mon cours d’introduction à la science politique qui se demandaient pourquoi je passais autant de temps à leur parler d’Alexis de Tocqueville et de Serge Dassault dans les mêmes paragraphes. Je trouve cette rencontre des nouveaux médias avec un garde-champêtre presque septuagénaire baroque et désopilante.

  1. Je cherche à écrire une liste plus systématique de ces rédactions, incluant quelques médias américains qui touchent aussi un lectorat en France, comme Ars Technica, BoingBoing, Gawker, Mashable et Wired. Ma liste inclut Écrans, Owni, Électron Libre, InternetActu, ReadWriteWeb, RSLN et ZDNet, mais surtout, en volume d’activité, Numerama (ex-Ratiatum), PC Inpact et probablement Rue89, qui liste plein de sources. Ma référence favorite reste TorrentFreak, pour son comparatisme engagé, complétée de quelques émissions sur France Culture et de comptes Twitter comme HadopInsiders. []