vendredi 29 mars 2013

HeLa ! A qui est ce génome ?

En biologie moléculaire, on utilise beaucoup des cultures cellulaires, à savoir qu'on a les cellules dans une boîte de Petri pour étudier la manière dont elles fonctionnent. Mais la plupart de nos cellules ne se laissent pas cultiver facilement, et c'était encore plus vrai avant les progrès récents concernant les cellules souches. Donc on utilise beaucoup des cellules dérivées de tumeurs, qui elles se maintiennent bien en culture.

La lignée probablement la plus célèbre est la lignée HeLa, dérivée d'une tumeur d'une pauvre femme noire dans l'Amérique des années 50, Henrietta Lacks. A l'époque, on n'avait pas jugé bon de lui demander son avis, ni à sa famille. Et les cellules HeLa ont été utilisées, et continuent d'être utilisées, dans un nombre énorme d'études de biologie.

Or deux choses : un, ces cellules, comme toutes les cellules dérivées de tumeur gardées longtemps en culture, ont subi beaucoup de mutations, y compris des très grosses, et leur génome est très différent de celui d'une cellule humaine "normale". Deux, on n'est plus dans l'ère de la biologie moléculaire, mais dans celle de la génomique, donc étudier un génome anormal en faisant comme s'il était normal pose problème.

Donc récemment des chercheurs de l'EMBL (le labo européen de biologie moléculaire) ont publié le génome de HeLa (enfin, un génome, parce que je parie que différentes cultures cellulaires ont différents génomes). Ce qui est très bien d'un point de vue purement de la compréhension de la biologie, parce qu'on peut mettre les expériences précédentes en contexte.

Mais très rapidement, des personnes, au premier chef desquels Jonathan Eisen, ont émis des doutes sur l'aspect éthique du séquençage du génome dérivé de Henrietta Lacks en l'absence de tout consentement éclairé. Deux arguments s'affrontent : on peut considérer que ce génome est tellement dérivé et bizarre par rapport à l'original qu'il n'a plus grand chose à voir avec la famille Lacks ; les cellules HeLa sont une forme de vie à part, pour laquelle un consentement éclairé n'est pas nécessaire. Ou on peut considérer que c'est bien le génome de Henrietta Lacks, même avec des mutations supplémentaires, et qu'il fallait donc un consentement. A cela s'ajoute le fait que Henrietta est morte depuis longtemps, donc c'est à ses petits-enfants qui n'ont que 1/4 de son génome en moyenne qu'il faudrait demander, et l'historique sordide de l'exploitation des cellules sans consentement ni aucune forme de réflexion éthique depuis les années 50. Je n'ai pas le temps d'aller dans tous les aspects du débat en cours, Eisen maintient une excellente liste des réactions en anglais, mais deux points intéressants :

Au blog Genomes Unzipped, ils ont montré qu'à partir des expériences déjà publiées on peut déjà reconstruire beaucoup des variants génétiques d'Henrietta Lacks.

Et ceci pose à nouveau la question posée par le premier génome Aborigène (voir aussi Tom Roud), de savoir à qui appartient l'information dans un génome, sachant qu'il est partagé avec votre famille et de manière plus large les personnes venant de la même région que vous.

vendredi 22 mars 2013

C'est tellement compliqué on ne peut jamais savoir ! Pas de vaccins, pas d'OGM et pas de jus de tomate !

[caption id="attachment_901" align="aligncenter" width="135"]nepas cliquez sur l'image et goutez l'humour suisse[/caption]

Le principe de précaution dans sa forme rationnelle est une réaction qui me paraît tout-à-fait sensée face à un techno-optimisme béat (qui n'a guère plus cours depuis un très bon moment quand même je pense) et face à de potentielles élites ne se préoccupant pas des risques pour la populace (voir discussion sur le test Erin Brokovitch).

Mais ces temps-ci j'ai surtout l'impression d'avoir affaire au principe de au-secours-j'ai-peur-je-comprend-pas-et-je-ne-veux-pas-comprendre. Ce qui est frustrant pour un scientifique dont la passion est de comprendre les choses justement. Et si possible prendre en compte cette compréhension dans le choix raisonné des actions.

Point de départ, deux exemples récents ayant affecté des blogs du C@fé des sciences (discussion aussi chez Sirtin).

En commentaire d'un billet de Sirtin sur les micro-ondes, un certain Nirvan s'inquiète du mouvement des molécules d'eau qu'il/elle ingère dans les aliments réchauffés au micro-onde. En réponse, lien vers l'excellent Podcast science, ainsi qu'une comparaison très raisonable de Nima Yeganefar de l'excellent blog Sham and science sur lequel on va revenir, et que je cite parce que c'est important :
Il est certainement plus risqué de prendre sa voiture pour aller au travail tous les jours (risque mis en évidence scientifiquement, mesuré, connu) que de manger des aliments réchauffés par micro onde (risque hypothétique, jamais mis en évidence, où on ne voit même pas un mécanisme possible).

C'est important parce que nombre des peurs que l'on entend évoquer à propos de techniques diverses n'ont aucun mécanisme envisagé. Par exemple si je vois une grosse bête que je ne connais pas, je peux me méfier, il existe un mécanisme "grosse bête attaque humain" bien connu. Plus technique, si on met au point un médicament pour qu'il affecte ma maladie, ça veut dire que ce produit est actif dans mon organisme, donc il y a un risque d'effets secondaires non déraisonnable. D'où les tests extensifs et très couteux imposés à l'industrie pharmaceutique (mais pas homéopathique parce qu'on sait qu'une pilule de sucre et d'eau ne peut faire ni mal ni bien...), qui conduisent à la non commercialisation de la grande majorité des composés prometteurs. Et il reste que même après un max de tests, il peut y avoir des erreurs, et même quand il n'y a pas erreur, presque tous les médicaments sont dangereux à la mauvaise dose ou en l'absence de pathologie. Donc vente en pharmacie. Mais le mécanisme des micro-ondes on le connaît bien (la physique c'est vachement plus simple que la biologie), et on ne voit pas en quoi ça rend les aliments dangereux en soi (pour ce qui est de chauffer des aliments dans du plastique, c'est une autre affaire - il peut y avoir des risques).

Deuxième histoire sur un blog du C@fé des sciences. Sham and science justement, que je vous recommende dans le genre anti-bétises (et anti-bétise) a écrit un bon billet sur la peur des vaccins et ses conséquences funestes. Ca n'a pas manqué, réaction de militants anti-vaccins ; je vous met un lien vers la réaction de Sham and science, pas vers les imbéciles tueurs d'enfants (vous voulez que j'appelle ça comment des gens qui par méconnaissance active cherchent à empécher les gens de sauver les enfants de maladies mortelles et préventibles ?). Les raisonnement m'intéresse parce qu'il est plus proche de la biologie, et se rapproche aussi de ce que l'on entend sur les OGM, que dont j'ai causé plusieurs fois sur ce blog.

En gros, la biologie ça serait très compliqué (vrai), en équilibre naturel (mouais bof), donc il ne faudrait surtout jamais la pertuber, surtout avec des choses qu'on n'a jamais fait. On voit bien ce raisonnement dans une vidéo de PH Gouyon où il explique que les OGM sont dangereux parce qu'on ne peut jamais savoir ce qui va se passer quand on met un gène dans un nouvel environnement génique. Même si ce gène était dans un autre aliment que vous mangiez, même si le produit de ce gène était déjà dans votre alimentation, là, interaction, paf, on peut pas savoir.

Alors, premièrement, on peut chercher à savoir au lieu de dire "on peut pas". Ca s'appelle la recherche scientifique, et en ce qui concerne les OGM c'est freiné par les arracheurs qui saccagent régulièrement les champs expérimentaux universitaires. Donc si on est empéché de chercher à savoir, c'est sur que c'est dur de savoir. Mais globalement y a des études faites ailleurs qu'en Europe, et y a des gens et du bétail qui mangent des OGM à grande échelle, donc on peut à-peu-près savoir. Pour les vaccins, c'est encore mieux, la recherche se fait sans arrachage et ça fait super longtemps qu'on observe les gens qui se font vacciner (si vous avez des enfants, vous savez qu'ils voient beaucoup le pédiatre au début de leur vie, avant pendant après les vaccins).

Deuxièmement, en ce qui concerne les OGM, on revient toujours au même point, qui est qu'il y en a de toutes sortes. Il y a donc des OGM dans lesquels on a mis dans une variété de riz un gène d'une autre variété de riz. Je pense qu'on a une certaine expérience de ce que ce gène fait dans un contexte (très compliqué je vous l'accorde) de riz. En ce qui concerne les vaccins, on a une très bonne idée de comment fonctionne le système immunitaire. On revient au point sur les médicaments en général : si c'est actif dans votre corps, ça ne peut pas être sans risques. C'est donc une question de coût-bénéfice. Sauver les vies de millions d'enfants et d'adultes tous les ans à coup sûr, contre le risque qu'il y ait peut-être un effet secondaire super rare ou super pas grave (seules possibilités pour qu'on ne l'ait pas encore remarqué) ? J'hésite.

Notez que c'est vrai que la biologie c'est compliqué, et qu'on peut découvrir des choses qu'on ne connaissait pas. Notez aussi que c'est les scientifiques qui les découvrent et les publient et avertissent le public, pas les pseudo-scientifiques conspirationistes. Notez aussi que plus notre connaissance avance, plus les problèmes qu'on découvre ont des chances d'être rares ou peu graves pour pas qu'on les ait vu avant. Ainsi, le mélange du jus de pamplemousse avec certains médicaments provoque des effets secondaires pouvant être graves. On est dans un cas pas hyper fréquent, et décrit dans la litérature scientifique depuis plus de 20 ans, mais il a fallu du temps pour bien vérifier. Un point à relever c'est que le mécanisme en cause est compréhensible, connu, et cohérent avec nos connaissances précédentes : les enzymes P450 sont connues depuis très longtemps pour leur rôle de détoxification qui les poussent à dégrader nos médicaments. Donc les dosages tiennent compte de leur effet et on prend assez de médicament pour en dégrader et encore en avoir. Des populations produisant des formes plus ou moins actives de ces enzymes ont donc besoin de doses différentes de médicaments. Le jus de pamplemousse contient des composés qui sont des inhibiteurs de certaines P450 (au fait, c'est dégueulasse que les principaux articles sur ce sujet de santé publique ne soient pas libre d'accès).

Revenons à l'argument : c'est compliqué, au secours. Je voudrais vous faire remarquer deux choses : un, nous avons tous un génome différent. Non seulement nous avons une combinaison d'allèles hérités de nos parents qui est probablement unique, sauf les vrais jumeaux, mais nous avons chacun une centaine de mutations nouvelles. Deux, chaque individu animal ou plante que nous mangeons, de même (avec moins de variété dans les espèces domestiques, mais d'un autre coté plein de variété dans par exemple les bactéries des fromages). Donc tous les jours vous réalisez dans votre alimentation des mélanges biologiques complexes jamais vu avant. Et vous survivez à la plupart de vos repas ! Waouh. Bon on peut minimiser cela en mangeant tous les repas la même chose très peu variée, mais je prends les paris sur ce qui sera meilleur pour la santé, ça ou un régime varié n'hésitant pas à essayer de nouvelles choses. Sans compter le bénéfice gustatif.

En fait un système peut être complexe mais avoir des comportements robustes, et être en grande partie prédictible. Dire à tout bout de champ "c'est compliqué, faut pas chercher à comprendre, faut rien toucher", ça n'avance pas beaucoup les choses. Reconnaître la complexité (et je vous mets au défi de trouver un biologiste, un médecin, un agronome qui la nie) et travailler avec, oui ça avance la connaissance. Et reconnaître que tous nos choix sont une question de gestion de risques jamais nuls, et de rapport coût / bénéfice, peut permettre de faire des choix raisonnés. La pondération des coûts et des bénéfices peut être très subjective, mais il faut le faire en connaissance de cause.

samedi 16 mars 2013

Le cerveau humain diffère-t-il de celui des singes ? La réponse dans l'expression des gènes

[caption id="attachment_866" align="aligncenter" width="96"]monkey Cliquez sur l'image[/caption]

C'est la semaine du cerveau ! "Du cerveau" vous pensez tout-de-suite au votre ou au mien à la limite, au cerveau humain. Mais tous les vertébrés ont un cerveau.

[caption id="" align="aligncenter" width="312"] Illustration Alain Prunier – http://alain-prunier.com/blog/[/caption]

Je suis toujours géné par les études qui visent à trouver ce qui nous rend unique, ce qui fait des humains des êtres tellement à part, parce que je ne suis pas convaincu que ça soit évidemment vrai. Avant de chercher à comprendre les causes d'un phénomène, j'aime bien m'assurer que le phénomène soit réel. Alors est-ce que les humains sont spéciaux, ou est-ce que cela nous semble seulement ainsi parce que nous sommes humains ? Je ne dis pas que je soit sur qu'il n'y ait rien de particulier à notre espèce, mais ne mettons pas la charrue avant les boeux. Par exemple il y a plein d'études qui comparent notre génome à d'autres génomes de mammifères pour trouver des gènes humain-spécifique, ou des changements génétiques tout petits humain-spécifique, et c'est publié avec des titres triomphants : on a trouvé les gènes ou les mutations qui font de nous des humains ! Mais qu'est-ce qui me dit qu'en comparant des génomes de rongeurs je n'aurais pas trouvé autant de différences qui font de la souris domestique Mus musculus ce qu'elle est, par rapport à la primitive souris des steppes Mus spicilegus ? Et les différences génétiques qui distinguent la mouche du vinaigre de la mouche des séchelles, hein ? Donc avant de me bassiner avec plein de petites différences, j'aimerais qu'on me montre en quoi elles sont intéressantes.

C'est pourquoi j'avais beaucoup aimé à l'époque un article novateur du groupe de Svante Pääbo, qui a aussi découvert le Denisova et plein d'autres trucs. Il faut d'abord se rappeler que les gènes pour être actifs doivent exprimer leur produit, qui fera le boulot (voir ce billet). Donc même s'il y a peu de différences en gènes entre deux cellules, il peut y avoir de grosses différences dues à l'expression différente de ces gènes. Par exemple, toutes les cellules de votre corps ont les mêmes gènes, mais ça fait du muscle ou du cerveau ou du gras selon l'expression des gènes (qui est aussi régulée selon votre activité et votre alimentation semble-t-il). De même on peut penser qu'une partie des différences entre espèces à génome très similaire, comme humain et chimpanzé ou souris domestique et souris des steppes, soit due à des différences d'expression des gènes. Ces différences elles-mêmes étant encodées dans le génome, dans les séquences régulatrices, voir discussion d'ENCODE en septembre.

Or donc, Enard et al en 2002 (article d'accès payant dans Science) ont comparé l'expression des gènes entre cerveaux d'humain, de chimpanzé et de gorille, pour voir s'il y avait de grosses différences qui expliqueraient notre cerveau de ouf. Des différences, y en a. Jusque-là, je ne serais pas impressioné, pour les raisons évoquées ci-dessus. Mais il ont aussi ajouté plein de contrôles :

  • l'expression des gènes dans les cerveaux de gorille et de chimpanzé se ressemble plus que le chimpanzé ne ressemble à l'humain, bien que le chimpanzé soit plus proche parent de l'humain ; ceci implique que l'expression dans le cerveau ait évolué plus vite chez l'humain.

  • en faisant la même expérience mais avec les globules blancs du sang, les expressions de gènes des trois espèces semblent avoir évolué à la même vitesse, donc l'accélération est au moins en partie cerveau-spécifique.

  • en faisant les mêmes comparaisons entre trois rongeurs, on ne voit de différences ni pour le cerveau ni pour les globules blancs ; ergo, c'est bien humain-spécifique.


Alors cette étude ne date pas d'hier, donc pour écrire ce billet j'ai essayé de me mettre un peu à jour. En commençant par un article de revue (qui résume les autres articles de manière critique et synthétique) du labo de Yoav Gilad (ex postdoc de Pääbo, mais presque tout les bons dans ce domaine lui sont liés semble-t-il), de juillet 2012 (article payant dans Nature Reviews Genetics). Déjà il ne dit pas que Enard 2002 soit tout faux, mais il parle surtout de résultats plus récents.

Un premier résultat cool est que l'expression des gènes semble retardée dans le développement embryonnaire et de l'enfant humain par rapport aux autres primates. Ceci est une confirmation moléculaire de ce que l'on pensait depuis longtemps sur des bases morphologiques et développementales, à savoir que les humains soient néoténiques, signifiant que nos adultes ressemblent aux jeunes de nos ancêtres. Dans une autre étude, ils ont trouvé que les différences d'expression entre humains et autres primates concernaient surtout deux "modules" de gènes, l'un s'occupant de la gestion de l'énergie par le cerveau et l'autre du développement embryonnaire du cerveau. D'un autre coté, plusieurs études semblent avoir trouvé des variations importantes d'expression entre espèces pour d'autres organes et d'autres espèces que le cerveau humain.

Dans une grosse étude récente (dont notre co-bloggueur Philippe Julien est co-auteur, et fait par des collègues dans mon université), il a été trouvé que l'expression des gènes évolue généralement lentement dans le cerveau, sauf chez les primates, et que les modules de gènes à évolution spécifiquement accélérés le sont spécifiquement chez l'humain.

Donc il semble bien qu'il y ait des différences significatives et objectives entre cerveau humain et autres mammifères, même avec le chimpanzé notre frère.

Mais, il y a un mais, l'expression des gènes contrairement au génome varie avec notre environnement, notre état de santé, notre nourriture, l'heure du jour ou de la nuit, la cause de la mort si on vient de mourir (et on arrive rarement à prélever du cerveau sur des animaux ou des personnes vivantes). Or autant on peut bien controler tous ces paramètres pour les souris, autant pour les chimpanzés en cage c'est faisable mais un peu plus compliqué, autant pour les humains c'est n'importe quoi. On prend ce qu'on a comme cadavre ayant donné à la science et on espère qu'il n'était pas trop drogué. De plus, les humains à de très rares exceptions près (et même les chasseurs-ceuilleurs cuisent leur viande) vivent dans un environnement très différent de celui des autres primates. Quelle serait l'expression des gènes d'un chimpanzé vivant comme un humain, et réciproquement ? Il faut bien avouer qu'on n'en sait rien.

Donc des résultats très intéressants, qui confirment notre intuition qu'il y a quelque chose à voir dans cette direction générale des différences d'expression des gènes et des différences entre cerveaux de primates, mais pas encore de conclusion ferme. A suivre et bonne fin de semaine du cerveau.

lundi 11 mars 2013

Semaine du cerveau, y a beau

Cette semaine, semaine spéciale cerveau au C@fé des sciences. Lisez-y plein de beaux billets, et notez que le mien, au lieu de sortir le vendredi comme d'habitude, sortira samedi matin dans un souci de cohérence.

Je vous dit déjà, il portera sur :

Le cerveau humain diffère-t-il de celui des singes ? La réponse dans l’expression des gènes

Bonne semaine !

vendredi 8 mars 2013

Carl Woese a révolutionné la biologie puis est mort sans prix Nobel

[caption id="attachment_857" align="aligncenter" width="98"]pieuvre cliquez sur l'image[/caption]

Tiens on parlait de phylogénie moléculaire, revenons sur un très grand monsieur de la biologie, qui est mort fin 2012 : Carl Woese. Peut-on imaginer un physicien ou un chimiste qui aurait changé par sa recherche le premier chapitre des livres d'introduction à la matière, et en fait la façon dont on considère toute sa discipline, mais n'aurait pas eu de prix Nobel ? Mais voilà, il n'y a pas de prix Nobel en biologie, mais en médecine, ce qui n'est pas la même chose. C'est dégoutant, voilà ce que c'est.

On pensait bien depuis Dawin et ses successeurs que toutes les espèces vivantes étaient apparentées, et que leurs relations avaient la forme d'un arbre. De manière très célèbre, la seule figure dans l'Origine des espèces est un schéma d'arbre des espèces, et la plus ancienne trace de cet idée date de ses brouillons en 1837 :

I think

Dans le siècle et demi qui a suivi, on a fait pas mal de progrès pour faire des arbres phylogénétiques des grosses espèces qu'on voit à l'oeil nu et qui ont plein de caractères permettant aisément de retrouver les parentés les plus évidentes. Les animaux et les plantes donc. Mais pour les micro-organismes, et notamment les bactéries, on restait coincé dans une approche pré-Darwinienne. On classait en gros et petits, en ronds et en longs, en qui réagissent à ce produit chimique et qui ne réagissent pas, et bien sur qui rendent malade ou pas.

Carl Woese a eu le premier l'idée que la génétique moléculaire fournissait des outils pour étudier l'histoire évolutive des bactéries. Toutes les bactéries partagent certaines molécules qui s'occupent de fonctions fondamentales à la survie de la cellule, comme la traduction des gènes en protéines (merci d'applaudir le ribosome !). De manière frappante, surtout par rapport à nos connaissances de l'époque, les gènes codant pour ces molécules, notamment l'ARNr 16S, sont suffisamment conservées entre espèces très différentes pour les comparer, classifier les similarités et les différences, et utiliser cette information pour non seulement classer les espèces au sens de Linné, les ranger dans de jolies boîtes, mais les classer au sens de Darwin, retrouver leur histoire évolutive, leurs relations de parenté. Mieux, ces gènes sont comparables entre les bactéries et les animaux ou les plantes ! Pour la première fois depuis Darwin, en 1977, on peut tracer un arbre phylogénétique incluant toutes les sortes d'espèces vivantes.

Et cet arbre était plein de surprises ! Animaux, plantes et champignons représentent une part de toute petite de la diversité du vivant, trois petites branches tardives au sein de l'embranchement des eucaryotes, qui inclut aussi toutes sortes de microbes dont les cellules marchent à-peu-près comme les notres. Et les autres microbes, qui zont pas de vrai noyau à chromosomes, se partagent en deux groupes d'âge et d'importance équivalent chacun aux eucaryotes, les bactéries "vraies" et les archées, d'abord trouvées dans des environnements dits extrêmes, sources très chaudes, eau très salée, mileu riche en sulfure, etc.

Cette découverte a eu plein de conséquences, je vais surement en oublier. Il devenait possible de classer le vivant de manière phylogénétique. Il devenait possible de classer des espèces dont on ne savait rien que l'ADN. Il devenait possible de comparer des espèces n'ayant aucun trait commun. Avant cela, même classer les relations entre insectes, vertébrés et vers n'était pas faisable. La diversité du monde microscopique devenait visible. Depuis, on a fait plein de progrès, on a nuancé cet arbre en découvrant l'abondance du transfert latéral de gènes entre espèces microbiennes, on a découvert une diversité encore plus grande en séquençant de l'ADN de l'environnement et en le classifiant, on a bien sur grandement amélioré et nos techniques de séquençage d'ADN et d'analyse phylogénétique, mais la contribution de Woese demeure immense.

Et le manque de Nobel met en évidence de la manière la plus forte possible que nous n'avons pas de prix Nobel en biologie.

vendredi 1 mars 2013

Notre génome n'est pas fonctionnel à 80% et je reste poli, moi #ENCODE

[caption id="attachment_839" align="aligncenter" width="138"]girafe Cliquez sur l'image[/caption]

Vous vous rappelez d'ENCODE ? Un méga gros projet de caractérisation de la fonction du génome humain, qui a publié ses résultats en septembre. J'en avais causé ici, et il y avait aussi un bon billet sur le blog bioinfo-fr. Comme discuté à l'époque, l'affirmation selon laquelle 80% du génome était supposément fonctionnelle avait causé pas mal de débats à l'époque, avec notamment les chercheurs en évolution des génomes très peu convaincus, c'est le moins qu'on puisse dire.

Critiquer sur des blogs, c'est bien, mais pour que cela ait un impact dans la communauté scientifique, il faut publier un article dans une revue sérieuse, et il faut que cet article soit lu. Dan Graur et collègues viennent de publier un article remarquable à bien des égards, avec ces objectifs à coeur (et peut-être un tout petit peu l'objectif de faire parler d'eux ;-) ). Déclaration de conflits d'intérêts : j'ai travaillé avec Dan en postdoc il y a longtemps.

L'article est :
On the immortality of television sets: “function” in the human genome according to the evolution-free gospel of ENCODE, Genome Biology and Evolution online before print

Le ton est ... disons inhabituel dans un article scientifique. Je vous invite à aller le lire si vous êtes à l'aise en anglais (il est Libre d'accès). Là pour le coup on a un article scientifique qui n'est pas écrit de manière chiante ! Dan est un habitué du coup, ayant écrit dans le passé les célèbres articles suivants :

Reading the entrails of chickens: molecular timescales of evolution and the illusion of precision. Trends Genet. 2004 Feb;20(2):80-6. (Critique très dure des datations moléculaires, voir billet récent sur les mammifères.)

The Permian bacterium that isn't. Mol Biol Evol. 2001 Jun;18(6):1143-6 (Démontage en règle d'un article rapportant une soi-disant bactérie vivante de 250 Millions d'années d'âge.)

Le ton surprenant de l'article sur ENCODE inclut des phrases telles que :
ENCODE accomplishes these aims mainly by playing fast and loose with the term “function,” by divorcing genomic analysis from its evolutionary context and ignoring a century of population genetics theory, and by employing methods that consistently overestimate functionality, while at the same time being very careful that these estimates do not reach 100%. More generally, the ENCODE Consortium has fallen trap to the genomic equivalent of the human propensity to see meaningful patterns in random data.

Sur le fond, que disent-ils ?

D'abord, qu'il faut distinguer en biologie entre la fonction "sélectionnée", c'est-à-dire qui a un impact sur la survie et la reproduction de l'organisme, par exemple pour le coeur pomper le sang, et la fonction "causale", par exemple pour le coeur faire bouboum-bouboum. La fonction causale existe, elle n'est pas fausse, mais elle n'a que peu d'intérêt pour comprendre la biologie. Graur et al. accusent le consortium ENCODE d'avoir confondu ces deux sens de fonction, en rapportant comme fonctionnel de manière pertinente (= sélectionnée même si ENCODE ne le dit pas) tout ce qui a une fonction détectable expérimentalement. Ce qu'un commentateur de mon billet précédent a excellemment résumé par "ça bouge quand on l’agite".

Le titre de l'article s'explique par l'affirmation de Graur et al. que toute fonction pertinente doit pouvoir être cassée, et le sera si le temps passe et qu'aucune sélection ne l'empêche. Ils affirment que la définition utilisée par ENCODE revient donc à dire qu'il y a des fonctions équivalentes à une télévision immortelle. Rigolo mais bon passons aux choses sérieuses.

Ils sont conscients qu'il peut être difficile de détecter la sélection, qui ne se traduit pas forcément par un ADN parfaitement conservé, mais citent des arguments connus en génétique des populations comme le coût de la sélection sur les mutations dans des régions fonctionnelles (mutational load) pour dire que 80% fonctionnel paraît très invraisemblable en l'état de nos connaissances. Ils citent une étude liée à ENCODE (mais un peu à part) qui trouve au maximum 9% de notre génome sous pression sélective.

Une critique particulièrement dure de la logique d'ENCODE, et probablement correcte est qu'ils les accusent du sophisme (raisonnement erroné) de l'affirmation du conséquent :

  • des régions fonctionnelles du génomes ont une propriété (sont transcrites, l'ADN est accessibles aux enyzmes, etc) ;

  • on trouve beaucoup d'ADN qui a cette propriété ;

  • donc tout cet ADN est des régions fonctionnelles.


Or on sait que tous les processus moléculaires dans une cellule ont une composante stochastique (au hasard quoi), parce qu'on a affaire à très peu de molécules.

Graur et al. critiquent ensuite les 5 principale propriétés utilisées par ENCODE :

  • La transcription, à savoir que l'ADN est copié en ARN qui sert à être traduit en protéines, qui font des choses (enzymes, muscles, tout ça). On sait que des régions non fonctionnelles sont transcrites, notamment les introns, qui sont découpés de l'ARN avant traduction. De même les pseudogènes ou les transposons défaillants, tous transcrits, connus depuis longtemps pour leurs absence de fonction (en tous cas liée à la transcription). A noter qu'on ne dit pas juste que ces choses sont non fonctionnelles parce qu'on ne sait pas ce qu'elles font. Par exemple Graur et al. citent une étude qui a enlevé 96 introns de levures et n'en ont trouvé que 3 qui ont un impact sur la croissance. Or les levures ont un génome beaucoup plus sélectionné que nous, ayant des tailles de population beaucoup beaucoup plus grandes.

  • Les modifications des histones, les protéines qui organisent l'ADN dans la cellule. Une étude de 2010 a trouvé que seul 2% de ces modifications chimiques affectent la fonction d'une manière détectable. On peut avoir raté des trucs, mais dire que toutes ces modifications sont fonctionnelles semble légèrement exagéré en effet.

  • L'ouverture de la chromatine, à savoir que l'ADN est accessible aux protéines. Dans ce cas, ils font une simple affirmation du conséquent, rien à dire de plus.

  • La liaison par des facteurs de transcription, les protéines qui activent ou répressent les gènes. Graur et al ne sont pas convaincus par des sites de liaison détectés de 400 à 800 nucléotides alors que tous les sites de liaison bien déterminés sont de l'ordre de 6 à 14 nucléotides. Ca se discute. Bref.

  • La méthylation du dinucléotide CpG. Bon c'est technique, mais Graur défendent, probablement à raison, que la méthylation est simplement une propriété chimique de CpG et ne dit rien sur la fonction locale de l'ADN.


Une critique très importante, que je traite à part bien que dans le papier elle soit inclue dans le point sur la transcription, est que ENCODE a largement utilisé des cellules tumorales (des cancers en boite de Petri). Il y a une bonne raison pratique : on en a plein, et il y avait besoin de beaucoup de matériel pour faire ENCODE. Mais voilà, dans ces cellules tout est détraqué, et on sait que ni la transcription, ni la structure de l'ADN ne sont comme dans une cellule de notre corps. Non seulement c'est détraqué, mais dans le sense de davantage de transcription et davantage d'activité dans tous les sens. Je confirme, vu que dans mon labo on a essayé d'utiliser ces données et on a du abandonner pour cette raison (pas que ça soit inutile, mais pas utile pour comprendre l'évolution humaine qui nous intéresse).

Une critique un peu technique est qu'apparemment dans leurs statistiques ENCODE a préféré minimiser les faux négatifs (ne rien rater, au risque de détecter des erreurs) que les faux positifs (ne détecter que des trucs corrects, au risque de rater des choses).

Graur et al. discutent de manière assez technique, et correcte (Graur est auteur du livre de référence en évolution moléculaire), des erreurs de biologie évolutive dans la compréhension du "junk DNA" par certains biologistes des génomes. Le plus important à comprendre c'est qu'on ne s'attend pas, sur des bases théoriques solides, à ce que le génome d'organismes à petite population tels que les mammifères (petite par rapport au nombre de bactéries par exemple) soit entièrement fonctionnel, mais au contraire qu'il contiennent beaucoup de choses qui sont inutiles et se sont accumulées par hasard.

Finalement, ils ont une réflexion que je trouve très intéressante sur le contraste entre "grosse science" (CERN, génome humain, etc) et "petite science" (le labo normal où chacun fait ses expériences). Ils proposent que le rôle principal de la grosse science est de générer des données, mais pas de les interpréter, ce qui doit être fait par des chercheurs individuels. Très méchamment, ils disent qu'ENCODE a fait comme les théologiens, ils ont cherché à donner un sens à chaque lettre du texte.

Et pour finir, un peu de ton irrévérent. Ils citent un leader du projet génome humain disant qu'ENCODE est le Google Maps du génome humain, en commentant que non, ENCODE est encore pire que Apple Maps. Puis citent l'adage selon lequel "si c'est trop beau pour être vrai, c'est que c'est trop beau pour être vrai."

Et le coup de grâce :
The ENCODE results were predicted by one of its lead authors to necessitate the rewriting of textbooks (Pennisi 2012). We agree, many textbooks dealing with marketing, mass-media hype, and public relations may well have to be rewritten.

vendredi 22 février 2013

Amusons-nous avec l'évolution humaine et la pilule

[caption id="attachment_817" align="aligncenter" width="144"]time Cliquez sur l'image, c'est pas le plus drole mais c'est très pertinent[/caption]

Il y a quelques temps j'avais parlé d'articles sérieux sur l'évolution humaine présente, à savoir que nous sommes bien sur encore soumis à la sélection naturelle (voir aussi cet article en anglais dans Wired). (Voir aussi Deviendrons-nous débiles et La suite par Tom Roud.)

Pour s'amuser un peu, je propose de réfléchir à quelles autres pressions sélectives peuvent affecter les humains modernes, dans le contexte de la contraception hormonale.

D'abord il faut préciser un point important : la sélection naturelle, pour fonctionner, n'a pas besoin d'être aussi dramatique qu'on l'imagine souvent. Un avantage de 1% (donc 1,01 fois plus de chances d'avoir des descendants qui survivent et ont des descendants) est considéré énorme et généralement peu vraisemblable en contexte naturel. La plupart du temps quand on peut calculer un avantage sélectif on est dans le 1,001 fois plus de chances de reproduction et de survie, voire beaucoup moins. Et plus la population est grande, plus un avantage petit reste significatif. On ne peut pas dire que la population humaine diminue depuis quelques millénaires.

Alors d'abord la pilule marche pas de manière égale chez toutes les femmes. S'il y a un composant génétique à ce que la pilule marche mal chez certaines femmes, ces femmes auront un peu plus d'enfants en moyenne, et les gènes de "résistance" à la pilule vont se propager. Donc ma première prédiction est que la pilule sera de moins en moins efficace en moyenne au bout de quelques centaines de générations d'usage (on se revoit pour en parler, OK ?). Un genre d'analogue à la résistance aux antibiotiques...

Ensuite, une conséquence évidente de la contraception c'est qu'on peut choisir si on a un autre enfant après en avoir eu un premier. Or il y a des bébés et des enfants faciles, qui dorment tout de suite beaucoup, sont calmes, mangent ce qu'on leur donne, etc. Et y a les petits monstres qui ne dorment pas et dont il faut s'occuper tout le temps. Je ne serais pas très surpris si les parents d'enfants faciles avaient un petit plus tendance à avoir un deuxième, voire un troisième, enfant, et si les parents d'enfants difficiles avaient un petit plus tendance à s'arréter là parce que ça va bien. Donc ma deuxième prédiction : des enfants de plus en plus faciles, surtout en tant que bébés. On se réjouit de voir ça.

D'autres idées ?

mardi 12 février 2013

Un petit débat scientifique pour #DarwinDay : fossiles contre ADN chez les mammifères

[caption id="attachment_797" align="aligncenter" width="300"]pterobear Cliquez sur le dessin. Darwin Day plus St Valentin d'un coup.[/caption]

Le 12 février c'est Darwin Day. Youpii !

Chaque fois qu'un groupement d'intérêts bizarre oppose de la pseudo-science aux résultats scientifiques, ils disent qu'il y a "débat". Genre débat créationisme - évolution, débat homéopathie - traitement avec des médicaments qui contiennent quelque chose. Quand nous les scientifiques disons qu'il n'y a pas débat en l'occurence, nous avons l'air de vouloir supprimer un débat à l'apparence légitime. Et comme les vrais débats scientifiques sont souvent abscons et se produisent entre spécialistes qui se balancent des détails méthodologiques à la figure sur des questions qui n'intéressent personne, bin la plupart des gens n'ont aucune référence pour voir à quoi ça devrait ressembler un débat scientifique légitime.

On peut proposer une heuristique (une solution imparfaite mais qui marche souvent ; la page Wikipedia francophone est bizarre, voyez plutôt l'anglophone) : un débat scientifique légitime est chiant. ;-) Mais ça n'est pas vraiment une solution.

Donc parlons d'un vrai débat, qui entre bien dans le cadre du Darwin Day. Molécules contre morphologie !

Il y a de cela plus d'un an j'avais publié un ralage contre la phylogénie obsolète des mammifères présentée au Musée d'histoire naturelle de Paris. Dans un commentaire long et bien argumenté, Nicobola avait défendu l'approche du Musée, haut lieu de la phylogénie à base morphologique. J'avais promis de répondre un jour. Ze Day 'Az Come!

Mais de quoi il cause phylogénie morphologique moléculaire ? Pourquoi ça nous intéresse maintenant ? Il n'y a pas longtemps j'ai parlé d'un article que je trouvais très cool, dans lequel les auteurs ont reconstruit l'état ancestral du génome des mammifères placentaires (nous, et les baleines gentilles, et les chiens mignons, mais pas les kangourous qui puent ni les ornithorynques qui piquent), et en ont déduit que notre ancêtre à tous qui vivait du temps des dinosaures était nettement plus gros qu'on ne le pensait habituellement. On le pense habituellement sur la base de fossiles. Cette étude-ci était basée sur les données moléculaires (analyse de l'ADN).

Et cette semaine vient de sortir avec grand tintamarre un article dans Science qui montre que l'ancêtre commun des placentaires a vécu beaucoup plus récemment que l'on ne le pensait ces dernières années, en fait après la disparition des dinosaures, et ils ont reconstruit l'ancêtre, et il est tout petit et très conforme à l'idée qu'on se fait habituellement d'un genre d'insectivore discret à doigts de souris. Dans cette étude-ci, ils ont combiné de l'information morphologique d'espèces vivantes (40), d'espèces fossiles (46), et de l'information moléculaire (mais pas trop : 27 gènes, soit 1/1000ème du génome codant, qui est 1% du génome).

Donc deux articles sérieux, par de bons chercheurs, appuyés sur des données solides, qui obtiennent des résultats contradictoires. La dernière manche en date d'un combat qui se livre depuis le début des années 1990 ; avantage aux morphologistes (à savoir qu'ils ont publié dans une plus grosse revue et ils ont eu davantage de couverture dans la presse).

Déclaration de conflit d'intérêts : je fais de l'évolution moléculaire ; je connais le chef de l'article moléculaire cité ci-dessus depuis plus de 20 ans ; j'ai travaillé sur la phylogénie moléculaire des mammifères dans ma thèse et postdoc. Mais j'ai des arguments !

Qu'ont-ils fait dans l'article morphologique récent ? Y a plus de 100 pages de matériel supplémentaire que je n'ai pas lu, donc je n'irais pas dans le détail, mais en gros ils ont rassemblé la plus énorme collection de caractères morphologiques jamais analysée à ma connaissance : 4541 caractères. Pour comprendre de quoi il retourne, il faut savoir qu'en analyse morphologique on ne peut pas mettre des cranes et des poils direcement dans le logiciel, donc il faut recoder la morphologie. Etape super importante, avec plusieurs problèmes potentiels : le risque de subjectivité, si vous codez plutôt ce qui vous arrange ; le risque de ne pas suffisamment détailler, et donc perdre de l'information ; le risque de trop détailler, et donc faire apparaître comme plusieurs caractères ce qui n'est en fait que plusieurs aspects du même. Kesako caractère ? Par exemple le poids de la bête, ou la forme du sperme (si si c'est dans le papier). Ensuite ils ont construit une phylogénie, à savoir les relations évolutives entre les espèces (vache plus proche de mouton que de chien etc). Permettez-moi de persifler un peu : j'ai l'impression que les 27 gènes sont là pour empécher que les données morphologiques toutes seules échouent trop fort à récuperer ce que l'on connaît très bien maintenant de l'arbre des mammifères, et que l'on connaît grace au signal des données moléculaires. 40% des branchements seulement sont cohérents quand ils séparent les données.

Etape suivante et c'est ce qui fait le scoop du papier, ils ont reconstruit l'age et la tronche de l'ancêtre. Pour l'age, vous vous rappelez que des fossiles étaient inclus dans l'analyse ? Les fossiles ça a cela de bien que c'est ancien, et on connaît son âge (avec une certaine précision). Or ces fossiles pas très vieux se placent tout en bas de l'arbre. Donc l'origine de l'arbre n'est pas très vieille. Donc les mammifères placentaires modernes se seraient diversifiés après la disparition des dinosaures. Ensuite pour reconstruire l'ancêtre ils utilisent la parcimonie, à savoir que si deux espèces partagent un trait, leur ancêtre l'avait (en gros).

Un reproche fait même dans le commentaire par ailleurs normalement positif dans Science, c'est qu'ils n'ont pas pris en compte la quantité d'évolution mesurée par les gènes dans l'analyse. Alors là je suis ambigu, parce que je n'ai jamais eu trop confiance dans les mesures dites "d'horloge moléculaire", qui comptent le nombre de changements dans l'ADN et divisent par le taux de mutations fixées dans l'évolution pour trouver la date. Il y a tellement de facteurs qui peuvent faire varier ces taux de mutation ou de fixation. Ceci dit, je doit bien reconnaître que les méthodes pour faire cela ont énormément progressé, et il est probablement en effet abusif de ne pas prendre en compte cette information du tout.

Un problème un peu plus grave à mon sens est que toute cette analyse morphologique se base sur une analyse de parcimonie de caractères morphologique. Or la parcimonie est une approche relativement simple qui n'inclut pas d'étape de modélisation de l'évolution. Quelque part la modélisation est implicite dans le choix des caractères à coder. Mais tout-de-même, il a été montré plusieurs fois que la parcimonie peut se tromper très fortement lorsque l'évolution suit des chemins biscornus, par exemple avec certaines espèces qui évoluent beaucoup plus vite que d'autres, ou une divergence très forte dans les fréquences des caractères entre espèces, ou des changements dans l'état d'équilibre (vers quoi tend le système évolutif) dans le temps. Et donc avec plein plein de données mais une méthode que je qualifierais quand même de naive au sens méthodologique (je ne veux pas dire que les collègues soient naifs, mais plutôt que la méthode ne peut pas être élaborée de par sa nature même), j'ai peur qu'on trouve un résultat quelque part évident, un espèce d'image moyenne de tous les mammifères, qui est donc ce petit insectivore déjà prédit intuitivement par Simpson dans les années 1940.

Alors que les données moléculaires, qui ont le désavantage de ne pas avoir de fossiles, ont deux avantages pas utilisés du tout ici, mais dans l'étude discutée précédemment si : il y en a beaucoup beaucoup, donc puissance statistique même avec modèle complexe, et comme l'ADN c'est relativement simple et répétitif (les 4541 caractères morphologiques incluent des tailles, des formes, des présence-absence, etc ; l'ADN inclut quatre variants chimiques : A, C, G, T), on peut légitimement construire des modèles basés sur une abstraction du nucléotide. Avec ces modèles, on peut prendre en compte les vitesses d'évolution très différentes ou les changements d'état d'équilibre, et donc par exemple trouver que l'ancêtre commun était différent de la moyenne des espèces modernes (jolie démonstration ici).

Donc si l'évolution a inclus un ancêtre common gros rustre, puis une évolution générale vers le plus petit avec perte des caractères morphologiques correspondant (genre survivire au monde Mad Maxien post-météorite géante), puis des opportunités pour re-grossir, un modèle suffisamment complexe nourri de suffisamment de données pourra retrouver cela avec du bol, mais une reconstuction parcimonieuse, non.

Et l'age pas si ancien ? Comme je le disais, je n'ai pas tout regardé en détail, mais il semble qu'ils utilisent les fossiles comme dates absolues, alors qu'un fossile ne donne que l'age minimum d'une espèce : s'il y a un fossile de 50 millions d'années, l'espèce devait exister il y a 50 millions d'années, mais elle pouvait exister plus tôt et on n'a pas de fossiles. Si je me trompe corrigez-moi (discussion intéressante en anglais sur le blog WhyEvolutionIsTrue; voir aussi ce commentaire). Mais surtout, ces fossiles ont été placés dans l'arbre (de parcimonie) par parcimonie. Ergo, tous les problèmes ci-dessus s'appliquent.

Ne me faites pas dire ce que je n'ai pas dit : j'adore les fossiles et les paléontologues. C'est uniquement de cette manière que l'on peut connaître énormément de points du passé. Mais il me semble que parfois les morphologistes ont tendance à se comporter comme les personnes du mythe de la caverne : ils commentent à l'envi les formes qui sont des produits du matériel héréditaire, quand ils veulent connaître l'histoire du matériel héréditaire. Ouvrez les yeux ! Sortez ! Depuis plus de 20 ans, on a accès directement au matériel héréditaire ! Donc quand on veut connaître cette histoire-là, faisons-le directement. Je maintiens que la phylogénie moléculaire est largement supérieure à la phylogénie morphologique, pour les raisons méthodologiqus citées ci-dessus, et parce que l'on mesure directement ce qui nous intéresse. Maintenant pour ce qui est de l'évolution de la forme, c'est l'inverse. Dans les gènes on ne voit que des indices, et c'est la forme des fossiles qui nous informe réellement sur à quoi qu'ils ressemblaient nos beaux ancêtres. Pas beau ça ?

vendredi 8 février 2013

Doit-on montrer le code informatique des scientifiques même s'il est moche ?

[caption id="attachment_631" align="aligncenter" width="103"] cliquez sur l'image (puis laissez la souris au-dessus de l'image pour voir le texte alternatif) (et si vous riez, vous êtes un affreux geek)[/caption]

En science on écrit beaucoup de code informatique. On écrit de gros programmes pour traiter plein de données (génomique, résultats du CERN), d'autres gros programmes pour simuler de gros modèles pour quand la réalité est complexe (le climat, les populations humaines), encore des gros programmes pour traiter des données compliquées (des structures cristallographiques). Et on écrit des petits programmes tout le temps : pour lier les gros entre eux, pour mettre les données au bon format, pour faire un petit calcul pas standard dans le logiciel, pour répéter une opération simple plein de fois, etc. (Je précise qu'il existe aussi des scientifiques qui ne programment pas. Il n'est pas question d'eux aujourd'hui.)

Au bilan, la qualité et la fiabilité de nos résultats scientifiques dépendent pas mal de tout ce code.

Et qu'est qu'on en fait, le plus souvent ? On l'écrit vite et mal, on le teste à peine, on ne le commente pas, et on le paume quelque part dans un sous-dossier de notre disque dur. La honte.

Une excellente analogie que j'ai trouvée récemment (document PDF) : peut-on imaginer que les mathématiciens publient leurs théorèmes sans montrer les preuves, parce que c'est du boulot de les mettre en forme, parce que chaque preuve est particulière à un problème et pas très utile ailleurs, c'est plus rentable de travailler sur un nouveau problème que de polir cette preuve pour publication, en fait ma preuve ne marche pas dans tous les cas mais dans le cas qui m'intéresse ça marchait, en fait c'est mon étudiant qui a fait la preuve et je ne l'ai plus, la preuve va me re-servir pour d'autres théorèmes alors je ne vais pas la donner à mes compétiteurs, les papiers avec des preuves seraient trop longs et les experts ne vont pas s'embéter à lire tout ça, ma preuve s'appuie sur un logiciel commercial (genre MatLab), vous pourrez pas vous en servir, etc.

Pour de vrai, les mathématicens publient leurs preuves, mais les scientifiques ne publient pas leur (notre) code, et nos arguments sont à-peu-près ceux ci-dessus.

Le point qui fait le plus débat est le compromis entre le travail nécessaire à rendre son code informatique présentable, et la pertinence de publier du code "sale". Ca fait longtemps que j'ai ce billet en brouillon et je veux le publier et je ne vais pas réussir à écrire tout ce que je voudrais, alors je vais mettre quelques liens intéressants avec des résumés :

  • Iddo Friedberg a fait un excellent bilan sur son blog Byte Size Biology, avec une analogie très drôle au film "Piranha 3D", et conclut qu'en l'état il n'a pas les moyens de faire du code propre, et ne veut pas partager du code pas propre, mais propose une nouvelle initiative, le Bioinformatic Testing Consortium,

  • Dans Nature, un article Publish your computer code: it is good enough argue que même si le code n'est pas beau ni propre ni aux règles, il faut le publier, ça fait partie de la démarche scientifique.

  • Un autre article dans Nature, Computational science: ...Error, prends plus ou moins l'angle inverse, et dit qu'il faut former tous les scientifiques au génie logiciel propre.

  • Un blog anonyme réagit à Iddo en disant que le but de la science n'est pas des logiciels, et donc des tests systématiques ne sont pas justifiés.

  • Un autre bloguer, Titus Brown, donne de bonnes raisons pour écrire du code proprement en respectant les règles, et donne de bons conseils pour le faire efficacement. Super citation de Darwin :
    "Ignorance more frequently begets confidence than does knowledge"


  • Sur le forum Biostar, un bioinformaticien anonyme dit que de documenter et publier son code est du même ordre de grandeur que de noter ses procédures expérimentales : indispensable. (LOLcat si vous suivez le lien)

  • John Graham-Cumming note que le problème se pose avec encore plus de force dans l'étude du climat, où l'obscurité des méthodes devient un argument politique.


Un gros problème est qu'en science on doit souvent écrire du code pour des projets qui se développent au fur et à mesure, sans savoir où on sera demain, et quel bout de code finira inutile et lequel produira le résultat critique pour la suite, voire lequel servira de base à une nouvelle méthode utilisée par ses collègues. Le fait est que dans la plupart des cas le code est vite fait - mal fait.

Il s'ajoute un autre problème : on a beau vous expliquer que si vous programmez proprement vous gagnerez du temps sur le long terme gnagnagna, vous souci premier est toujours d'obtenir le résultat. Alors on revient à #overlyhonestmethods, on fait souvent ce qu'il faut pour avancer, à coups de rubban adhésif. Mais publier son code, c'est pas un peu mettre #overlyhonestmethods dans ses articles officiels ?

A quoi je répondrais qu'il faut qu'on y passe. Trop de nos résultats sont dépendants de notre code pour le cacher. Et l'effort fait aujourd'hui payera demain, avec un code mieux débuggé et plus efficace même pour nous, avec plus de facilité à retrouver ce qu'on a fait dans 5 ans quand on aura tout oublié mais que l'article sera toujours là avec son code à-peu-près propre. Oui à-peu-près parce que je pense que pour que ça marche il faut accepter qu'on ne va généralement pas avoir du code informatique de qualité professionnelle.

Alors en pratique que faire ? Demander aux journaux scientifiques de demander le code, le demander en tant qu'expert ; publier son propre code (un peu tard pour moi, je fous plus rien en programmation) ; demander à ses collègues et étudiants de publier le leur (grosse résistance en vue) ; former les étudiants a minima à la programmation propre ; participer à des initiatives comme celle d'Iddo. Et espérer que les attitudes vont changer.

Mise à jour : @JeanFred nous signale l'existence du Science code manifesto, par le Climate Code Foundation, qui traite de ces mêmes questions.

vendredi 25 janvier 2013

Pourquoi est-ce que j'ai dit non à un "challenge" de Philip Morris International ?

[caption id="attachment_763" align="aligncenter" width="215"]snazzy Cliquez sur l'image[/caption]

J'ai récemment été contacté pour participer à un challenge intéressant et pertinent à ma recherche, dans le cadre du Systems Biology Verification (SBV) IMPROVER project. Le hic, c'est que c'est organisé et financé par Philip Morris International, une petite compagnie de tabac dont vous avez peut-être entendu parler.

J'ai dit non.

Alors ceci pose la question : pourquoi ai-je dit non, alors que j'aurais peut-être dit oui si c'était financé par une autre industrie ?

Dans une industrie normale, la recherche & développement peut avoir des objectifs légitime. Même que s'il n'y en avait pas, ça serait bien embêtant. Ces industries répondent à des besoins légitimes. On peut discuter de la mise en oeuvre, et penser que certaines chose pourraient être mieux faites, mais quelque chose doit être fait. Par exemple le junk food c'est pas bien, mais faut bien manger, donc il y a la place pour pour une R&D légitime et utile dans l'agro-alimentaire. Les gros 4x4 c'est pas bien, mais faut bien se déplacer, et y a de la place pour une R&D légitime et utile sur des moteurs économes et peu poluants. Etc.

Mais quel peut être l'objectif de la R&D dans l'industrie du tabac ? Rendre le tabac légèrement moins dangereux ? Y a plus simple : y a qu'à pas fumer. Ce n'est pas un besoin légitime. Et la recherche soutenue par l'industrie du tabac a un autre intérêt : semer le trouble et le doute sur la recherche qui montre de manière claire et non ambigue que le tabac est un abominable poison. Ca peut être subtil, souvent en soutenant de la recherche sur des causes légitimes permettant de mettre le projecteur ailleurs.

Dans le cas de ce "Challenge", le thème est "Species translation", et semble être sur les problèmes de transfer des résultats expérimentaux entre espèces. Par exemple les problèmes à étendre à l'humain des résultats de toxicologie établis chez des rats ou des souris. C'est bien une question légitime, mais on sent qu'il y a un certain avantage pour le producteur de produits toxiques à mettre ceci en avant.

Mise à jour : version anglaise du billet sur mon nouveau blog universitaire en anglais, pour ceux qui veulent partager avec des non francophones.