Cette semaine, semaine spéciale cerveau au C@fé des sciences. Lisez-y plein de beaux billets, et notez que le mien, au lieu de sortir le vendredi comme d'habitude, sortira samedi matin dans un souci de cohérence.
Je vous dit déjà, il portera sur :
Le cerveau humain diffère-t-il de celui des singes ? La réponse dans l’expression des gènes
Bonne semaine !
lundi 11 mars 2013
vendredi 8 mars 2013
Carl Woese a révolutionné la biologie puis est mort sans prix Nobel
[caption id="attachment_857" align="aligncenter" width="98"]
cliquez sur l'image[/caption]
Tiens on parlait de phylogénie moléculaire, revenons sur un très grand monsieur de la biologie, qui est mort fin 2012 : Carl Woese. Peut-on imaginer un physicien ou un chimiste qui aurait changé par sa recherche le premier chapitre des livres d'introduction à la matière, et en fait la façon dont on considère toute sa discipline, mais n'aurait pas eu de prix Nobel ? Mais voilà, il n'y a pas de prix Nobel en biologie, mais en médecine, ce qui n'est pas la même chose. C'est dégoutant, voilà ce que c'est.
On pensait bien depuis Dawin et ses successeurs que toutes les espèces vivantes étaient apparentées, et que leurs relations avaient la forme d'un arbre. De manière très célèbre, la seule figure dans l'Origine des espèces est un schéma d'arbre des espèces, et la plus ancienne trace de cet idée date de ses brouillons en 1837 :

Dans le siècle et demi qui a suivi, on a fait pas mal de progrès pour faire des arbres phylogénétiques des grosses espèces qu'on voit à l'oeil nu et qui ont plein de caractères permettant aisément de retrouver les parentés les plus évidentes. Les animaux et les plantes donc. Mais pour les micro-organismes, et notamment les bactéries, on restait coincé dans une approche pré-Darwinienne. On classait en gros et petits, en ronds et en longs, en qui réagissent à ce produit chimique et qui ne réagissent pas, et bien sur qui rendent malade ou pas.
Carl Woese a eu le premier l'idée que la génétique moléculaire fournissait des outils pour étudier l'histoire évolutive des bactéries. Toutes les bactéries partagent certaines molécules qui s'occupent de fonctions fondamentales à la survie de la cellule, comme la traduction des gènes en protéines (merci d'applaudir le ribosome !). De manière frappante, surtout par rapport à nos connaissances de l'époque, les gènes codant pour ces molécules, notamment l'ARNr 16S, sont suffisamment conservées entre espèces très différentes pour les comparer, classifier les similarités et les différences, et utiliser cette information pour non seulement classer les espèces au sens de Linné, les ranger dans de jolies boîtes, mais les classer au sens de Darwin, retrouver leur histoire évolutive, leurs relations de parenté. Mieux, ces gènes sont comparables entre les bactéries et les animaux ou les plantes ! Pour la première fois depuis Darwin, en 1977, on peut tracer un arbre phylogénétique incluant toutes les sortes d'espèces vivantes.
Et cet arbre était plein de surprises ! Animaux, plantes et champignons représentent une part de toute petite de la diversité du vivant, trois petites branches tardives au sein de l'embranchement des eucaryotes, qui inclut aussi toutes sortes de microbes dont les cellules marchent à-peu-près comme les notres. Et les autres microbes, qui zont pas de vrai noyau à chromosomes, se partagent en deux groupes d'âge et d'importance équivalent chacun aux eucaryotes, les bactéries "vraies" et les archées, d'abord trouvées dans des environnements dits extrêmes, sources très chaudes, eau très salée, mileu riche en sulfure, etc.
Cette découverte a eu plein de conséquences, je vais surement en oublier. Il devenait possible de classer le vivant de manière phylogénétique. Il devenait possible de classer des espèces dont on ne savait rien que l'ADN. Il devenait possible de comparer des espèces n'ayant aucun trait commun. Avant cela, même classer les relations entre insectes, vertébrés et vers n'était pas faisable. La diversité du monde microscopique devenait visible. Depuis, on a fait plein de progrès, on a nuancé cet arbre en découvrant l'abondance du transfert latéral de gènes entre espèces microbiennes, on a découvert une diversité encore plus grande en séquençant de l'ADN de l'environnement et en le classifiant, on a bien sur grandement amélioré et nos techniques de séquençage d'ADN et d'analyse phylogénétique, mais la contribution de Woese demeure immense.
Et le manque de Nobel met en évidence de la manière la plus forte possible que nous n'avons pas de prix Nobel en biologie.
Tiens on parlait de phylogénie moléculaire, revenons sur un très grand monsieur de la biologie, qui est mort fin 2012 : Carl Woese. Peut-on imaginer un physicien ou un chimiste qui aurait changé par sa recherche le premier chapitre des livres d'introduction à la matière, et en fait la façon dont on considère toute sa discipline, mais n'aurait pas eu de prix Nobel ? Mais voilà, il n'y a pas de prix Nobel en biologie, mais en médecine, ce qui n'est pas la même chose. C'est dégoutant, voilà ce que c'est.
On pensait bien depuis Dawin et ses successeurs que toutes les espèces vivantes étaient apparentées, et que leurs relations avaient la forme d'un arbre. De manière très célèbre, la seule figure dans l'Origine des espèces est un schéma d'arbre des espèces, et la plus ancienne trace de cet idée date de ses brouillons en 1837 :
Dans le siècle et demi qui a suivi, on a fait pas mal de progrès pour faire des arbres phylogénétiques des grosses espèces qu'on voit à l'oeil nu et qui ont plein de caractères permettant aisément de retrouver les parentés les plus évidentes. Les animaux et les plantes donc. Mais pour les micro-organismes, et notamment les bactéries, on restait coincé dans une approche pré-Darwinienne. On classait en gros et petits, en ronds et en longs, en qui réagissent à ce produit chimique et qui ne réagissent pas, et bien sur qui rendent malade ou pas.
Carl Woese a eu le premier l'idée que la génétique moléculaire fournissait des outils pour étudier l'histoire évolutive des bactéries. Toutes les bactéries partagent certaines molécules qui s'occupent de fonctions fondamentales à la survie de la cellule, comme la traduction des gènes en protéines (merci d'applaudir le ribosome !). De manière frappante, surtout par rapport à nos connaissances de l'époque, les gènes codant pour ces molécules, notamment l'ARNr 16S, sont suffisamment conservées entre espèces très différentes pour les comparer, classifier les similarités et les différences, et utiliser cette information pour non seulement classer les espèces au sens de Linné, les ranger dans de jolies boîtes, mais les classer au sens de Darwin, retrouver leur histoire évolutive, leurs relations de parenté. Mieux, ces gènes sont comparables entre les bactéries et les animaux ou les plantes ! Pour la première fois depuis Darwin, en 1977, on peut tracer un arbre phylogénétique incluant toutes les sortes d'espèces vivantes.
Et cet arbre était plein de surprises ! Animaux, plantes et champignons représentent une part de toute petite de la diversité du vivant, trois petites branches tardives au sein de l'embranchement des eucaryotes, qui inclut aussi toutes sortes de microbes dont les cellules marchent à-peu-près comme les notres. Et les autres microbes, qui zont pas de vrai noyau à chromosomes, se partagent en deux groupes d'âge et d'importance équivalent chacun aux eucaryotes, les bactéries "vraies" et les archées, d'abord trouvées dans des environnements dits extrêmes, sources très chaudes, eau très salée, mileu riche en sulfure, etc.
Cette découverte a eu plein de conséquences, je vais surement en oublier. Il devenait possible de classer le vivant de manière phylogénétique. Il devenait possible de classer des espèces dont on ne savait rien que l'ADN. Il devenait possible de comparer des espèces n'ayant aucun trait commun. Avant cela, même classer les relations entre insectes, vertébrés et vers n'était pas faisable. La diversité du monde microscopique devenait visible. Depuis, on a fait plein de progrès, on a nuancé cet arbre en découvrant l'abondance du transfert latéral de gènes entre espèces microbiennes, on a découvert une diversité encore plus grande en séquençant de l'ADN de l'environnement et en le classifiant, on a bien sur grandement amélioré et nos techniques de séquençage d'ADN et d'analyse phylogénétique, mais la contribution de Woese demeure immense.
Et le manque de Nobel met en évidence de la manière la plus forte possible que nous n'avons pas de prix Nobel en biologie.
vendredi 1 mars 2013
Notre génome n'est pas fonctionnel à 80% et je reste poli, moi #ENCODE
[caption id="attachment_839" align="aligncenter" width="138"]
Cliquez sur l'image[/caption]
Vous vous rappelez d'ENCODE ? Un méga gros projet de caractérisation de la fonction du génome humain, qui a publié ses résultats en septembre. J'en avais causé ici, et il y avait aussi un bon billet sur le blog bioinfo-fr. Comme discuté à l'époque, l'affirmation selon laquelle 80% du génome était supposément fonctionnelle avait causé pas mal de débats à l'époque, avec notamment les chercheurs en évolution des génomes très peu convaincus, c'est le moins qu'on puisse dire.
Critiquer sur des blogs, c'est bien, mais pour que cela ait un impact dans la communauté scientifique, il faut publier un article dans une revue sérieuse, et il faut que cet article soit lu. Dan Graur et collègues viennent de publier un article remarquable à bien des égards, avec ces objectifs à coeur (et peut-être un tout petit peu l'objectif de faire parler d'eux ;-) ). Déclaration de conflits d'intérêts : j'ai travaillé avec Dan en postdoc il y a longtemps.
L'article est :
On the immortality of television sets: “function” in the human genome according to the evolution-free gospel of ENCODE, Genome Biology and Evolution online before print
Le ton est ... disons inhabituel dans un article scientifique. Je vous invite à aller le lire si vous êtes à l'aise en anglais (il est Libre d'accès). Là pour le coup on a un article scientifique qui n'est pas écrit de manière chiante ! Dan est un habitué du coup, ayant écrit dans le passé les célèbres articles suivants :
Reading the entrails of chickens: molecular timescales of evolution and the illusion of precision. Trends Genet. 2004 Feb;20(2):80-6. (Critique très dure des datations moléculaires, voir billet récent sur les mammifères.)
The Permian bacterium that isn't. Mol Biol Evol. 2001 Jun;18(6):1143-6 (Démontage en règle d'un article rapportant une soi-disant bactérie vivante de 250 Millions d'années d'âge.)
Le ton surprenant de l'article sur ENCODE inclut des phrases telles que :
Sur le fond, que disent-ils ?
D'abord, qu'il faut distinguer en biologie entre la fonction "sélectionnée", c'est-à-dire qui a un impact sur la survie et la reproduction de l'organisme, par exemple pour le coeur pomper le sang, et la fonction "causale", par exemple pour le coeur faire bouboum-bouboum. La fonction causale existe, elle n'est pas fausse, mais elle n'a que peu d'intérêt pour comprendre la biologie. Graur et al. accusent le consortium ENCODE d'avoir confondu ces deux sens de fonction, en rapportant comme fonctionnel de manière pertinente (= sélectionnée même si ENCODE ne le dit pas) tout ce qui a une fonction détectable expérimentalement. Ce qu'un commentateur de mon billet précédent a excellemment résumé par "ça bouge quand on l’agite".
Le titre de l'article s'explique par l'affirmation de Graur et al. que toute fonction pertinente doit pouvoir être cassée, et le sera si le temps passe et qu'aucune sélection ne l'empêche. Ils affirment que la définition utilisée par ENCODE revient donc à dire qu'il y a des fonctions équivalentes à une télévision immortelle. Rigolo mais bon passons aux choses sérieuses.
Ils sont conscients qu'il peut être difficile de détecter la sélection, qui ne se traduit pas forcément par un ADN parfaitement conservé, mais citent des arguments connus en génétique des populations comme le coût de la sélection sur les mutations dans des régions fonctionnelles (mutational load) pour dire que 80% fonctionnel paraît très invraisemblable en l'état de nos connaissances. Ils citent une étude liée à ENCODE (mais un peu à part) qui trouve au maximum 9% de notre génome sous pression sélective.
Une critique particulièrement dure de la logique d'ENCODE, et probablement correcte est qu'ils les accusent du sophisme (raisonnement erroné) de l'affirmation du conséquent :
Or on sait que tous les processus moléculaires dans une cellule ont une composante stochastique (au hasard quoi), parce qu'on a affaire à très peu de molécules.
Graur et al. critiquent ensuite les 5 principale propriétés utilisées par ENCODE :
Une critique très importante, que je traite à part bien que dans le papier elle soit inclue dans le point sur la transcription, est que ENCODE a largement utilisé des cellules tumorales (des cancers en boite de Petri). Il y a une bonne raison pratique : on en a plein, et il y avait besoin de beaucoup de matériel pour faire ENCODE. Mais voilà, dans ces cellules tout est détraqué, et on sait que ni la transcription, ni la structure de l'ADN ne sont comme dans une cellule de notre corps. Non seulement c'est détraqué, mais dans le sense de davantage de transcription et davantage d'activité dans tous les sens. Je confirme, vu que dans mon labo on a essayé d'utiliser ces données et on a du abandonner pour cette raison (pas que ça soit inutile, mais pas utile pour comprendre l'évolution humaine qui nous intéresse).
Une critique un peu technique est qu'apparemment dans leurs statistiques ENCODE a préféré minimiser les faux négatifs (ne rien rater, au risque de détecter des erreurs) que les faux positifs (ne détecter que des trucs corrects, au risque de rater des choses).
Graur et al. discutent de manière assez technique, et correcte (Graur est auteur du livre de référence en évolution moléculaire), des erreurs de biologie évolutive dans la compréhension du "junk DNA" par certains biologistes des génomes. Le plus important à comprendre c'est qu'on ne s'attend pas, sur des bases théoriques solides, à ce que le génome d'organismes à petite population tels que les mammifères (petite par rapport au nombre de bactéries par exemple) soit entièrement fonctionnel, mais au contraire qu'il contiennent beaucoup de choses qui sont inutiles et se sont accumulées par hasard.
Finalement, ils ont une réflexion que je trouve très intéressante sur le contraste entre "grosse science" (CERN, génome humain, etc) et "petite science" (le labo normal où chacun fait ses expériences). Ils proposent que le rôle principal de la grosse science est de générer des données, mais pas de les interpréter, ce qui doit être fait par des chercheurs individuels. Très méchamment, ils disent qu'ENCODE a fait comme les théologiens, ils ont cherché à donner un sens à chaque lettre du texte.
Et pour finir, un peu de ton irrévérent. Ils citent un leader du projet génome humain disant qu'ENCODE est le Google Maps du génome humain, en commentant que non, ENCODE est encore pire que Apple Maps. Puis citent l'adage selon lequel "si c'est trop beau pour être vrai, c'est que c'est trop beau pour être vrai."
Et le coup de grâce :
Vous vous rappelez d'ENCODE ? Un méga gros projet de caractérisation de la fonction du génome humain, qui a publié ses résultats en septembre. J'en avais causé ici, et il y avait aussi un bon billet sur le blog bioinfo-fr. Comme discuté à l'époque, l'affirmation selon laquelle 80% du génome était supposément fonctionnelle avait causé pas mal de débats à l'époque, avec notamment les chercheurs en évolution des génomes très peu convaincus, c'est le moins qu'on puisse dire.
Critiquer sur des blogs, c'est bien, mais pour que cela ait un impact dans la communauté scientifique, il faut publier un article dans une revue sérieuse, et il faut que cet article soit lu. Dan Graur et collègues viennent de publier un article remarquable à bien des égards, avec ces objectifs à coeur (et peut-être un tout petit peu l'objectif de faire parler d'eux ;-) ). Déclaration de conflits d'intérêts : j'ai travaillé avec Dan en postdoc il y a longtemps.
L'article est :
On the immortality of television sets: “function” in the human genome according to the evolution-free gospel of ENCODE, Genome Biology and Evolution online before print
Le ton est ... disons inhabituel dans un article scientifique. Je vous invite à aller le lire si vous êtes à l'aise en anglais (il est Libre d'accès). Là pour le coup on a un article scientifique qui n'est pas écrit de manière chiante ! Dan est un habitué du coup, ayant écrit dans le passé les célèbres articles suivants :
Reading the entrails of chickens: molecular timescales of evolution and the illusion of precision. Trends Genet. 2004 Feb;20(2):80-6. (Critique très dure des datations moléculaires, voir billet récent sur les mammifères.)
The Permian bacterium that isn't. Mol Biol Evol. 2001 Jun;18(6):1143-6 (Démontage en règle d'un article rapportant une soi-disant bactérie vivante de 250 Millions d'années d'âge.)
Le ton surprenant de l'article sur ENCODE inclut des phrases telles que :
ENCODE accomplishes these aims mainly by playing fast and loose with the term “function,” by divorcing genomic analysis from its evolutionary context and ignoring a century of population genetics theory, and by employing methods that consistently overestimate functionality, while at the same time being very careful that these estimates do not reach 100%. More generally, the ENCODE Consortium has fallen trap to the genomic equivalent of the human propensity to see meaningful patterns in random data.
Sur le fond, que disent-ils ?
D'abord, qu'il faut distinguer en biologie entre la fonction "sélectionnée", c'est-à-dire qui a un impact sur la survie et la reproduction de l'organisme, par exemple pour le coeur pomper le sang, et la fonction "causale", par exemple pour le coeur faire bouboum-bouboum. La fonction causale existe, elle n'est pas fausse, mais elle n'a que peu d'intérêt pour comprendre la biologie. Graur et al. accusent le consortium ENCODE d'avoir confondu ces deux sens de fonction, en rapportant comme fonctionnel de manière pertinente (= sélectionnée même si ENCODE ne le dit pas) tout ce qui a une fonction détectable expérimentalement. Ce qu'un commentateur de mon billet précédent a excellemment résumé par "ça bouge quand on l’agite".
Le titre de l'article s'explique par l'affirmation de Graur et al. que toute fonction pertinente doit pouvoir être cassée, et le sera si le temps passe et qu'aucune sélection ne l'empêche. Ils affirment que la définition utilisée par ENCODE revient donc à dire qu'il y a des fonctions équivalentes à une télévision immortelle. Rigolo mais bon passons aux choses sérieuses.
Ils sont conscients qu'il peut être difficile de détecter la sélection, qui ne se traduit pas forcément par un ADN parfaitement conservé, mais citent des arguments connus en génétique des populations comme le coût de la sélection sur les mutations dans des régions fonctionnelles (mutational load) pour dire que 80% fonctionnel paraît très invraisemblable en l'état de nos connaissances. Ils citent une étude liée à ENCODE (mais un peu à part) qui trouve au maximum 9% de notre génome sous pression sélective.
Une critique particulièrement dure de la logique d'ENCODE, et probablement correcte est qu'ils les accusent du sophisme (raisonnement erroné) de l'affirmation du conséquent :
- des régions fonctionnelles du génomes ont une propriété (sont transcrites, l'ADN est accessibles aux enyzmes, etc) ;
- on trouve beaucoup d'ADN qui a cette propriété ;
- donc tout cet ADN est des régions fonctionnelles.
Or on sait que tous les processus moléculaires dans une cellule ont une composante stochastique (au hasard quoi), parce qu'on a affaire à très peu de molécules.
Graur et al. critiquent ensuite les 5 principale propriétés utilisées par ENCODE :
- La transcription, à savoir que l'ADN est copié en ARN qui sert à être traduit en protéines, qui font des choses (enzymes, muscles, tout ça). On sait que des régions non fonctionnelles sont transcrites, notamment les introns, qui sont découpés de l'ARN avant traduction. De même les pseudogènes ou les transposons défaillants, tous transcrits, connus depuis longtemps pour leurs absence de fonction (en tous cas liée à la transcription). A noter qu'on ne dit pas juste que ces choses sont non fonctionnelles parce qu'on ne sait pas ce qu'elles font. Par exemple Graur et al. citent une étude qui a enlevé 96 introns de levures et n'en ont trouvé que 3 qui ont un impact sur la croissance. Or les levures ont un génome beaucoup plus sélectionné que nous, ayant des tailles de population beaucoup beaucoup plus grandes.
- Les modifications des histones, les protéines qui organisent l'ADN dans la cellule. Une étude de 2010 a trouvé que seul 2% de ces modifications chimiques affectent la fonction d'une manière détectable. On peut avoir raté des trucs, mais dire que toutes ces modifications sont fonctionnelles semble légèrement exagéré en effet.
- L'ouverture de la chromatine, à savoir que l'ADN est accessible aux protéines. Dans ce cas, ils font une simple affirmation du conséquent, rien à dire de plus.
- La liaison par des facteurs de transcription, les protéines qui activent ou répressent les gènes. Graur et al ne sont pas convaincus par des sites de liaison détectés de 400 à 800 nucléotides alors que tous les sites de liaison bien déterminés sont de l'ordre de 6 à 14 nucléotides. Ca se discute. Bref.
- La méthylation du dinucléotide CpG. Bon c'est technique, mais Graur défendent, probablement à raison, que la méthylation est simplement une propriété chimique de CpG et ne dit rien sur la fonction locale de l'ADN.
Une critique très importante, que je traite à part bien que dans le papier elle soit inclue dans le point sur la transcription, est que ENCODE a largement utilisé des cellules tumorales (des cancers en boite de Petri). Il y a une bonne raison pratique : on en a plein, et il y avait besoin de beaucoup de matériel pour faire ENCODE. Mais voilà, dans ces cellules tout est détraqué, et on sait que ni la transcription, ni la structure de l'ADN ne sont comme dans une cellule de notre corps. Non seulement c'est détraqué, mais dans le sense de davantage de transcription et davantage d'activité dans tous les sens. Je confirme, vu que dans mon labo on a essayé d'utiliser ces données et on a du abandonner pour cette raison (pas que ça soit inutile, mais pas utile pour comprendre l'évolution humaine qui nous intéresse).
Une critique un peu technique est qu'apparemment dans leurs statistiques ENCODE a préféré minimiser les faux négatifs (ne rien rater, au risque de détecter des erreurs) que les faux positifs (ne détecter que des trucs corrects, au risque de rater des choses).
Graur et al. discutent de manière assez technique, et correcte (Graur est auteur du livre de référence en évolution moléculaire), des erreurs de biologie évolutive dans la compréhension du "junk DNA" par certains biologistes des génomes. Le plus important à comprendre c'est qu'on ne s'attend pas, sur des bases théoriques solides, à ce que le génome d'organismes à petite population tels que les mammifères (petite par rapport au nombre de bactéries par exemple) soit entièrement fonctionnel, mais au contraire qu'il contiennent beaucoup de choses qui sont inutiles et se sont accumulées par hasard.
Finalement, ils ont une réflexion que je trouve très intéressante sur le contraste entre "grosse science" (CERN, génome humain, etc) et "petite science" (le labo normal où chacun fait ses expériences). Ils proposent que le rôle principal de la grosse science est de générer des données, mais pas de les interpréter, ce qui doit être fait par des chercheurs individuels. Très méchamment, ils disent qu'ENCODE a fait comme les théologiens, ils ont cherché à donner un sens à chaque lettre du texte.
Et pour finir, un peu de ton irrévérent. Ils citent un leader du projet génome humain disant qu'ENCODE est le Google Maps du génome humain, en commentant que non, ENCODE est encore pire que Apple Maps. Puis citent l'adage selon lequel "si c'est trop beau pour être vrai, c'est que c'est trop beau pour être vrai."
Et le coup de grâce :
The ENCODE results were predicted by one of its lead authors to necessitate the rewriting of textbooks (Pennisi 2012). We agree, many textbooks dealing with marketing, mass-media hype, and public relations may well have to be rewritten.
Libellés :
bioinformatique,
biologie,
débat,
discussion d'article,
évolution,
génomique,
humain,
Non classé,
rigolo,
science et société
vendredi 22 février 2013
Amusons-nous avec l'évolution humaine et la pilule
[caption id="attachment_817" align="aligncenter" width="144"]
Cliquez sur l'image, c'est pas le plus drole mais c'est très pertinent[/caption]
Il y a quelques temps j'avais parlé d'articles sérieux sur l'évolution humaine présente, à savoir que nous sommes bien sur encore soumis à la sélection naturelle (voir aussi cet article en anglais dans Wired). (Voir aussi Deviendrons-nous débiles et La suite par Tom Roud.)
Pour s'amuser un peu, je propose de réfléchir à quelles autres pressions sélectives peuvent affecter les humains modernes, dans le contexte de la contraception hormonale.
D'abord il faut préciser un point important : la sélection naturelle, pour fonctionner, n'a pas besoin d'être aussi dramatique qu'on l'imagine souvent. Un avantage de 1% (donc 1,01 fois plus de chances d'avoir des descendants qui survivent et ont des descendants) est considéré énorme et généralement peu vraisemblable en contexte naturel. La plupart du temps quand on peut calculer un avantage sélectif on est dans le 1,001 fois plus de chances de reproduction et de survie, voire beaucoup moins. Et plus la population est grande, plus un avantage petit reste significatif. On ne peut pas dire que la population humaine diminue depuis quelques millénaires.
Alors d'abord la pilule marche pas de manière égale chez toutes les femmes. S'il y a un composant génétique à ce que la pilule marche mal chez certaines femmes, ces femmes auront un peu plus d'enfants en moyenne, et les gènes de "résistance" à la pilule vont se propager. Donc ma première prédiction est que la pilule sera de moins en moins efficace en moyenne au bout de quelques centaines de générations d'usage (on se revoit pour en parler, OK ?). Un genre d'analogue à la résistance aux antibiotiques...
Ensuite, une conséquence évidente de la contraception c'est qu'on peut choisir si on a un autre enfant après en avoir eu un premier. Or il y a des bébés et des enfants faciles, qui dorment tout de suite beaucoup, sont calmes, mangent ce qu'on leur donne, etc. Et y a les petits monstres qui ne dorment pas et dont il faut s'occuper tout le temps. Je ne serais pas très surpris si les parents d'enfants faciles avaient un petit plus tendance à avoir un deuxième, voire un troisième, enfant, et si les parents d'enfants difficiles avaient un petit plus tendance à s'arréter là parce que ça va bien. Donc ma deuxième prédiction : des enfants de plus en plus faciles, surtout en tant que bébés. On se réjouit de voir ça.
D'autres idées ?
Il y a quelques temps j'avais parlé d'articles sérieux sur l'évolution humaine présente, à savoir que nous sommes bien sur encore soumis à la sélection naturelle (voir aussi cet article en anglais dans Wired). (Voir aussi Deviendrons-nous débiles et La suite par Tom Roud.)
Pour s'amuser un peu, je propose de réfléchir à quelles autres pressions sélectives peuvent affecter les humains modernes, dans le contexte de la contraception hormonale.
D'abord il faut préciser un point important : la sélection naturelle, pour fonctionner, n'a pas besoin d'être aussi dramatique qu'on l'imagine souvent. Un avantage de 1% (donc 1,01 fois plus de chances d'avoir des descendants qui survivent et ont des descendants) est considéré énorme et généralement peu vraisemblable en contexte naturel. La plupart du temps quand on peut calculer un avantage sélectif on est dans le 1,001 fois plus de chances de reproduction et de survie, voire beaucoup moins. Et plus la population est grande, plus un avantage petit reste significatif. On ne peut pas dire que la population humaine diminue depuis quelques millénaires.
Alors d'abord la pilule marche pas de manière égale chez toutes les femmes. S'il y a un composant génétique à ce que la pilule marche mal chez certaines femmes, ces femmes auront un peu plus d'enfants en moyenne, et les gènes de "résistance" à la pilule vont se propager. Donc ma première prédiction est que la pilule sera de moins en moins efficace en moyenne au bout de quelques centaines de générations d'usage (on se revoit pour en parler, OK ?). Un genre d'analogue à la résistance aux antibiotiques...
Ensuite, une conséquence évidente de la contraception c'est qu'on peut choisir si on a un autre enfant après en avoir eu un premier. Or il y a des bébés et des enfants faciles, qui dorment tout de suite beaucoup, sont calmes, mangent ce qu'on leur donne, etc. Et y a les petits monstres qui ne dorment pas et dont il faut s'occuper tout le temps. Je ne serais pas très surpris si les parents d'enfants faciles avaient un petit plus tendance à avoir un deuxième, voire un troisième, enfant, et si les parents d'enfants difficiles avaient un petit plus tendance à s'arréter là parce que ça va bien. Donc ma deuxième prédiction : des enfants de plus en plus faciles, surtout en tant que bébés. On se réjouit de voir ça.
D'autres idées ?
mardi 12 février 2013
Un petit débat scientifique pour #DarwinDay : fossiles contre ADN chez les mammifères
[caption id="attachment_797" align="aligncenter" width="300"]
Cliquez sur le dessin. Darwin Day plus St Valentin d'un coup.[/caption]
Le 12 février c'est Darwin Day. Youpii !
Chaque fois qu'un groupement d'intérêts bizarre oppose de la pseudo-science aux résultats scientifiques, ils disent qu'il y a "débat". Genre débat créationisme - évolution, débat homéopathie - traitement avec des médicaments qui contiennent quelque chose. Quand nous les scientifiques disons qu'il n'y a pas débat en l'occurence, nous avons l'air de vouloir supprimer un débat à l'apparence légitime. Et comme les vrais débats scientifiques sont souvent abscons et se produisent entre spécialistes qui se balancent des détails méthodologiques à la figure sur des questions qui n'intéressent personne, bin la plupart des gens n'ont aucune référence pour voir à quoi ça devrait ressembler un débat scientifique légitime.
On peut proposer une heuristique (une solution imparfaite mais qui marche souvent ; la page Wikipedia francophone est bizarre, voyez plutôt l'anglophone) : un débat scientifique légitime est chiant. ;-) Mais ça n'est pas vraiment une solution.
Donc parlons d'un vrai débat, qui entre bien dans le cadre du Darwin Day. Molécules contre morphologie !
Il y a de cela plus d'un an j'avais publié un ralage contre la phylogénie obsolète des mammifères présentée au Musée d'histoire naturelle de Paris. Dans un commentaire long et bien argumenté, Nicobola avait défendu l'approche du Musée, haut lieu de la phylogénie à base morphologique. J'avais promis de répondre un jour. Ze Day 'Az Come!
Mais de quoi il cause phylogénie morphologique moléculaire ? Pourquoi ça nous intéresse maintenant ? Il n'y a pas longtemps j'ai parlé d'un article que je trouvais très cool, dans lequel les auteurs ont reconstruit l'état ancestral du génome des mammifères placentaires (nous, et les baleines gentilles, et les chiens mignons, mais pas les kangourous qui puent ni les ornithorynques qui piquent), et en ont déduit que notre ancêtre à tous qui vivait du temps des dinosaures était nettement plus gros qu'on ne le pensait habituellement. On le pense habituellement sur la base de fossiles. Cette étude-ci était basée sur les données moléculaires (analyse de l'ADN).
Et cette semaine vient de sortir avec grand tintamarre un article dans Science qui montre que l'ancêtre commun des placentaires a vécu beaucoup plus récemment que l'on ne le pensait ces dernières années, en fait après la disparition des dinosaures, et ils ont reconstruit l'ancêtre, et il est tout petit et très conforme à l'idée qu'on se fait habituellement d'un genre d'insectivore discret à doigts de souris. Dans cette étude-ci, ils ont combiné de l'information morphologique d'espèces vivantes (40), d'espèces fossiles (46), et de l'information moléculaire (mais pas trop : 27 gènes, soit 1/1000ème du génome codant, qui est 1% du génome).
Donc deux articles sérieux, par de bons chercheurs, appuyés sur des données solides, qui obtiennent des résultats contradictoires. La dernière manche en date d'un combat qui se livre depuis le début des années 1990 ; avantage aux morphologistes (à savoir qu'ils ont publié dans une plus grosse revue et ils ont eu davantage de couverture dans la presse).
Déclaration de conflit d'intérêts : je fais de l'évolution moléculaire ; je connais le chef de l'article moléculaire cité ci-dessus depuis plus de 20 ans ; j'ai travaillé sur la phylogénie moléculaire des mammifères dans ma thèse et postdoc. Mais j'ai des arguments !
Qu'ont-ils fait dans l'article morphologique récent ? Y a plus de 100 pages de matériel supplémentaire que je n'ai pas lu, donc je n'irais pas dans le détail, mais en gros ils ont rassemblé la plus énorme collection de caractères morphologiques jamais analysée à ma connaissance : 4541 caractères. Pour comprendre de quoi il retourne, il faut savoir qu'en analyse morphologique on ne peut pas mettre des cranes et des poils direcement dans le logiciel, donc il faut recoder la morphologie. Etape super importante, avec plusieurs problèmes potentiels : le risque de subjectivité, si vous codez plutôt ce qui vous arrange ; le risque de ne pas suffisamment détailler, et donc perdre de l'information ; le risque de trop détailler, et donc faire apparaître comme plusieurs caractères ce qui n'est en fait que plusieurs aspects du même. Kesako caractère ? Par exemple le poids de la bête, ou la forme du sperme (si si c'est dans le papier). Ensuite ils ont construit une phylogénie, à savoir les relations évolutives entre les espèces (vache plus proche de mouton que de chien etc). Permettez-moi de persifler un peu : j'ai l'impression que les 27 gènes sont là pour empécher que les données morphologiques toutes seules échouent trop fort à récuperer ce que l'on connaît très bien maintenant de l'arbre des mammifères, et que l'on connaît grace au signal des données moléculaires. 40% des branchements seulement sont cohérents quand ils séparent les données.
Etape suivante et c'est ce qui fait le scoop du papier, ils ont reconstruit l'age et la tronche de l'ancêtre. Pour l'age, vous vous rappelez que des fossiles étaient inclus dans l'analyse ? Les fossiles ça a cela de bien que c'est ancien, et on connaît son âge (avec une certaine précision). Or ces fossiles pas très vieux se placent tout en bas de l'arbre. Donc l'origine de l'arbre n'est pas très vieille. Donc les mammifères placentaires modernes se seraient diversifiés après la disparition des dinosaures. Ensuite pour reconstruire l'ancêtre ils utilisent la parcimonie, à savoir que si deux espèces partagent un trait, leur ancêtre l'avait (en gros).
Un reproche fait même dans le commentaire par ailleurs normalement positif dans Science, c'est qu'ils n'ont pas pris en compte la quantité d'évolution mesurée par les gènes dans l'analyse. Alors là je suis ambigu, parce que je n'ai jamais eu trop confiance dans les mesures dites "d'horloge moléculaire", qui comptent le nombre de changements dans l'ADN et divisent par le taux de mutations fixées dans l'évolution pour trouver la date. Il y a tellement de facteurs qui peuvent faire varier ces taux de mutation ou de fixation. Ceci dit, je doit bien reconnaître que les méthodes pour faire cela ont énormément progressé, et il est probablement en effet abusif de ne pas prendre en compte cette information du tout.
Un problème un peu plus grave à mon sens est que toute cette analyse morphologique se base sur une analyse de parcimonie de caractères morphologique. Or la parcimonie est une approche relativement simple qui n'inclut pas d'étape de modélisation de l'évolution. Quelque part la modélisation est implicite dans le choix des caractères à coder. Mais tout-de-même, il a été montré plusieurs fois que la parcimonie peut se tromper très fortement lorsque l'évolution suit des chemins biscornus, par exemple avec certaines espèces qui évoluent beaucoup plus vite que d'autres, ou une divergence très forte dans les fréquences des caractères entre espèces, ou des changements dans l'état d'équilibre (vers quoi tend le système évolutif) dans le temps. Et donc avec plein plein de données mais une méthode que je qualifierais quand même de naive au sens méthodologique (je ne veux pas dire que les collègues soient naifs, mais plutôt que la méthode ne peut pas être élaborée de par sa nature même), j'ai peur qu'on trouve un résultat quelque part évident, un espèce d'image moyenne de tous les mammifères, qui est donc ce petit insectivore déjà prédit intuitivement par Simpson dans les années 1940.
Alors que les données moléculaires, qui ont le désavantage de ne pas avoir de fossiles, ont deux avantages pas utilisés du tout ici, mais dans l'étude discutée précédemment si : il y en a beaucoup beaucoup, donc puissance statistique même avec modèle complexe, et comme l'ADN c'est relativement simple et répétitif (les 4541 caractères morphologiques incluent des tailles, des formes, des présence-absence, etc ; l'ADN inclut quatre variants chimiques : A, C, G, T), on peut légitimement construire des modèles basés sur une abstraction du nucléotide. Avec ces modèles, on peut prendre en compte les vitesses d'évolution très différentes ou les changements d'état d'équilibre, et donc par exemple trouver que l'ancêtre commun était différent de la moyenne des espèces modernes (jolie démonstration ici).
Donc si l'évolution a inclus un ancêtre common gros rustre, puis une évolution générale vers le plus petit avec perte des caractères morphologiques correspondant (genre survivire au monde Mad Maxien post-météorite géante), puis des opportunités pour re-grossir, un modèle suffisamment complexe nourri de suffisamment de données pourra retrouver cela avec du bol, mais une reconstuction parcimonieuse, non.
Et l'age pas si ancien ? Comme je le disais, je n'ai pas tout regardé en détail, mais il semble qu'ils utilisent les fossiles comme dates absolues, alors qu'un fossile ne donne que l'age minimum d'une espèce : s'il y a un fossile de 50 millions d'années, l'espèce devait exister il y a 50 millions d'années, mais elle pouvait exister plus tôt et on n'a pas de fossiles. Si je me trompe corrigez-moi (discussion intéressante en anglais sur le blog WhyEvolutionIsTrue; voir aussi ce commentaire). Mais surtout, ces fossiles ont été placés dans l'arbre (de parcimonie) par parcimonie. Ergo, tous les problèmes ci-dessus s'appliquent.
Ne me faites pas dire ce que je n'ai pas dit : j'adore les fossiles et les paléontologues. C'est uniquement de cette manière que l'on peut connaître énormément de points du passé. Mais il me semble que parfois les morphologistes ont tendance à se comporter comme les personnes du mythe de la caverne : ils commentent à l'envi les formes qui sont des produits du matériel héréditaire, quand ils veulent connaître l'histoire du matériel héréditaire. Ouvrez les yeux ! Sortez ! Depuis plus de 20 ans, on a accès directement au matériel héréditaire ! Donc quand on veut connaître cette histoire-là, faisons-le directement. Je maintiens que la phylogénie moléculaire est largement supérieure à la phylogénie morphologique, pour les raisons méthodologiqus citées ci-dessus, et parce que l'on mesure directement ce qui nous intéresse. Maintenant pour ce qui est de l'évolution de la forme, c'est l'inverse. Dans les gènes on ne voit que des indices, et c'est la forme des fossiles qui nous informe réellement sur à quoi qu'ils ressemblaient nos beaux ancêtres. Pas beau ça ?
Le 12 février c'est Darwin Day. Youpii !
Chaque fois qu'un groupement d'intérêts bizarre oppose de la pseudo-science aux résultats scientifiques, ils disent qu'il y a "débat". Genre débat créationisme - évolution, débat homéopathie - traitement avec des médicaments qui contiennent quelque chose. Quand nous les scientifiques disons qu'il n'y a pas débat en l'occurence, nous avons l'air de vouloir supprimer un débat à l'apparence légitime. Et comme les vrais débats scientifiques sont souvent abscons et se produisent entre spécialistes qui se balancent des détails méthodologiques à la figure sur des questions qui n'intéressent personne, bin la plupart des gens n'ont aucune référence pour voir à quoi ça devrait ressembler un débat scientifique légitime.
On peut proposer une heuristique (une solution imparfaite mais qui marche souvent ; la page Wikipedia francophone est bizarre, voyez plutôt l'anglophone) : un débat scientifique légitime est chiant. ;-) Mais ça n'est pas vraiment une solution.
Donc parlons d'un vrai débat, qui entre bien dans le cadre du Darwin Day. Molécules contre morphologie !
Il y a de cela plus d'un an j'avais publié un ralage contre la phylogénie obsolète des mammifères présentée au Musée d'histoire naturelle de Paris. Dans un commentaire long et bien argumenté, Nicobola avait défendu l'approche du Musée, haut lieu de la phylogénie à base morphologique. J'avais promis de répondre un jour. Ze Day 'Az Come!
Mais de quoi il cause phylogénie morphologique moléculaire ? Pourquoi ça nous intéresse maintenant ? Il n'y a pas longtemps j'ai parlé d'un article que je trouvais très cool, dans lequel les auteurs ont reconstruit l'état ancestral du génome des mammifères placentaires (nous, et les baleines gentilles, et les chiens mignons, mais pas les kangourous qui puent ni les ornithorynques qui piquent), et en ont déduit que notre ancêtre à tous qui vivait du temps des dinosaures était nettement plus gros qu'on ne le pensait habituellement. On le pense habituellement sur la base de fossiles. Cette étude-ci était basée sur les données moléculaires (analyse de l'ADN).
Et cette semaine vient de sortir avec grand tintamarre un article dans Science qui montre que l'ancêtre commun des placentaires a vécu beaucoup plus récemment que l'on ne le pensait ces dernières années, en fait après la disparition des dinosaures, et ils ont reconstruit l'ancêtre, et il est tout petit et très conforme à l'idée qu'on se fait habituellement d'un genre d'insectivore discret à doigts de souris. Dans cette étude-ci, ils ont combiné de l'information morphologique d'espèces vivantes (40), d'espèces fossiles (46), et de l'information moléculaire (mais pas trop : 27 gènes, soit 1/1000ème du génome codant, qui est 1% du génome).
Donc deux articles sérieux, par de bons chercheurs, appuyés sur des données solides, qui obtiennent des résultats contradictoires. La dernière manche en date d'un combat qui se livre depuis le début des années 1990 ; avantage aux morphologistes (à savoir qu'ils ont publié dans une plus grosse revue et ils ont eu davantage de couverture dans la presse).
Déclaration de conflit d'intérêts : je fais de l'évolution moléculaire ; je connais le chef de l'article moléculaire cité ci-dessus depuis plus de 20 ans ; j'ai travaillé sur la phylogénie moléculaire des mammifères dans ma thèse et postdoc. Mais j'ai des arguments !
Qu'ont-ils fait dans l'article morphologique récent ? Y a plus de 100 pages de matériel supplémentaire que je n'ai pas lu, donc je n'irais pas dans le détail, mais en gros ils ont rassemblé la plus énorme collection de caractères morphologiques jamais analysée à ma connaissance : 4541 caractères. Pour comprendre de quoi il retourne, il faut savoir qu'en analyse morphologique on ne peut pas mettre des cranes et des poils direcement dans le logiciel, donc il faut recoder la morphologie. Etape super importante, avec plusieurs problèmes potentiels : le risque de subjectivité, si vous codez plutôt ce qui vous arrange ; le risque de ne pas suffisamment détailler, et donc perdre de l'information ; le risque de trop détailler, et donc faire apparaître comme plusieurs caractères ce qui n'est en fait que plusieurs aspects du même. Kesako caractère ? Par exemple le poids de la bête, ou la forme du sperme (si si c'est dans le papier). Ensuite ils ont construit une phylogénie, à savoir les relations évolutives entre les espèces (vache plus proche de mouton que de chien etc). Permettez-moi de persifler un peu : j'ai l'impression que les 27 gènes sont là pour empécher que les données morphologiques toutes seules échouent trop fort à récuperer ce que l'on connaît très bien maintenant de l'arbre des mammifères, et que l'on connaît grace au signal des données moléculaires. 40% des branchements seulement sont cohérents quand ils séparent les données.
Etape suivante et c'est ce qui fait le scoop du papier, ils ont reconstruit l'age et la tronche de l'ancêtre. Pour l'age, vous vous rappelez que des fossiles étaient inclus dans l'analyse ? Les fossiles ça a cela de bien que c'est ancien, et on connaît son âge (avec une certaine précision). Or ces fossiles pas très vieux se placent tout en bas de l'arbre. Donc l'origine de l'arbre n'est pas très vieille. Donc les mammifères placentaires modernes se seraient diversifiés après la disparition des dinosaures. Ensuite pour reconstruire l'ancêtre ils utilisent la parcimonie, à savoir que si deux espèces partagent un trait, leur ancêtre l'avait (en gros).
Un reproche fait même dans le commentaire par ailleurs normalement positif dans Science, c'est qu'ils n'ont pas pris en compte la quantité d'évolution mesurée par les gènes dans l'analyse. Alors là je suis ambigu, parce que je n'ai jamais eu trop confiance dans les mesures dites "d'horloge moléculaire", qui comptent le nombre de changements dans l'ADN et divisent par le taux de mutations fixées dans l'évolution pour trouver la date. Il y a tellement de facteurs qui peuvent faire varier ces taux de mutation ou de fixation. Ceci dit, je doit bien reconnaître que les méthodes pour faire cela ont énormément progressé, et il est probablement en effet abusif de ne pas prendre en compte cette information du tout.
Un problème un peu plus grave à mon sens est que toute cette analyse morphologique se base sur une analyse de parcimonie de caractères morphologique. Or la parcimonie est une approche relativement simple qui n'inclut pas d'étape de modélisation de l'évolution. Quelque part la modélisation est implicite dans le choix des caractères à coder. Mais tout-de-même, il a été montré plusieurs fois que la parcimonie peut se tromper très fortement lorsque l'évolution suit des chemins biscornus, par exemple avec certaines espèces qui évoluent beaucoup plus vite que d'autres, ou une divergence très forte dans les fréquences des caractères entre espèces, ou des changements dans l'état d'équilibre (vers quoi tend le système évolutif) dans le temps. Et donc avec plein plein de données mais une méthode que je qualifierais quand même de naive au sens méthodologique (je ne veux pas dire que les collègues soient naifs, mais plutôt que la méthode ne peut pas être élaborée de par sa nature même), j'ai peur qu'on trouve un résultat quelque part évident, un espèce d'image moyenne de tous les mammifères, qui est donc ce petit insectivore déjà prédit intuitivement par Simpson dans les années 1940.
Alors que les données moléculaires, qui ont le désavantage de ne pas avoir de fossiles, ont deux avantages pas utilisés du tout ici, mais dans l'étude discutée précédemment si : il y en a beaucoup beaucoup, donc puissance statistique même avec modèle complexe, et comme l'ADN c'est relativement simple et répétitif (les 4541 caractères morphologiques incluent des tailles, des formes, des présence-absence, etc ; l'ADN inclut quatre variants chimiques : A, C, G, T), on peut légitimement construire des modèles basés sur une abstraction du nucléotide. Avec ces modèles, on peut prendre en compte les vitesses d'évolution très différentes ou les changements d'état d'équilibre, et donc par exemple trouver que l'ancêtre commun était différent de la moyenne des espèces modernes (jolie démonstration ici).
Donc si l'évolution a inclus un ancêtre common gros rustre, puis une évolution générale vers le plus petit avec perte des caractères morphologiques correspondant (genre survivire au monde Mad Maxien post-météorite géante), puis des opportunités pour re-grossir, un modèle suffisamment complexe nourri de suffisamment de données pourra retrouver cela avec du bol, mais une reconstuction parcimonieuse, non.
Et l'age pas si ancien ? Comme je le disais, je n'ai pas tout regardé en détail, mais il semble qu'ils utilisent les fossiles comme dates absolues, alors qu'un fossile ne donne que l'age minimum d'une espèce : s'il y a un fossile de 50 millions d'années, l'espèce devait exister il y a 50 millions d'années, mais elle pouvait exister plus tôt et on n'a pas de fossiles. Si je me trompe corrigez-moi (discussion intéressante en anglais sur le blog WhyEvolutionIsTrue; voir aussi ce commentaire). Mais surtout, ces fossiles ont été placés dans l'arbre (de parcimonie) par parcimonie. Ergo, tous les problèmes ci-dessus s'appliquent.
Ne me faites pas dire ce que je n'ai pas dit : j'adore les fossiles et les paléontologues. C'est uniquement de cette manière que l'on peut connaître énormément de points du passé. Mais il me semble que parfois les morphologistes ont tendance à se comporter comme les personnes du mythe de la caverne : ils commentent à l'envi les formes qui sont des produits du matériel héréditaire, quand ils veulent connaître l'histoire du matériel héréditaire. Ouvrez les yeux ! Sortez ! Depuis plus de 20 ans, on a accès directement au matériel héréditaire ! Donc quand on veut connaître cette histoire-là, faisons-le directement. Je maintiens que la phylogénie moléculaire est largement supérieure à la phylogénie morphologique, pour les raisons méthodologiqus citées ci-dessus, et parce que l'on mesure directement ce qui nous intéresse. Maintenant pour ce qui est de l'évolution de la forme, c'est l'inverse. Dans les gènes on ne voit que des indices, et c'est la forme des fossiles qui nous informe réellement sur à quoi qu'ils ressemblaient nos beaux ancêtres. Pas beau ça ?
Libellés :
biologie,
débat,
discussion d'article,
évolution,
Non classé
vendredi 8 février 2013
Doit-on montrer le code informatique des scientifiques même s'il est moche ?
[caption id="attachment_631" align="aligncenter" width="103"]
cliquez sur l'image (puis laissez la souris au-dessus de l'image pour voir le texte alternatif) (et si vous riez, vous êtes un affreux geek)[/caption]
En science on écrit beaucoup de code informatique. On écrit de gros programmes pour traiter plein de données (génomique, résultats du CERN), d'autres gros programmes pour simuler de gros modèles pour quand la réalité est complexe (le climat, les populations humaines), encore des gros programmes pour traiter des données compliquées (des structures cristallographiques). Et on écrit des petits programmes tout le temps : pour lier les gros entre eux, pour mettre les données au bon format, pour faire un petit calcul pas standard dans le logiciel, pour répéter une opération simple plein de fois, etc. (Je précise qu'il existe aussi des scientifiques qui ne programment pas. Il n'est pas question d'eux aujourd'hui.)
Au bilan, la qualité et la fiabilité de nos résultats scientifiques dépendent pas mal de tout ce code.
Et qu'est qu'on en fait, le plus souvent ? On l'écrit vite et mal, on le teste à peine, on ne le commente pas, et on le paume quelque part dans un sous-dossier de notre disque dur. La honte.
Une excellente analogie que j'ai trouvée récemment (document PDF) : peut-on imaginer que les mathématiciens publient leurs théorèmes sans montrer les preuves, parce que c'est du boulot de les mettre en forme, parce que chaque preuve est particulière à un problème et pas très utile ailleurs, c'est plus rentable de travailler sur un nouveau problème que de polir cette preuve pour publication, en fait ma preuve ne marche pas dans tous les cas mais dans le cas qui m'intéresse ça marchait, en fait c'est mon étudiant qui a fait la preuve et je ne l'ai plus, la preuve va me re-servir pour d'autres théorèmes alors je ne vais pas la donner à mes compétiteurs, les papiers avec des preuves seraient trop longs et les experts ne vont pas s'embéter à lire tout ça, ma preuve s'appuie sur un logiciel commercial (genre MatLab), vous pourrez pas vous en servir, etc.
Pour de vrai, les mathématicens publient leurs preuves, mais les scientifiques ne publient pas leur (notre) code, et nos arguments sont à-peu-près ceux ci-dessus.
Le point qui fait le plus débat est le compromis entre le travail nécessaire à rendre son code informatique présentable, et la pertinence de publier du code "sale". Ca fait longtemps que j'ai ce billet en brouillon et je veux le publier et je ne vais pas réussir à écrire tout ce que je voudrais, alors je vais mettre quelques liens intéressants avec des résumés :
Un gros problème est qu'en science on doit souvent écrire du code pour des projets qui se développent au fur et à mesure, sans savoir où on sera demain, et quel bout de code finira inutile et lequel produira le résultat critique pour la suite, voire lequel servira de base à une nouvelle méthode utilisée par ses collègues. Le fait est que dans la plupart des cas le code est vite fait - mal fait.
Il s'ajoute un autre problème : on a beau vous expliquer que si vous programmez proprement vous gagnerez du temps sur le long terme gnagnagna, vous souci premier est toujours d'obtenir le résultat. Alors on revient à #overlyhonestmethods, on fait souvent ce qu'il faut pour avancer, à coups de rubban adhésif. Mais publier son code, c'est pas un peu mettre #overlyhonestmethods dans ses articles officiels ?
A quoi je répondrais qu'il faut qu'on y passe. Trop de nos résultats sont dépendants de notre code pour le cacher. Et l'effort fait aujourd'hui payera demain, avec un code mieux débuggé et plus efficace même pour nous, avec plus de facilité à retrouver ce qu'on a fait dans 5 ans quand on aura tout oublié mais que l'article sera toujours là avec son code à-peu-près propre. Oui à-peu-près parce que je pense que pour que ça marche il faut accepter qu'on ne va généralement pas avoir du code informatique de qualité professionnelle.
Alors en pratique que faire ? Demander aux journaux scientifiques de demander le code, le demander en tant qu'expert ; publier son propre code (un peu tard pour moi, je fous plus rien en programmation) ; demander à ses collègues et étudiants de publier le leur (grosse résistance en vue) ; former les étudiants a minima à la programmation propre ; participer à des initiatives comme celle d'Iddo. Et espérer que les attitudes vont changer.
Mise à jour : @JeanFred nous signale l'existence du Science code manifesto, par le Climate Code Foundation, qui traite de ces mêmes questions.
En science on écrit beaucoup de code informatique. On écrit de gros programmes pour traiter plein de données (génomique, résultats du CERN), d'autres gros programmes pour simuler de gros modèles pour quand la réalité est complexe (le climat, les populations humaines), encore des gros programmes pour traiter des données compliquées (des structures cristallographiques). Et on écrit des petits programmes tout le temps : pour lier les gros entre eux, pour mettre les données au bon format, pour faire un petit calcul pas standard dans le logiciel, pour répéter une opération simple plein de fois, etc. (Je précise qu'il existe aussi des scientifiques qui ne programment pas. Il n'est pas question d'eux aujourd'hui.)
Au bilan, la qualité et la fiabilité de nos résultats scientifiques dépendent pas mal de tout ce code.
Et qu'est qu'on en fait, le plus souvent ? On l'écrit vite et mal, on le teste à peine, on ne le commente pas, et on le paume quelque part dans un sous-dossier de notre disque dur. La honte.
Une excellente analogie que j'ai trouvée récemment (document PDF) : peut-on imaginer que les mathématiciens publient leurs théorèmes sans montrer les preuves, parce que c'est du boulot de les mettre en forme, parce que chaque preuve est particulière à un problème et pas très utile ailleurs, c'est plus rentable de travailler sur un nouveau problème que de polir cette preuve pour publication, en fait ma preuve ne marche pas dans tous les cas mais dans le cas qui m'intéresse ça marchait, en fait c'est mon étudiant qui a fait la preuve et je ne l'ai plus, la preuve va me re-servir pour d'autres théorèmes alors je ne vais pas la donner à mes compétiteurs, les papiers avec des preuves seraient trop longs et les experts ne vont pas s'embéter à lire tout ça, ma preuve s'appuie sur un logiciel commercial (genre MatLab), vous pourrez pas vous en servir, etc.
Pour de vrai, les mathématicens publient leurs preuves, mais les scientifiques ne publient pas leur (notre) code, et nos arguments sont à-peu-près ceux ci-dessus.
Le point qui fait le plus débat est le compromis entre le travail nécessaire à rendre son code informatique présentable, et la pertinence de publier du code "sale". Ca fait longtemps que j'ai ce billet en brouillon et je veux le publier et je ne vais pas réussir à écrire tout ce que je voudrais, alors je vais mettre quelques liens intéressants avec des résumés :
- Iddo Friedberg a fait un excellent bilan sur son blog Byte Size Biology, avec une analogie très drôle au film "Piranha 3D", et conclut qu'en l'état il n'a pas les moyens de faire du code propre, et ne veut pas partager du code pas propre, mais propose une nouvelle initiative, le Bioinformatic Testing Consortium,
- Dans Nature, un article Publish your computer code: it is good enough argue que même si le code n'est pas beau ni propre ni aux règles, il faut le publier, ça fait partie de la démarche scientifique.
- Un autre article dans Nature, Computational science: ...Error, prends plus ou moins l'angle inverse, et dit qu'il faut former tous les scientifiques au génie logiciel propre.
- Un blog anonyme réagit à Iddo en disant que le but de la science n'est pas des logiciels, et donc des tests systématiques ne sont pas justifiés.
- Un autre bloguer, Titus Brown, donne de bonnes raisons pour écrire du code proprement en respectant les règles, et donne de bons conseils pour le faire efficacement. Super citation de Darwin :
"Ignorance more frequently begets confidence than does knowledge"
- Sur le forum Biostar, un bioinformaticien anonyme dit que de documenter et publier son code est du même ordre de grandeur que de noter ses procédures expérimentales : indispensable. (LOLcat si vous suivez le lien)
- John Graham-Cumming note que le problème se pose avec encore plus de force dans l'étude du climat, où l'obscurité des méthodes devient un argument politique.
Un gros problème est qu'en science on doit souvent écrire du code pour des projets qui se développent au fur et à mesure, sans savoir où on sera demain, et quel bout de code finira inutile et lequel produira le résultat critique pour la suite, voire lequel servira de base à une nouvelle méthode utilisée par ses collègues. Le fait est que dans la plupart des cas le code est vite fait - mal fait.
Il s'ajoute un autre problème : on a beau vous expliquer que si vous programmez proprement vous gagnerez du temps sur le long terme gnagnagna, vous souci premier est toujours d'obtenir le résultat. Alors on revient à #overlyhonestmethods, on fait souvent ce qu'il faut pour avancer, à coups de rubban adhésif. Mais publier son code, c'est pas un peu mettre #overlyhonestmethods dans ses articles officiels ?
A quoi je répondrais qu'il faut qu'on y passe. Trop de nos résultats sont dépendants de notre code pour le cacher. Et l'effort fait aujourd'hui payera demain, avec un code mieux débuggé et plus efficace même pour nous, avec plus de facilité à retrouver ce qu'on a fait dans 5 ans quand on aura tout oublié mais que l'article sera toujours là avec son code à-peu-près propre. Oui à-peu-près parce que je pense que pour que ça marche il faut accepter qu'on ne va généralement pas avoir du code informatique de qualité professionnelle.
Alors en pratique que faire ? Demander aux journaux scientifiques de demander le code, le demander en tant qu'expert ; publier son propre code (un peu tard pour moi, je fous plus rien en programmation) ; demander à ses collègues et étudiants de publier le leur (grosse résistance en vue) ; former les étudiants a minima à la programmation propre ; participer à des initiatives comme celle d'Iddo. Et espérer que les attitudes vont changer.
Mise à jour : @JeanFred nous signale l'existence du Science code manifesto, par le Climate Code Foundation, qui traite de ces mêmes questions.
vendredi 25 janvier 2013
Pourquoi est-ce que j'ai dit non à un "challenge" de Philip Morris International ?
[caption id="attachment_763" align="aligncenter" width="215"]
Cliquez sur l'image[/caption]
J'ai récemment été contacté pour participer à un challenge intéressant et pertinent à ma recherche, dans le cadre du Systems Biology Verification (SBV) IMPROVER project. Le hic, c'est que c'est organisé et financé par Philip Morris International, une petite compagnie de tabac dont vous avez peut-être entendu parler.
J'ai dit non.
Alors ceci pose la question : pourquoi ai-je dit non, alors que j'aurais peut-être dit oui si c'était financé par une autre industrie ?
Dans une industrie normale, la recherche & développement peut avoir des objectifs légitime. Même que s'il n'y en avait pas, ça serait bien embêtant. Ces industries répondent à des besoins légitimes. On peut discuter de la mise en oeuvre, et penser que certaines chose pourraient être mieux faites, mais quelque chose doit être fait. Par exemple le junk food c'est pas bien, mais faut bien manger, donc il y a la place pour pour une R&D légitime et utile dans l'agro-alimentaire. Les gros 4x4 c'est pas bien, mais faut bien se déplacer, et y a de la place pour une R&D légitime et utile sur des moteurs économes et peu poluants. Etc.
Mais quel peut être l'objectif de la R&D dans l'industrie du tabac ? Rendre le tabac légèrement moins dangereux ? Y a plus simple : y a qu'à pas fumer. Ce n'est pas un besoin légitime. Et la recherche soutenue par l'industrie du tabac a un autre intérêt : semer le trouble et le doute sur la recherche qui montre de manière claire et non ambigue que le tabac est un abominable poison. Ca peut être subtil, souvent en soutenant de la recherche sur des causes légitimes permettant de mettre le projecteur ailleurs.
Dans le cas de ce "Challenge", le thème est "Species translation", et semble être sur les problèmes de transfer des résultats expérimentaux entre espèces. Par exemple les problèmes à étendre à l'humain des résultats de toxicologie établis chez des rats ou des souris. C'est bien une question légitime, mais on sent qu'il y a un certain avantage pour le producteur de produits toxiques à mettre ceci en avant.
Mise à jour : version anglaise du billet sur mon nouveau blog universitaire en anglais, pour ceux qui veulent partager avec des non francophones.
J'ai récemment été contacté pour participer à un challenge intéressant et pertinent à ma recherche, dans le cadre du Systems Biology Verification (SBV) IMPROVER project. Le hic, c'est que c'est organisé et financé par Philip Morris International, une petite compagnie de tabac dont vous avez peut-être entendu parler.
J'ai dit non.
Alors ceci pose la question : pourquoi ai-je dit non, alors que j'aurais peut-être dit oui si c'était financé par une autre industrie ?
Dans une industrie normale, la recherche & développement peut avoir des objectifs légitime. Même que s'il n'y en avait pas, ça serait bien embêtant. Ces industries répondent à des besoins légitimes. On peut discuter de la mise en oeuvre, et penser que certaines chose pourraient être mieux faites, mais quelque chose doit être fait. Par exemple le junk food c'est pas bien, mais faut bien manger, donc il y a la place pour pour une R&D légitime et utile dans l'agro-alimentaire. Les gros 4x4 c'est pas bien, mais faut bien se déplacer, et y a de la place pour une R&D légitime et utile sur des moteurs économes et peu poluants. Etc.
Mais quel peut être l'objectif de la R&D dans l'industrie du tabac ? Rendre le tabac légèrement moins dangereux ? Y a plus simple : y a qu'à pas fumer. Ce n'est pas un besoin légitime. Et la recherche soutenue par l'industrie du tabac a un autre intérêt : semer le trouble et le doute sur la recherche qui montre de manière claire et non ambigue que le tabac est un abominable poison. Ca peut être subtil, souvent en soutenant de la recherche sur des causes légitimes permettant de mettre le projecteur ailleurs.
Dans le cas de ce "Challenge", le thème est "Species translation", et semble être sur les problèmes de transfer des résultats expérimentaux entre espèces. Par exemple les problèmes à étendre à l'humain des résultats de toxicologie établis chez des rats ou des souris. C'est bien une question légitime, mais on sent qu'il y a un certain avantage pour le producteur de produits toxiques à mettre ceci en avant.
Mise à jour : version anglaise du billet sur mon nouveau blog universitaire en anglais, pour ceux qui veulent partager avec des non francophones.
vendredi 18 janvier 2013
Pas si petits, les mammifères du temps des dinosaures ?
[caption id="attachment_717" align="aligncenter" width="122"]
Cliquez sur l'image[/caption]
On a tous en tête le cliché des mammifères petits comme des souris qui vivent dans l'ombre desmammifères dinosaures. D'abord, je ne sais pas vous mais moi j'ai toujours en tête les "reptiles mammliens", qui sont aussi nos ancêtres après tout, ne sont pas si ridicules que ça :
[caption id="" align="alignnone" width="420"]
Dimetrodon en jette, non ? Un ancêtre à moi[/caption]
Mais ça n'est pas de ça que je veux parler aujourd'hui, mais bien des bestioles qui vivaient au crétacé. Généralement parlant, on connait les ancêtres des mammifères placentaires (tous les mammifères sauf les marsupiaux [kangourous, koalas, tout ça] et les monotrèmes [ornithorynque, echnidés, c'est tout]) par quelques dizaines de fossiles pas très gros. Donc on suppose qu'ils étaient petits, et pas très répandus. Dans un nouvel article, Romiguier et al. se sont basés sur les séquences d'ADN des génomes de mammifères plaentaires vivants pour arriver à une estimation indirecte.
Nicolas Galtier, le dernier auteur de cet article (place prestigieuse en biologie), développe depuis longtemps des méthodes bioinformatiques permettant de reconstruire avec une bonne confiance des caractéristiques de séquences ancestrales à partir des séquences modernes. Notamment le taux de GC. A savoir que l'ADN est constitué de 4 bases, A, C, G, T, qui forment des paires de liaison qui tiennent ensemble la double hélice d'ADN : G-C ou A-T. Le taux de GC est tout simplement la fréquence des G et des C dans la séquence totale. Si tout était au hasard et équilibré, on aurait toujours 50%, avec la variance due à une loi de Poisson. Mais en fait le taux de GC varie très largement, entre génomes et entre régions de génomes. Et de manière intéressante il corrèle avec plein d'autres paramètres, tels que la température optimale de survie des bactéries (vrai seulement pour le taux de GC de certains ARN). C'est ainsi que dans le passé, avec un modèle de prédiction du taux de GC ancestral, il a calculé que l'ancêtre commun de tout le vivant ne vivait probablement pas aux hautes températures que l'on pensait jusqu'alors.
Dans ce nouvel article, ils utilisent deux autres corrélations : les mammifères avec la vie la plus courte ont d'une part un taux de GC plus élevé, et d'autre part une sélection naturelle sur les protéines plus forte (dN/dS plus faible, pour les pros). Pour ces deux paramètres on sait reconstruire l'état ancestral si on a assez de données. Ici ils ont utilisé 787 gènes partagés par 33 espèces de placentaires, ce qui est tout-à-fait correct comme échantillonage.
D'abord une précision, dans ce que l'on appelle "traits d'histoire de vie" il y a plein de corrélations qui font que la causalité est parfois difficile à établir. Les espèces qui ont une vie courte ont donc un temps de génération court, ont des individus petits, un métabolisme élevé (quoique le contraire vient d'être trouvé dans des papillons, bizarre autant qu'étrange), etc. Ce que l'on voit au final c'est un genre de résumé de tout ceci.
Et paf, l'ancêtre commun des placentaires est prédit avec une longévité de 33,3 ± 7,6 années (dans la litérature scientifique on note généralement ± l'écart-type, ce qui veut dire que l'intervalle de confiance à 95% est ici 18,4 à41,2 48,2 années) par le GC, et de 19 à 45 années par la sélection sur les protéines. Pas exactement le cliché de la souris cachée sous un rocher (pour les souris la longévité est estimée à 4 ans max). De telles espérences de vie correspondent à un gros mammifère terrestre, ou à un moyen arboréal (les corrélations sont légèrement différentes pour les espèces vivant dans les arbres).
Pourquoi l'incohérence avec les fossiles ? D'abord, on n'en a pas beaucoup, 81 bien documentés d'après cet article. Ensuite, de grosses espèces peuvent être plus rares et moins fossiliser. Plus important, certains environnements se prêtent bien à la fossilisation, d'autres moins. Par exemple la forêt tropicale, au sol très acide, préserve très mal les restes d'animaux morts. J'ai entendu un paléontologue plaisanter une fois que les lémuriens sont tous apparus ces derniers 1000 ans, puisqu'ils n'ont laissé aucun fossile dans leur île tropicale (on ne les trouve qu'à Madagascar). Alors si nos ancêtres placentaires du temps des dinosaures vivaient dans ce genre d'environnement, pas de chance. A noter que les résults intermédiaires de l'analyse, vérifiables par des fossiles plus abondants (évolution des chevaux ou des éléphants), sont cohérents avec ces fossiles.
Un avantage des données génomiques, c'est que l'on peut échantilloner les espèces modernes de manières équilibrée, sans être victime de ce genre de biais, et que l'on peut utiliser des modèles qui prennent en compte et la variation des modes et taux d'évolution au cours du temps, et la structure en arbre de l'évolution. Ce que je veux dire par là c'est que même si beaucoup d'espèces modernes sont de petits rongeurs, comme ils sont tous proches parents ils nous en apprennent moins qu'un dauphin, un chien et une chauve-souris. Enfin, les données moléculaires ont l'avantage d'être en grande quantité et relativement standardisée (A, C, G, T, plutôt que "orientation de l'oreille interne"). Bien sûr les fossiles restent notre seule fenêtre directe dans le passé lointain.
Finalement les auteurs font remarquer à juste titre que pas mal d'espères grosses et à espérance de vie élevée ont survécu à la météorite qui a tué les dinosaures et pas mal d'autres groupes : les crocodiles ou les tortues par exemple.
Ce papier n'est surement pas le dernier mot sur l'étude de l'évolution ancienne des mammifères, mais j'aime bien l'éclairage nouveau qu'il donne.
Cliquez sur l'image[/caption]
On a tous en tête le cliché des mammifères petits comme des souris qui vivent dans l'ombre des
[caption id="" align="alignnone" width="420"]
Mais ça n'est pas de ça que je veux parler aujourd'hui, mais bien des bestioles qui vivaient au crétacé. Généralement parlant, on connait les ancêtres des mammifères placentaires (tous les mammifères sauf les marsupiaux [kangourous, koalas, tout ça] et les monotrèmes [ornithorynque, echnidés, c'est tout]) par quelques dizaines de fossiles pas très gros. Donc on suppose qu'ils étaient petits, et pas très répandus. Dans un nouvel article, Romiguier et al. se sont basés sur les séquences d'ADN des génomes de mammifères plaentaires vivants pour arriver à une estimation indirecte.
Nicolas Galtier, le dernier auteur de cet article (place prestigieuse en biologie), développe depuis longtemps des méthodes bioinformatiques permettant de reconstruire avec une bonne confiance des caractéristiques de séquences ancestrales à partir des séquences modernes. Notamment le taux de GC. A savoir que l'ADN est constitué de 4 bases, A, C, G, T, qui forment des paires de liaison qui tiennent ensemble la double hélice d'ADN : G-C ou A-T. Le taux de GC est tout simplement la fréquence des G et des C dans la séquence totale. Si tout était au hasard et équilibré, on aurait toujours 50%, avec la variance due à une loi de Poisson. Mais en fait le taux de GC varie très largement, entre génomes et entre régions de génomes. Et de manière intéressante il corrèle avec plein d'autres paramètres, tels que la température optimale de survie des bactéries (vrai seulement pour le taux de GC de certains ARN). C'est ainsi que dans le passé, avec un modèle de prédiction du taux de GC ancestral, il a calculé que l'ancêtre commun de tout le vivant ne vivait probablement pas aux hautes températures que l'on pensait jusqu'alors.
Dans ce nouvel article, ils utilisent deux autres corrélations : les mammifères avec la vie la plus courte ont d'une part un taux de GC plus élevé, et d'autre part une sélection naturelle sur les protéines plus forte (dN/dS plus faible, pour les pros). Pour ces deux paramètres on sait reconstruire l'état ancestral si on a assez de données. Ici ils ont utilisé 787 gènes partagés par 33 espèces de placentaires, ce qui est tout-à-fait correct comme échantillonage.
D'abord une précision, dans ce que l'on appelle "traits d'histoire de vie" il y a plein de corrélations qui font que la causalité est parfois difficile à établir. Les espèces qui ont une vie courte ont donc un temps de génération court, ont des individus petits, un métabolisme élevé (quoique le contraire vient d'être trouvé dans des papillons, bizarre autant qu'étrange), etc. Ce que l'on voit au final c'est un genre de résumé de tout ceci.
Et paf, l'ancêtre commun des placentaires est prédit avec une longévité de 33,3 ± 7,6 années (dans la litérature scientifique on note généralement ± l'écart-type, ce qui veut dire que l'intervalle de confiance à 95% est ici 18,4 à
Pourquoi l'incohérence avec les fossiles ? D'abord, on n'en a pas beaucoup, 81 bien documentés d'après cet article. Ensuite, de grosses espèces peuvent être plus rares et moins fossiliser. Plus important, certains environnements se prêtent bien à la fossilisation, d'autres moins. Par exemple la forêt tropicale, au sol très acide, préserve très mal les restes d'animaux morts. J'ai entendu un paléontologue plaisanter une fois que les lémuriens sont tous apparus ces derniers 1000 ans, puisqu'ils n'ont laissé aucun fossile dans leur île tropicale (on ne les trouve qu'à Madagascar). Alors si nos ancêtres placentaires du temps des dinosaures vivaient dans ce genre d'environnement, pas de chance. A noter que les résults intermédiaires de l'analyse, vérifiables par des fossiles plus abondants (évolution des chevaux ou des éléphants), sont cohérents avec ces fossiles.
Un avantage des données génomiques, c'est que l'on peut échantilloner les espèces modernes de manières équilibrée, sans être victime de ce genre de biais, et que l'on peut utiliser des modèles qui prennent en compte et la variation des modes et taux d'évolution au cours du temps, et la structure en arbre de l'évolution. Ce que je veux dire par là c'est que même si beaucoup d'espèces modernes sont de petits rongeurs, comme ils sont tous proches parents ils nous en apprennent moins qu'un dauphin, un chien et une chauve-souris. Enfin, les données moléculaires ont l'avantage d'être en grande quantité et relativement standardisée (A, C, G, T, plutôt que "orientation de l'oreille interne"). Bien sûr les fossiles restent notre seule fenêtre directe dans le passé lointain.
Finalement les auteurs font remarquer à juste titre que pas mal d'espères grosses et à espérance de vie élevée ont survécu à la météorite qui a tué les dinosaures et pas mal d'autres groupes : les crocodiles ou les tortues par exemple.
Ce papier n'est surement pas le dernier mot sur l'étude de l'évolution ancienne des mammifères, mais j'aime bien l'éclairage nouveau qu'il donne.
Libellés :
bioinformatique,
biologie,
discussion d'article,
évolution,
génomique,
Non classé
vendredi 11 janvier 2013
Rions un peu avec les méthodes scientifiques et Twitter
[caption id="attachment_727" align="aligncenter" width="289"]
Cliquez sur l'image pour faire un quizz[/caption]
Ces derniers jours il y a eu une floraison de tweets humouristiques de scientifiques, sur le thème, "les vraies méthodes utilisées en science qu'on n'ose jamais écrire". C'est sous le hashtag (mot-clé Twitter) #overlyhonestmethods. Y en a plein de hilarants, je vous conseille de lire ça tant que c'est disponible. Ca a été lancé par un neuropharmacologue apparemment. Y a des résumés et des best-of ici, ici, ici, et surement ailleurs. (Mise à jour : voir aussi liens dans commentaires.)
Quelques-un de mes favoris (parmi ceux que j'ai réussi à retrouver ou me rappeler), en traduction approximative, avec commentaire dessous des fois :
Mon préféré !
"Règle" que si quelque chose est resté à terre moins de 5 secondes (3 selon certains) ça n'est pas contaminé. Je ne l'ai jamais vu appliqué à autre chose qu'un biscuit pour de vrai.
Dans les journaux très prestigieux comme Nature et Science, il n'y a presque pas de place pour les méthodes, qui sont généralement peu détaillées et incompréhensibles.
Y a beaucoup de variantes sur le thème "on a choisi un temps d'expérience correspondant au repas, à la pause café, à rentrer dormir une bonne nuit, à avoir un week-end peinard".
Et ceux que j'ai écrit moi-même :
Je n'ai jamais fait ça ! Mais j'ai été tenté, et j'ai parfois utilisé une méthode dont je pense qu'elle n'apporte rien parce qu'on me l'a demandé et qu'en effet ça ne contredisait pas mes résultats (mais je comprenais pourquoi - je crois). Ma contribution la plus retweetée à ce bazar.
Très technique, et d'ailleurs pas retweeté. Les intéressés se reconaitront.
Alors c'est une grosse exagération, mais ça arrive qu'on doive justifier de l'usage d'une resource informatique alors qu'on n'a pas encore l'application pertinente, et qu'on fasse un calcul qui aurait pu se faire ailleurs. Normalement, c'est parce qu'on va vraiment utiliser la resource bientôt et qu'il faut mettre au point. Mais j'ai expertisé des papiers où j'ai vraiment l'impression qu'ils ont fait ça.
Un peu simplifié pour le tweet, mais il m'est arrivé en gros ça : des sources de données différentes utilisées à différents endroits du papier parce qu'il a été tellement long à préparer. Dans ces cas-là, on ajoute normalement un contrôle pour vérifier que ça ne biaise pas le résultat.
Moi j'ai trouvé beaucoup de ces tweets hilarants. Un truc auquel on pourrait s'attendre c'est que des anti-science ou anti-intellectuels se précipitent dessus pour dire "voilà la face noire et cachée de la science, voilà à quoi ils dépensent nos sous, j'avais bien dit qu'on ne pouvait pas leur faire confiance". Plus inatendu pour moi, des scientifiques s'inquiètent de ce que ces tweets montrent des pratiques scientifiques douteuses (par exemple ici). A quoi je répond, détendez-vous les gars.
Et à tout seigneur tout honneur, il faut noter que PhD Comics avait anticipé cet humour :
[caption id="attachment_729" align="aligncenter" width="508"]
cliquez dessus[/caption]
Ces derniers jours il y a eu une floraison de tweets humouristiques de scientifiques, sur le thème, "les vraies méthodes utilisées en science qu'on n'ose jamais écrire". C'est sous le hashtag (mot-clé Twitter) #overlyhonestmethods. Y en a plein de hilarants, je vous conseille de lire ça tant que c'est disponible. Ca a été lancé par un neuropharmacologue apparemment. Y a des résumés et des best-of ici, ici, ici, et surement ailleurs. (Mise à jour : voir aussi liens dans commentaires.)
Quelques-un de mes favoris (parmi ceux que j'ai réussi à retrouver ou me rappeler), en traduction approximative, avec commentaire dessous des fois :
J'ai utilisé des étudiants comme sujets, parce que les rats coutent cher et on s'y attache.
Mon préféré !
Quand on a fait tomber un échantillon à terre, on a totalement respecté la règle des 5 secondes
"Règle" que si quelque chose est resté à terre moins de 5 secondes (3 selon certains) ça n'est pas contaminé. Je ne l'ai jamais vu appliqué à autre chose qu'un biscuit pour de vrai.
On a fait tourner les échantillons à 1300 rpm, parce qu'après la machine fait un bruit inquiétant.
Ah vous voulez des méthodes que vous pouvez suivre ? Pff, regardez la couverture du journal, c'est Nature ici
Dans les journaux très prestigieux comme Nature et Science, il n'y a presque pas de place pour les méthodes, qui sont généralement peu détaillées et incompréhensibles.
On voulait voir ce qui se passerait si on faisait X, juste pour s'amuser. Super explosion ! On a trouvé une hypothèse plus tard.
On a laissé incuber pour la durée du repas.
Y a beaucoup de variantes sur le thème "on a choisi un temps d'expérience correspondant au repas, à la pause café, à rentrer dormir une bonne nuit, à avoir un week-end peinard".
Le pH du tampon a été ajusté avec du HCl, puis dans l'autre sens avec du NaOH... puis encore un peu de HCl...
On a utilisé ce programme, parce que tout le monde le fait, non ?
Vous pouvez télécharger notre code à l'URL fournie. Bonne chance pour télécharger la seule personne qui arrive à le faire fonctionner.
Les données sont anciennes parce qu'entre la première version du papier et la finale, j'ai eu un bébé.
Et ceux que j'ai écrit moi-même :
Nous avons utilisé une méthode que nous ne connaissons ni ne comprenons parce que le reviewer 2 nous l'a demandé et les résultats ne nous dérangent pas de toutes façons.
Je n'ai jamais fait ça ! Mais j'ai été tenté, et j'ai parfois utilisé une méthode dont je pense qu'elle n'apporte rien parce qu'on me l'a demandé et qu'en effet ça ne contredisait pas mes résultats (mais je comprenais pourquoi - je crois). Ma contribution la plus retweetée à ce bazar.
Nous n'avons pas utilisé la parsimonie parce que les cladistes étaient tellement arrogants dans les années 90.
Très technique, et d'ailleurs pas retweeté. Les intéressés se reconaitront.
Les calculs ont été effectués sur un super-ordinateur, un cluster, un grid et le cloud pour justifier nos financements. Résultats montrés : viennent de mon PC.
Alors c'est une grosse exagération, mais ça arrive qu'on doive justifier de l'usage d'une resource informatique alors qu'on n'a pas encore l'application pertinente, et qu'on fasse un calcul qui aurait pu se faire ailleurs. Normalement, c'est parce qu'on va vraiment utiliser la resource bientôt et qu'il faut mettre au point. Mais j'ai expertisé des papiers où j'ai vraiment l'impression qu'ils ont fait ça.
On a utilisé Uniprot pour la Figure 1 et Ensembl pour la Figure 2 parce qu'ils ont été faits par des postdocs différents à 2 ans d'écart.
Un peu simplifié pour le tweet, mais il m'est arrivé en gros ça : des sources de données différentes utilisées à différents endroits du papier parce qu'il a été tellement long à préparer. Dans ces cas-là, on ajoute normalement un contrôle pour vérifier que ça ne biaise pas le résultat.
Moi j'ai trouvé beaucoup de ces tweets hilarants. Un truc auquel on pourrait s'attendre c'est que des anti-science ou anti-intellectuels se précipitent dessus pour dire "voilà la face noire et cachée de la science, voilà à quoi ils dépensent nos sous, j'avais bien dit qu'on ne pouvait pas leur faire confiance". Plus inatendu pour moi, des scientifiques s'inquiètent de ce que ces tweets montrent des pratiques scientifiques douteuses (par exemple ici). A quoi je répond, détendez-vous les gars.
Et à tout seigneur tout honneur, il faut noter que PhD Comics avait anticipé cet humour :
[caption id="attachment_729" align="aligncenter" width="508"]
vendredi 4 janvier 2013
Redif : test de l'oignon
Pendant les fêtes, je vais faire quelques rediffusions de billets de mon ancien blog sur blogspot. Voici la troisième et dernière redif. Billet original ici.
Intuitivement, on s'attends à ce que les organismes plus complexes aient besoin d'un génome plus complexe pour coder tout ça. Pas du tout, il n'y a aucun rapport évident entre complexité de l'organisme et taille du génome. Cela s'appelle le "paradoxe C". (Parce qu'au temps où on savait peu de choses sur l'ADN, on avait remarqué que tous les individus d'une espèce en avaient autant ; oh une constante dirent les biologistes envieux des physiciens, appellons-la "C" ; ergo C = quantité d'ADN par cellule dans une espèce, et on s'en fout ; pourquoi ? on y vient.)
Solution au paradoxe C : c'est pas tout des gènes, loin de là. Donc les organismes plus complexes ont plus de gènes, peu importante l'ADN pourvu qu'on ait les protéines. Alors et de une, ça ne marche pas non plus. Vers nématode, 1000 cellules à tout casser, 20 000 gènes. Humain, capable d'inventer des bombes atomiques, 20 000 gènes (vous me direz, il a des transcrits alternatifs ; allez lire Sandwalk et laissez-moi tranquille). Argl gosh. Et de deux, ça laisse un autre problème vexant : à quoi sert tout cet ADN qui n'est pas des gènes ?
Alors il y a deux écoles en gros :
Et c'est là que viennent lesonions oignons. T. Ryan Gregory, qui étudie les variations de taille des génomes, a proposé le test de l'oignon pour tous ceux qui déclarent avoir trouvé l'explication ultime pourquoi tout cet ADN sert à quelque chose (quelle phrase moche mais j'ai la flemme de chercher mieux). Le test c'est que votre explication doit expliquer deux choses simples : pourquoi l'oignon que l'on mange, Allium cepa, a 17 pg d'ADN alors que nous les humains n'en avons que 3,5 pg. Et pourquoi des espèces d'oignonoïdes qui se ressemblent et vivent heureusement à l'état de nature ont entre 7 et 31,5 pg d'ADN. S'il y a des biologistes moléculaires qui me lisent, tous les détails techniques du défi sur le blog de Gregory.
Vous aurez deviné que je me classe dans les neutralistes bien sûr. Comme tous les gens beaux, drôles et intelligents. Voir aussi cette excellente collection d'essais sur le blog Sandwalk (par un prof de biochimie canadien).
![]() |
| cliquez sur l'image |
Intuitivement, on s'attends à ce que les organismes plus complexes aient besoin d'un génome plus complexe pour coder tout ça. Pas du tout, il n'y a aucun rapport évident entre complexité de l'organisme et taille du génome. Cela s'appelle le "paradoxe C". (Parce qu'au temps où on savait peu de choses sur l'ADN, on avait remarqué que tous les individus d'une espèce en avaient autant ; oh une constante dirent les biologistes envieux des physiciens, appellons-la "C" ; ergo C = quantité d'ADN par cellule dans une espèce, et on s'en fout ; pourquoi ? on y vient.)
Solution au paradoxe C : c'est pas tout des gènes, loin de là. Donc les organismes plus complexes ont plus de gènes, peu importante l'ADN pourvu qu'on ait les protéines. Alors et de une, ça ne marche pas non plus. Vers nématode, 1000 cellules à tout casser, 20 000 gènes. Humain, capable d'inventer des bombes atomiques, 20 000 gènes (vous me direz, il a des transcrits alternatifs ; allez lire Sandwalk et laissez-moi tranquille). Argl gosh. Et de deux, ça laisse un autre problème vexant : à quoi sert tout cet ADN qui n'est pas des gènes ?
Alors il y a deux écoles en gros :
- Ceux qui disent que ça doit forcément servir à quelque chose, mais on ne sait pas encore à quoi. Ils poussent des cris de victoire chaque fois qu'un article découvre une nouvelle fonction pour 0,1% du génome humain. Curieusement, ils se recrutent dans deux camps : les né0-Darwinistes orthodoxes, pour qui toute l'évolution s'explique forcément par la sélection naturelle, donc tout doit servir à quelque chose. Et les créationistes, pour qui tout a été crée par le Père Noël pour une raison, et donc doit servir à quelque chose. (Pas si curieusement que ça au fond : le Darwinisme est une réponse à la théologie naturelle, les deux répondent à la question de l'adaptation fonctionnelle des organismes, et s'opposent aux approches dites structuralistes, qui répondent à la question de la forme des organismes, y compris ce qui ne sert à rien.) (trop de parenthèses aujourd'hui, vous ne trouvez pas ?) (trop de parenthèse tue la parenthèse.
- Et ceux qui disent que non c'est de la merde ("junk" en jargon technique), ça ne sert à rien. Plutôt des neutralistes, à savoir des gens qui pensent que la plus grande partie de l'évolution moléculaire est due au hasard.
Et c'est là que viennent les
Vous aurez deviné que je me classe dans les neutralistes bien sûr. Comme tous les gens beaux, drôles et intelligents. Voir aussi cette excellente collection d'essais sur le blog Sandwalk (par un prof de biochimie canadien).
Inscription à :
Articles (Atom)
