vendredi 13 juillet 2012

Grandeur et chute de la bioinformatique ? Promesses et progrès

[caption id="attachment_301" align="aligncenter" width="400"] cliquez sur l'image[/caption]

De manière exceptionnelle, ce billet va consister pour l'essentiel en la traduction d'un article paru dans une revue spécialisée. Il s'agit d'un article d'opinion, écrit par Christos Ouzounis, bioinformaticien grec, qui décrit de manière que je trouve intéressante l'histoire de la bioinformatique, discipline jeune, et de ses relations avec le reste de la biologie.

J'ai le droit de traduire et publier cet article parce qu'il est publié dans PLoS Computational Biology sous copyright Creative Commons, ce qui nous rappelle l'utilité de la publication ouverte en sciences. J'ai quand même demandé l'autorisation de Christos, par politesse, et il me l'a volontiers donnée. Ma traduction n'a pas préservé les citations bibliographiques, ce qui m'aurait réclamé un travail supplémentaire que je n'avais pas le temps de faire. Déjà, je dois dire que si je m'étais rendu compte du travail que cela représenterait, je n'aurait pas entrepris de le faire.

En plus de traduire l'article, je vais ajouter mes commentaires dans un format un peu différent, comme ceci.


Dernier point : j'ai déjà tendance à faire des anglicismes en temps normal (mon activité scientifique étant en anglais), donc dans la traduction il y en aura surement d'autant plus. Je m'en excuse par avance.

 

vendredi 6 juillet 2012

Annoter un gène, un génome, c'est quoi ?

[caption id="attachment_258" align="aligncenter" width="267"] cliquez sur l'image[/caption]

En réponse aux questions obtuses de JRobinss (ex Julien) sur le billet "conjecture orthologue", je vais expliquer le mot annotation en contexte de bioinformatique / génomique, et au passage montrer que dans la biologie moderne, les expériences fournissent des données incompréhensibles et inutiles à moins que de bons et nobles bioinformaticiens ne leur donnent du sens.

Au début, était le génome. On l'a séquencé. Qu'est-ce que ça veut dire ? Ca veut dire qu'on a lu la suite des nucléotides, ou bases, qui le constituent. Et ça nous apprend quoi ? En première approximation, rien. Pour expliquer plus avant, nous allons plonger à corps perdu dans les analogies. Les analogies sont de mauvais guides pour le raisonnement, mais parfois une bonne manière d'expliquer (sauf quand c'est moi, mais c'est mon blog).

Alors un génome est une suite de bases comme du texte écrit est une suite de lettres. Ou d'idéogrammes, ça dépend comment c'est écrit. Prenons justement l'exemple des idéogrammes. Supposons que vous ne lisiez pas le chinois (une supposition peu risquée pour la plupart de mes lecteurs je pense), et qu'on vous offre l'oeuvre intégrale de Confucius en version originale. Si vous parcourez toutes les pages, et regardez tous les caractères, vous aurez d'une certaine manière "lu" Confucius. Mais on est d'accord que ça ne vous aura pas apporté grand-chose. Si je vous montre la séquence complète du génome humain, ça sera à-peu-près pareil.

Bien sûr on ne sait pas rien du génome, alors disons que vous avez pris un an de cours de chinois. Vous commencez à reconnaître des caractères ici et là, vous pouvez lire une phrase simple, vous reconnaissez la structure. Mais le plus gros ne fait toujours pas sens.

Alors ça c'est trop simple, vous savez que dans le livre tous les caractères font sens, et sont utiles à la compréhension du tout. Dans un génome, vous ne savez pas où sont les gènes, les séquences régulatrices, et les morceaux qui ne font rien. Donc on va compliquer l'analogie. Maintenant on va recoder Confucius en Unicode, et ajouter à des endroits au hasard (y compris donc au milieu des phrases) des séries de caractères alphanumériques aléatoires.

Je vous donne ceci, et votre mission est de : trouver les codes correspondant à des caractères chinois, les décoder, comprendre le sens de ces caractères (qui n'aura pas toujours une traduction française non ambigue), comprendre le sens des phrases qu'ils composent, et finalement comprendre l'oeuvre de Confucius. Facile.

Eh bien annoter un génome, c'est ça. On doit trouver les éléments fonctionnels (gènes - qui peuvent être coupés en morceaux, séquences régulatrices des gènes, etc), définir au moins d'une certaine manière ce qu'ils font (leur fonction), et si possible définir la façon dont ces éléments fonctionnent ensemble pour faire de la biologie, une cellule, un organisme.

Comme le programme complet est très ambitieux, et franchement pas faisable en l'état de nos connaissances (on est en 2ème année de chinois là), on se focalise généralement sur deux objectifs :

  • Définir les éléments fonctionnels du génome ; pour les gènes codant pour des protéines c'est presque facile, pour le reste on galère encore pas mal mais on progresse.

  • Définir la fonction au moins des gènes à un niveau simple, genre "c'est une enzyme impliquée dans la digestion". C'est de ce type-là d'annotation qu'on causait dans le billet précédent sur les orthologues. La question était donc de voir si on avait annoté les orthologues avec des fonctions similaires, et on trouvé trouvait surtout que les annotations dépendaient de la personne qui avait fait l'étude.


Je pousse mon analogie un peu loin, là, mais disons que si deux groupes d'étudiants "annotent" comme ceci deux versions différentes de Confucius (en mandarin et en cantonais, allez), et qu'ils ont étudié avec des profs différents et qu'ils ont des intérêts différents, on aura peut-être des traductions plus similaires entre chapitres d'une même version, qu'entre chapitres correspondant des deux versions, non pas parce que les textes sont vraiment plus similaires, mais parce qu'ils se focalisent sur les mêmes ensembles limités de mots, et font les mêmes choix lorsque c'est ambigu. (Pour que l'analogie marche vraiment faudrait des chapitres dupliqués qui ont presque mais pas tout-à-fait le même sens, mais ça devient vicieux.)

Bon j'espère que c'est plus clair, sinon enguelez-moi dans les commentaires. En tous cas, vous pouvez constater que la biologie c'est bien compliqué, allez, et c'est pour ça qu'en même temps que lire une séquence d'ADN devient de plus en plus facile, la comprendre reste un défi.

lundi 25 juin 2012

Article d'opinion dans Le Temps sur le libre accès #openaccess

[caption id="attachment_245" align="aligncenter" width="288"] cliquez sur l'image[/caption]

Si tout va bien, un article d'opinion de ma part doit être sorti aujourd'hui dans le journal Le Temps. La version dans le journal inclut quelques modifications faites par le journaliste du Temps. J'ai décidé de mettre ici ma version originale. J'en profite pour l'enrichir de quelques liens, et remercier mes relecteurs, qui se reconnaitrons : Anne-Françoise, Christine, Dalit, et Julien.

vendredi 15 juin 2012

Publications en libre accès : les perdants #openaccess

[caption id="attachment_228" align="aligncenter" width="150"] cliquez sur l'image[/caption]

Pour compléter mon billet sur les gagnants potentiels du libre accès à la litérature scientifique, voici les perdants auxquels je peux penser :

  • Les actionaires des éditeurs scientifiques, qui ne feraient plus des bénéfices de plus de 30%. C'est peu dire que je m'en fous.

  • Les employés d'Elsevier et toute autre companie qui ne s'adapterait pas, s'ils font faillite. C'est très dommage, mais on ne peut pas bloquer tout l'accès à l'information pour permettre à quelques personnes de garder leur travail. Et je n'ai jamais vu démontré que le passage au libre accès ménerait globalement à une perte d'emplois. Après tout, PLoS et BMC emploient bien des personnes aussi.

  • Plus pertinent, de nombreuses sociétés savantes co-gèrent des journaux avec les éditeurs privés, et en reçoivent une partie des bénéfices. Par exemple la société européenne de biologie évolutive publie avec Wiley le Journal of Evolutionary Biology, et reçoit 50% des bénéfices. Ceci constitue la majeure partie de son budget, qui lui permet de financer en partie les conférences européennes de biologie évolutive, la venue d'étudiants et de collègues de pays pauvres, de la communication scientifique sur l'évolution, etc. Je ne voudrais pas sous-estimer le rôle de ces sociétés. Je note quand même trois points : l'un c'est qu'il y a des sociétés qui survivent sans un tel "pacte avec le diable", comme la société internationale de biocuration, que je connais bien pour en être trésorier. Alors on est une petite société, mais on fait un congrès annuel, on a une page web et une liste email, on représente les biocurateurs auprès d'instances diverses, et on supporte même financièrement la venue de collègues de pays pauvres au congrès. Donc il y a d'autres moyens. Le deuxième point, c'est qu'il me semble que le dégat social du à la publication en accès fermé est nettement plus grand que le gain du aux sociétés savantes. S'il faut faire des choix, le mien est fait. Troisièmement, ce genre d'arrangements porte le risque à long terme que l'objectif affiché de la société (défendre la science et les scientifiques) soit négligé par rapport à un objectif financier lié au journal. C'est ce qui est arrivé à mon avis à la très riche société américaine de chimie, devenue à un moment un des plus gros adversaires du libre accès (d'après une recherche web rapide, ils semblent s'être calmés).

  • Les chercheurs de labos pas très riches et pas très pauvres. Dans le libre accès, c'est généralement le labo de recherche qui paye la publication, alors que dans le modèle classique c'est le budget de la bibliothèque. Si vous êtes dans un labo très pauvre, vous pouvez obtenir de ne pas payer (PLoS est OK avec ça si "vous n'avez pas de fonds permettant de payer"). Si vous êtes très riche, tout va bien (bin tiens). SI vous êtes entre deux, que vous avez des sous mais que c'est soit payer le libre accès, soit payer votre thésard deux mois de plus ? Ah. Ceci me paraît aisément le plus gros obstacle. Pour le lever, deux solutions : que les institutions qui financent la recherche acceptent de payer ces factures (ce que fait par exemple le Welcome Trust en Grande Bretagne), ou que ces factures soient couvertes par les budgets des bibliothèques (ce qui est le cas pour BMC seulement dans mon université).


Je pense que le problème réel c'est que nous sommes dans une transition entre deux états stables. On passe d'un pic de fitness optimale (ou un creux d'énergie minimale pour les physiciens) à un autre, en passant par une vallée sub-optimale. Dans cette vallée, on doit continuer à payer les abonnements, tout en payant le libre accès ; une partie des budgets est attachée aux bibliothèques, qui n'ont pas vocation à payer les frais des équipes de recherche, et une partie est donnée aux projets de recherche, qui n'ont pas vocation à remplacer les bibliothèques. A terme je pense que cela va se stabiliser, et que le coût total pour un labo moyen, qui lit autant de litérature qu'un gros mais publie moins, va être plus faible qu'avant. A condition de voir l'ensemble, donc non seulement les crédits de chaque équipe, mais l'ensemble de l'argent public et de charités (genre Telethon) qui va dans les projets de recherche, mais aussi les bibliothèques, les salaires, etc.

A ce propos, je signale une expérience nouvelle qui paraît intéressante, même si je ne sais pas encore vraiment quoi en penser : PeerJ est un nouveau journal libre accès pour lequel chaque auteur aura besoin de payer une fois dans sa vie une somme relativement faible ($99 à $259 - publier un article dans PLoS One coûte $1350 et c'est considéré bon marché). Leur plan est qu'il y a des millions de scientifiques, et que chaque co-auteur de chaque papier (jusqu'à 12, après c'est gratuit) devra payer.

vendredi 8 juin 2012

le test Erin Brokovitch

[caption id="attachment_181" align="aligncenter" width="165" caption="cliquez sur l'image"][/caption]

Sophien Kamoun, un biologiste des plantes, a récemment proposé sur Twitter le "test Erin Brokovitch" pour juger de la sincérité des scientifiques par rapport à une technologie. C'était dans le cadre d'une attaque par des militants anglais contre des essais OGM non comerciaux, qui visaient à produire du blé nécessitant moins d'insecticides. Le test est basé sur la scène du film où les vilains n'ont pas le courage de boire leur propre eau (poluée) :

lien vers la video (ça marche pas d'inclure la vidéo dans le billet dans Wordpress ?)

http://www.youtube.com/watch?v=FavCK1bhHOY

Alors je me suis amusé à trouver quelques tests "Erin Brokovitch". En connaissez-vous d'autres ?

  • Les biologistes moléculaires des plantes sont prêts à manger des OGM (moi aussi).

  • Par contre plein de biologistes qui étudient l'écologie refusent d'en planter dans leur jardin (moi ça ne me gène pas trop).

  • Les informaticiens ne veulent pas du vote électronique (moi non plus, très fortement).

  • Certains génomiciens sont prêts à faire séquencer leur génome, d'autres non (moi).

  • Les médecins et les immunologues font vacciner leurs enfants.

  • Je séche pour un test à donner aux climatologues pour juger de leur sincérité concernant les prédictions climatiques.

vendredi 1 juin 2012

Tout le monde doit pouvoir lire la litérature scientifique, j'y tiens #openaccess

[caption id="attachment_181" align="aligncenter" width="165" caption="cliquez sur l'image"][/caption]

Désolé de revenir encore à cette question du libre accès à la litérature scientifique, mais cela me paraît très important, et surtout il y a un commentaire que j'entends ou je lis souvent, et auquel je veux répondre : permettre l'accès libre et gratuit à la litérature scientifique ne servirait à rien, parce que personne ne serait capable de la comprendre.

Cet argument a tendance à m'énerver, d'abord parce qu'il suppose qu'il y a un coût à rendre l'information scientifique disponible, et qu'il faudrait donc d'abord faire une étude coût-bénéfice avant de passer au libre accés. Allo ? Internet ? 2012 ? Oui il y aurait eu un coût en 1990 à permettre à tout le monde de recevoir gratuitement tous les journaux scientifiques à la maison. Mais aujourd'hui c'est plus simple de laisser tout le monde lire que de mettre des barrières. Oui il y a le coût des serveurs, mais si l'argument c'est que personne ne va lire, ça ne tient pas (plus on sert de gens, plus il faut des serveurs chers et plus il faut d'électricité chère). Si tout le monde va lire par contre, ça coûte des sous, mais bin y a un intérêt on dirait. Et rappel, comme le disait récemment Michael Eisen, le libre accès ce n'est pas ne plus payer la publication scientifique, c'est la payer en amont (la recherche) et non en aval (la recherche plus tous les autres utilisateurs potentiels).

Venons-en au fond de l'argument. Si toute la litérature scientifique était libre d'accès, qui en profiterait ?

  •  Les chercheurs. On a tous des journaux auxquels notre université n'est pas abonnée. Il y a un mois environ, on me signale une revue intéressante sur des méthodes bioinformatiques et génomiques dans RNA. Ah mais bien que RNA soit un journal de société savante, je n'y ai pas accès. Et je suis dans une université riche, dans un pays (très) riche.

  • A propos de chercheurs, c'est sympa d'encourager la recherche interdisciplinaire, mais ça nécessite de lire un ensemble plus vaste de journaux différents (pas forcément plus d'articles, mais d'origines diverses). Si vous voulez être à l'interface biologie-informatique dans un institut de biologie, pas sûr que votre bibliothèque soit abonnée aux journaux d'informatique. Si vous voulez appliquer la physique à la médecine dans un institut technologique ... vous suivez.

  • Encore les chercheurs. Winston Hide, Sud Africain travaillant à Harvard, a récemment démissioné du comité de lecture d'un journal de génomique à cause de son expérience en Afrique du Sud, où comme dans tous les pays du Tiers Monde il est très difficile d'avoir accès aux revues payantes.

  • Dernier exemple issu de la recherche : le nombre d'articles augmentant exponentiellement, beaucoup d'informations peuvent être difficiles à trouver. On développe de plus en plus le "text mining", la recherche automatisée d'informations dans les articles. Par exemple OpenSNP, développé par des étudiants, récupère l'information dans les articles libre d'accès concernant les variations génétiques humaines, et vous permet de comprendre les résultats d'un test génétique en temps réel de l'avancement de la recherche. Pour autant qu'elle soit disponible en libre accès. Pour une explication des problèmes au text mining (en anglais), voir cet article du Guardian.

  • Mais sortons de la recherche pure. Oui les grosses boîtes pharma, chimiques, télécom, etc, peuvent payer tous les abonnements, et ça rapporte des sous aux éditeurs scientifiques. Mais quid des start-up, des petites companies biotech ou high-tech, ou même des moyennes (les abonnements sont très chers si on veut couvrir largement un domaine) ? Une des motivations paraît-il pour les start-up qui s'agglutinent près des grandes universités est l'accès à leurs bibliothèques. Ce point de l'accès des PME technologiques me paraît très important. Il s'agit de réserves d'innovation et de croissance très importantes. Alors (1) les gouvernements payent pour la recherche publique, puis (2) ils payent pour l'accès des universités à cette même recherche, et (3) ils subventionnent les start-up. Argent qui peut par exemple servir à payer des abonnements pour lire la recherche subventionnée par les gouvernements en (1), ou à payer des loyers élevés dans des hubs technologiques où le gouvernement paye ces abonnements de toutes façons. Hmmm. Peut-être que cela ferait légèrement sens de donner accès aux innovateurs à la connaissance scientifique ? Je dis ça, je dis rien.

  • Autre groupe très important : les associations de malades. Pour de nombreuses maladies, dont les traitements sont encore en évolution constante, les patients doivent avoir accès à l'information. Alors on arrive ici dans le cas de personnes par forcément formées à la recherche scientifique. Mais d'une part l'auto-formation de personnes motivées à un domaine qui les touche directement ne doit pas être handicapé par le manque d'accès à l'information, et d'autre part des réseaux peuvent mettre en lien patients plus ou moins bien formés (bin oui, des chercheurs en oncologie peuvent attraper des cancers), des chercheurs, des médecins, etc. Une recherche Google rapide trouve par exemple le site SciencAs' de l'INSERM, qui met en relation chercheurs biomédicaux à la retraite et associations de malades (plus de 370 apparemment). C'est sympa si en plus ils peuvent lire et échanger les résultats de la recherche médicale payés avec leur impôts, hein ?

  • Il existe quantité d'autres sujets sur lesquels des personnes qui ne travaillent pas dans la recherche peuvent avoir vocation à se regrouper, se former, et vouloir se tenir au courant de la recherche au moins superficiellement. La protection de la nature, la paléoanthropologie et la paléontologie, l'astronomie, l'informatique, etc, sont autant de domaines dans lesquels les amateurs éclairés peuvent avoir un niveau très décent. Et peuvent profiter d'un accès aux articles de recherche. Tiens d'ailleurs à ce propos, ces articles qui sont fermés au public ne comprennent pas que les comptes-rendus de résultats bruts (déjà importants), mais aussi des articles dits "de revue", dans lesquels des chercheurs font la synthèse de ce que l'on sait dans un domaine à un moment. Rendre ces articles accessibles comblerait un vide important entre la vulgarisation proprement dite et la litérature primaire.

  • Parmi les sujets de recherche, certains font l'objet de débats publics. Il est souvent difficile de savoir à l'avance lesquels. J'ai des copains qui sont allés étudier la génétique végétale au début des années 1990 (oui je suis vieux) pour ne pas avoir à tuer des souris, et qui se sont retrouvés au milieu des débats sur les OGM. Que ce soit le créationisme, les OGM, le changement climatique, le nucléaire, les ondes des portables, ou les effets de la chasse, cela me paraît important de pouvoir montrer que les scientifiques n'ont rien à cacher. On doit rendre public et disponibles à tous et nos résultats et nos données. Certains domaines sont plus avancés que d'autre pour cela, mais ça doit un objectif vers lequel tendre. Ensuite, il peut y avoir des cas où un non spécialiste, mais compétent en programmation et/ou en statistiques, décèle une erreur. Il faut écouter.

  • Les journalistes scientifiques ! Le Monde, Le Temps, et autres, n'ont pas des abonnements à toutes les revues scientifiques. Ils lisent ce que les attachés de presse veulent bien leur envoyer. Ca serait pas cool, qu'il puissent chercher par mots-clés et par recommendations twitter, et écrire là-dessus aussi ?

  • D'ailleurs j'élargis le cercle. Des millions de personnes font des études de sciences, d'ingéniérie, ou autres sujets proches, et ne travaillent ensuite pas dans la recherche. Ces personnes ont des familles, des amis, des voisins. Interviennent sur des blogs, des discussions Facebook ou Twitter. Si toute la recherche scientifique est libre d'accès, et que l'on forme les étudiants à le savoir, à savoir aller chercher cette information, ou simplement que l'on met des liens vers les articles libre d'accès dès que possible (oui je vous regarde, journalistes scientifiques des grands médias), alors cela peut permettre une nettement plus grande diffusion de connaissances et de compréhension de la science.

  • Un sous-ensemble important de ces personnes formées à la science mais ne travaillant pas en recherche sont les enseignants du secondaire. Pas tous les articles sont très techniques et illisibles, et en plus pas la peine de sous-estimer les capacités d'une personne motivée titulaire d'un bachelor/licence ou d'un master. Avoir accès aux articles scientifiques, pour au moins pouvoir montrer les figures originales d'une découverte rapportée dans la presse, voire pour aider à un projet de lycée, même si cela était exploité dans un cas sur 100 ça serait super.


Je suis sûr que j'ai oublié des utilisateurs potentiels, mais je veux finir sur deux rappels et deux appels.

Rappel numéro 1 : tout ceci ne coûterait pas un centime de plus. Au contraire, si toute la recherche était publiée libre d'accès, cela coûterait moins cher.

Rappel numéro 2 : libre, cela veut aussi dire que le copyright n'est pas donné à des sangsues du type Elsevier, et que la réutilisation pour illustrer Wikipedia, un article de magazine, ou un cours de lycée est légale et gratuite.

Appel numéro 1 : chers journalistes scientifiques, donnez toujours un lien vers l'article d'origine. S'il est libre d'accès, soulignez-le. S'il ne l'est pas, soulignez-le aussi. Comme ça tout le monde pourra voir d'où vient la science, ou pourra comprendre que c'est un scandale de lui bloquer l'accès.

Appel numéro 2 : signez la pétition sur le site de la Maison Blanche pour que toute la recherche financée par le gouvernement américain soit disponible librement (voir aussi discussion sur le site Passeur de sciences). C'est insuffisant, mais ça serait un bon début et un signal fort. La pétition a besoin de 25'000 signatures pour que Obama soit obligé de lui répondre. Elle va surement les atteindre, et il va surement répondre. Mais l'effet ne sera pas le même à 25'001 signatures, ou à 1 million. Chaque voix compte. Pour signer, pas besoin d'être américain ou d'habiter aux USA. Suffit d'avoir plus de 13 ans. Allez, elle est ici :

https://wwws.whitehouse.gov/petitions/!/petition/require-free-access-over-internet-scientific-journal-articles-arising-taxpayer-funded-research/wDX82FLQ

Mise à jour : vu sur Twitter : "Breakdown of PubMed Central users: 25% universities/academic; 18% government; 40% citizens/private; 17% businesses"

Mise à jour : la pétition a passé les 25'000 signatures, et voici la réaction de PLoS, demandant à continuer à signer et faire signer.

vendredi 25 mai 2012

Histoire d'un article : la solution de la conjecture orthologue




Aujourd'hui un billet un peu particulier. Nous avons publié récemment un papier sur la fonction de gènes orthologues et paralogues (voir aussi ce billet), et mon co-auteur Christophe Dessimoz a écrit un billet invité sur le blog de Jonathan Eisen, qui donne "l'histoire derrière le papier". Je vais vous proposer ici une traduction de son billet, avec des modifications pour accommoder le fait que son histoire est à la première personne (à savoir Christophe), et qu'ici c'est mon blog, et donc ça sera à la première personne à savoir moi. Je remercie Christophe de m'avoir autorisé à ré-utiliser ainsi son texte.

Avertissement : ce billet est un peu technique ; mais je pense qu'il est intéressant de montrer comment fonctionne la recherche en vrai.

Dans cet article, nous avons soutenu la "conjecture orthologues", à savoir l'idée très répandue mais peu testée que les orthologues tendent à être davantage conservés fonctionnellement que les paralogues.

Dans ce billet nous allons également explorer quelques problèmes plus généraux, y compris les écueils de l'analyse statistique sur des données très hétérogènes comme la Gene Ontology, et le rôle clé de l'expertise par les pairs (peer-reviewing).

Comme beaucoup d'autres projets en bioinformatique, celui-ci a démarré comme une analyse rapide qui allait prendre "quelques heures", et a fini par nous occuper pendant plusieurs années...

La conjecture orthologue et les hypothèses alternatives

La conjecture orthologue est l'hypothèse que, en moyenne et pour des niveaux de divergence de séquence similaires, des gènes qui ont divergé par spéciation (des "orthologues") sont plus similaires en fonction que des gènes qui ont divergé par duplication ("paralogues"). Elle est basée sur l'idée que la duplication de gènes est un moteur principal de l'innovation fonctionnelle. Ceci fait sens, intuitivement, parce que la copie supplémentaire obtenue par duplication devrait avoir la liberté d'évoluer une nouvelle fonction. Tout ceci forme le "dogme" conventionnel.

Alternativement, pour des niveaux similaires de divergence de séquence, il pourrait ne pas y avoir de différence particulière entre orthologues et paralogues. C'est le modèle le plus simple, et il fait sens si la fonction d'un gène est uniquement porté par sa séquence protéique (nous ne considérons ici qu'un produit protéique par gène). D'après cette hypothèse, nous attendons une corrélation forte entre similarité de séquence et de fonction.

Mais ce ne sont pas les seules hypothèses possibles. Notamment, Nehrt et collègues ont trouvé une conservation de fonction plus forte entre homologues dans la même espèce, qu'entre homologues d'espèces différentes, ce qui les a amené à conclure que "l'aspect le plus important de la similarité de fonction n'est pas la similarité de séquence, mais plutôt la similarité de contexte". Si l'environnement (le "contexte") est bien la force évolutive principale, il n'est pas déraisonable de spéculer que les paralogues dans la même espèce puissent évoluer de manière corrélée, et soient ainsi fonctionnellement plus similaires que leurs équivalents entre espèces.

Pourquoi s'embêter à tester ces hypothèses ?

Tester ces hypothèses est important non seulement pour une meilleure compréhension générale de l'évolution de la fonction des gènes, mais aussi parce que cela a des implications pratiques. La grande majorité des annotations fonctionnelles des gènes (98% des annotations Gene Ontology) sont propagées computationnellement, depuis des données expérimentales dans une poignée d'organismes modèles. Et la propagation utilise souvent des modèles du type de la conjecture orthologue.

Comment notre travail a commencé

Notre projet est né durant une pause à la conférence pour le 10ème anniversaire de l'Institut suisse de bioinformatique, en septembre 2008. Christophe m'expliquait son travail avec Adrian Althenhoff sur l'évaluation de méthodes de détection d'orthologues, dans lequel ils avaient utilisé la similarité de fonction comme indicateur de l'orthologie. Ils avaient implicitement supposé que la conjecture orthologue était correcte, ce que je leur ai fait remarquer. J'étais assez sceptique de cette conjecture, et vers cette époque, avec mon doctorant Romain Studer, nous avions publié un article d'opinion dans Trends in Genetics, intitulé "How confident can we be that orthologs are similar, but paralogs differ?" (chez Elsevier pas libre d'accès, désolé ; exemplaire gratuit ici). Avec toutes les données en main, nous avons décidé de retourner l'analyse d'Adrian et Christophe, et de comparer la similarité d'annotation Gene Ontology des orthologues et des paralogues. Loin de nous l'idée que cette analyse nous occuperait plus de 3 ans !

Première tentative

Cela nous a pris seulement quelques semaines pour obtenir nos premiers résultats. Mais nous étions très intrigués. Comme Nehrt et al. allaient le publier plus tard, nous avons observé que les paralogues au sein de la même espèce tendaient à être plus conservés fonctionnellement que les orthologues. Au départ nous étions très sceptiques. Après tout, Christophe s'attendait à confirmer la conjecture orthologue, et je penchais en faveur d'une divergence uniforme. Nous avons commencé à contrôler pour toutes sortes de biais potentiels, et à contrôler la structure des données (par exemple la source des prédictions d'orthologie / paralogie, les mesures de similarité de fonction ou de séquence, la variation entre groupes d'espèces). Après un an, nos annexes étaient devenus un PDF de 67 pages rempli à craquer de graphes. Mais l'observation de départ tenait sous toutes sortes de conditions. A ce point, nous commencions à penser que nos résultats n'étaient pas artéfactuels, et qu'il était temps de les rendre publics. (Nous commencions aussi à manquer d'idées pour des contrôles supplémentaires, et espérions que les experts pourraient nous aider !)

Rejets

Nous avons essayé de publier le papier dans des journaux prestigieux, mais notre manuscript a été rejeté avant d'être expertisé. Nous avons trouvé frustrant que, bien que le travail soit jugé important, il soit rejeté avant expertise pour raison invoquée de problème technique. L'éditeur devrait juger de l'importance, et les experts de la qualité technique, en principe.

Finalement Genome Research a envoyé notre manuscript à expertiser, et nous avons reçu un rapport critique mais informatif. L'expert a dit que nos résultats étaient dus à des facteurs espèce-spécifiques, dus à ce que "les paralogues dans la même espèce tendent à être 'manipulés' ensemble, par les expérimentateurs et les annotateurs". L'argument était construit sur un exemple que nous avions discuté dans le papier : Cdc10/Cdc12 chez S. cerevisiae et Spn2/Spn4 chez S. pombe sont des paralogues au sein de chaque espèce (des levures - des champignons unicellulaires), tandis que Cdc10/Spn2 et Cdc12/Spn4 sont les paires d'orthologues. Les annotations Gene Ontology des orthologues étaient très différentes, tandis que les annotations des paralogues étaient très similaires. L'expert a regardé les articles d'origine des annotations en détail, et a remarqué que "la divergence fonctionnelle entre ces gènes est davantage apparente que réelle". Les deux paires de paralogues sont des composants de l'anneau de septines (Wikipedia en anglais). Les différences d'annotation semblent dues à des différences dans les expériences faites et la façon dont elles ont été transcrites. L'expert a écrit :

"Un unique papier va souvent examiner les phénotypes [effets sur l'organisme] de plusieurs paralogues dans une espèce, menant à un papier, qui est probablement traité par un annotateur GO à la fois. Par contre, les phénotypes des orthologues dans différentes espèces proviennent presque toujours de papiers différents, via des équipes d'annotateurs différentes."

L'effet 'auteur' : un biais facile à rater

Au départ, c'était tentant de simplement écarter la critique. Après tout, "le pluriel d'anecdote n'est pas données" [ref]. Plus important, nous avions essayé de prendre en compte plusieurs biais espèce-spécifiques, tels que les différences de fréquence d'annotations entre espèces (par exemple étude surtout de gènes du développement chez le nématode C. elegans). De plus, nous avions été prudents dans nos conclusions, suggérant que nos résultats pourraient être dus à un effet confondant, inconnu jusqu'ici, dans les données Gene Ontology (rappel : on était à court d'idées). Donc l'expert ne nous disais rien que nous ne sachions déjà.

Vraiment ? Stimulés par l'image des paralogues de même espèce manipulés ensemble, nous avons décidé d'étudier s'il pourrait y avoir une corrélation entre le partage d'auteurs et la similarité d'annotation de fonction. Voici ce que nous avons observé :

La similarité d'annotations de fonction à partir d'un papier commun est bien plus élevée qu'autrement ! Même si on se limite aux annotations tirés de papiers différents, mais avec au moins un auteur en commun, la similarité d'annotations fonctionnelles est encore bien plus élevée que pour les papiers sans aucun auteur commun.

Le paradoxe de Simpson

En soi, l'effet des auteurs n'est pas forcément un problème : si les annotations entre orthologues et paralogues sont distribués de manière semblable entre les origines, les différences d'auteur vont se compenser. Le problème dans notre cas est que les paralogues sont un ordre de grandeur plus fréquemment annotés à partir du même labo que les orthologues. D'où le paradoxe de Simpson : les paralogues apparaissent fonctionnellement plus similaires que les orthologues juste parce que les paralogues ont nettement plus de chances d'être étudiés par les mêmes personnes.

Un exemple classique du paradoxe de Simpson est le cas du "biais de genre à Berkeley" : l'université avait été attaquée en justice pour biais contre les candidates féminines, sur la base des nombres d'admissions totaux en 1973 (44% des hommes admis, contre 33% des femmes). En fait, le taux d'admission dans chaque département était similaire pour les deux sexes (et en faveur des femmes dans quelques départements). Le taux d'acceptation plus bas pour les femmes n'était pas du à un biais sexiste, mais à une tendance des femmes à candidater dans les départements les plus sélectifs. Par exemple si 100 femmes et 10 hommes candidatent dans un département avec 40% d'acceptation, et qu'il n'y a pas de biais, on va accepter 40 femmes et 4 hommes ; si en parallèle 100 hommes et 10 femmes candidatent dans un département avec 60% d'acceptation, on va accepter 60 hommes et 6 femmes ; en cumulé, on aura accepté 46 femmes et 64 hommes sans biais sexiste. Fou non ?

Papier de Nehrt et al.

La découverte de biais dû aux auteurs nous a forcé à ré-analyser toutes nos données, et à complètement ré-écrire notre manuscript. Après quelques mois de ce travail, en juin 2011, Matt Hahn et ses collègues ont publié leur papier (Nehrt et al). Matt a écrit l'histoire très intéressante (et parallèle à la notre) derrière son papier sur le blog de Eisen. En bref, ils ont trouvé que les paralogues au sein d'une espèce (seuls humain et souris ont été comparés) sont plus similaires en fonction que les orthologues.

Tout en n'étant pas très surpris par leurs observations sur le fond – elles étaient cohérentes avec notre manuscript rejeté – nous avons été frappés par la similarité dans la présentation des résultats :

[caption id="attachment_166" align="aligncenter" width="999"] A gauche, figure 2A de Nehrt et al., à droite figure de notre manuscript rejeté en 2010. Remarquer que leurs lignes bleues et vertes sont combinées dans notre ligne jaune.[/caption]

La publication de Nehrt et al nous a donné des sentiments mélangés. Clairement, leur travail enlevait une part de la nouveauté dans notre étude. Mais en même temps, ils ont attiré beaucoup d'attention sur le problème (y compris en inventant le nom de "conjecture orthologue"). Et bien sur, nous savions déjà à ce point-là que leurs observations étaient confondues par des facteurs tels que le biais des auteurs, donc ça n'était pas la fin de l'histoire.

Est-il possible de tirer des conclusions fiables de données d'observation telles que les annotations GO ?

Avant de passer à nos résultats, ça vaut le coup de réfléchir encore un peu sur le problème des biais dans les données. Les statisticiens et les épidémiologistes font une distinction forte entre données expérimentales (provenant d'une expérience contrôlée, désignée de sorte que les groupes d'étude et de contrôle soient aussi identiques que possible en tous points sauf le paramètre à étudier), et les données d'observation* (données trouvées posées là n'importe comment par n'importe qui). Les données de la base de données GO tombe clairement dans la deuxième catégorie : des données d'observation. Nous sommes à la merci d'innombrables effets cachés qui peuvent biaiser nos conclusions de toutes sortes de manières.

* je traduis librement de l'anglais observational data

Pouvons-nous compter sur ces données du tout ? Pour certains, la réponse apparaît être un "non" catégorique. Une approche plus pragmatique a été exprimée par le consortium GO dans une réponse récente à Nehrt et al, où ils ont identifié des effets confondants potentiels ignorés dans cette étude, tels que les biais d'annotation espèce-spécifiques (ils ont suggéré sans rire que l'étude soutient plutôt "la conjecture de l'annotation biaisée"), et ont mis en avant que "les utilisateurs de GO doivent s'assurer qu'ils testent pour les biais potentiels et les prennent en compte avant interprétation".

Au final, ce débat et notre expérience mettent en avant les problèmes des données d'observation. En même temps, ce type de données est souvent tout ce que nous avons, et la meilleure stratégie semble d'être en effet d'identifier autant que possible les facteurs confondants, de les prendre en compte, et d'avancer prudemment.

Une réponse

En contrôlant pour le biais d'auteurs et quelques autres – certains déjà connus, d'autres nouvellement identifiés – nous avons trouvé que pour des niveaux similaires de divergence, les orthologues tendent à être plus conservés que les paralogues. Ceci est vrai de différentes méthodes de prédiction des orthologues et paralogues, différents aspects de la fonction, différentes mesures de similarité de séquence, et différentes stratégies d'échantillonnage des données. Mais en termes absolus, la différence est souvent faible, et varie pas mal entre espèces et aspects de la fonction. Notre étude confirme donc la conjecture orthologue, mais en même temps montre qu'elle n'est pas si utile que ça en pratique, puisqu'elle a peu de pouvoir prédictif.

[caption id="attachment_167" align="aligncenter" width="464"] Cliquez pour voir l'original[/caption]

A noter deux contributions cruciales à cette étude : les experts (peer-review), et la science ouverte. Nous avons clairement une dette envers l'expert qui a rejeté notre papier sur la base d'un biais potentiel dans l'origine des annotations. Les experts de la deuxième version ont fourni des avis détaillés et compétents. En ce qui concerne la science ouverte, comment ferions-nous de la bioinformatique sans ? Sans données publiquement disponibles de génomique et d'annotations fonctionnelles, une telle étude serait impossible.


Ceci n'est pas la fin de l'histoire, nous organisons un symposium à Dublin en juin sur le sujet, et je sais que plusieurs collègues travaillent encore à montrer que nous avons tous raté un point clé ou quelque chose comme ça. Et vous pouvez suivre mon collègue Christophe Dessimoz sur twitter @cdessimoz.

mardi 15 mai 2012

Un an de blog

[caption id="attachment_97" align="aligncenter" width="152" caption="cliquez sur l'image"][/caption]

Le premier billet sur l'incarnation précédente de ce blog (sur blogger.com) est paru il y a tout juste un an. Les début furent assez minables, mais j'ai ensuite trouvé un rythme qui me plaît bien, et après tout personne d'autre n'est obligé à me lire. Le plus difficile au début a été d'écrire à propos de science en français, alors que presque toute mon activité professionnelle est en anglais. C'est également intéressant de voir ce qui est clair ou pas pour mes lecteurs, ce qui vous intéresse plus ou moins, et aussi pour moi ce que j'arrive à expliquer facilement, ce que j'écris vite et sans effort, et au contraire les brouillons que je n'ai jamais fini, ou les billets qui ont demandé plus de travail que je n'aurais pensé.

Au passage, ceci m'aura permis de découvrir un univers de passionnés de science et de vulgarisation en français que je ne connaissais pas du tout, moi qui lisais toujours sur internet en anglais.

Et puis tiens, je vais reproduire le résumé de mon blog que j'avais envoyé pour me présenter aux membres de l'association C@fé des sciences :
J'ai commencé à blogger en mai dernier, parce que je lis beaucoup de blogs en anglais tenus par des scientifiques actifs, souvent chefs de groupe. J'apprécie beaucoup ces blogs, et je constate qu'ils sont lus par un mélange de collègues et de personnes intéressées par la science. Je pense que beaucoup de lecteurs apprécient de communiquer directement avec les chercheurs. J'ai donc cherché à faire un blog similaire en français, parce que je trouve que ça manque.

 

Je suis français mais je suis parti depuis 2003, alors j'ai un point de vue un peu externe sur les débats de politique scientifique française. Donc je m'aventure peu là-dedans, et quand je le ferais j'aurais des chances d'être à contre-courant.

 

vendredi 11 mai 2012

Les humains modernes n'échappent pas à la sélection naturelle

[caption id="attachment_147" align="aligncenter" width="189" caption="ne cliquez pas si vous êtes facilement choqués"][/caption]

Un papier récent dans PNAS a fait beaucoup de bruit, peut-être parce que tout le monde croît comprendre les conclusions, mais peut-être aussi parce qu'elles vont contre une intuition très répandue : les auteurs ont montré par une étude détaillée de mariages et de naissances en Finlande entre 1760 et 1849 qu'il existait de fortes variations entre individus. Les rapports sur cet article (Science magazine payant ici, dites-moi si vous avez une source gratuite ou francophone) rapportent ceci comme montrant que la sélection naturelle agissait encore sur les humains très récemment. Or beaucoup de gens ont l'intuition que grâce au confort de la civilisation nous échappons à la sélection naturelle.

Deux remarques :

  1. L'article ne démontre pas de sélection naturelle, puisqu'il ne montre pas de composant héréditaire de la variabilité dans les taux de survie et de natalité. D'ailleurs les auteurs écrivent dans leur résumé qu'ils montrent que les changements de ces derniers 10'000 ans "n'ont pas rendu impossible la sélection naturelle ou sexuelle potentielle dans notre espèce" ("did not preclude the potential for natural and sexual selection in our species"). Pas exactement renversant, hein ?

  2. L'étude porte sur une société pré-industrielle, et en tant que telle ne porte pas sur les conditions en société industrielle moderne. Or l'intuition notée ci-dessus correpondant à un monde avec des supermarchés pleins, des antibiotiques, et des lunettes de vue.


Mais profitons de ce coup de projecteur pour évoquer quelques autres données pertinentes.

D'abord une équipe a étudié il y a deux ans les données correpondant à une cohorte (un ensemble de personnes étudiées médicalement sur la durée) étudiée depuis très longtemps pour suivre les problèmes cardiaques (noter que les personnes sont choisies au hasard au départ, ce ne sont pas des personnes avec problèmes cardiaques). Il y a 5'209 personnes examinées 29 fois entre 1948 et 2008, et leur 5'124 enfants, examinés 8 fois entre 1971 et 2008. Les données des petits enfants sont disponibles en partie, mais n'ont pas été utilisées ici. Les auteurs n'ont pas plus que ceux de l'étude finlandaise accès à la génétique, mais ils ont accès aux traits caractéristiques des individus. Et ils ont les généalogies, qui leur permettent d'estimer l'héritabilité (à noter qu'il peut y avoir une pseudo-héritabilité culturelle). Ils ont donc cherché des traits qui expliquent la variation en succès reproducteur, au lieu de juste mesurer la variation. Le résultat le plus intéressant est qu'ils détectent une tendance à l'augmentation de la durée de reproduction des femmes, à savoir un premier enfant plus jeune et une ménopause plus tardive. Une interprétation est que, dans la mesure où la sélection n'est effectivement plus très forte sur la survie adulte, il est avantageux d'investir dans la reproduction au maximum. Dans des conditions pré-industrielles, il est probable que d'investir trop d'effort (au sens biologique - répartition de l'énergie au sein du corps si on veut) dans la reproduction pouvait mettre en cause la résistance aux maladies ou à la malnutrition. Dans l'Amérique contemporaine, votre corps sera aidé par la société pour ces problèmes, et peut donc mettre le paquet avec moins de risques sur la reproduction.

Pour le point suivant, je n'ai pas de référence précise (c'est mal, je sais), mais dans une présentation récente par Andy Clark, pointure mondiale de la génétique évolutive et notamment humaine, il a affirmé que le gros de la sélection naturelle chez les humains se faisait in utero, et persiste malgré les changements sociaux. A savoir que la plupart des mutations detrimentales ne permettent pas à l'embryon précoce de survivre, et il y a avortement spontané.

La conclusion de l'étude de la cohorte, qui est cohérente avec d'autres études de ce type, est que la sélection naturelle continue d'agir sur les humains y compris dans les sociétés industrielles riches, mais porte d'avantage sur la reproduction que sur la survie post-natale. Un corolaire est qu'il est probable que la sélection sur les hommes soit en faveur d'une reproduction acharnée même si elle est au détriment de l'espérance de vie. En effet du point de vue succès reproducteur, mieux vaut mourir à 70 ans avec 4 enfants qu'à 90 ans avec 1 enfant.

Darwin not dead.

vendredi 4 mai 2012

L'amphioxus, un génome fossile vivant ?

[caption id="attachment_132" align="aligncenter" width="300"] cliquez sur l'image[/caption]

Je vais parler d'un petit article de revue que nous avons publié récemment avec des collègues, sur l'amphioxus.

Les amphioxus sont des chordés, comme nous, mais contrairement à nous pas des vertébrés (voir ce billet de Tom Roud). Ils sont notamment intéressants à étudier parce qu'ils resemblent morphologiquement aux fossiles les plus anciens d'ancêtres de vertébrés. On pense donc que leur anatomie et son contrôle génétique ont beaucoup à nous apprendre sur l'évolution des vertébrés. On a remarqué en préparant notre revue que beaucoup d'articles qui parlent de l'amphioxus utilisent le mot "ancêtre" dans leur titre ou leur résumé, nettement plus souvent que pour d'autres organismes proches des vertébrés (hydres, ascidies). Même si tout le monde sait (ou devrait savoir) que l'amphioxus a continué à évoluer après que nos chemins se soient séparés il y a 700 à 800 millions d'années, on a souvent tendance à le considérer comme un "fossile vivant", et à le traiter dans les analyses comme représentant notre ancêtre. Y compris pour les études génomiques. Nous avons donc décider de vérifier à quel point l'évidence disponible soutient l'idée que le génome d'amphioxus représente celui de l'ancêtre des chordés (y compris des vertébrés, veaux vaches cochons couvée truites  requins et lamproies).

Problème : comme pour la plupart des espèces d'intérêt en biologie évolutive, mais pas d'intérêt en recherche biomédicale, le génome de l'amphioxus a été séquencé, assemblé et annoté avec un budget réduit. Or une séquence de génome ça n'est pas un résultat expérimental. C'est le résultat du traitement de données expérimentales qui sont des centaines de millers de petites séquences d'ADN (selon la technique de séquençage). Ces petites séquences doivent être assemblées en grandes séquences correspondant idéalement aux chromosomes. Mais quand on a n'a pas assez de sous pour faire du séquençage supplémentaire, ni assez de sous pour payer des experts à tout vérifier, on se retrouve avec plein de morceaux d'ADN dont on a la séquence, mais dont on ne sait pas sur quel chromosome ils vont. Pire, comme ça n'est pas une bestiole de laboratoire, on a pour chaque gène deux copies (ou allèles), du papa amphioxus et de la maman amphioxus. Pire de chez pire, l'amphioxus comme beaucoup de bestioles marines (j'essaye de ne pas dire invertébré, ça ne se fait pas) a une variation entre allèles très importante, similaire à celle observée entre deux espèces de mammifères voire plus. Ajoutez à cela que détecter les gènes dans l'ADN une fois séquencé et assemblé pose le même genre de problèmes, et qu'on n'a toujours pas de sous pour payer des experts à tout vérifier, on a une séquence de génome bien malpropre.

Avançons quand même.

Quand on pose la question : "le génome de l'amphioxus est-il similaire au génome ancestral ?", on peut répondre de différentes manières. Nous avons donc choisi différentes métriques, et pour chacune nous avons regardé si l'amphioxus était plus similaire à l'ancêtre prédit (par reconstruction statistique) que d'autres espèces. Nous avons pris comme points de comparaison plusieurs vertébrés : humain, poulet, poisson zèbre, ainsi que des ascidies, une hydre et un oursin, tous relativement proches de vertébrés sans en être (des deutérostomes sauf l'hydre [merci Gabriel pour la correction!]), et plus loin la mouche drosophile, le vers nématode, et une anémone comme espèce ayant divergé il y a très longtemps.

Première métrique : les duplications de gènes. Si on duplique un gène, on passe de une à deux copies dans le génome (ne pas confondre avec des allèles, merci), qui peuvent potentiellement diverger en fonction (objet d'un futur billet de blog, promis). Cela donne une forme de divergence par rapport à l'ancêtre. On sait que l'ancêtre des vertébrés a subi deux duplications complètes du génome, donc tous les gènes fois quatre au moins temporairement, et qu'en plus l'ancêtre des poissons téléostéens (99% des poissons que vous connaissez) en a eu une troisième. Malgrès des pertes très importantes de dupliqués redondants après ces duplications de génomes, on constate qu'elles dominent le paysage des duplications chez les animaux étudiés. Donc l'amphioxus a bien moins de dupliqués que les vertébrés, alors que le poisson zèbre (téléostéen bon teint) en a le plus. Donc l'amphioxus est plus ancestral que nous, mais pas plus que les autres qui ne sont pas des vertébrés.

Deuxième métrique : les pertes de gènes. Encore une petite note méthodologique d'abord. On détecte les gènes à comparer (homologues) par similarité de séquence. Donc on ne peut pas vraiment distinguer des gènes ayant beaucoup divergé en séquence, de gènes ayant été vraimement perdu. On va faire avec ce qu'on a. On constate d'abord que l'amphioxus est l'espèce qui a gardé le plus de gènes en commun avec l'anémone ; l'amphioxus marque des points d'ancestralité ici. Si on compare à l'ancêtre des chordés reconstruit par bioinformatique, l'amphioxus et les vertébrés en ont perdu peu, alors que les ascidies en ont perdu plein (le diagramme de Venn ci-dessous représente une partie de ces résultats). Donc selon les métriques, l'amphioxus gagne tout seul ou ex-aequo.

[caption id="" align="alignnone" width="308"] Diagramme de Venn des pertes de gènes[/caption]

En combinant ces résultats, on trouve que l'amphioxus se trouve à la fois dans le groupe avec peu de duplications, et dans celui avec peu de pertes. Il est donc bien le plus proche de l'ancêtre. Mais il n'est pas ancestral pour autant, car il y a bien dupliqué environ 10% de ses gènes, et perdu environ un tiers.

Enfin, nous avons vérifié la conservation de position des gènes sur les chromosomes. Les ascidies c'est n'importe quoi, aucune conservation ces pauvres bêtes. Les plus conservés sont le poulet parmi les vertébrés, et l'amphioxus parmi les autres. Alors si les duplications de génome ne vous dérangent pas, le poulet représente mieux l'ordre ancestral ; si vous voulez la version non dupliquée, c'est l'amphioxus. A noter que l'amphioxus part avec un désavantage, vu le mauvais assemblage de son génome par nous autres biologistes feignants. Il est possible qu'avec des progrès techniques on trouve une meilleure conservation encore.

Observation intéressante, grâce à la conservation de position des gènes, on a pu étudier des séquences régulatrices conservées entre amphioxus et vertébrés, quelque chose que l'on n'a pas pu faire chez les ascidies. Ce qui veut dire que l'on peut étudier l'évolution du contrôle de l'expression des gènes.

Notre conclusion est donc que l'amphioxus n'a pas un génome fossile, mais qu'il évolue effectivement plus lentement. Donc prendre l'amphioxus pour l'ancêtre, non. Comparer à l'amphioxus pour comprendre notre évolution, oui.