课程介绍
自然语言大模型早已超出NLP研究领域,正在成为AI for science的基石。生物信息学中的基因序列,则是和自然语言最类似的,把大模型应用于生物序列研究,就成了最近一两年的热门研究方向,特别是2024年预测蛋白质结构的alphaFold获得诺贝尔化学奖,更是为生物学的研究指明了未来的方向。
但对大多数从事生物学研究的工作者而言,大模型又非常陌生。事实上,在2023年之前,GPT等大模型还是NLP领域研究的小众课题,只是因为chatgpt的爆发,才进入公众视野。
而大部生物学+大模型的研究,也都是2023年之后的工作,但领域跨度过大,这些论文一般都是大公司、大团队协作的产物,大部分研究者要学习或者重现这些工作,困难重重,我们在很多top论文的github issue中,都能感受到这一点。
一方面,言必称大模型几乎是生物学研究确定的未来,另一方面,众多生物学研究者却在大模型的门槛前徘徊不前。如何在这个门槛前加一道梯子,就成了该领域一个迫切的需求。
DNAGTP2就是这样的梯子,仅望能抛砖引玉,让更多的生物学工作者能够越过大模型的门槛,戴上大模型的翅膀,卷过同行。
github:https://huggingface.co/dnagpt/dnagpt2