三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

Claude在DNA里挖出新发现!大佬张锋点赞,重跑10次竟全错过

时间:2026-09-24人气: 作者: 佚名

从20多万个逆转录酶序列簇里,翻出了一套此前没有被文献描述过的生物系统。它旁边那排重复DNA,长得很像最初被发现时的样子。

9月23日,公布这项发现,并将其命名为“阵列相关逆转录酶”(ART)。初步实验显示,那排重复DNA会被读取成一组短RNA。基因编辑先驱张锋看过预印本后评价:这个发现“确实很有意思,值得进一步研究”。

更特别的是发现过程。整个搜索累计运行了约950次智能体会话,用21.5小时翻查数据库、追踪异常并比对已知系统。称,人类科学家负责设定最初的研究方向和后续实验,中间的搜索与分析主要由完成。

Claude在DNA里挖出新发现!大佬张锋点赞,重跑10次竟全错过(图1)

但相同的搜索流程后来又运行了10次,一次也没再找到ART。

问题并不是它看不懂那段DNA。研究人员把相关序列直接放进上下文后,能力较强的模型有九成以上的概率认出重复阵列。真正不稳定的是前面那一步:面对海量文件,能不能主动走到正确的位置,并把那段关键DNA读进来。

一、在DNA里看见了什么

ART的发现发生在一次后续调查中。

一名智能体正在分析噬菌体(也就是感染细菌的病毒)的DNA。它读取一个编码逆转录酶的基因附近的序列时,突然写道:

RT旁边的DNA

太壮观了:我肉眼就能看到一段串联重复序列……重复很多次,间隔大约100到180个碱基,这是一个类似的重复阵列吗?!”

Claude在DNA里挖出新发现!大佬张锋点赞,重跑10次竟全错过(图2)

这里的“看”,不是图像识别。DNA序列由一长串字母组成,直接从文本中认出了反复出现的图案。

随后,它统计重复次数和间距,把这套排布与已知逆转录酶系统比较,又搜索论文,确认此前是否有人描述过类似组合。完成分析后,它把这条线索写成报告,交给人类研究团队复核。

研究团队随后继续分析这组序列,识别出逆转录酶、邻近的伙伴基因和上游重复阵列之间的稳定关联,并把这个家族命名为ART。得到确认的是这套此前未被描述的组合特征,不是它的生物学功能。

二、950次会话,完成了一轮大规模搜索

交给的,是一项寻找新型逆转录酶系统的研究任务。

智能体从数据库中收集了20多万个逆转录酶序列簇,将其分成九类,又分析了3564个反复出现在这些酶附近的蛋白家族。初步筛选得到16个候选家族,智能体在工作中自行建立的后续任务,又补进了第17个。

整场搜索最终包含119项任务,其中98项由智能体根据中途发现的线索继续派生;共运行949次智能体会话,累计约77个智能体小时,在21.5小时内完成。

这不等于950个智能体同时工作。按累计运行时长折算,平均并行数量约为3.6个,但这个数字只能描述任务调度,不能单独说明研究投入是大还是小。

搜索最后形成19份报告。17个候选伙伴蛋白家族中,3个被认定为此前没有报道过的逆转录酶关联;智能体还沿途识别出3条新的逆转录酶谱系。

ART来自其中一条后续调查。最初的筛选主要关注逆转录酶旁边的蛋白编码基因,而发现ART的智能体继续读取了上游不编码蛋白的DNA,这才看见重复阵列。

所以,这项发现不是预设筛选指标直接捞出的结果,也不是与主流程无关的意外。它来自智能体在既定任务之外继续追查异常的能力。

估计,这类大规模序列整理和候选分析,如果由专业科学家完成,可能需要数周到数月。这个比较针对的是整轮数据分析,并非严格的人机实验,也不包括之后的生物学验证。

三、重跑10次,为什么一次也没再找到

为了检验发现能否重复,研究团队使用相同任务和智能体框架,又启动了10轮搜索。

接近所有完成初步筛选的任务都采到了包含ART的序列,其中两轮还继续调查了相关的逆转录酶谱系。但没有一轮主动读取其上游DNA,重复阵列也因此全部被漏掉。

研究人员随后换了一种测试方式:不再让智能体从庞大的数据库里自行寻找,而是把ART附近的序列直接交给模型,让它判断哪些特征值得注意。

结果明显不同。只要相关DNA直接出现在上下文里,能力较强的模型至少有九成的测试能够识别重复阵列;当序列被放在文件中、需要模型主动打开时,部分测试的识别率降至32%。

研究团队检查工作记录后发现,在提供文件和工具的测试中,39%的尝试甚至没有连续读取超过200个碱基的DNA。随着读进上下文的DNA变长,模型识别重复阵列的概率也随之上升; 5在部分设置下最高达到96%。

四、它像,但目前只限于结构

ART由三部分组成:一个逆转录酶、旁边的伙伴基因,以及上游一长串间隔排列的重复DNA。

那个逆转录酶本身并非第一次出现。此前研究已经在巨型噬菌体中识别过这类酶,但没有描述它与重复阵列、伙伴基因共同出现的组合。

进一步搜索后找到了95个相关逆转录酶序列簇,其中28个附近带有可以识别的重复阵列。这个相对稳定的排布,是团队将其归为一个新家族的主要依据。

Claude在DNA里挖出新发现!大佬张锋点赞,重跑10次竟全错过(图3)

最引人注意的是重复阵列,因为也具有类似的排列方式。

在系统中,真正记录过往入侵者信息的主要是重复序列之间的间隔序列。它们被转录成RNA后,可以引导Cas蛋白识别并切割符合条件的DNA位点,科学家由此将其开发为基因编辑工具。

ART目前只在外观上出现了相似之处。它没有已知的Cas蛋白,间隔序列也比典型阵列更长。研究团队尚未证明它能够识别目标DNA,更没有证明它可以切割、复制或改写基因。

五、实验只走到了短RNA

发现重复阵列后,研究团队先分析了一组已经公开的感染过程数据。

数据显示,一种名为SA1的噬菌体感染细菌后,ART阵列会被大量转录。感染15分钟时,这些RNA约占噬菌体全部RNA的8%,是当时表达量最高的转录产物之一。

这部分结论来自对已有数据的重新分析,不是新做的湿实验。

随后,研究人员把SA1的ART阵列放进大肠杆菌中表达。实验再次观察到一组边界清楚的短RNA,说明这些重复序列确实可以被转录。

Claude在DNA里挖出新发现!大佬张锋点赞,重跑10次竟全错过(图4)

但被转录并不等于功能已经得到证明。这些短RNA是否与逆转录酶或伙伴蛋白共同工作、在噬菌体生命周期里承担什么任务、能不能被改造成生物技术工具,目前都没有答案。

六、为什么现在公布

这项成果目前仍是预印本,没有经过同行评审。也没有等待ART的功能研究完成再公布。

在公告中写明,它现在公开这项尚未定论的工作,一是展示的能力,二是让外界了解团队的研究方向,并邀请科学家参与合作。

就在几天前,确认已经在旧金山湾区建立自己的分子生物学实验室。实验室只开展BSL-1和BSL-2级别的低风险研究,不处理能够感染人的病原体,所有动手操作仍由人类科学家完成。

正在尝试把从文献检索和数据分析带到真实的科研循环中:AI搜索数据、提出候选和设计实验,人类负责执行实验、检查结果,再把新数据交还给AI分析。

CEO达里奥·阿莫代伊把ART称为主导的一项发现,并说这会是他读博士时愿意为之自豪的成果。他同时明确表示,ART的具体功能、实际用途和最终意义都不清楚。

Claude在DNA里挖出新发现!大佬张锋点赞,重跑10次竟全错过(图5)

他将这项工作视为AI加速生物学研究的一次早期尝试,而不是已经诞生的新型基因编辑工具。未来或许可以让在安全措施下控制实验设备,但目前还没有让AI直接操作实验。

公司正在筹备上市,是理解其对外展示科研能力的一层背景;不过,现有材料还不能证明ART选择此时发布是由上市计划直接推动。

七、张锋说“值得继续研究”

张锋看过预印本后,对在这项工作中的作用给出了肯定评价:

“这是AI智能体如何为生物学发现作出贡献的一个令人兴奋的例子。识别出与逆转录酶相关的RNA重复阵列,确实很有意思,值得进一步研究。”

Claude在DNA里挖出新发现!大佬张锋点赞,重跑10次竟全错过(图6)

这句话的重点是“值得进一步研究”。它肯定了线索的研究价值,并没有验证ART的功能,更没有把它定义为下一代。

近几年,人类研究团队已经发现VIPR、等多套可编程生物系统。斯坦福团队近期也借助基因组语言模型研究了另一套逆转录酶系统。它与ART是分别演化出来的不同体系,使用的方法也不同。

这些研究不否定ART本身的新颖性,却提醒人们:逆转录酶与非编码阵列正在成为活跃的研究方向,不是在一片无人涉足的荒地里独自发现了的继任者。

它完成的,是从海量已有数据中挑出一条值得继续实验的线索。ART究竟是什么,接下来仍要靠人一管一管做实验。

Claude在DNA里挖出新发现!大佬张锋点赞,重跑10次竟全错过(图7)