三伍新闻资讯,有趣实用的生活常识!

最新更新文章排行

三伍新闻资讯

当前位置: 首页 > AI智能

AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Academic Survey

时间:2026-09-14人气: 作者: 佚名

AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Academic Survey(图1)

随着学术文献数量持续增长,高质量学术综述已经成为研究者快速进入陌生领域、梳理研究脉络和追踪最新进展的重要入口。但真正写好一篇综述并不容易:它通常需要阅读大量文献、持续跟进领域动态,并投入大量专家时间。

大模型的出现,让这件事开始有了新的可能。近年来,Deep 和自动 系统已经能够完成论文检索、资料整理、分析与长文本生成,甚至快速产出数万字的 。

但如果真正对照一篇高质量的 ,问题就复杂得多。

论文该怎么组织? 怎么划分?不同论文应该放到哪些 ?一个 Claim 到底应该由哪些 支撑?写完之后,、Cross-、、Table 和最终 PDF 又是否真的可靠?

这些问题,并不是简单拉长上下文、生成更多文字、引用更多论文就能解决的。现有 Deep 和自动 系统,很多时候仍主要围绕 “检索 — 分析 — 写作” 展开,最终结果也更接近一份 ,而不是一篇结构完整、组织严谨的 。

针对这些问题,浙江大学、上海交通大学团队及其合作者提出 Deep (DAS),尝试让 AI 在 1 小时内自动完成一篇面向发表的 。

不同于传统的「检索 — 写作」流水线,DAS 采用 ,将整个过程重新定义为 -Loop 。

AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Academic Survey(图2)

图 1|现有 Deep 和自动综述生成系统与 DAS 对比图

在 DAS-Bench 的 30 个 Topic 上,DAS 从、、 和 四个核心维度进行评测,最终平均得分达到4.34,完整参与 30 个 Topic 的最强基线为4.03。在专家匿名评测中,DAS 相比 Naive RAG 在27/30个 Topic 上更受偏好,相比 则在19/21个共享 CS Topic 上更受偏好。

目前,项目网站已经直接开放了220 篇 DAS 自动生成的热门方向 ,完整结果和不同方法的对比都可以在线查看。

AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Academic Survey(图3)

面对近 200 万篇论文,

DAS 先解决的不是「写」,而是「读懂」

DAS 的后续检索、组织和写作,都建立在一个底层文献基础设施之上 ——DAS-2M Lake。

团队对2020 年 1 月以来近 200 万篇 arXiv 论文进行全文解析,并利用 LLM 提取面向 的结构化 ,包括方法、数据集、实验结果、创新点和局限性等信息,目前DAS-2M 已完整开源至 Face。相比只依赖 Title 和 ,这相当于提前对大规模论文进行更细粒度的「预理解」:一篇论文只需解析一次,便可以被不同 Topic 重复利用;同时,DAS-2M 也是一个持续动态更新的 Lake,随着新的 arXiv 论文发布,系统会通过同一套解析与 提取流程不断补充最新文献,使 DAS 在生成新的 时能够持续跟进领域进展。

在此基础上,DAS 建立 和 索引。用户输入 Topic 后,系统先从 DAS-2M 中检索出全局候选文献,再基于这些候选论文构建- ,并通过 Paper-to- 判断每篇论文应该支持哪些 。

这样,DAS 后续的 、Paper 、 和 ,都不再建立在零散检索结果上,而是共享同一套可复用的文献表示和候选集合。

从组织到写作,

DAS 如何形成 Loop?

DAS 的核心并不是简单串联多个 Agent,而是维护一个持续更新的 State:候选文献决定, 和 进一步约束写作,而 发现的问题又可以重新激活对应的 State。整个 的构建过程因此不再是一次性的流水线,而是一个可以持续更新和回退的 。

AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Academic Survey(图4)

图 2|DAS 整体框架。

在真正生成正文之前,DAS 还会继续进行分层规划: → Plan → → Claim → Group。

也就是说, 并不是正文写完之后再补,而是在 Claim-Level 阶段就确定「什么 Claim 应该由哪些论文支撑」,再据此完成 。

写完也并不意味着结束。 会检查章节目标、论述逻辑和 ;如果发现问题,系统会根据问题范围执行 Edit、 或 ,并再次进入 。与此同时, 负责检查 、Cross-、LaTeX 和 等确定性约束,由此形成: → → → Re-的闭环。

最终,通过 的内容才会进入 ,由系统进一步完成 、Table、、Cross- 和 LaTeX ,并编译得到完整 PDF。

这也是 DAS 所强调的「面向发表」:目标不只是写出一篇足够长的文本,而是尽可能保证从文献组织、Claim/ ,一直到 、图表和最终 的一致性与可靠性。

效果到底怎么样?

220 篇完整 已经可以直接查看

当然,对于一个 系统,只看 分数还不够,最后还是要看真正生成出来的论文。

目前 DAS 官网已经开放了220 篇热门研究方向的完整 ,同时还提供 Codex、GPT Deep 、、 等方法的生成结果,可以直接横向比较。论文中的定性比较也显示,不同系统在 、粗粒度 、重复结构以及 与正文耦合等方面存在明显差异。

AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Academic Survey(图5)

图 3|Codex、GPT Deep 、、 与 DAS 的完整 定性比较。

AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生成面向发表的Academic Survey(图6)

图 4|DAS 官网目前已经开放 220 篇热门 Topic 的完整生成结果。

生成效果究竟怎么样,与其只看一个 分数,不如直接打开一篇看看。

AI 距离真正「写完一篇 」,还有多远?

当然,面向发表并不意味着可以直接替代研究者完成最终投稿。DAS 生成的 仍需要人工核验;与此同时, 本身也仍是一个开放问题,不同 Judge 在细粒度评价上依然可能存在差异。论文中的 Cross-Judge 也观察到了这一现象。

随着 DAS-2M 持续更新,未来还可以进一步探索动态文献追踪、人机协同修改,以及可维护、可持续更新的 。

DAS 希望探索的最终问题并不是「AI 能不能一次写出一篇很长的文章」,而是:

面对不断增长的学术文献,AI 能否通过可追溯、可修正的 Loop,帮助研究者更快进入陌生领域,并持续组织和理解不断演化的学术知识?

作者介绍

论文共同第一作者为浙江大学 APRIL 实验室博士生徐志凯、薛竹村,通讯作者为浙江大学百人计划研究员张江宁。