
随着学术文献数量持续增长,高质量学术综述已经成为研究者快速进入陌生领域、梳理研究脉络和追踪最新进展的重要入口。但真正写好一篇综述并不容易:它通常需要阅读大量文献、持续跟进领域动态,并投入大量专家时间。
大模型的出现,让这件事开始有了新的可能。近年来,Deep 和自动 系统已经能够完成论文检索、资料整理、分析与长文本生成,甚至快速产出数万字的 。
但如果真正对照一篇高质量的 ,问题就复杂得多。
论文该怎么组织? 怎么划分?不同论文应该放到哪些 ?一个 Claim 到底应该由哪些 支撑?写完之后,、Cross-、、Table 和最终 PDF 又是否真的可靠?
这些问题,并不是简单拉长上下文、生成更多文字、引用更多论文就能解决的。现有 Deep 和自动 系统,很多时候仍主要围绕 “检索 — 分析 — 写作” 展开,最终结果也更接近一份 ,而不是一篇结构完整、组织严谨的 。
针对这些问题,浙江大学、上海交通大学团队及其合作者提出 Deep (DAS),尝试让 AI 在 1 小时内自动完成一篇面向发表的 。
不同于传统的「检索 — 写作」流水线,DAS 采用 ,将整个过程重新定义为 -Loop 。

图 1|现有 Deep 和自动综述生成系统与 DAS 对比图
在 DAS-Bench 的 30 个 Topic 上,DAS 从、、 和 四个核心维度进行评测,最终平均得分达到4.34,完整参与 30 个 Topic 的最强基线为4.03。在专家匿名评测中,DAS 相比 Naive RAG 在27/30个 Topic 上更受偏好,相比 则在19/21个共享 CS Topic 上更受偏好。
目前,项目网站已经直接开放了220 篇 DAS 自动生成的热门方向 ,完整结果和不同方法的对比都可以在线查看。

面对近 200 万篇论文,
DAS 先解决的不是「写」,而是「读懂」
DAS 的后续检索、组织和写作,都建立在一个底层文献基础设施之上 ——DAS-2M Lake。
团队对2020 年 1 月以来近 200 万篇 arXiv 论文进行全文解析,并利用 LLM 提取面向 的结构化 ,包括方法、数据集、实验结果、创新点和局限性等信息,目前DAS-2M 已完整开源至 Face。相比只依赖 Title 和 ,这相当于提前对大规模论文进行更细粒度的「预理解」:一篇论文只需解析一次,便可以被不同 Topic 重复利用;同时,DAS-2M 也是一个持续动态更新的 Lake,随着新的 arXiv 论文发布,系统会通过同一套解析与 提取流程不断补充最新文献,使 DAS 在生成新的 时能够持续跟进领域进展。
在此基础上,DAS 建立 和 索引。用户输入 Topic 后,系统先从 DAS-2M 中检索出全局候选文献,再基于这些候选论文构建- ,并通过 Paper-to- 判断每篇论文应该支持哪些 。
这样,DAS 后续的 、Paper 、 和 ,都不再建立在零散检索结果上,而是共享同一套可复用的文献表示和候选集合。
从组织到写作,
DAS 如何形成 Loop?
DAS 的核心并不是简单串联多个 Agent,而是维护一个持续更新的 State:候选文献决定, 和 进一步约束写作,而 发现的问题又可以重新激活对应的 State。整个 的构建过程因此不再是一次性的流水线,而是一个可以持续更新和回退的 。

图 2|DAS 整体框架。
在真正生成正文之前,DAS 还会继续进行分层规划: → Plan → → Claim → Group。
也就是说, 并不是正文写完之后再补,而是在 Claim-Level 阶段就确定「什么 Claim 应该由哪些论文支撑」,再据此完成 。
写完也并不意味着结束。 会检查章节目标、论述逻辑和 ;如果发现问题,系统会根据问题范围执行 Edit、 或 ,并再次进入 。与此同时, 负责检查 、Cross-、LaTeX 和 等确定性约束,由此形成: → → → Re-的闭环。
最终,通过 的内容才会进入 ,由系统进一步完成 、Table、、Cross- 和 LaTeX ,并编译得到完整 PDF。
这也是 DAS 所强调的「面向发表」:目标不只是写出一篇足够长的文本,而是尽可能保证从文献组织、Claim/ ,一直到 、图表和最终 的一致性与可靠性。
效果到底怎么样?
220 篇完整 已经可以直接查看
当然,对于一个 系统,只看 分数还不够,最后还是要看真正生成出来的论文。
目前 DAS 官网已经开放了220 篇热门研究方向的完整 ,同时还提供 Codex、GPT Deep 、、 等方法的生成结果,可以直接横向比较。论文中的定性比较也显示,不同系统在 、粗粒度 、重复结构以及 与正文耦合等方面存在明显差异。

图 3|Codex、GPT Deep 、、 与 DAS 的完整 定性比较。

图 4|DAS 官网目前已经开放 220 篇热门 Topic 的完整生成结果。
生成效果究竟怎么样,与其只看一个 分数,不如直接打开一篇看看。
AI 距离真正「写完一篇 」,还有多远?
当然,面向发表并不意味着可以直接替代研究者完成最终投稿。DAS 生成的 仍需要人工核验;与此同时, 本身也仍是一个开放问题,不同 Judge 在细粒度评价上依然可能存在差异。论文中的 Cross-Judge 也观察到了这一现象。
随着 DAS-2M 持续更新,未来还可以进一步探索动态文献追踪、人机协同修改,以及可维护、可持续更新的 。
DAS 希望探索的最终问题并不是「AI 能不能一次写出一篇很长的文章」,而是:
面对不断增长的学术文献,AI 能否通过可追溯、可修正的 Loop,帮助研究者更快进入陌生领域,并持续组织和理解不断演化的学术知识?
作者介绍
论文共同第一作者为浙江大学 APRIL 实验室博士生徐志凯、薛竹村,通讯作者为浙江大学百人计划研究员张江宁。
造物 100 #06|自动驾驶「上」轮椅了,口袋相机学会飞行
硬件创新力下降,新品类迭代放缓,转向成熟产品的形态和能力融合...(195 )人阅读时间:2026-09-14
AI自动写综述做到什么程度了?浙大、上交提出DAS,1小时生
学术综述写作面临挑战,大模型虽能辅助检索、整理与生成,但在结...(122 )人阅读时间:2026-09-14
从认路到「跌倒再战」,机器人也在重走大模型的Scaling之
过去三年,大模型通过预训练、对齐和部署实现能力提升。具身智能...(121 )人阅读时间:2026-09-14
破局单模型局限!清华大学李秀教授团队提出EMERGE-Pol
在机器人操作研究中,单一模型难以应对复杂任务。清华大学等机构...(172 )人阅读时间:2026-09-14