文章摘要
随着编程类智能体发展,AI辅助科研成新范式,但面临工具链路碎片化、科研幻觉两大痛点。Spark-to-Paper是端到端科研论文自动生成工具,依托编程助手能力,以13个模块化技能运行。其有独特技术架构,实测表现佳,引文有效率等指标突出。系统代码已开源,欢迎各界参与共建。

随着编程类智能体的发展,AI辅助科研已经成为重塑传统科研流程的新范式,智能体可以自主完成任务规划、方案生成与全流程执行,大幅提升科研效率。但受限于科研流程本身的复杂性以及当前大模型的能力边界,AI辅助科研仍面临两大核心痛点,制约了其实际落地应用。

其一,工具链路碎片化:文献阅读、研究假设提出、代码编写、实验试错、参数调优等环节分散在多个不同平台,各环节的产出物难以实现无缝衔接,即便使用Claude Code、Codex这类编程助手,也缺乏一套能够完整串联“从初始想法到最终论文”的端到端流程。

其二,科研幻觉问题:大模型本身存在固有幻觉缺陷,在面对复杂长链条的科研任务时,很容易出现文献引用错误、实验数据虚构、因果推导逻辑偏差等问题——比如引用的文献无法检索到、实验数据没有实际来源、实验结果与结论相互矛盾时仍强行掩盖问题,这严重破坏了科研工作的可复现性与严谨性。

Spark-to-Paper:打通从研究想法到完整论文的全流程

Spark-to-Paper是一款端到端的科研论文自动生成工具,它依托现有编程助手的能力,以13个可组合的模块化技能运行,无需额外部署独立智能体平台或编排服务。用户仅需输入初始研究想法,系统即可自动完成文献检索、实验方案设计、实验执行、论文撰写、基于证据的结论修订、可编辑论文图表生成等全流程环节,最终输出可直接编译的完整LaTeX项目包。

该系统并没有重新搭建独立的智能体平台,而是充分复用现有编程助手已有的文件读取、代码执行、信息检索与工具调用能力,将整个科研流程拆解为13个可灵活组合的模块化技能。每个技能都明确规定了任务目标、约束条件、可用工具与交付标准,具体执行由编程助手根据当前项目的实时状态自主完成,同时通过一条轻量级流水线来指定任务的执行顺序。所有技能共享同一个项目目录,通过文件化的产物实现协作衔接,前一个环节的输出直接作为后一个环节的输入,文献资料、研究蓝图、代码文件、实验结果、图表素材与修改记录都会完整保留,一旦某个环节出现问题,可以直接从对应产物的节点开始修改,无需重新生成整篇论文。

从一句简短的研究想法出发,系统首先会将其扩展为结构化的研究提案,随后依次完成研究规划、文献引用整理、论文撰写、内容修订、评审校验、图表生成与文档组装等环节,最终输出包含完整手稿、参考文献列表、论文图表与模板配置的LaTeX项目包,可直接进行编译。在文档组装阶段,系统会根据目标会议或期刊的格式要求自动调整章节顺序、统一引用格式与文档结构,编译完成后还会通过确定性检查流程,确保没有未解析的引用与LaTeX语法错误。

实验执行环节同样由系统自动完成:在规划阶段,系统会预先确定实验使用的数据集、对比基线、评价指标、消融实验方案与结果表格的结构(此时数值留空),形成流程内的轻量级预注册机制;在论文写作完成后,系统会从论文提出的研究主张反向推导缺失的实验证据,在代码与数据集可用的情况下自动运行最小必要的实验集,记录实验日志、指标文件、结果表格与图表,再用实测得到的结果回填论文正文、重新绘制结果图表,同时联动更新摘要、引言、结果与结论等章节的内容。

论文图表按照用途分为两类,采用不同的生成路径:实验结果图会直接读取实测得到的实验数据,通过绘图程序生成并导出矢量PDF格式文件,图表数值与实际实验结果严格绑定;方法示意图与解释性图表则先通过图像模型生成视觉草图,再由编程助手以生成HTML文件的形式重建文字、形状、连线与整体布局,经过渲染对比迭代校准后导出矢量PDF,如果重建效果不理想则回退为栅格图。

系统核心技术架构

基于技能的模块化流水线

13个模块化技能通过输入路由与八个核心阶段进行组织:输入判断环节会根据初始条件选择对应的结果完整性模式,当没有实测结果时进入提案模式,此时所有实验数值必须留空;当有实测数据时则进入数据感知模式,所有定量结论都必须有实际实验结果支撑。核心论文生成流程包括规划、引文整理、写作、修订、评审、绘图、组装七个环节,实验执行环节则根据需求触发,将实测得到的证据回填到论文中。在整个流水线中,大模型负责需要理解与判断的决策类工作,可核验的操作则由确定性程序完成,两者各司其职,实现优势互补。

预注册式实验设计与证据驱动修订

预注册式实验设计与证据驱动修订是系统的核心特点之一:实验规划与最终的实验报告实现严格分离,在观测到实际实验结果之前,规划阶段就已经固定了数据集、对比基线、评价指标、消融实验方案与结果表格的结构;实验阶段仅按需执行最小必要的证据集,昂贵的计算资源申请或外部数据获取必须基于具体的研究主张与可用资源情况进行背书。实验完成后,系统会根据实测得到的证据重新复审论文手稿,将每个研究论点分类为完全支持、部分支持、未支持、被反驳或需要进一步验证,根据分类结果分别保留、弱化、删除该论点,或将其移入局限性讨论环节,甚至触发补充实验;阴性、无效或不显著的实验结果会被完整保留而非省略,同时联动更新摘要、引言、结果与结论等章节,确保全文内容与最终的实验证据保持一致。

完整性检查、长程自省与失败边界控制

为了确保论文的严谨性,系统设置了多层完整性检查与自省机制:首先是确定性的校验环节,对可验证的属性逐项把关,包括蓝图结构合规性、引用一致性、术语记法统一、图表文件齐全、LaTeX编译成功,以及提案模式下“未观测结果必须留空”等规则,这些校验都通过确定性程序而非模型判断执行,避免引入额外的幻觉风险。

语义层面的问题则通过两级模型自省流程处理:第一次自我审查会在每次编辑后局部检查论点的漂移情况与前后内容的一致性;对抗式评审则从理论正确性、实验设计合理性与系统有效性等多个角度对整篇论文进行多轮独立审查,每条评审意见都必须引用论文中的具体段落,并从三个方向进行核验:问题是否真实存在、该问题是否已经在其他部分得到解答、该问题是否超出了论文的声称范围,只有无法被反驳的意见才会进入修订环节,评审流程会持续到一轮内不再产生新的有效问题为止。

针对“反复实验否定同一研究方向”的自我反驳循环,系统将实验-批评-修订的循环上限设置为7轮,当超过上限仍无法支撑核心研究目标时,系统会终止当前研究轨迹并生成失败报告,记录原始研究想法、尝试过的研究方法、实测结果与证据不足的原因,随后从新的研究想法重新启动流程,失败的研究轨迹会被完整保留为研究产出,但不会被包装为成功的论文。

可编辑图表生成

论文图表按照用途分为两类,采用不同的生成路径:实验结果图会直接读取实测得到的实验数据,通过绘图程序生成并导出矢量PDF格式文件,图表数值与实际实验结果严格绑定;方法示意图与解释性图表则先通过图像模型生成视觉草图,再由编程助手以生成HTML文件的形式重建文字、形状、连线与整体布局,经过渲染对比迭代校准后导出矢量PDF,如果重建效果不理想则回退为栅格图,最终生成的图表均保持可编辑状态。

实测表现与对比评测

标准化受控课题测试

在8个标准化受控研究课题的对比测试中,Spark-to-Paper的引文有效率达到99.5%,高于人类撰写预印本的97.8%、AI Scientist的93%、AI Scientist-v2的91%、Agent Laboratory的96%以及单轮直接生成基线的81%。论文图形元素的可编辑率达到96.4%,对比之下,人类预印本的可编辑率仅为58%,AI Scientist与Agent Laboratory发布的产物中可编辑图表元素占比为0%。

在防幻觉的消融测试中,针对36条人工注入的虚假结论,单轮直接生成仅能检出14%,加入校验门禁后检出率提升至69%,叠加自我审查环节后达到81%,完整系统的检出率则达到92%;对抗式评审的精确率为74%,意味着绝大多数评审意见都对应真实可核验的问题。

效率方面,完整系统平均消耗11.9M tokens,成本约8.1美元,耗时3.2小时;而单轮直接生成的基线方案仅消耗0.11M tokens,成本0.66美元,耗时仅16分钟,但引文有效率仅为81%。可以看出,Spark-to-Paper通过增加一定的推理与校验成本,换取了更可靠的文献引用、可追溯的实验结果与可编辑的论文产物。

目前,该系统的研究论文已在相关学术平台的当日榜单中排名首位。

开源与社区共建

该系统的代码与相关资源已完全开源,欢迎所有开发者、科研人员与领域专家参与共建,可通过代码仓库提交反馈或贡献内容,团队将持续迭代优化系统功能。相关资源链接如下:

以上内容不代表本平台立场,仅供读者参考