技术知识库 · 工具评测 · · 国科智飞 Gavin

科研自动化开源项目盘点:论文全链路能自动到哪一步

从合成数据到可编译手稿,SciTeX 生态给出了论文自动化的完整样例;但演示数据不是研究,引用与结论的责任仍在人。

论文写作大概是 AI 助手最容易被寄予厚望的场景:资料多、格式繁琐、重复劳动多。但「自动写论文」和「自动做科研」之间隔着几道坎。这篇盘点按 SciTeX 生态里的三个开源项目,看看论文全链路现在能自动到哪一步、边界又在哪里。

它是什么

三个项目覆盖了从演示到工具再到框架的不同层次:

项目 许可 量级 定位
appautomaton/latex-arxiv-SKILL MIT 400 多 star 论文写作 Agent Skill,ML/AI 综述端到端生成
scitex-ai/automated-research-demo AGPL-3.0 数十 star SciTeX 全链路演示,从合成数据到评审回复
SciTeX 上游框架 各模块多为 AGPL-3.0 会话管理型研究基础设施

需要说明的是,早期资料里记录的上游仓库 scitex/scitex 现在已经无法公开访问(GitHub 返回 404)。当前能确认的是 scitex-ai 组织下的一组模块,包括 scitex-writer、scitex-python、crossref-local、figrecipe 等,多数为 AGPL-3.0。引用这个生态时,以实际能访问的仓库为准。

三者的关系:SciTeX 是底座,automated-research-demo 是跑给它看的一条完整链路,latex-arxiv-SKILL 则把论文写作这一段单独做成了可移植的 Agent Skill。

能力与亮点

latex-arxiv-SKILL:把论文写作变成有验收标准的工程。 它是一份遵循 Agent Skills 规范的技能包,兼容 Claude Code 和 Codex。输入一个主题后,流程是:文献调研(10 到 20 篇,不出正文)→ 搭建 IEEEtran 双栏项目脚手架 → 人工审批关卡 → 生成议题清单 → 逐个议题写作并逐条验证引用 → 语言节奏打磨 → 编译出 PDF。最有意思的是 issue-driven 设计:把论文拆成一个个带验收标准的议题,像做软件开发一样推进写作。用户只需要两个提示词:第一个给主题,第二个授权它选定标题和范围,产出 main.tex、ref.bib 和编译好的 main.pdf。它需要本地 LaTeX 环境(pdflatex、bibtex 或 latexmk),作者在 macOS 上测试通过。收尾阶段还有一轮 QA,处理排版溢出、未定义引用这类编译细节,仓库带 CI 配置,说明维护者把「能编译通过」当成持续的验收标准。

automated-research-demo:全链路真的能跑通。 这个演示项目展示了从合成数据生成、统计分析、图表和表格制作、手稿撰写,到模拟同行评审回复的完整流水线;编排层是 Claude Code,参考文献通过 crossref-local 走 MCP 获取,手稿由 scitex-writer 编译。示例研究采用 3×3 因子设计(年龄 × 睡眠质量)、N=180,自动产出 4 张图、4 张表、手稿 PDF 和评审回复 PDF,报告了显著的交互作用(p<.001)。它证明的是「链路可以自动化」,不是「结论成立」——数据是合成的,那个 p 值也是演示产物。值得关注的是它的模块划分:数据生成、统计、绘图、写作、评审各是一个环节,链路里没有隐藏的魔法,每一步都可以替换成真实工具。

Skill 化的工程模式值得单独学。 工作流被封装成「技能定义文件加脚本目录」的标准结构,复制到 .codex/skills 或 .claude/skills 即可被不同 Agent 调用;换个主题重新激活,就产出新论文。把复杂流程沉淀为原子化、跨 Agent 可复用的 Skill,是这些项目共同的方法论。

局限与坑

演示数据不能当研究发现。 automated-research-demo 的数据是合成的,p<.001 之类的数字只用于展示流水线,不能引用、不能当作睡眠与认知关系的证据。

论文自动化不等于科研自动化。 假设从哪来、实验怎么设计、真实数据怎么采、结论是否站得住、投哪个期刊、署名与伦理——这些环节仍然必须由人负责。工具压缩的是文献整理、格式排版、图表生成、初稿撰写这些机械部分。

许可证要看清。 latex-arxiv-SKILL 是 MIT,宽松友好;SciTeX 生态的模块多为 AGPL-3.0,如果要包装成对外服务,需要评估网络条款带来的开源义务。

引用验证不等于引用真实。 逐条校验能消灭格式错误和失效条目,但「这条引用是否真实存在、是否支持该论点」仍需人工把关。编译通过、零未定义引用,不代表内容可信。

项目都还很小。 除 400 多 star 的 Skill 之外,其余项目量级都在几十 star;上游仓库还出现了 404。生态年轻、入口可能变动,作为参考和学习没问题,作为生产依赖要先验证。

技能本身也在快速迭代。 论文 Skill 仍在活跃更新,目录结构、提示词和脚本都可能变;把它引入团队流程时,最好锁定版本并在自己的仓库里留一份 fork,避免上游一次重构打断写作节奏。

投稿政策要自己查。 期刊和会议对 AI 辅助写作的披露要求各不相同,投稿前确认规则,别在最后一步出问题。

环境和场景限制。 需要本地 LaTeX 工具链;目标场景是 ML/AI 的英文 arXiv 综述,中文期刊和学位论文的排版规范、参考文献格式不在覆盖范围内。

适用场景

不适合期待全自动选题和发现的人、中文期刊或学位论文工作流,以及不愿意逐条复核引用和结论的团队。

选型建议

想动手写论文,先从 latex-arxiv-SKILL 开始:MIT 许可、仓库活跃、安装面小,装好 LaTeX 环境就能试。建议拿一个窄主题跑完整流程,然后逐条人工复核引用和论点,用一篇文章的成本验证它是否适合你的写作习惯。两个提示词的流程看起来极简,但中间的审批关卡和引用校验才是质量所在,别跳过它们。

如果团队里不止一个人写论文,可以考虑把流程固化下来:统一模板、统一引用检查、统一编译环境,再让不同的人按同一套 Skill 走。这比每个人各自摸索提示词更能积累经验。

想理解「科研 Agent 怎么搭」,去看 automated-research-demo 的流水线拆分:数据、统计、图表、写作、评审各管一段,参考价值大于直接使用——注意它是 AGPL-3.0 的演示项目,不是生产工具。

要往自己的系统里集成,先去 scitex-ai 组织逐个确认模块的许可证和活跃度,再决定依赖哪些。合理的预期是:这些工具能把论文的机械工作量从数周压到数天,但研究的智力责任,仍然在人这一侧。上线前还要过一遍所在机构对 AI 使用的规定和期刊的披露要求,这一步省不得。

参考来源