Auto-research 这个概念是在 2025 年底开始火起来的。
在这股自动化科研的浪潮中,我看见了三类人。
第一类是不屑者:认为 AI 生成的东西都是垃圾,甚至排斥、抵触 AI。
第二类是狂热者:我看见朋友圈有人用纯 AI 生成的论文投了 25+ 篇 NeurIPS。
第三类是理性的使用者:开始拥抱 AI,但是不过度依赖它。
那我们要成为谁呢?
知道大家不愿意看 AI 生成的文字,因为能看见这篇文章的人都已经和 AI 对话上千小时,甚至上万小时了。
所以,本文均由我手敲出来。但是由于我也和 AI 对话上千小时,难免被 AI 污染,所以会有很多 AI 味的文字,大家多担待。
AI 为什么暂时很难自动产出好 idea
我认为,目前有意义的科研 idea 还很难通过 AI 自动化产出。从本质上讲,主流 LLM 的任务是预测下一个 token,或对齐人的偏好;在这个过程中,它的核心目标是降低损失,也就是追求不犯错、更合理、更符合现有事实。如果模型在训练中输出了极其离奇的好 idea,在损失函数眼里,这通常意味着 high loss,会被修正和惩罚。
可是,一个 fancy 的 idea 往往意味着离奇、反常识、打破常规。模型的底层逻辑是求同和对齐,而创新往往是求异和颠覆。这也是为什么我不认为当前的 AI 能稳定自动地产出真正有意义的科研 idea。
当然,我们也不能有这么好的工具不用,而是去古法科研。我不希望自己成为追随其他人使用方法的人,所以每个人都应该找到最适合自己的工作流。我更想深入 LLM 的底层,自下而上地思考它在应用方面的潜力:我们每个人的知识都是有限的,没人能掌握所有领域的知识;而 LLM 能在短时间内掌握大量知识,甚至是某个领域的全部知识。当 temperature 调高时,它甚至能够把两个跨度极大的领域缝合到一起,找到逻辑关系。虽然这是缝合创新,但很多时候也可能变得极有价值。
既然我们发现了它的这个特性,那就不要把希望寄托于 LLM 直接给出一个非常新颖的 idea,而是利用它的高并发和广度来激发我们的灵感。
可以这么说:
AI 是打火石,不能生火,但是可以点燃我们自己的灵感火苗。
我的 Auto-Research 工作流
那具体怎么做呢?
我经过大量实践,总结出下面这个工作模式。当然,后面可能会继续更新。
我把整个 research 的过程拆分成:
- 文献调研
- 确定 baseline
- 想 idea
- 跑实验
- 画图
- 写作
这个过程中间可能会循环。比如实验之后还是找不到好问题,就继续循环。中止循环的节点是:定义出漂亮的问题,并且围绕这个问题已经足够深入地了解。
第一步:文献调研
我习惯利用 Grok 的搜索能力,加上 GPT Pro 的深度调研和总结。
同时,我会加上约束:
重点关注中稿顶会、且附带开源代码的工作。
筛选掉 99% 的论文后,再逐字精读 paper,挑选 baseline。有想法时及时记录。
第二步:确定 baseline
确定一篇或多篇 baseline 后,我会先让 AI 复现开源代码库,检查实现是否和论文一致。
然后开始把公式和代码对齐,找到文章真正的实现位置,思考有哪些地方没有做完善,并把 baseline 没有考虑到的实验补全,观察结果里是否有有意思的现象。
在这个阶段,我会特别注意 session 管理:
- 用 conductor 理清每个 session,防止污染。
- 每篇 baseline 复现后,都有自己的主 session 和子 session。
- 用 tmux 管理长期运行的实验进程、日志和监控窗口。
第三步:想 idea
我目前主要用下面几种方式想 idea。
1. 从 limitation 里找崩塌点
看大牛论文的 limitation 部分,看 baseline 的崩塌点和 limitations,提出一个能兼容极端情况的新范式。
2. 跨学科、跨领域迁移
比如,之前视频领域的很多论文就是从图像领域找方法。
How?
去量化、重构并彻底理解一些传统概念。比如做机器人时,可以去看控制领域的一些概念,并尝试借鉴。
3. 深挖实验里的反常结果
先排除实验设计问题。
然后深挖原因:这个反常识的结果是怎么产生的?它背后有没有更本质的机制?
很多时候,反常结果里可能藏着一些还没有被人发现的本质性东西。
4. 避开不适合自己的问题
及时避开大厂极度关注的超级热门问题,以及需要大量算力资源的问题。
5. 用模型的知识量点燃灵感
反复调用 GPT Pro 模型或 Claude Fable,让它们发散地思考:
- 你关心的问题,是不是曾经被别的领域的前人用别的方法解决过?
- 你的领域能不能借鉴其他领域的想法、知识、思路?
用模型的知识量,点燃你灵感的火花。
第四步:跑实验
我称这个方法为五步约束法。
我已经通过这个方法写代码并 review,发现每次逻辑上都比较稳。
有了 idea 后,利用 AI 写代码,但不是直接让 AI 莽写,而是逐步加约束:
- 自己写一个
research_contract.md:假设是什么,预期结果是什么,成功和失败分别如何定义清楚。这是约束 1。 - 交给 GPT Pro 完善,并自己 review 一次。这是约束 2。
- 用 grill-with-docs 把所有实验细节敲定。这是约束 3。
- 用 Trellis 写成 agent 最喜欢的代码结构。这是约束 4。
- 开 goal 模式开始写代码。代码写完后 review 逻辑。这是约束 5。
然后让 agent 监测 GPU,每 3 小时提醒自己一次,及时拿到实验结果。
第五步:画图
画图这一步,我一般这样做:
- 先用笔画出大概框架。
- 让 AI 根据我的思路补全。
- 重画。
- 找老师调整。
- 修改。
其中,“找老师调整”和“修改”这两步会反复循环。
第六步:写作
写作阶段,我会先自己写出大概框架,然后用 Claude 补全,再自己检查和修改。
我相信,随着 Auto-research 的发展,慢慢的趋势是:更多东西不用自己做。
但是,AI 科研的出现,是为了给我们留出更多时间进行深刻思考,而不是制造垃圾。
思考永远不能停下。