跳到正文
Jinghao
返回

浅谈 Auto-Research

Auto-research 这个概念是在 2025 年底开始火起来的。

在这股自动化科研的浪潮中,我看见了三类人。

第一类是不屑者:认为 AI 生成的东西都是垃圾,甚至排斥、抵触 AI。

第二类是狂热者:我看见朋友圈有人用纯 AI 生成的论文投了 25+ 篇 NeurIPS。

第三类是理性的使用者:开始拥抱 AI,但是不过度依赖它。

那我们要成为谁呢?

知道大家不愿意看 AI 生成的文字,因为能看见这篇文章的人都已经和 AI 对话上千小时,甚至上万小时了。

所以,本文均由我手敲出来。但是由于我也和 AI 对话上千小时,难免被 AI 污染,所以会有很多 AI 味的文字,大家多担待。

AI 为什么暂时很难自动产出好 idea

我认为,目前有意义的科研 idea 还很难通过 AI 自动化产出。从本质上讲,主流 LLM 的任务是预测下一个 token,或对齐人的偏好;在这个过程中,它的核心目标是降低损失,也就是追求不犯错、更合理、更符合现有事实。如果模型在训练中输出了极其离奇的好 idea,在损失函数眼里,这通常意味着 high loss,会被修正和惩罚。

可是,一个 fancy 的 idea 往往意味着离奇、反常识、打破常规。模型的底层逻辑是求同和对齐,而创新往往是求异和颠覆。这也是为什么我不认为当前的 AI 能稳定自动地产出真正有意义的科研 idea。

当然,我们也不能有这么好的工具不用,而是去古法科研。我不希望自己成为追随其他人使用方法的人,所以每个人都应该找到最适合自己的工作流。我更想深入 LLM 的底层,自下而上地思考它在应用方面的潜力:我们每个人的知识都是有限的,没人能掌握所有领域的知识;而 LLM 能在短时间内掌握大量知识,甚至是某个领域的全部知识。当 temperature 调高时,它甚至能够把两个跨度极大的领域缝合到一起,找到逻辑关系。虽然这是缝合创新,但很多时候也可能变得极有价值。

既然我们发现了它的这个特性,那就不要把希望寄托于 LLM 直接给出一个非常新颖的 idea,而是利用它的高并发和广度来激发我们的灵感。

可以这么说:

AI 是打火石,不能生火,但是可以点燃我们自己的灵感火苗。

我的 Auto-Research 工作流

那具体怎么做呢?

我经过大量实践,总结出下面这个工作模式。当然,后面可能会继续更新。

我把整个 research 的过程拆分成:

  1. 文献调研
  2. 确定 baseline
  3. 想 idea
  4. 跑实验
  5. 画图
  6. 写作

这个过程中间可能会循环。比如实验之后还是找不到好问题,就继续循环。中止循环的节点是:定义出漂亮的问题,并且围绕这个问题已经足够深入地了解。

第一步:文献调研

我习惯利用 Grok 的搜索能力,加上 GPT Pro 的深度调研和总结。

同时,我会加上约束:

重点关注中稿顶会、且附带开源代码的工作。

筛选掉 99% 的论文后,再逐字精读 paper,挑选 baseline。有想法时及时记录。

第二步:确定 baseline

确定一篇或多篇 baseline 后,我会先让 AI 复现开源代码库,检查实现是否和论文一致。

然后开始把公式和代码对齐,找到文章真正的实现位置,思考有哪些地方没有做完善,并把 baseline 没有考虑到的实验补全,观察结果里是否有有意思的现象。

在这个阶段,我会特别注意 session 管理:

第三步:想 idea

我目前主要用下面几种方式想 idea。

1. 从 limitation 里找崩塌点

看大牛论文的 limitation 部分,看 baseline 的崩塌点和 limitations,提出一个能兼容极端情况的新范式。

2. 跨学科、跨领域迁移

比如,之前视频领域的很多论文就是从图像领域找方法。

How?

去量化、重构并彻底理解一些传统概念。比如做机器人时,可以去看控制领域的一些概念,并尝试借鉴。

3. 深挖实验里的反常结果

先排除实验设计问题。

然后深挖原因:这个反常识的结果是怎么产生的?它背后有没有更本质的机制?

很多时候,反常结果里可能藏着一些还没有被人发现的本质性东西。

4. 避开不适合自己的问题

及时避开大厂极度关注的超级热门问题,以及需要大量算力资源的问题。

5. 用模型的知识量点燃灵感

反复调用 GPT Pro 模型或 Claude Fable,让它们发散地思考:

用模型的知识量,点燃你灵感的火花。

第四步:跑实验

我称这个方法为五步约束法

我已经通过这个方法写代码并 review,发现每次逻辑上都比较稳。

有了 idea 后,利用 AI 写代码,但不是直接让 AI 莽写,而是逐步加约束:

  1. 自己写一个 research_contract.md:假设是什么,预期结果是什么,成功和失败分别如何定义清楚。这是约束 1。
  2. 交给 GPT Pro 完善,并自己 review 一次。这是约束 2。
  3. 用 grill-with-docs 把所有实验细节敲定。这是约束 3。
  4. 用 Trellis 写成 agent 最喜欢的代码结构。这是约束 4。
  5. 开 goal 模式开始写代码。代码写完后 review 逻辑。这是约束 5。

然后让 agent 监测 GPU,每 3 小时提醒自己一次,及时拿到实验结果。

第五步:画图

画图这一步,我一般这样做:

  1. 先用笔画出大概框架。
  2. 让 AI 根据我的思路补全。
  3. 重画。
  4. 找老师调整。
  5. 修改。

其中,“找老师调整”和“修改”这两步会反复循环。

第六步:写作

写作阶段,我会先自己写出大概框架,然后用 Claude 补全,再自己检查和修改。

我相信,随着 Auto-research 的发展,慢慢的趋势是:更多东西不用自己做。

但是,AI 科研的出现,是为了给我们留出更多时间进行深刻思考,而不是制造垃圾。

思考永远不能停下。


分享这篇文章: