千笔-AIWritePaper · https://www.aiwritepaper.com
「模型会不会做科学」很容易停在聊天印象:答对几道题、复述几段摘要。Google Research 在 ICTS 相关公开分享里强调另一条路:先评测模型在真实科研工作流上的缺口,再把算力花在可计分的实证软件迭代上。Nature 论文描述的 Empirical Research Assistance(ERA)把大模型提案与树搜索结合起来,在沙箱里执行候选代码、用明确指标打分,并在生物信息、流行病学预报等多个基准上报告专家级结果。本文依据公开讲座要点、Google Research 博文、Nature 文本与google-research/era仓库,写成独立技术笔记,不是口播搬运。
图:左侧评测阶梯从知识测验到可计分实证;右侧 ERA 在问题定义、提案、沙箱计分、PUCT 选点间迭代。
目标说明
读完你应能:
- 说出科研向评测为何不能停在「高中测验式」准确率。
- 理解「可计分科学任务」:问题描述、数据、程序化指标三者缺一不可。
- 概括 ERA / Flat UCB 树搜索:生成候选、执行打分、按探索/利用选节点扩展。
- 列出边界:需要可程序化奖励、专家定题与防作弊;不自动覆盖开放式纯理论。
- 知道公开入口:Nature 论文、GitHub 参考实现、Google Labs Science 相关实验工具。
适用与边界
适合关注
- 要为实验室设计「模型能不能帮我写分析代码」的验收
- 关心 Agent 科研系统如何避免只会聊天
- 想把 Kaggle 式指标驱动流程迁移到自己的计算实验
不该误读成
- 「AI 已经替代科学家」:公开材料反复强调专家在环,定题、组合想法、防作弊仍关键。
- 「任意科研问题丢进去就出论文」:没有可执行评分函数时,搜索缺少方向,也更容易投机。
- 「只有闭源 Gemini 能做」:仓库给出算法参考;同类思路在学界有其他实现,关键仍是指标与沙箱。
风险
用错误或可作弊的奖励,系统会优化到奖励,而不是科学目标。讲座中提到指令遵循与防投机的改进。涉及健康、安全等领域时,工具输出必须经过领域审查,不能因为排行榜好看就部署。
机制:评测阶梯
公开分享里的演进可以概括为多层(表述按主题归纳,细节以论文与博文为准):
- 知识与测验:早期用学科问答看模型「知不知道」。
- 长上下文与推理:读全文、抽实体、聚合跨段信息、复现计算。
- 多模态:从图/表检索证据并回答,评测可混合程序化检索指标与模型评审。
- 工具与仿真:例如有限元软件任务,早期求解率很低,反馈环变强后显著上升(讲座中的数量级对比反映时代模型能力,具体数字随版本变化,引用时请回看原始材料)。
- 可计分实证软件:给定数据与指标,让系统写代码并在沙箱优化分数。
关键洞察:科学工作流需要领域深度、长文能力与可执行反馈。只做单次生成,很难覆盖「数小时级人类专家任务」;把推理算力用在多次尝试与选择上,才接近 Agent 用法。
机制:ERA 如何工作
博文与论文把 ERA 描述为:在给定科学问题与成功度量时,搜索文献想法、写代码、组合技术、评估结果,并用树搜索在巨大方案空间里导航。参考实现说明核心是Flat UCB Tree Search(FUTS):
generate_fn:根据问题与历史解,让 LLM 提出新候选(通常是程序)。execute_fn:在沙箱跑候选,按问题指标返回分数。- 搜索按迭代扩展节点,用 PUCT 类公式权衡利用高分路径与探索少访节点。
- 输出是搜索过程中的最佳候选;公开页可查看部分任务的树与代码差异。
与「聊天里改提示词」的差别:反馈来自真实执行分数,而不是模型自我感觉。提示里可注入研究想法摘要,帮助系统尝试论文级思路;专家仍负责提出「试哪些想法」。
报告过的应用方向包括单细胞表示学习、传染病住院预报、地球空间与神经活动预测、数值积分与零售预测等(见博文与论文列表)。产品侧,Computational Discovery 等实验工具在 Google Labs / Gemini for Science 叙事下逐步开放,需按官网申请,不在此承诺可用性或价格。
步骤:把思路落到你自己的任务
- 写清可计分任务:输入数据路径、训练/验证约定、标量指标(或可程序化校验器)。
- 准备沙箱:限制网络与权限,只暴露必要库;记录随机种子。
- 定义生成提示:问题全文 + 可选研究想法;要求输出可执行代码。
- 实现打分:失败(崩溃、超时)给明确惩罚,避免静默当零却不可诊断。
- 跑小型树搜索:先少迭代验证管道,再加大预算。
- 人审最佳候选:读代码差异,检查是否投机(泄漏标签、硬编码测试集等)。
- 归档:保存树、分数曲线、最终补丁与环境锁定文件。
若你只做评测不做搜索,也可停在步骤 1–2:用同一任务包对比不同模型的单次/多次采样成功率,这已经比「感觉更聪明」有用。
可验证检查清单
| 检查项 | 通过标准 |
|---|---|
| 指标 | 可用脚本对固定输出算出同一分数 |
| 沙箱 | 候选无法读写沙箱外敏感路径 |
| 复现 | 固定种子与版本后,分数曲线趋势可大致重现 |
| 防作弊 | 有针对泄漏与硬编码的检查或惩罚 |
| 文档 | 能指回 Nature / 博文 / GitHub 具体段落 |
| 边界 | 文中区分「基准成绩」与「开放问题研究中」 |
踩坑
| 踩坑 | 后果 | 改法 |
|---|---|---|
| 只有模糊鲁棒「好不好」 | 搜索被评审模型带偏 | 优先程序化指标 |
| 上下文塞满聊天历史 | 噪声大、贵 | 只回传分数与必要错误 |
| 忽视专家定题 | 优化到无科学价值的点 | 人指定想法与约束 |
| 把排行榜第一当真理 | 部署风险 | 领域复核与独立复现 |
| 无版本钉扎 | 无法复述结果 | 锁定模型与代码提交 |
| 把讲座口误数字当论文 | 引用不稳 | 以 Nature/博文为准 |
讲座脉络:为何先评测再做 Agent
分享者从医疗影像、可解释性、无障碍语音等应用背景,谈到当下兴趣回到「AI 能否推动科学本身」。历史阶段被概括为:为 AI 而研究科学启发;用 AI 做科学预测与文献加速;再到尝试让 AI 参与提出与执行计算实验。评测工作先于大胆自动化:若模型连读论文抽参数、复现分析都做不稳,就谈不上自主发现。
材料科学例子很典型:论文报告了某种模拟设定,代码往往不开源。任务变成抽取材料与条件、写出调用相应库的脚本并核对数值。这要求领域知识、长上下文与推理同时在线。多模态基准则抓住「图是论文论证核心」这一现实:不会读图的模型,等于丢掉作者最想强调的证据。
从单次调用走到 Agent,核心赌注是扩展推理时计算:同一问题多次生成、执行、选择。FunSearch、AlphaEvolve 等线用进化或搜索改进程序;ERA 把类似思想接到数据科学与更广的实证软件。对你自己的实验室,不一定要复刻整套树搜索,但应问:我的任务有没有标量反馈?有没有安全执行环境?没有这两者,所谓科研 Agent 多半仍是聊天。
应用故事(预报、径流、二氧化碳、零售等)说明「专家出题 + 系统搜代码」可以打到公开榜前列,同时博文也提醒投机与指令遵循问题。把这些读成「可复现实验管道的胜利」比读成「模型有自我意识」更有工程价值。
给你的评测委员会的一页纸
如果实验室要决定「是否引入某科研 Agent」,开会前先填:
- 目标任务能否写成程序化指标?不能则只做辅助起草,不做自动搜索。
- 数据能否进沙箱?涉及隐私则先合成或脱敏。
- 成功标准是公开榜、内部历史最佳,还是物理一致性检查?
- 谁有权批准把某候选代码合并进正式分析库?
- 失败时如何回滚?是否保留每次树搜索的完整日志?
五问有空,就不要采购口号。ERA 类系统的公开成绩证明的是:在可计分设定下,搜索式写代码能达到很强水平;它没有证明「无需指标的科学发现已被解决」。把这句话写进纪要,能避免预算会议跑偏。
参考实现仓库适合做教学与小规模复现;真实科学问题仍要自备数据、指标与领域审查。Google Labs 上的实验产品面向申请制,可用性随时间变化,写作时请以官网为准,不在正文承诺「人人可立即免费无限用」。
总结
评科研 LLM/Agent,应沿着「知识 → 长文与推理 → 多模态与工具 → 可计分实证」加严。ERA 展示了一种把推理算力变成树搜索写软件的路径:有指标、有沙箱、有探索利用,才有机会逼近专家级实证代码。它加速的是可验证的计算实验迭代,不是自动颁发科学结论。材料入口:YouTubeF-bF_YLXg9g、Google Research 博文、Nature 论文、github.com/google-research/era、labs.google/science。