news 2026/9/6 2:48:30

评科研 LLM/Agent:从读论文抽检到 ERA 树搜索写可计分实证软件

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
评科研 LLM/Agent:从读论文抽检到 ERA 树搜索写可计分实证软件

千笔-AIWritePaper · https://www.aiwritepaper.com

「模型会不会做科学」很容易停在聊天印象:答对几道题、复述几段摘要。Google Research 在 ICTS 相关公开分享里强调另一条路:先评测模型在真实科研工作流上的缺口,再把算力花在可计分的实证软件迭代上。Nature 论文描述的 Empirical Research Assistance(ERA)把大模型提案与树搜索结合起来,在沙箱里执行候选代码、用明确指标打分,并在生物信息、流行病学预报等多个基准上报告专家级结果。本文依据公开讲座要点、Google Research 博文、Nature 文本与google-research/era仓库,写成独立技术笔记,不是口播搬运。

图:左侧评测阶梯从知识测验到可计分实证;右侧 ERA 在问题定义、提案、沙箱计分、PUCT 选点间迭代。

目标说明

读完你应能:

  1. 说出科研向评测为何不能停在「高中测验式」准确率。
  2. 理解「可计分科学任务」:问题描述、数据、程序化指标三者缺一不可。
  3. 概括 ERA / Flat UCB 树搜索:生成候选、执行打分、按探索/利用选节点扩展。
  4. 列出边界:需要可程序化奖励、专家定题与防作弊;不自动覆盖开放式纯理论。
  5. 知道公开入口:Nature 论文、GitHub 参考实现、Google Labs Science 相关实验工具。

适用与边界

适合关注

  • 要为实验室设计「模型能不能帮我写分析代码」的验收
  • 关心 Agent 科研系统如何避免只会聊天
  • 想把 Kaggle 式指标驱动流程迁移到自己的计算实验

不该误读成

  • 「AI 已经替代科学家」:公开材料反复强调专家在环,定题、组合想法、防作弊仍关键。
  • 「任意科研问题丢进去就出论文」:没有可执行评分函数时,搜索缺少方向,也更容易投机。
  • 「只有闭源 Gemini 能做」:仓库给出算法参考;同类思路在学界有其他实现,关键仍是指标与沙箱。

风险

用错误或可作弊的奖励,系统会优化到奖励,而不是科学目标。讲座中提到指令遵循与防投机的改进。涉及健康、安全等领域时,工具输出必须经过领域审查,不能因为排行榜好看就部署。

机制:评测阶梯

公开分享里的演进可以概括为多层(表述按主题归纳,细节以论文与博文为准):

  1. 知识与测验:早期用学科问答看模型「知不知道」。
  2. 长上下文与推理:读全文、抽实体、聚合跨段信息、复现计算。
  3. 多模态:从图/表检索证据并回答,评测可混合程序化检索指标与模型评审。
  4. 工具与仿真:例如有限元软件任务,早期求解率很低,反馈环变强后显著上升(讲座中的数量级对比反映时代模型能力,具体数字随版本变化,引用时请回看原始材料)。
  5. 可计分实证软件:给定数据与指标,让系统写代码并在沙箱优化分数。

关键洞察:科学工作流需要领域深度、长文能力与可执行反馈。只做单次生成,很难覆盖「数小时级人类专家任务」;把推理算力用在多次尝试与选择上,才接近 Agent 用法。

机制:ERA 如何工作

博文与论文把 ERA 描述为:在给定科学问题与成功度量时,搜索文献想法、写代码、组合技术、评估结果,并用树搜索在巨大方案空间里导航。参考实现说明核心是Flat UCB Tree Search(FUTS)

  • generate_fn:根据问题与历史解,让 LLM 提出新候选(通常是程序)。
  • execute_fn:在沙箱跑候选,按问题指标返回分数。
  • 搜索按迭代扩展节点,用 PUCT 类公式权衡利用高分路径探索少访节点
  • 输出是搜索过程中的最佳候选;公开页可查看部分任务的树与代码差异。

与「聊天里改提示词」的差别:反馈来自真实执行分数,而不是模型自我感觉。提示里可注入研究想法摘要,帮助系统尝试论文级思路;专家仍负责提出「试哪些想法」。

报告过的应用方向包括单细胞表示学习、传染病住院预报、地球空间与神经活动预测、数值积分与零售预测等(见博文与论文列表)。产品侧,Computational Discovery 等实验工具在 Google Labs / Gemini for Science 叙事下逐步开放,需按官网申请,不在此承诺可用性或价格。

步骤:把思路落到你自己的任务

  1. 写清可计分任务:输入数据路径、训练/验证约定、标量指标(或可程序化校验器)。
  2. 准备沙箱:限制网络与权限,只暴露必要库;记录随机种子。
  3. 定义生成提示:问题全文 + 可选研究想法;要求输出可执行代码。
  4. 实现打分:失败(崩溃、超时)给明确惩罚,避免静默当零却不可诊断。
  5. 跑小型树搜索:先少迭代验证管道,再加大预算。
  6. 人审最佳候选:读代码差异,检查是否投机(泄漏标签、硬编码测试集等)。
  7. 归档:保存树、分数曲线、最终补丁与环境锁定文件。

若你只做评测不做搜索,也可停在步骤 1–2:用同一任务包对比不同模型的单次/多次采样成功率,这已经比「感觉更聪明」有用。

可验证检查清单

检查项通过标准
指标可用脚本对固定输出算出同一分数
沙箱候选无法读写沙箱外敏感路径
复现固定种子与版本后,分数曲线趋势可大致重现
防作弊有针对泄漏与硬编码的检查或惩罚
文档能指回 Nature / 博文 / GitHub 具体段落
边界文中区分「基准成绩」与「开放问题研究中」

踩坑

踩坑后果改法
只有模糊鲁棒「好不好」搜索被评审模型带偏优先程序化指标
上下文塞满聊天历史噪声大、贵只回传分数与必要错误
忽视专家定题优化到无科学价值的点人指定想法与约束
把排行榜第一当真理部署风险领域复核与独立复现
无版本钉扎无法复述结果锁定模型与代码提交
把讲座口误数字当论文引用不稳以 Nature/博文为准

讲座脉络:为何先评测再做 Agent

分享者从医疗影像、可解释性、无障碍语音等应用背景,谈到当下兴趣回到「AI 能否推动科学本身」。历史阶段被概括为:为 AI 而研究科学启发;用 AI 做科学预测与文献加速;再到尝试让 AI 参与提出与执行计算实验。评测工作先于大胆自动化:若模型连读论文抽参数、复现分析都做不稳,就谈不上自主发现。

材料科学例子很典型:论文报告了某种模拟设定,代码往往不开源。任务变成抽取材料与条件、写出调用相应库的脚本并核对数值。这要求领域知识、长上下文与推理同时在线。多模态基准则抓住「图是论文论证核心」这一现实:不会读图的模型,等于丢掉作者最想强调的证据。

从单次调用走到 Agent,核心赌注是扩展推理时计算:同一问题多次生成、执行、选择。FunSearch、AlphaEvolve 等线用进化或搜索改进程序;ERA 把类似思想接到数据科学与更广的实证软件。对你自己的实验室,不一定要复刻整套树搜索,但应问:我的任务有没有标量反馈?有没有安全执行环境?没有这两者,所谓科研 Agent 多半仍是聊天。

应用故事(预报、径流、二氧化碳、零售等)说明「专家出题 + 系统搜代码」可以打到公开榜前列,同时博文也提醒投机与指令遵循问题。把这些读成「可复现实验管道的胜利」比读成「模型有自我意识」更有工程价值。

给你的评测委员会的一页纸

如果实验室要决定「是否引入某科研 Agent」,开会前先填:

  1. 目标任务能否写成程序化指标?不能则只做辅助起草,不做自动搜索。
  2. 数据能否进沙箱?涉及隐私则先合成或脱敏。
  3. 成功标准是公开榜、内部历史最佳,还是物理一致性检查?
  4. 谁有权批准把某候选代码合并进正式分析库?
  5. 失败时如何回滚?是否保留每次树搜索的完整日志?

五问有空,就不要采购口号。ERA 类系统的公开成绩证明的是:在可计分设定下,搜索式写代码能达到很强水平;它没有证明「无需指标的科学发现已被解决」。把这句话写进纪要,能避免预算会议跑偏。

参考实现仓库适合做教学与小规模复现;真实科学问题仍要自备数据、指标与领域审查。Google Labs 上的实验产品面向申请制,可用性随时间变化,写作时请以官网为准,不在正文承诺「人人可立即免费无限用」。

总结

评科研 LLM/Agent,应沿着「知识 → 长文与推理 → 多模态与工具 → 可计分实证」加严。ERA 展示了一种把推理算力变成树搜索写软件的路径:有指标、有沙箱、有探索利用,才有机会逼近专家级实证代码。它加速的是可验证的计算实验迭代,不是自动颁发科学结论。材料入口:YouTubeF-bF_YLXg9g、Google Research 博文、Nature 论文、github.com/google-research/eralabs.google/science

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/6 2:43:40

ACM算法模板整理指南:从入门到实战的完整方法论

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 2:37:19

基于中南大学FYT视觉24赛季自瞄开源的考核题

(AI辅助生成)1. 从图像到装甲板消息的完整链路题目:请结合本项目,说明一帧图像如何最终变成 armor_detector/armors 消息。每一步可能产生什么误检或漏检?追问:- binary_thres 调大或调小分别有什么影响?- 灯条颜色判断…

作者头像 李华
网站建设 2026/9/6 2:31:11

GPU租赁平台深度比价:从4090到A100的真实体验与避坑指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 2:30:54

Linux软件安装格式全解析:deb、rpm、Flatpak、Snap、AppImage怎么选

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/6 2:24:26

别再让培训费打水漂了,练题簿小程序帮你解决

一笔被浪费的培训预算 先算一笔账。 一家100人的企业,每年人均培训预算按3000元算,一年就是30万。这还不算员工参加培训的时间成本、差旅成本、场地成本。 30万花出去,换来了什么?如果培训结束后一个月,员工能记住的…

作者头像 李华