做产品调研的时候,最危险的一种文献综述是:每一句都像论文里的话,却没有一句能落到原文。
Agent 写得越流畅,读者越容易跳过核查。尤其当问题横跨医学、教育、材料这些不同领域时,同一个词在不同论文里可能指完全不同的实验条件。
一、"显著提升"是个统计结论,不是使用说明
举个具体的例子。团队想了解某种新材料的耐久性。Agent 找到一篇题目相关的论文,摘要里写着"表现显著提升",于是把它改写成"适用于所有户外场景"。
问题在于:实验可能只在特定温度和短周期内完成。
"显著"是统计结果,不是万能使用说明。从摘要到结论之间,少了三样东西:实验条件、观察周期、适用边界。
二、一张可用的文献卡片应该长什么样
可以给 Agent 固定字段,让每篇论文产出同样结构的一张卡:
| 字段 | 要求 |
|---|---|
| 研究对象 | 具体材料 / 人群 / 系统,不要泛化 |
| 样本规模 | 数字 + 统计单位 |
| 对照方式 | 有没有对照、对照是什么 |
| 主要发现 | 原文表述,不要改写成更强的语气 |
| 作者承认的局限 | 直接从讨论章节摘 |
| 引用定位 | 年份、来源、相关段落位置 |
两条硬规矩:
- 引用一篇论文不能只给题目,必须带年份、来源、段落位置;
- 两篇研究结论相反时,不要投票,先看实验条件是否可比。
三、只拿到摘要就明确说"只核对了摘要"
这一点很关键。缺全文、缺补充材料、缺数据集,都应该是待办事项,而不是让语言模型用常识把空白补圆。
诚实地停在证据边界,比给出一个自信但不可复现的答案有用得多。
一种常见的省事做法,是让 Agent 把"目前只看到摘要"这句话省略掉——摘要读起来就变成了一篇完整证据。这个省略不会提高质量,只会提高风险。
四、把查找和阅读连成一条链
百智云 Agent 工具包提供论文搜索、网页与文档解析等工具能力,适合搭一条"找到候选论文 → 读取内容 → 保留来源"的工作链。
工具能降低资料搬运成本,但是否值得采用某个结论,仍然要由懂领域的人根据方法和适用场景判断。这两者之间的分工最好在流程里写死,不要靠默契。
五、怎么验收
不妨让 Agent 先处理五篇与你的问题最相关的论文,每篇输出一张同样字段的文献卡片。然后由研究员抽查:关键句能否在原文找到。
- 找到,再决定要不要扩大范围;
- 找不到,先看是检索错了、解析漏了,还是模型顺手润色过。
小结
好的文献综述不是把十篇摘要排成一列,而是告诉你:我们知道什么,还不知道什么。
后面那半句,通常是更值钱的那半句。