引言
BI 系统最擅长的是「画图」——把数据变成柱状图、折线图、热力图。但业务决策靠的是「读文字」——管理层不会盯着图表看半小时,他们需要一段结论:「Q2 销售额同比增长 15%,主要由华东区新品线驱动,但毛利率下降 2pp 需关注。」
这个从图表到文字的转化,过去靠人——分析师看完图,手动写报告。效率低、不一致(不同分析师写的报告风格不同)、延迟高(周报往往周五才能出)。
自然语言生成(Natural Language Generation,NLG)技术让 BI 系统能自动把数据洞察写成业务可读的文字报告。衡石 BI 在最新版本中将 NLG 能力与指标管理、异常检测、Agentic BI 深度整合,构建了从「数据」到「文字」的自动写作管线。
本文将深入解析这套技术。
一、NLG 在 BI 中的价值定位
1.1 传统报告生产的瓶颈
一个典型的企业月度经营报告生产流程:
分析师从 BI 系统导出 20 张图表
逐张看图,提取关键变化(哪些指标涨了、哪些跌了、异常在哪)
把变化写成文字,组织成报告结构
排版、校对、提交
这个过程耗时 1-2 天,且高度依赖分析师的个人能力和时间。如果分析师请假,报告就_DELAY。
1.2 NLG 解决的三个问题
问题一:效率。自动报告把 1-2 天缩短到分钟级。数据更新后,报告自动重新生成。
问题二:一致性。同一套生成规则,每次报告的风格、结构、口径完全一致。不会出现「这次重点写了 A,下次忘了写 A」。
问题三:可规模化。一个分析师最多管 5 条业务线,NLG 系统可以同时生成 50 条业务线的报告,零边际成本。
1.3 NLG 与 ChatBI 的区别
容易混淆,但定位不同:
ChatBI:用户问、AI 答,是交互式的、一次性的
NLG 报告:系统主动生成、结构化的、可归档的文档
ChatBI 是「对话」,NLG 报告是「写作」。两者底层都依赖 LLM,但应用场景不同。
二、衡石 BI 的 NLG 技术架构
2.1 四层生成管线
衡石 BI 的 NLG 不是「把图表丢给 LLM 让它写」,而是结构化的四层管线:
第一层:数据洞察提取(Insight Extraction)
在生成文字之前,先从数据中提取「有什么值得说的」。这一步不依赖 LLM,而是用规则 + 统计方法:
变化检测:识别每个指标本期 vs 上期/去年同期的变化幅度和方向
异常标记:标记超出正常范围的指标(复用前文异常检测能力)
排名变化:识别排名上升/下降显著的实体(如「产品线 C 从第 5 升到第 2」)
贡献度分解:对于总量变化,分解各维度的贡献(如「总增长 100 万中,华东区贡献 60 万」)
这一层产出结构化的「洞察对象列表」——每个对象包含「什么指标、怎么变化、变化多少、为什么变(归因)」。
第二层:叙述规划(Narrative Planning)
基于洞察对象,规划报告的叙述结构:
优先级排序:哪些洞察重要(异常 > 大幅变化 > 小幅变化),优先写
逻辑组织:按业务模块分组(销售模块的变化放一起,财务模块的变化放一起)
篇幅分配:重要洞察多写,次要洞察一句带过
输出「叙述大纲」——类似写作的提纲。
第三层:文字生成(Text Generation)
基于叙述大纲,逐段生成文字。这一层使用 LLM,但 Prompt 不是「请写一份报告」,而是「请基于以下结构化洞察对象,生成一段描述性文字」。
每个洞察对象有对应的模板策略:
变化类:「X 本期值 Y,环比 Z%(↑/↓),主要由于 A 因素驱动」
异常类:「检测到 X 异常(偏离基线 Nσ),建议排查 B 原因」
排名类:「X 在维度 D 上排名上升 K 位,当前第 M」
第四层:审校与润色(Review & Polish)
生成文字后做质量检查:
数值一致性:文字中写的数字是否与数据一致(防 LLM 幻觉)
口径一致性:同一指标在全文中称呼一致(不出现「销售额」和「营收」混用)
语气适配:根据报告类型调整语气(高管摘要→简洁有力;运营周报→详细具体)
2.2 模板与生成的混合策略
纯 LLM 生成的问题是不可控——每次生成的报告结构不同、可能遗漏关键信息、数字可能错。
衡石采用「模板约束 + LLM 生成」的混合策略:
结构化部分用模板:报告的开头(「本报告涵盖 X 月经营数据」)、指标变化的标准表述(「环比 +X%」)、结尾的免责声明——这些用固定模板,确保一致性和准确性。
非结构化部分用生成:对变化原因的解释、对趋势的定性描述、对建议的措辞——这些用 LLM 生成,提供灵活性和可读性。
约束机制:LLM 生成时强制「只能基于第一层提取的洞察对象写,不得引入洞察对象以外的数字或结论」。这从源头杜绝了幻觉。
2.3 领域知识注入(RAG)
生成的文字要符合企业语境,不能泛泛而谈。衡石复用前文所述的 RAG 能力:
在生成行业特定的描述时,检索行业知识库(如「零售行业 Q2 通常是淡季」)
在生成建议时,检索历史最佳实践(如「毛利率下降时通常建议优化供应链成本」)
在生成归因时,检索指标血缘关系(如「毛利率下降可能由成本上升或折扣加大导致」)
RAG 让 NLG 报告不只是「描述数据」,而是「结合业务语境解读数据」。
三、NLG 报告的三种形态
3.1 形态一:周期报告(定时自动生成)
最典型的形态——日报、周报、月报自动生成并推送。
流程:
定时触发(如每月 1 号 8:00)
拉取上期数据,执行洞察提取
按模板生成报告
推送至订阅用户(邮件、企业微信、BI 站内信)
特点:完全无人参与。数据更新即报告更新。
案例:某零售客户的 200 家门店,每家门店每天自动生成一份「门店日报」——含当日销售额、客流、客单价、环比变化、异常提示。200 份报告同时生成,零人工成本。
3.2 形态二:异常驱动报告(事件触发)
不是定时生成,而是异常发生时自动生成根因分析报告。
流程:
异常检测发现某指标异常
触发 Data Agent 做根因分析(复用 ReAct 推理)
将分析结果用 NLG 写成结构化报告
推送至相关负责人
特点:报告内容是「诊断书」而非「流水账」——聚焦异常是什么、为什么、怎么办。
3.3 形态三:交互式报告(对话增强)
用户与报告对话,动态生成补充内容。
场景:用户收到月报,看到「华东区销售额增长 15%」,追问「主要是哪些产品驱动的?」
流程:
用户在报告界面输入追问
系统理解追问意图,查询相关数据
生成补充段落,插入原报告
特点:报告是活的——用户可以在此基础上继续探索,而非看完就结束。
四、NLG 的质量保障
4.1 数值准确性
NLG 报告最大的风险是「文字说的数字和数据对不上」——这是 LLM 幻觉在报告场景的具体表现。
衡石的保障措施:
强制数值回填:报告中所有数字由系统从数据中直接提取并填充,LLM 不负责「推算」数字,只负责「组织文字描述」。如模板为「环比 {change}%」,{change} 是系统填入的真实值,LLM 只写前后文。
生成后校验:报告生成后,系统用正则提取所有数字,与原始数据逐一比对。任何不一致阻断发布并告警。
置信度标注:对于 LLM 生成的定性描述(如「增长趋势稳健」),如果缺乏数据支撑,标注「推测」字样。
4.2 风格一致性
不同读者需要不同风格的报告:
高管版:精简——3 段话讲清核心结论,附关键图表。省略细节。
运营版:详细——分模块详述每个指标变化,附钻取路径。
技术版:含数据来源、计算口径、更新时间等元数据,便于核查。
衡石通过「报告模板 + 读者角色」实现风格控制。同一份数据,不同角色看到不同风格的报告。
4.3 可解释性
NLG 报告不是黑盒——用户点击报告中的任意结论,可以看到支撑该结论的数据和计算过程。
如点击「华东区贡献了总增长的 60%」,展开看到:总增长 100 万,华东区增长 60 万,占比 60%。这种透明性让用户信任报告结论。
五、与 Agentic BI 的协同
5.1 从「生成报告」到「驱动行动」
NLG 报告 + Agentic BI 的结合,超越了「写报告」:
报告生成后,Agent 自动识别报告中的「待办项」(如「毛利率下降需关注」)
Agent 触发后续行动:创建跟进任务、通知责任人对接、或在下期报告中跟踪该事项进展
形成「发现问题 → 生成报告 → 驱动行动 → 跟踪闭环」的完整链路
5.2 多 Agent 协作写报告
复杂报告可由多个 Agent 分工协作:
数据 Agent:负责提取洞察对象
分析 Agent:负责对异常做根因分析
写作 Agent:负责把洞察和分析组织成文字
审校 Agent:负责数值一致性和口径检查
这种多 Agent 写作模式,比单一 LLM 端到端生成质量更高、可控性更强。
六、常见坑与避坑
坑 1:LLM 自由发挥导致数字错误
直接把图表和数据丢给 LLM,让它「写一份报告」。结果 LLM 编造了图表里没有的数字,或者把 15% 写成 51%。
避坑:衡石的「数值回填」机制——LLM 只写文字框架,数字由系统填充。从根本上杜绝数字幻觉。
坑 2:报告千篇一律缺乏重点
每次报告都按固定结构写,重要的异常被淹没在常规描述中。
避坑:叙述规划层按业务重要性动态排序——异常和重大变化永远放在最前面,常规波动简写或省略。
坑 3:技术术语堆砌,业务看不懂
报告用了大量 BI 术语(「环比」「同比」「贡献度分解」),业务领导读不懂。
避坑:风格控制——高管版报告用业务语言(「比上个月多了 15%」而非「环比 +15%」),技术细节放附录。
七、总结
NLG 不是 BI 的炫技功能,而是数据分析价值闭环的关键一环。图表让「懂数据的人」看懂,文字报告让「做决策的人」看懂。当 BI 系统能自动把数据写成业务可读的报告,分析价值的传播效率提升了一个数量级。
衡石 BI 的 NLG 技术,三个核心设计:
四层管线:洞察提取 → 叙述规划 → 文字生成 → 审校润色,结构化而非黑盒
模板约束 + 生成:关键数字用系统回填,LLM 只组织文字,从根源防幻觉
多形态适配:周期报告、异常驱动报告、交互式报告,覆盖不同场景
当 BI 系统不仅会「画图」,还会「写报告」,数据分析才真正完成了从「呈现」到「传达」的最后一公里。