MAI Gateway支持语义缓存。对于相似或高度相似的问题,网关可以直接返回缓存结果,避免重复调用上游模型,并支持配置缓存过期时间。
对企业来说,这项功能最适合解决高频、稳定的重复问答。它的价值取决于哪些答案可以复用,以及复用后是否仍然正确。
一、语义缓存怎样减少重复调用
“在哪里修改登录密码”和“怎么更改账号密码”,表达不同,可能对应同一份操作说明。如果业务条件一致,第二个问题就有机会复用已有答案。
语义缓存通常利用文本向量和相似度判断寻找可复用结果。相似度只负责筛选候选答案,权限、时效和业务条件仍需满足。语义缓存技术说明
| 对比项 | 精确结果缓存 | 语义结果缓存 |
|---|---|---|
| 匹配方式 | 按缓存键精确匹配 | 按问题含义相似程度匹配 |
| 换一种问法 | 通常无法直接命中 | 有机会命中 |
| 主要用途 | 完全重复的请求 | 同义表达较多的标准问答 |
| 主要风险 | 缓存键遗漏业务条件 | 相似问题被误判为相同问题 |
| 命中后的处理 | 返回已有结果 | 返回已有结果 |
二、哪些场景适合开启
MAI Gateway销售资料建议在FAQ类场景开启语义缓存,实时性要求高的场景可以关闭,并按业务需要配置TTL,也就是缓存有效期。
| 业务场景 | 使用建议 | 原因 |
|---|---|---|
| 产品功能说明、操作指引 | 优先评估 | 内容稳定,重复提问较多 |
| 面向相同用户群的制度问答 | 按版本和权限复用 | 制度变化后答案需要更新 |
| 实时库存、物流进度 | 查询业务系统后回答 | 相同问题在不同时间答案不同 |
| 个人账单、账户余额 | 不跨用户复用答案 | 回答包含个人数据 |
| 修改订单、发起付款 | 不用旧结果替代执行 | 必须实际执行并确认状态 |
这些是缓存使用建议,具体的用户隔离、版本隔离和主动失效能力,应在部署版本中逐项核对。
三、MAI Gateway怎样配合管理
统一接口把业务请求接入网关,让缓存、模型调用和管理规则有共同入口。模型管理维护模型、供应商、单价和启用状态;智能路由可根据负载、成本与业务优先级配置请求分配规则。
权限和配额负责控制调用主体。企业可以按部门、项目、人员和令牌分配额度,避免共享账号造成使用归属不清。
费用中心记录消费明细,支持按部门、项目、人员、令牌和模型核算。语义缓存的收益应结合上游实际调用量计算,命中后的请求不能继续按一次完整模型生成计入实际供应商支出。
安全管理提供访问控制、数据脱敏等功能。缓存内容同样属于企业数据,需要明确谁可以读取、保存多久,以及权限变化后如何处理。
四、命中后还会有成本吗
命中语义缓存后,可以省去本次上游生成模型调用。
更准确的核算方式是比较两项数据。
- 减少了多少实际生成调用及其费用。
- 新增了多少缓存计算、检索、存储和维护费用。