news 2026/8/31 18:11:15

图纸、表格、扫描件,这些“AI 读不懂“的文件现在也能问了

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
图纸、表格、扫描件,这些“AI 读不懂“的文件现在也能问了

之前我们介绍了 Knowhere 的纯视觉理解路线:VISION-MAP,它能够更好地识别图像类资料,而且能把原始页面留在系统里,让 Agent 需要时直接看页,每个结论都能回到证据上核对。

有读者好奇:一份几百页的文档,难道要让视觉模型从头翻到尾吗?

当然不是。

每问一次都通读全文,又慢又贵,还会把无关内容一起塞进上下文。VISION-MAP 真正要解决的,是在不把原始页面"抄没了"的前提下,先帮 Agent 找到最值得看的那几页。

今天我们就来讲讲 VISION-MAP 是怎么工作的,以及怎么使用它。

VISION-MAP 是怎么工作的?

第一步,保留源文件和页面标注。

文档进入 Knowhere 后,原始文件不会因为解析而被一份 Markdown 取代。每一页还会按原始样子存储,但其核心内容和图表资产已被理解和标准,页面里的文字、表格线、图片、印章和相对位置都在,为后面的回溯和审计留下了完整入口。注意,我们保留的是页面注释,不是把文件页面作为图片再存一次。

第二步,建立地图。

只有一堆页面还不够。一本几百页的文件,如果没有结构,Agent 还是只能从头翻到尾。

VISION-MAP 会按照文档的章节关系组织页面,形成“章—节—页面”的层级地图,并给页面配上必要的轻量说明。这些说明负责告诉 Agent“这页大概讲什么、属于哪里”,但不会取代原始页面。

第三步,先找路,再看页。

用户提出问题后,Agent 不需要把整份文件重新读一遍。它会先根据问题在章节地图里判断方向:哪些章节相关,是否还要往下钻,哪些页面值得收下。

找到候选页面后,再由视觉模型直接阅读原页,核对金额、条款、图表或版式关系,并把答案引用回具体页面。

这也延续了 Knowhere 一直以来的三步思路:先发现可能相关的内容,再沿着章节结构导航,最后交付可以追溯的证据。

VISION-MAP 适合什么场景?

VISION-MAP 不是什么场景都用得上。文档干净、答案就在一段话里的时候,直接读文字反而更快。它真正有用的地方,是那些答案没那么好找,还得留着让人复核的场景。尤其是处理高价值、强合规、高要求的文档时,VISION-MAP 最能发挥作用。

金融场景:答案和出处一样重要

如果分析师想知道:“某公司本季度经营现金流下降的主要原因是什么?”

只靠关键词搜,很容易翻出一堆带着“经营现金流”的段落——有的来自摘要,有的是现金流量表,有的是管理层讨论,甚至可能混进上一年的对比数据。单看每一条都不算错,拼在一起却说不清楚问题。

VISION-MAP 的做法是先翻到现金流量表,再去管理层讨论(MD&A)里找对应的说明,把数字、单位、口径、范围和解释依据都对上了再回答。给出的答案后面还跟着行项目、章节和页码,你想验证,随时可以点回去看。

对于投研、审计、风控等任务而言,“答案从哪里来”往往与答案本身同样重要。

工程场景:材料表、条款和图纸各说各的

再看工程、建筑和制造行业。

设计规范、招标文件、施工图集,随便一套就是几百上千页。想查一个材料的防火等级、一个构件的安装要求,翻起来才发现:等级在一张表里,要求写在另一章,具体位置还得看图纸。这些东西一旦被切成一段段的文本块,相互之间的关系就断了。

VISION-MAP 则会把相关的条款、表格和图纸页面一起找出来,让视觉模型对着页面核对。工程师和审查人员也能直接打开原页,看清楚表格里的数字、图纸上的标注,以及是不是最新版本。

归根结底,VISION-MAP 将 Agent 的文档问答从“给出一个概括性结论”,推进为“像人一样读懂文档,并拿出可核验依据的答案”,这也更符合专业人员当前逐页阅读、定位、复核和决策的真实工作习惯。它替代不了人的判断,但能省下不少来回翻资料、对版本的功夫,也能少一些断章取义和引错版本的麻烦。

为什么“能回到源页”这么重要?

因为合同审查、财务分析、工程核验这些事,出了错是要担责任的,不能一句“模型说的”就交差。

在这一点上,VISION-MAP 更像是给 Agent 配了一位懂行的文档审查员。它不会将文件简单切分为彼此割裂的文本 chunk,而是以接近人类阅读的方式,逐页理解文档中的标题层级、段落语义、表格、图像、图纸与版面结构,并建立“问题—证据—页面位置”的可追溯关联。

在用户提问后,系统不仅生成答案,还能基于对问题和文档结构的理解,准确定位答案来自哪一页、哪一个章节、哪张表格甚至哪一处字段;用户可一键跳转回原始证据进行核验。这种能力的核心价值不只是提升检索准确率,更是显著增强 Agent 检索与回答过程的透明度、可解释性和可审计性

结果可以讨论,但证据得随时能打开——这就是 VISION-MAP 想保留的东西。

怎么在 Knowhere 里使用它?

现在,最简单的体验方式是直接打开我们的在线Knowhere Brain:https://notebook.knowhereto.ai/

当你上传一份文档时,可以根据文件特点选择合适的理解方式。

如果是排版清晰、以正文为主的电子文档,可以使用文本解析,让 Agent 快速搜索和引用段落。

如果是扫描文件、复杂报告、图纸、图文混排资料,或者你特别在意原始版式与数字细节,可以使用 VISION-MAP,让 Agent 沿着章节地图找到相关页面,再直接阅读原页。

实际使用中,你不需要操心底层到底调用了多少次模型。你只需要像平常一样提问,例如:

  • “帮我核对这一年的合同金额和付款条件。”

  • “这张图纸里设备 A 和管线 B 是什么关系?”

  • “这份报告的结论,和前面的图表是否一致?”

Knowhere 会根据文档和问题选择路径,把相关文字或页面交给 Agent。需要核验时,你可以从回答回到章节、具体页图,并追溯到最初上传的源文件。

文本轨负责高效地读,视觉轨负责完整地看。

这就是 Knowhere 的两条文档理解路线,也是我们做 VISION-MAP 的思路。

如果你正在处理扫描合同、复杂报告、工程图纸或任何“解析成文字以后总觉得少了点什么”的文件,欢迎来 Knowhere 体验 VISION-MAP,也欢迎把那些最难读、最容易出错的文件交给我们。

我们会继续把这双眼睛打磨得更好。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 18:09:57

OpenHarmony分布式音乐播放器开发实战:跨设备协同与ArkTS实现

简介:本资源是一个面向OpenHarmony开发者与嵌入式系统学习者的分布式音乐播放器源码工程,聚焦轻量级设备上的音频播放、跨端UI交互与DSoftBus通信实践,适用于鸿蒙生态应用开发入门与进阶实训。压缩包共260个文件,涵盖40个GN构建脚…

作者头像 李华
网站建设 2026/8/31 18:09:05

小说创作全链路:从故事核到修改的六步系统方法

小说创作最真实的门槛,不是不会写开头,而是很多人写到三万字就不知道自己在哪里、接下来往哪走。赵德发这套“16讲打通小说创作全链路”,核心就是在解决这个问题:把小说写作从依赖灵感的玄学,变成一条可以拆解、可以练…

作者头像 李华
网站建设 2026/8/31 18:08:28

从ARC-AGI-3看Harness真相:别把系统能力当模型能力

最近开发圈里有个消息传播得很快:Opus 5 拿下了 ARC-AGI-3。只看标题,这又是一个“模型变强了”的故事。看惯了大模型新闻的开发者,可能已经条件反射地准备收藏一份“最强模型”清单。但我想先拦一下:如果你做 AI 应用开发&#x…

作者头像 李华
网站建设 2026/8/31 18:03:40

从零构建CNKI KBase Python连接包:Linux环境下的数据库驱动开发实践

简介:本资源是一个面向科研人员与Linux平台开发者的CNKI KBase数据库连接工具包,专为解决学术文献数据在Linux环境下难以高效接入、查询与分析的痛点而设计。包内共50个文件,涵盖3个核心Python脚本(如TPIClient.py、KBase.py&…

作者头像 李华
网站建设 2026/8/31 18:02:40

文件夹病毒与U盘安全:专杀工具原理及手工修复全攻略

简介:这是一款专为Windows平台设计的文件夹病毒查杀工具,面向普通用户及IT运维人员,用于精准识别并清除伪装成正常文件夹的顽固型病毒,解决因误点感染导致的系统异常、文件隐藏或权限失控等问题。资源包共606个文件,主…

作者头像 李华
网站建设 2026/8/31 17:59:26

AI攻击进入人机结合阶段,企业安全防御急需升级

OpenAI、Anthropic、Google 等一百多家公司联名呼吁抵御恶意 AI 网络攻击,这件事值得技术人认真看,不是因为它上了新闻,而是因为它把“AI 安全”从模型对齐、内容审核这类单点话题,拉回到了网络防御的主战场。攻击者已经开始把大模…

作者头像 李华