本系列为笔者在实习过程中的所见所闻记录,内容为技术摘要,旨在提供关于Agent领域相关技术名词的通俗和简要介绍,详细内容暂不展开,供同在该领域进修的童鞋们参考。
01 Harness
用来控制、约束和自动化运行代码的框架或平台,它的竞品包括 Jenkins、GitHub Actions、GitLab CI、ArgoCD 等。
想象你去了一个超级现代化的机场(Harness 平台),你把行李(代码)扔进传送带,系统自动帮你过安检(跑自动化测试),系统自动帮你打包贴标签(打包成 Docker 镜像,打上 Tag),系统自动把行李送到对应的登机口(触发 Promotion,把代码晋级到 Stage 环境 或 Prod 环境)。
Harness (Harness.io) 就是这样一个商业化的 DevOps 平台。程序员写完代码点一下提交,Harness 就会接管后续所有的脏活累活,保证代码安全、自动地上线。
如果你用 Python 写代码,你用的pytest框架,本质上就是一个 Test Harness。 如果你用 Java,JUnit就是一个 Test Harness。
有时候,程序员为了测试某个特定的函数,会自己手写一段测试脚本,这段专门用来跑测试的脚本,也可以被称为 Test Harness。
| 看到 Harness 的地方 | 它的真实身份 | 通俗理解 |
|---|---|---|
| 公司的发布流程/运维文档 | Harness.io (CI/CD 平台) | 帮你把代码自动打包、晋级到 Stage 环境的“流水线大管家” |
| 代码仓库/测试目录/教科书 | Test Harness (测试框架) | 带有“副刹车”的教练车,用来安全地运行和给你的代码打分 |
| 英文 AI 论文 | 动词 (Harness) | “利用 / 驾驭” (Harness the power of AI) |
02 原生视觉
指模型能够直接利用图像的视觉表示进行理解和推理,而不是只接收外部 OCR 或图像描述工具转换出来的文字。
直接看图不等于模型不需要编码器或预处理,而是视觉信息不必先被压缩为一段自然语言描述。 Qwen2.5-VL 就包含视觉编码器,并通过视觉语言对齐和端到端训练学习多模态能力。
有些厂商用 natively multimodal 强调,模型从预训练阶段就联合学习多种模态,而不是先训练纯文本模型,再添加视觉模块进行适配。例如,Google 对 Gemini 的“原生多模态”描述,明确包含“从一开始就在不同模态上预训练”。
| 概念 | 说明什么 |
|---|---|
| VLM | 模型能够关联和处理视觉与语言 |
| 原生视觉能力 | 通常强调模型内部能利用视觉输入,而非仅依赖外部转文字 |
| 原生多模态训练 | 通常强调多模态能力在预训练阶段就被联合学习 |
03 Jev:给程序做结构化决策的模型
Jev 是 TypeSafe AI 推出的决策模型,官方称为 System One Model。它接收上下文和指定类型的问题,返回选择、评分、概率等结构化结果,主要用于分类、路由和筛选。
例如,一个客服 Agent 收到:
上下文:用户说“本月被重复扣款,请退款” 问题:交给哪个部门? 候选项:账务、技术支持、销售 输出:账务,以及相应的概率或置信度04 mmproj:本地多模态推理使用的配套权重组件
mmproj 来自 multimodal projector,多模态投影器,在 llama.cpp 的 GGUF 生态中,它通常指一个配套权重文件,例如:
model.gguf mmproj-model-f16.gguf主模型文件负责语言模型部分,mmproj 文件负责多模态侧的编码与投影。
05 dsh
DeepSeek Harness,是 DeepSeek 开发的开源 Agent Harness,采用高度插件化的架构。可以让 Agent 编写适用于 dsh 插件体系的代码,实现你需要的工作流或扩展能力。
dsh-TUI,Terminal User Interface,终端用户界面。它在终端里为 DeepSeek Harness 提供全屏交互、流式 Markdown、工具调用展示、会话管理和状态显示等功能。