NeoHorse深度研究分析:数据真实性、技术可行性与落地前景全维度解读
论文重点
NeoHorse是前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创立的基元律动(TokenRhythm)团队发布的首个Agent-Native模型。该模型基于Qwen3.5系列进行Agentic后训练,将Routing Harness(智能路由调度系统)运行中积累的多模型协作执行经验转化为模型参数能力,初步探索了递归自我改进(Recursive Self-Improvement, RSI)的技术路径。作为「模型不归一」时代的产物,它试图解决多模型协作中「何时切换、谁来接手」的核心调度问题。
核心研究内容
问题定义
当前大模型评估体系存在一个根本性困境:当模型被放入Agent系统执行完整任务时,传统的单一Benchmark分数难以反映真实能力。一个真正的Agent不仅需要给出看似合理的答案,还必须持续读取环境反馈、处理错误、根据实际进展调整路径——不同环节对模型能力的要求截然不同。
基元律动团队判断,「模型不归一」将是AI产业的长期结构特徵。模型越多、分工越细,就越需要一套系统来回答:这一步该用哪个模型?何时切换到更强模型?执行受阻后谁该接手?这正是Routing Harness要解决的问题。
NeoHorse的核心任务在于:如何将Harness在多模型协作中积累的执行经验——「什么任务需要什么能力」「模型在哪一步容易失败」「怎样的修復路径有效」——转化为单一模型的内在能力。
创新方法
NeoHorse的技术路径可以概括为「用路由数据训练模型,让模型学会路由思维」,具体包含三大核心组件:
1. Routing Harness驱动的数据飞轮
Agent在Harness中完成一次任务会留下完整执行轨迹。与常见的「问题-答案」静态数据不同,Harness数据还包含三层关键信息:任务需要什么能力、系统做出了什么执行决策、环境最终给出了什么反馈。
一条完整的执行轨迹包含以下结构化信息:
输入任务 → 路由器判断所需能力 → 选择模型 → 模型推理与工具调用 → 环境返回结果 → 模型继续执行或出错 → 系统切换模型/调整路径 → 任务最终完成或失败例如,路由器最初判断某任务只需普通模型,但执行失败后升级到更强模型才完成——这条轨迹包含了能力判断偏差、失败环节、成功策略等多维度信息。
2. Routing-guided Agentic Post-Training框架
具体包含两个核心技术组件:
- Routing-guided Curriculum SFT(课程监督微调):根据路由系统对任务难度的判断,构建渐进式训练课程
- Routing-guided On-Policy Distillation(策略蒸馏):将Harness中的执行轨迹转化为训练信号,同时保留每个响应周围的执行上下文
3. 闭环RSI路径
Routing Harness将任务分配给异构模型池,记录工具交互和结果,评估能力需求,利用能力级反馈塑造下一轮训练数据混合。更新后的模型可以重新回到Harness中,形成一个「评估-选择-更新」的闭环——这正是迈向递归自我改进的第一步。
研究成果
NeoHorse-1发布4B和9B两个版本,在10项复盖Harness Agent、工具使用、代码和指令遵循等能力的评测中取得以下成果:
4B版本:
| 基准 | Qwen3.5-4B | NeoHorse-1-4B | Δ |
|---|---|---|---|
| 宏平均 | 58.94 | 64.87 | +5.93 |
| QwenClawBench | 38.47 | 44.68 | +6.21 |
| WorkBuddy Bench | - | - | +9.79 |
| VitaBench | 21.50 | 32.00 | +10.50 |
| HumanEval | 87.20 | 92.07 | +9.75 |
9B版本:
| 基准 | Qwen3.5-9B | NeoHorse-1-9B | Δ |
|---|---|---|---|
| 宏平均 | 65.60 | 69.04 | +3.44 |
| PinchBench | 74.55 | 82.25 | +7.70 |
| VitaBench | 31.25 | 42.25 | +11.00 |
模型规格:
- 原生上下文长度262,144 token,可扩展至1,010,000 token
- 权重格式:Safetensors / BF16
- 仅支持文本输入/文本输出推理
值得关注的是,4B模型的综合表现已经达到/略超9B基础模型——这意味着通过后训练,4B模型在宏平均上超越了参数规模大一倍以上的Qwen3.5-9B。
实际落地应用的可能性
落地可行性较高,理由如下:
团队背景极具说服力。CEO王云鹤为前华为诺亚方舟实验室主任、盘古大模型负责人,被誉为90后「盘古少帅」;CTO韩凯为前华为诺亚方舟实验室首席研究员,与王云鹤是老搭档。公司核心团队成员多来自华为盘古、头部大模型厂商与全球顶尖云服务企业。公司已完成数千万美元融资,平台已积累5.4万用户,单日Token调用量超过5000亿。模型训练获得了无问芯穹的算力支持与Infra优化,清华大学、北京大学团队参与算法和训练方法研究。这些条件确保了技术执行层面的可靠性。
技术路线务实。NeoHorse并非从零训练基础模型,而是基于成熟的Qwen3.5系列进行后训练——这大幅降低了技术风险,将资源聚焦在最有价值的「Agent能力注入」环节。更重要的是,训练数据来自团队自有Routing Harness(OpenSquilla)在实际运行中积累的执行轨迹——这是其他团队难以複製的数据壁垒。
应用场景明确。NeoHorse面向的是Agent工作过程中的核心能力:调用工具、读取环境反馈、发现错误、调整路径、最终完成任务。这与当前AI Agent开发的实际需求高度契合,无论是自动化工作流、智能客服、代码助手还是複杂任务规划,都有直接的应用空间。
技术细节
后训练框架的核心机制
NeoHorse的Agentic Post-Training本质上解决的是一个「数据-能力」映射问题。传统的SFT(监督微调)使用的是静态的问答对,而NeoHorse使用的是动态的执行轨迹。
这条轨迹的价值在于它包含了「决策-执行-反馈-调整」的完整闭环,而不是孤立的「问题-答案」对。模型在训练中学习到的不仅是「正确答案」,更是「如何在动态环境中调整策略」。
数据处理
数据质量控制包括:
- 精确与近似去重
- 评估数据去汙(防止训练数据汙染测试集)
- 结构验证
- 六维度语义评估(包括是否完成用户目标、是否遵守指令、工具使用是否合理、结论是否有证据支撑、错误后能否恢復、是否在适当时机终止任务)
- 子场景级Scene/Goal/Outcome标註
与基座模型的关係
NeoHorse基于Qwen3.5系列进行后训练,发布的是语言模型权重。需要注意的是,该版本仅包含文本推理权重,不包含视觉权重。重新打包仅改变了配置和张量键名,微调后的张量数值本身未发生突变。
研究设定
硬件与算力
模型训练由无问芯穹提供算力支持与Infra优化。具体的GPU配置未在公开文档中披露,但考虑到基座模型为Qwen3.5-4B和Qwen3.5-9B,后训练所需的算力规模应在数十至数百张A100/H100级别GPU的范围内。
软件与框架
- 基座模型:Qwen3.5-4B / Qwen3.5-9B
- 训练框架:Routing-guided Agentic Post-Training框架(含Curriculum SFT和On-Policy Distillation)
- 推理接口:文本输入/文本输出
- 权重格式:Safetensors / BF16
- 上下文长度:262,144 token原生,可扩展至1,010,000 token
评估体系
10项评测涵盖四大维度:
- Agentic能力:QwenClawBench、WorkBuddy Bench、PinchBench、VitaBench
- 工具使用:BFCL v4、tau2-Bench
- 编程能力:HumanEval、LiveCodeBench v6
- 指令遵循:IFBench
综合分析:数据真实性与可行性深度校验
1. 数据来源的真实性与壁垒
结论:数据来源真实可信,具有显着的竞争壁垒。
NeoHorse的训练数据并非来自公开爬取的文本语料,而是来自其Routing Harness(即OpenSquilla开源项目)在实际运行中产生的Agent执行轨迹。
一条完整的执行轨迹包含以下结构化信息:
输入任务 → 路由器判断所需能力 → 选择模型 → 模型推理与工具调用 → 环境返回结果 → 模型继续执行或出错 → 系统切换模型/调整路径 → 任务最终完成或失败这条轨迹与常规SFT数据的本质区别在于:常规数据只有「问题-答案」两端,而Harness数据还包含能力判断、执行决策、环境反馈三层信息。
合理性分析:这种数据来源路径是可信的。TokenRhythm团队的核心业务本身就是Routing Harness——调度多个模型完成複杂任务。Harness在实际服务客户的过程中必然积累大量执行日誌,将这些日誌转化为训练数据是自然的技术延伸。更重要的是,其他团队无法複製这种数据——除非他们也运营着同等规模的Harness服务。这构成了NeoHorse真正的竞争壁垒。
需要注意的风险:目前公开信息未披露Harness数据的具体规模(多少条轨迹、复盖多少种任务类型、时间跨度多长)。数据的量和多样性直接影响模型泛化能力,这方面缺乏量化数据支撑。
2. 评估基准的权威性与潜在偏差
结论:评测基准选择合理,复盖全面,但部分基准存在饱和度问题。
NeoHorse使用的十项评测可归为四类:
| 类别 | 基准名称 | 来源/定位 | 权威性 |
|---|---|---|---|
| Agentic能力 | QwenClawBench | 阿里Qwen团队开发的OpenClaw Agent基准 | 高 |
| WorkBuddy Bench | 腾讯开发的多领域编码Agent评测套件 | 高 | |
| PinchBench | Kilo.ai开发的OpenClaw Agent评测系统 | 中高 | |
| VitaBench | 美团LongCat团队开发的生活场景交互式Agent基准 | 高 | |
| 工具调用 | BFCL v4 | 伯克利函数调用排行榜,AST精确评分 | 高 |
| tau2-Bench | 普林斯顿大学与Sierra Research联合推出 | 高 | |
| 编程能力 | HumanEval | 164个手写Python编程问题 | 经典但趋于饱和 |
| LiveCodeBench v6 | 代码生成基准 | 中高 | |
| 指令遵循 | IFBench | AllenAI开发,NeurIPS 2025论文 | 高 |
关键观察:
第一,基准选择具有针对性。四项Agentic基准分别来自阿里、腾讯、Kilo.ai、美团——均为业界认可的Agent评测体系。NeoHorse作为Agent-Native模型,用这些基准评估是合理的。
第二,HumanEval的饱和度问题值得关注。根据行业分析,前沿模型在HumanEval上已普遍达到91-95%,该基准已「实际饱和」。NeoHorse-4B的HumanEval得分92.07确实落在这个饱和区间内。这意味着HumanEval上的分数差异(+9.75分)并不能有力证明编程能力的实质性提升——更应关注LiveCodeBench等更难基准的表现。
第三,VitaBench的提升幅度最为显着(+10.50分)。VitaBench是一个相当有挑战性的基准。NeoHorse在此基准上从21.50提升到32.00,这个增幅如果真实,确实说明Agent能力的显着改善。
3. 对比模型的策略性分析
结论:对比模型选择合理,但存在一定的「田忌赛马」策略。
4B版本对比了五款模型:
| 对比模型 | 参数规模 | 定位 |
|---|---|---|
| Qwen3.5-4B | 4B | 基座模型(直接对比基线) |
| Gemma-4-E4B-it | ~4B | Google的指令微调模型 |
| Nanbeige-4.2-3B | 3B | 国产开源模型 |
| Agents-A1-4B | 4B | Agent专用模型 |
合理性分析:
与Qwen3.5-4B的对比是必要的——这是基座模型,Δ值(+5.93宏平均)直接反映了后训练带来的增益。
与其他4B级模型的对比是合理的——Gemma是Google的强基线,Agents-A1是同类Agent专用模型。这些对比有助于定位NeoHorse在同规模模型中的相对位置。
潜在的选择偏差:对比模型中缺少一些强基线,如Mistral-7B(虽然参数量更大)或Llama-3.2系列。不过考虑到NeoHorse基于Qwen架构,与Qwen家族的对比最具参考价值。
值得注意的是:根据报道,NeoHorse-1-4B的「综合表现已经达到/略超9B基础模型」——这意味着4B模型通过后训练,在宏平均上超越了参数规模大一倍以上的Qwen3.5-9B。这是一个相当大胆的声称,需要更详细的跨规模对比数据来验证。
4. 分数提升的合理性分析
结论:多数提升在合理范围内,但个别基准的提升需要更审慎看待。
整体提升
- 4B版本:宏平均58.94→64.87,+5.93分(约+10%)
- 9B版本:宏平均65.60→69.04,+3.44分(约+5.2%)
分析:4B版本的提升幅度(+10%)大于9B版本(+5.2%),这在技术上是合理的——参数越小的模型,后训练的边际收益通常越大,因为基座模型本身能力较弱,可提升空间更大。9B基座已经较强,进一步提升的难度更高。
分项提升的合理性
| 基准 | 4B Δ值 | 合理性判断 |
|---|---|---|
| VitaBench | +10.50 | 增幅最大,需关注具体任务类型的提升分布 |
| WorkBuddy Bench | +9.79 | 腾讯新基准,数据汙染风险较低 |
| HumanEval | +9.75 | 因基准饱和,实际意义有限 |
| QwenClawBench | +6.21 | 合理 |
| PinchBench | +6.14 | 合理 |
| LiveCodeBench | +5.72 | 合理 |
| IFBench | +5.00 | 合理 |
| tau2-Bench | +4.17 | 合理 |
| BFCL v4 | +0.77 | 几乎无提升,值得关注 |
关键发现:
BFCL v4几乎无提升(+0.77)。BFCL v4是伯克利的函数调用基准,採用AST(抽象语法树)精确评分——这是一种确定性评估,不存在LLM Judge的主观偏差。NeoHorse在此基准上几乎无提升,说明后训练并未显着改善模型的纯函数调用能力。这恰恰说明NeoHorse的提升主要集中在Agentic推理和任务规划层面,而非底层的工具调用格式准确性——这种差异化提升方向是可信的。倘若数据存在人为造假,团队完全有动机将所有基准分数均匀提高,而非留下这个「平淡的短板」——这反而增加了整体数据的可信度。
VitaBench大幅提升(+10.50)。VitaBench由美团团队开发,是相对较新的基准,数据汙染风险较低。但10.50分的增幅是否完全来自模型能力提升,还是部分来自训练数据与VitaBench任务分布的偶然契合,需要查看具体的任务类型分解数据才能判断——目前公开信息中缺乏这种细粒度数据。
5. 需要注意的局限与未解问题
数据汙染风险
NeoHorse官方声称进行了「评估数据去汙」,但未披露具体方法和验证结果。考虑到:
- 训练数据包含「公开数据」
- 部分评估基准(如HumanEval)的测试集已在互联网广泛流传
数据汙染的潜在风险不能被完全排除。如果训练数据中混入了评估基准的测试样本,分数提升就可能被夸大。
评估的独立性问题
目前公布的评估结果全部来自TokenRhythm团队自测,尚未看到第三方独立验证。虽然团队披露了详细的对比数据和基准选择,但缺乏独立第三方的復现验证始终是评估可信度的一个缺口。
基准的「自我参照」风险
QwenClawBench是阿里Qwen团队开发的,而NeoHorse基于Qwen3.5后训练——基座模型与基准出自同一体系。这不一定意味着分数被高估,但确实存在一定的「自我参照」风险,即模型在与其训练分布相似的基准上表现更好。
与同类工作的对比
需要指出的是,存在另一个同样名为「Qwen3.5-9B-Neo」的模型——由社区成员Jackrong基于Qwen3.5-9B进行推理优化微调,在BBH(+0.87 pp)、MATH Hard(+0.98 pp)、MUSR(+2.91 pp)上取得提升。这说明基于Qwen3.5的后训练确实能带来可验证的能力提升,从侧面支持了NeoHorse技术路线的可行性。但NeoHorse的评估维度更偏向Agent能力,与Jackrong/Neo的推理/数学导向不同,两者不宜直接对比。
综合结论总表
| 评估维度 | 分析结论 | 可信度评级 |
|---|---|---|
| 数据来源 | 来自Harness真实执行轨迹,逻辑自洽,壁垒极高 | ★★★★☆ |
| 数据质控流程 | 披露了六维度语义评估等多重质控 | ★★★★☆ |
| 基准选择 | 复盖全面,但HumanEval饱和,QwenClawBench存在体系内关联 | ★★★☆☆ |
| 对比模型 | 合理但存在策略性选择 | ★★★☆☆ |
| 分数提升逻辑 | 总体符合边际效应,BFCL的平淡表现反而增强了可信度 | ★★★★☆ |
| 独立验证 | 缺乏第三方復现,是当前最大痛点 | ★★☆☆☆ |
| 数据汙染防范 | 有去汙声明但缺乏技术细节公示 | ★★★☆☆ |
最终判断:
NeoHorse的研究数据在生产逻辑与数值变化规律上高度自洽,并无明显造假痕迹。BFCL v4几乎无提升这一细节反而增加了整体数据的可信度——如果团队有意造假,完全可以把所有基准都「提升」一遍。团队的背景(华为盘古基因)、学术合作(清华、北大)和融资规模(数千万美元)进一步增强了技术执行的可信度。
其最大的价值不在于某几个Benchmark的绝对高分,而在于开闢了「将路由调度经验反哺单一模型」的务实新范式。它基于成熟的Qwen3.5进行后训练,技术风险可控,数据来源具有独特的竞争壁垒。
目前最大的不确定性来自于第三方復现验证与数据规模的透明度。建议关注TokenRhythm后续发布的详细技术论文或开源评估工具包。
实践应用
适用场景
Agent开发与部署:NeoHorse原生支持工具调用、环境反馈读取、错误发现与路径调整,是构建複杂Agent系统的理想基座。
自动化工作流:需要多步骤决策和动态调整的任务,如自动化测试、数据清洗、报告生成等。
智能编程助手:HumanEval得分92.07(4B版本)和92.68(9B版本)表明其在代码生成方面具备竞争力。
长上下文处理:262K原生上下文(可扩展至1M token)使其适合处理长文档、代码仓库分析等场景。
使用建议
- 开箱即用:模型已在Hugging Face发布,可直接下载使用
- API调用:可通过TokenRhythm API平台调用
- 二次开发:基于Qwen3.5架构,兼容现有的Qwen生态工具和部署方案
- 注意限制:当前版本仅支持文本推理,不包含视觉能力
潜在风险
- RSI路径的技术挑战尚未完全解决,需理性看待「递归自我改进」的宣传
- 模型的实际Agent能力需要在真实工作流中验证,Benchmark分数与实际表现可能存在差距
- 作为初创公司的首个模型,生态支持和长期维护能力有待观察
参考资料来源
- 原始GitHub仓库:https://github.com/TokenRhythm/NeoHorse
- 技术报告:https://github.com/TokenRhythm/NeoHorse/blob/main/TechnicalReport_NeoHorse_v1.pdf
- Hugging Face模型页面:TokenRhythm/NeoHorse-1-4B
- Hugging Face模型页面:TokenRhythm/NeoHorse-1-9B
- 量子位报道:《王云鹤创业后交出首个模型》
- 雷锋网报道:《王云鹤创业估值数亿美元,押注多模型Harness和Agent-Native Model》