news 2026/9/8 15:04:02

[论文分析]NeoHorse:迈向递归自我优化的Agent-Native模型深度技术分析

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
[论文分析]NeoHorse:迈向递归自我优化的Agent-Native模型深度技术分析

NeoHorse深度研究分析:数据真实性、技术可行性与落地前景全维度解读

论文重点

NeoHorse是前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创立的基元律动(TokenRhythm)团队发布的首个Agent-Native模型。该模型基于Qwen3.5系列进行Agentic后训练,将Routing Harness(智能路由调度系统)运行中积累的多模型协作执行经验转化为模型参数能力,初步探索了递归自我改进(Recursive Self-Improvement, RSI)的技术路径。作为「模型不归一」时代的产物,它试图解决多模型协作中「何时切换、谁来接手」的核心调度问题。

核心研究内容

问题定义

当前大模型评估体系存在一个根本性困境:当模型被放入Agent系统执行完整任务时,传统的单一Benchmark分数难以反映真实能力。一个真正的Agent不仅需要给出看似合理的答案,还必须持续读取环境反馈、处理错误、根据实际进展调整路径——不同环节对模型能力的要求截然不同。

基元律动团队判断,「模型不归一」将是AI产业的长期结构特徵。模型越多、分工越细,就越需要一套系统来回答:这一步该用哪个模型?何时切换到更强模型?执行受阻后谁该接手?这正是Routing Harness要解决的问题。

NeoHorse的核心任务在于:如何将Harness在多模型协作中积累的执行经验——「什么任务需要什么能力」「模型在哪一步容易失败」「怎样的修復路径有效」——转化为单一模型的内在能力

创新方法

NeoHorse的技术路径可以概括为「用路由数据训练模型,让模型学会路由思维」,具体包含三大核心组件:

1. Routing Harness驱动的数据飞轮

Agent在Harness中完成一次任务会留下完整执行轨迹。与常见的「问题-答案」静态数据不同,Harness数据还包含三层关键信息:任务需要什么能力、系统做出了什么执行决策、环境最终给出了什么反馈。

一条完整的执行轨迹包含以下结构化信息:

输入任务 → 路由器判断所需能力 → 选择模型 → 模型推理与工具调用 → 环境返回结果 → 模型继续执行或出错 → 系统切换模型/调整路径 → 任务最终完成或失败

例如,路由器最初判断某任务只需普通模型,但执行失败后升级到更强模型才完成——这条轨迹包含了能力判断偏差、失败环节、成功策略等多维度信息。

2. Routing-guided Agentic Post-Training框架

具体包含两个核心技术组件:

  • Routing-guided Curriculum SFT(课程监督微调):根据路由系统对任务难度的判断,构建渐进式训练课程
  • Routing-guided On-Policy Distillation(策略蒸馏):将Harness中的执行轨迹转化为训练信号,同时保留每个响应周围的执行上下文

3. 闭环RSI路径

Routing Harness将任务分配给异构模型池,记录工具交互和结果,评估能力需求,利用能力级反馈塑造下一轮训练数据混合。更新后的模型可以重新回到Harness中,形成一个「评估-选择-更新」的闭环——这正是迈向递归自我改进的第一步。

研究成果

NeoHorse-1发布4B和9B两个版本,在10项复盖Harness Agent、工具使用、代码和指令遵循等能力的评测中取得以下成果:

4B版本:

基准Qwen3.5-4BNeoHorse-1-4BΔ
宏平均58.9464.87+5.93
QwenClawBench38.4744.68+6.21
WorkBuddy Bench--+9.79
VitaBench21.5032.00+10.50
HumanEval87.2092.07+9.75

9B版本:

基准Qwen3.5-9BNeoHorse-1-9BΔ
宏平均65.6069.04+3.44
PinchBench74.5582.25+7.70
VitaBench31.2542.25+11.00

模型规格:

  • 原生上下文长度262,144 token,可扩展至1,010,000 token
  • 权重格式:Safetensors / BF16
  • 仅支持文本输入/文本输出推理

值得关注的是,4B模型的综合表现已经达到/略超9B基础模型——这意味着通过后训练,4B模型在宏平均上超越了参数规模大一倍以上的Qwen3.5-9B。

实际落地应用的可能性

落地可行性较高,理由如下:

团队背景极具说服力。CEO王云鹤为前华为诺亚方舟实验室主任、盘古大模型负责人,被誉为90后「盘古少帅」;CTO韩凯为前华为诺亚方舟实验室首席研究员,与王云鹤是老搭档。公司核心团队成员多来自华为盘古、头部大模型厂商与全球顶尖云服务企业。公司已完成数千万美元融资,平台已积累5.4万用户,单日Token调用量超过5000亿。模型训练获得了无问芯穹的算力支持与Infra优化,清华大学、北京大学团队参与算法和训练方法研究。这些条件确保了技术执行层面的可靠性。

技术路线务实。NeoHorse并非从零训练基础模型,而是基于成熟的Qwen3.5系列进行后训练——这大幅降低了技术风险,将资源聚焦在最有价值的「Agent能力注入」环节。更重要的是,训练数据来自团队自有Routing Harness(OpenSquilla)在实际运行中积累的执行轨迹——这是其他团队难以複製的数据壁垒。

应用场景明确。NeoHorse面向的是Agent工作过程中的核心能力:调用工具、读取环境反馈、发现错误、调整路径、最终完成任务。这与当前AI Agent开发的实际需求高度契合,无论是自动化工作流、智能客服、代码助手还是複杂任务规划,都有直接的应用空间。

技术细节

后训练框架的核心机制

NeoHorse的Agentic Post-Training本质上解决的是一个「数据-能力」映射问题。传统的SFT(监督微调)使用的是静态的问答对,而NeoHorse使用的是动态的执行轨迹。

这条轨迹的价值在于它包含了「决策-执行-反馈-调整」的完整闭环,而不是孤立的「问题-答案」对。模型在训练中学习到的不仅是「正确答案」,更是「如何在动态环境中调整策略」。

数据处理

数据质量控制包括:

  • 精确与近似去重
  • 评估数据去汙(防止训练数据汙染测试集)
  • 结构验证
  • 六维度语义评估(包括是否完成用户目标、是否遵守指令、工具使用是否合理、结论是否有证据支撑、错误后能否恢復、是否在适当时机终止任务)
  • 子场景级Scene/Goal/Outcome标註

与基座模型的关係

NeoHorse基于Qwen3.5系列进行后训练,发布的是语言模型权重。需要注意的是,该版本仅包含文本推理权重,不包含视觉权重。重新打包仅改变了配置和张量键名,微调后的张量数值本身未发生突变。

研究设定

硬件与算力

模型训练由无问芯穹提供算力支持与Infra优化。具体的GPU配置未在公开文档中披露,但考虑到基座模型为Qwen3.5-4B和Qwen3.5-9B,后训练所需的算力规模应在数十至数百张A100/H100级别GPU的范围内。

软件与框架

  • 基座模型:Qwen3.5-4B / Qwen3.5-9B
  • 训练框架:Routing-guided Agentic Post-Training框架(含Curriculum SFT和On-Policy Distillation)
  • 推理接口:文本输入/文本输出
  • 权重格式:Safetensors / BF16
  • 上下文长度:262,144 token原生,可扩展至1,010,000 token

评估体系

10项评测涵盖四大维度:

  • Agentic能力:QwenClawBench、WorkBuddy Bench、PinchBench、VitaBench
  • 工具使用:BFCL v4、tau2-Bench
  • 编程能力:HumanEval、LiveCodeBench v6
  • 指令遵循:IFBench

综合分析:数据真实性与可行性深度校验

1. 数据来源的真实性与壁垒

结论:数据来源真实可信,具有显着的竞争壁垒。

NeoHorse的训练数据并非来自公开爬取的文本语料,而是来自其Routing Harness(即OpenSquilla开源项目)在实际运行中产生的Agent执行轨迹。

一条完整的执行轨迹包含以下结构化信息:

输入任务 → 路由器判断所需能力 → 选择模型 → 模型推理与工具调用 → 环境返回结果 → 模型继续执行或出错 → 系统切换模型/调整路径 → 任务最终完成或失败

这条轨迹与常规SFT数据的本质区别在于:常规数据只有「问题-答案」两端,而Harness数据还包含能力判断、执行决策、环境反馈三层信息。

合理性分析:这种数据来源路径是可信的。TokenRhythm团队的核心业务本身就是Routing Harness——调度多个模型完成複杂任务。Harness在实际服务客户的过程中必然积累大量执行日誌,将这些日誌转化为训练数据是自然的技术延伸。更重要的是,其他团队无法複製这种数据——除非他们也运营着同等规模的Harness服务。这构成了NeoHorse真正的竞争壁垒。

需要注意的风险:目前公开信息未披露Harness数据的具体规模(多少条轨迹、复盖多少种任务类型、时间跨度多长)。数据的量和多样性直接影响模型泛化能力,这方面缺乏量化数据支撑。

2. 评估基准的权威性与潜在偏差

结论:评测基准选择合理,复盖全面,但部分基准存在饱和度问题。

NeoHorse使用的十项评测可归为四类:

类别基准名称来源/定位权威性
Agentic能力QwenClawBench阿里Qwen团队开发的OpenClaw Agent基准
WorkBuddy Bench腾讯开发的多领域编码Agent评测套件
PinchBenchKilo.ai开发的OpenClaw Agent评测系统中高
VitaBench美团LongCat团队开发的生活场景交互式Agent基准
工具调用BFCL v4伯克利函数调用排行榜,AST精确评分
tau2-Bench普林斯顿大学与Sierra Research联合推出
编程能力HumanEval164个手写Python编程问题经典但趋于饱和
LiveCodeBench v6代码生成基准中高
指令遵循IFBenchAllenAI开发,NeurIPS 2025论文

关键观察

第一,基准选择具有针对性。四项Agentic基准分别来自阿里、腾讯、Kilo.ai、美团——均为业界认可的Agent评测体系。NeoHorse作为Agent-Native模型,用这些基准评估是合理的。

第二,HumanEval的饱和度问题值得关注。根据行业分析,前沿模型在HumanEval上已普遍达到91-95%,该基准已「实际饱和」。NeoHorse-4B的HumanEval得分92.07确实落在这个饱和区间内。这意味着HumanEval上的分数差异(+9.75分)并不能有力证明编程能力的实质性提升——更应关注LiveCodeBench等更难基准的表现。

第三,VitaBench的提升幅度最为显着(+10.50分)。VitaBench是一个相当有挑战性的基准。NeoHorse在此基准上从21.50提升到32.00,这个增幅如果真实,确实说明Agent能力的显着改善。

3. 对比模型的策略性分析

结论:对比模型选择合理,但存在一定的「田忌赛马」策略。

4B版本对比了五款模型:

对比模型参数规模定位
Qwen3.5-4B4B基座模型(直接对比基线)
Gemma-4-E4B-it~4BGoogle的指令微调模型
Nanbeige-4.2-3B3B国产开源模型
Agents-A1-4B4BAgent专用模型

合理性分析

  1. 与Qwen3.5-4B的对比是必要的——这是基座模型,Δ值(+5.93宏平均)直接反映了后训练带来的增益。

  2. 与其他4B级模型的对比是合理的——Gemma是Google的强基线,Agents-A1是同类Agent专用模型。这些对比有助于定位NeoHorse在同规模模型中的相对位置。

  3. 潜在的选择偏差:对比模型中缺少一些强基线,如Mistral-7B(虽然参数量更大)或Llama-3.2系列。不过考虑到NeoHorse基于Qwen架构,与Qwen家族的对比最具参考价值。

值得注意的是:根据报道,NeoHorse-1-4B的「综合表现已经达到/略超9B基础模型」——这意味着4B模型通过后训练,在宏平均上超越了参数规模大一倍以上的Qwen3.5-9B。这是一个相当大胆的声称,需要更详细的跨规模对比数据来验证。

4. 分数提升的合理性分析

结论:多数提升在合理范围内,但个别基准的提升需要更审慎看待。

整体提升
  • 4B版本:宏平均58.94→64.87,+5.93分(约+10%)
  • 9B版本:宏平均65.60→69.04,+3.44分(约+5.2%)

分析:4B版本的提升幅度(+10%)大于9B版本(+5.2%),这在技术上是合理的——参数越小的模型,后训练的边际收益通常越大,因为基座模型本身能力较弱,可提升空间更大。9B基座已经较强,进一步提升的难度更高。

分项提升的合理性
基准4B Δ值合理性判断
VitaBench+10.50增幅最大,需关注具体任务类型的提升分布
WorkBuddy Bench+9.79腾讯新基准,数据汙染风险较低
HumanEval+9.75因基准饱和,实际意义有限
QwenClawBench+6.21合理
PinchBench+6.14合理
LiveCodeBench+5.72合理
IFBench+5.00合理
tau2-Bench+4.17合理
BFCL v4+0.77几乎无提升,值得关注

关键发现

BFCL v4几乎无提升(+0.77)。BFCL v4是伯克利的函数调用基准,採用AST(抽象语法树)精确评分——这是一种确定性评估,不存在LLM Judge的主观偏差。NeoHorse在此基准上几乎无提升,说明后训练并未显着改善模型的纯函数调用能力。这恰恰说明NeoHorse的提升主要集中在Agentic推理和任务规划层面,而非底层的工具调用格式准确性——这种差异化提升方向是可信的。倘若数据存在人为造假,团队完全有动机将所有基准分数均匀提高,而非留下这个「平淡的短板」——这反而增加了整体数据的可信度。

VitaBench大幅提升(+10.50)。VitaBench由美团团队开发,是相对较新的基准,数据汙染风险较低。但10.50分的增幅是否完全来自模型能力提升,还是部分来自训练数据与VitaBench任务分布的偶然契合,需要查看具体的任务类型分解数据才能判断——目前公开信息中缺乏这种细粒度数据

5. 需要注意的局限与未解问题

数据汙染风险

NeoHorse官方声称进行了「评估数据去汙」,但未披露具体方法和验证结果。考虑到:

  • 训练数据包含「公开数据」
  • 部分评估基准(如HumanEval)的测试集已在互联网广泛流传

数据汙染的潜在风险不能被完全排除。如果训练数据中混入了评估基准的测试样本,分数提升就可能被夸大。

评估的独立性问题

目前公布的评估结果全部来自TokenRhythm团队自测,尚未看到第三方独立验证。虽然团队披露了详细的对比数据和基准选择,但缺乏独立第三方的復现验证始终是评估可信度的一个缺口。

基准的「自我参照」风险

QwenClawBench是阿里Qwen团队开发的,而NeoHorse基于Qwen3.5后训练——基座模型与基准出自同一体系。这不一定意味着分数被高估,但确实存在一定的「自我参照」风险,即模型在与其训练分布相似的基准上表现更好。

与同类工作的对比

需要指出的是,存在另一个同样名为「Qwen3.5-9B-Neo」的模型——由社区成员Jackrong基于Qwen3.5-9B进行推理优化微调,在BBH(+0.87 pp)、MATH Hard(+0.98 pp)、MUSR(+2.91 pp)上取得提升。这说明基于Qwen3.5的后训练确实能带来可验证的能力提升,从侧面支持了NeoHorse技术路线的可行性。但NeoHorse的评估维度更偏向Agent能力,与Jackrong/Neo的推理/数学导向不同,两者不宜直接对比。

综合结论总表

评估维度分析结论可信度评级
数据来源来自Harness真实执行轨迹,逻辑自洽,壁垒极高★★★★☆
数据质控流程披露了六维度语义评估等多重质控★★★★☆
基准选择复盖全面,但HumanEval饱和,QwenClawBench存在体系内关联★★★☆☆
对比模型合理但存在策略性选择★★★☆☆
分数提升逻辑总体符合边际效应,BFCL的平淡表现反而增强了可信度★★★★☆
独立验证缺乏第三方復现,是当前最大痛点★★☆☆☆
数据汙染防范有去汙声明但缺乏技术细节公示★★★☆☆

最终判断

NeoHorse的研究数据在生产逻辑与数值变化规律上高度自洽,并无明显造假痕迹。BFCL v4几乎无提升这一细节反而增加了整体数据的可信度——如果团队有意造假,完全可以把所有基准都「提升」一遍。团队的背景(华为盘古基因)、学术合作(清华、北大)和融资规模(数千万美元)进一步增强了技术执行的可信度。

其最大的价值不在于某几个Benchmark的绝对高分,而在于开闢了「将路由调度经验反哺单一模型」的务实新范式。它基于成熟的Qwen3.5进行后训练,技术风险可控,数据来源具有独特的竞争壁垒。

目前最大的不确定性来自于第三方復现验证数据规模的透明度。建议关注TokenRhythm后续发布的详细技术论文或开源评估工具包。

实践应用

适用场景

  1. Agent开发与部署:NeoHorse原生支持工具调用、环境反馈读取、错误发现与路径调整,是构建複杂Agent系统的理想基座。

  2. 自动化工作流:需要多步骤决策和动态调整的任务,如自动化测试、数据清洗、报告生成等。

  3. 智能编程助手:HumanEval得分92.07(4B版本)和92.68(9B版本)表明其在代码生成方面具备竞争力。

  4. 长上下文处理:262K原生上下文(可扩展至1M token)使其适合处理长文档、代码仓库分析等场景。

使用建议

  • 开箱即用:模型已在Hugging Face发布,可直接下载使用
  • API调用:可通过TokenRhythm API平台调用
  • 二次开发:基于Qwen3.5架构,兼容现有的Qwen生态工具和部署方案
  • 注意限制:当前版本仅支持文本推理,不包含视觉能力

潜在风险

  • RSI路径的技术挑战尚未完全解决,需理性看待「递归自我改进」的宣传
  • 模型的实际Agent能力需要在真实工作流中验证,Benchmark分数与实际表现可能存在差距
  • 作为初创公司的首个模型,生态支持和长期维护能力有待观察

参考资料来源

  • 原始GitHub仓库:https://github.com/TokenRhythm/NeoHorse
  • 技术报告:https://github.com/TokenRhythm/NeoHorse/blob/main/TechnicalReport_NeoHorse_v1.pdf
  • Hugging Face模型页面:TokenRhythm/NeoHorse-1-4B
  • Hugging Face模型页面:TokenRhythm/NeoHorse-1-9B
  • 量子位报道:《王云鹤创业后交出首个模型》
  • 雷锋网报道:《王云鹤创业估值数亿美元,押注多模型Harness和Agent-Native Model》
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/8 15:02:14

混合信号验证MSDV实战:从RNM抽象到Verilog-on-Top网表落地

芯片行业做验证的,尤其是搞数模混合的,最近几年应该都绕不开“MSDV”这个词。手头这个项目,本质上就是想解决一个很实际的问题:模拟电路在数字仿真环境里,怎么个跑法才又快又准?标题里几个关键词把路径标得…

作者头像 李华
网站建设 2026/9/8 15:01:47

嵌入式固件启动流程与OTA升级实战:从Bootloader到HardFault定位

做嵌入式固件这几年,我最大的一个感受是:越底层的代码越需要看得足够深。业务逻辑出问题,日志打一打、断点设一设,熬几个通宵总能找到原因;但启动阶段的问题往往毫无征兆、没有日志、复现率还不稳定,甚至有…

作者头像 李华
网站建设 2026/9/8 15:01:15

蓝牙音箱主控芯片JL701N选型与量产避坑指南

做蓝牙音箱项目的选型,最怕的不是功能做不出来,而是主控芯片选错了,后面所有环节都在给这个错误买单。去年我手里那个便携蓝牙音箱项目就是个活例子:断连、底噪、成本超标轮着来,前前后后改了三版PCB,光打样…

作者头像 李华
网站建设 2026/9/8 15:00:52

基于FPGA的CameraLink转光纤远距离图像传输方案设计与工程实践

做工业视觉项目的人,大概都经历过这种尴尬:相机端是标准CameraLink接口,但产线上两台设备相距二十多米,客户却咬死要用光纤传输,理由是铜缆布线要跨过天花板上的强电桥架,或者单纯就是怕电磁干扰。我最初接…

作者头像 李华