news 2026/10/8 19:37:52

跑分打不过中美,欧洲开源 Kolibri 新 MoE 模型:它到底图什么?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
跑分打不过中美,欧洲开源 Kolibri 新 MoE 模型:它到底图什么?

先问你一个问题:

假设你在一家德国的政府部门,或者一家造飞机发动机的公司上班。老板说:"用 AI 提高效率吧。"

你敢把内部合同、图纸、公民档案,一股脑发给美国公司的聊天机器人吗?

多半不敢。

这就是Kolibri(德语里的"蜂鸟")想解决的问题。2026 年 10 月,德国海德堡的 AI 公司Aleph Alpha在 Hugging Face 上发布了这个模型,权重完全公开,采用最宽松的 Apache 2.0 协议之一。

但它一出场,争议就来了:它的"跑分"并不是最强的,甚至被媒体直接评价为"打不过开源第一梯队"。

那它到底图什么?

一、先用人话讲:Kolibri 是什么?

一句话:一个能在你自己的服务器上运行、数据不出门的 AI 大脑,主打德语和英语。

拆成三个关键词:

① "开放权重"(Open-weight)
你可以把模型文件直接下载下来,装在自己的机器上跑,不用把数据发给任何第三方。类比:别人不是请你"去餐厅吃饭",而是直接把"菜谱和食材"给你,你在自家厨房做。

② "主权"(Sovereign)
官方强调:模型在德国研发,训练用的是德国和芬兰的基础设施,按欧盟法规的思路设计,客户可以完全自己运行。这里要提醒一句:这是厂商自己的说法,目前还没有独立第三方来验证。

③ "专家混合"(Mixture-of-Experts,MoE)
这是最有意思的部分。

想象一家有384 位专科医生的大医院。你来看病,不会让 384 个医生一起会诊,而是由分诊台挑出6 个最合适的专科医生,再加 1 个全科医生来看你。

Kolibri 就是这样:总共有781 亿个参数(医院里所有医生的总和),但处理每一个字时只激活约34.6 亿个,大约只有4.4%。

好处很直接:脑子很大,但干活很省电、很便宜、很快。

二、成绩单:好看,但没那么好看

官方公布的对比里,有一些亮眼的数字:

项目

Kolibri

对比

综合(英文)

75.5

Qwen3.5 35B-A3B 为 74.7,GPT-OSS 120B 为 72.3

综合(德文)

70.8

Qwen3.5 35B-A3B 为 69.8,GPT-OSS 120B 为 70.2

数学竞赛 AIME 2025

96.9

同类对手多在 80 多到 90 左右

博士级科学题 GPQA

84.3

同类对手在 70 多到 83

行业文档问答(英文平均)

89.7

对手在 62~87 之间

意思是:在"参数激活量差不多"的小型 MoE 里,Kolibri 属于第一梯队。

但是,请看另一面:

  • 写代码解决真实工程问题(SWE-Bench Verified):Kolibri66.4,对手 Qwen3.6 是73.8

  • 终端操作能力(TerminalBench):Kolibri27.7,Qwen3.5 和 Nvidia Nemotron 都是39.7

  • 更大的"稠密"模型 Qwen3.8 27B,英文综合80.2,明显高于 Kolibri

而且,有媒体的评价相当不留情面:Kolibri 能赢过春季发布的对手,但当前开源领域的领先者已经把它远远甩在后面。

另一家科技站点则提醒读者:厂商宣称的低服务成本,目前还没有独立的成本数据来支撑。

三、真正的争议:三个"灵魂拷问"

问题一:拿半年前的对手比,算赢吗?
AI 圈半年等于一个时代。你在一个已经被超越的赛道上领先,听起来像"考了全班倒数第十,但打败了去年的自己"。

问题二:"主权"到底有多"纯"?
翻看官方模型卡会发现一个有趣的细节:训练数据里的合成数据,是用别人的模型生成的,包括 Google 的 Gemma、Mistral 的 NeMo,以及用阿里 Qwen3-32B 给数据打质量分。官方说明这些都是许可证宽松的模型。

更直白的是,官方自己承认训练数据里含有中国模型生成的内容,并因此专门做了过滤和"去政治偏见"的对齐训练。

所以"主权"更准确的意思是:部署和合规可控,而不是"从种子到果实全是自己的"。

问题三:对中文用户有用吗?
基本没有。它只支持德语和英语。官方说这是"深度优先于广度"的刻意选择。对做德国政府、制造、航空业务的人,这是优点;对中文用户,这是硬伤。

四、那它为什么还值得关注?

因为它赌的不是"最强",而是三件事:

  1. 能自己跑

    :官方给的硬件门槛,最低 2 张 A100 80GB,或者 1 张 H200 / B200,对企业而言不算离谱。

  2. 敢说"我不知道"

    :训练时用了一套叫 Merlin-Arthur 的方法,专门教模型在证据不足时"弃权"而不是瞎编。

  3. 合规优先

    :官方强调它面向的是"人审核结果后再行动"的场景,而不是无人监督的全自动系统。

另外有报道称,这个发布在 Hacker News 上拿到了近 500 分、近 300 条评论,对一家欧洲 AI 公司来说相当罕见。

五、给科技爱好者的硬核部分

1)架构细节

项目

数值

总参数 / 激活参数

78.1B / 3.46B

层数

50

每层专家

384 个路由专家,每个 token 选 6 个,外加 1 个共享专家

注意力

4:1 的滑动窗口注意力(窗口 512)与全局 GQA 交替

隐藏维度

2560

位置编码

RoPE 只用在滑动窗口层

词表

128,000

上下文

原生 262,144,外推到 1,048,576

精度

FP8 权重,约 78GB

有两个设计很值得说:

滑动窗口 + 稀疏全局:大多数层只看附近 512 个 token,只有 1/5 的层看全文。这样长文本的显存和计算成本大幅下降。

位置编码只放在滑动窗口层:官方说这让上下文可以在不做位置缩放的情况下继续延长。当然,代价是性能会衰减,RULER 测试里,Kolibri Base 在 4k 长度得分 86.9,到 1M 长度降到 63.2。不过在 1M 这一档,它比同表里的 Nemotron(58.5)和 Qwen3.5(57.5)还高。

2)为德语量身定做的分词器

官方训练了一种叫UniBPE的分词算法,在保留 BPE 贪心合并的前提下,改用 Unigram 目标来挑选合并项,更尊重德语的复合词结构。结果是:德语压缩率4.7 字节/token,英语4.2 字节/token,在同级模型里很有竞争力。

分词效率直接等于省钱:同样一份德语合同,token 越少,推理越快、越便宜。

3)训练成本,一笔明白账

  • 硬件:768 块 NVIDIA B200(96 个 8 卡节点)

  • 预训练:21 天,约 39.2 万 GPU 小时,数据量20 万亿 token

  • 中期训练:5 天,3.44 万亿 token

  • 长上下文扩展:13 小时,2010 亿 token

  • 总计算量:约6.4×10²³ FLOPs

  • 估算耗电:约950 MWh(不含后训练和 RL)

  • 优化器:用的是Muon,并配合 Exact Quantile Balancing 做专家负载均衡

4)怎么让它跑起来

下面的代码来自官方模型卡,我没有亲自在 GPU 上验证,请以官方文档为准。

第一步:安装并启动服务

...Python

pip install 'aleph-alpha-inference>=1'

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \

--reasoning-parser kolibri1 \

--tool-call-parser kolibri1 \

--enable-auto-tool-choice

第二步:像调用 OpenAI 一样调用它,并选择"思考力度"

...Python

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

response = client.chat.completions.create(

model="Aleph-Alpha/Kolibri-1",

messages=[

{"role": "user", "content": "Erkläre kurz, was ein Mixture-of-Experts-Modell ist."}

],

extra_body={

"chat_template_kwargs": {

"reasoning_effort": "high", # none / low / medium / high

"enable_thinking": True,

}

},

)

print(response.choices[0].message.content)

第三步:让它调用工具(查天气为例)

...Python

import json

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

MODEL = "Aleph-Alpha/Kolibri-1"

tools = [{

"type": "function",

"function": {

"name": "get_weather",

"description": "Get the current weather for a city.",

"parameters": {

"type": "object",

"properties": {"city": {"type": "string"}},

"required": ["city"],

},

},

}]

def get_weather(city):

return {"city": city, "temperature": 18, "conditions": "cloudy"}

messages = [{"role": "user", "content": "Wie ist das Wetter gerade in Heidelberg?"}]

first = client.chat.completions.create(model=MODEL, messages=messages, tools=tools)

msg = first.choices[0].message

messages.append(msg)

for call in msg.tool_calls or []:

result = get_weather(**json.loads(call.function.arguments))

messages.append({"role": "tool", "tool_call_id": call.id,

"content": json.dumps(result)})

final = client.chat.completions.create(model=MODEL, messages=messages, tools=tools)

print(final.choices[0].message.content)

官方推荐的采样参数:temperature=1.0、top_p=0.97、top_k=128。如果想跑超过 262,144 token 的超长上下文,要额外加 --max-model-len 1048576 和对应的 --hf-overrides。

5)"不胡说"是怎么训练出来的?

Merlin-Arthur 协议的思路,类似一场"证据攻防赛":

  • Merlin

    (好巫师):把上下文里的无关部分藏起来,让正确答案更容易被推出。模型要学会答对。

  • Morgana

    (坏巫师):把关键证据藏起来,让正确答案推不出来。模型要学会弃权,不要硬编。

这两种样本加上原始样本一起训练,目的是让模型在"证据够"和"证据不够"之间学会分辨。

不过数据也提醒我们不要神话:在官方对比表里,Kolibri 的"闭卷事实问答"(RGB Closed-Book)只有51.0,"事实核查纠错"只有34.0,明显落后于不少对手。

所以它更像是"不太敢乱说",而不是"什么都懂"。

六、我的判断

Kolibri 不是来当"最强 AI"的,它是来当"最让人放心的 AI"的。

对大多数普通用户,它没什么用:不会中文,也不比顶级模型聪明。

但对于那些数据绝对不能出门、又必须讲德语的机构,一个能自己部署、许可证干净、合规文档齐全的模型,可能比多出的几分跑分更有价值。

至于它是欧洲 AI 的翻身仗,还是体面的认输?我倾向于:它是一张入场券,不是一份冠军奖状。真正的考验,是半年后它的下一代,能不能追上那些跑在前面的对手。

最后留个问题给你:

如果有一个"稍弱一点,但数据完全留在你自己手里"的 AI,和一个"最强,但数据要交给别人"的 AI,你会选哪个?

更多transformer,VIT,swin tranformer 参考头条号:人工智能研究所 v号:人工智能研究Suo, 启示AI科技

动画详解transformer 在线视频教程


版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/8 19:25:26

开源AI技能集Superpowers:让Claude稳定遵循你的工作习惯

1. 这个项目到底解决什么问题如果你经常用 Claude 这类 AI 助手处理日常任务,一定遇到过同一个问题——它很强,但它记不住你的习惯。每次让它写日志、做周报、给变量命名、按你的风格检查代码,它都像第一次见你一样,从头开始“猜”…

作者头像 李华
网站建设 2026/10/8 19:25:18

AI编程助手如何重塑代码审查:人机协同的三种模式与落地实践

1. 从“人肉审查”到“人机协同”:AI编程助手到底改了什么代码审查这件事,干了十年开发的人都有体会:它从来不是“看代码”这么简单。一个中等规模的团队,每天可能产生几十个合并请求,每个请求涉及几百行改动。审查者要…

作者头像 李华
网站建设 2026/10/8 19:12:39

题解:洛谷 P1098 [NOIP 2007 提高组] 字符串的展开

本文分享的必刷题目是从蓝桥云课、洛谷、AcWing等知名刷题平台精心挑选而来,并结合各平台提供的算法标签和难度等级进行了系统分类。题目涵盖了从基础到进阶的多种算法和数据结构,旨在为不同阶段的编程学习者提供一条清晰、平稳的学习提升路径。 欢迎大家订阅我的专栏:算法…

作者头像 李华