先问你一个问题:
假设你在一家德国的政府部门,或者一家造飞机发动机的公司上班。老板说:"用 AI 提高效率吧。"
你敢把内部合同、图纸、公民档案,一股脑发给美国公司的聊天机器人吗?
多半不敢。
这就是Kolibri(德语里的"蜂鸟")想解决的问题。2026 年 10 月,德国海德堡的 AI 公司Aleph Alpha在 Hugging Face 上发布了这个模型,权重完全公开,采用最宽松的 Apache 2.0 协议之一。
但它一出场,争议就来了:它的"跑分"并不是最强的,甚至被媒体直接评价为"打不过开源第一梯队"。
那它到底图什么?
一、先用人话讲:Kolibri 是什么?
一句话:一个能在你自己的服务器上运行、数据不出门的 AI 大脑,主打德语和英语。
拆成三个关键词:
① "开放权重"(Open-weight)
你可以把模型文件直接下载下来,装在自己的机器上跑,不用把数据发给任何第三方。类比:别人不是请你"去餐厅吃饭",而是直接把"菜谱和食材"给你,你在自家厨房做。
② "主权"(Sovereign)
官方强调:模型在德国研发,训练用的是德国和芬兰的基础设施,按欧盟法规的思路设计,客户可以完全自己运行。这里要提醒一句:这是厂商自己的说法,目前还没有独立第三方来验证。
③ "专家混合"(Mixture-of-Experts,MoE)
这是最有意思的部分。
想象一家有384 位专科医生的大医院。你来看病,不会让 384 个医生一起会诊,而是由分诊台挑出6 个最合适的专科医生,再加 1 个全科医生来看你。
Kolibri 就是这样:总共有781 亿个参数(医院里所有医生的总和),但处理每一个字时只激活约34.6 亿个,大约只有4.4%。
好处很直接:脑子很大,但干活很省电、很便宜、很快。
二、成绩单:好看,但没那么好看
官方公布的对比里,有一些亮眼的数字:
项目 | Kolibri | 对比 |
综合(英文) | 75.5 | Qwen3.5 35B-A3B 为 74.7,GPT-OSS 120B 为 72.3 |
综合(德文) | 70.8 | Qwen3.5 35B-A3B 为 69.8,GPT-OSS 120B 为 70.2 |
数学竞赛 AIME 2025 | 96.9 | 同类对手多在 80 多到 90 左右 |
博士级科学题 GPQA | 84.3 | 同类对手在 70 多到 83 |
行业文档问答(英文平均) | 89.7 | 对手在 62~87 之间 |
意思是:在"参数激活量差不多"的小型 MoE 里,Kolibri 属于第一梯队。
但是,请看另一面:
写代码解决真实工程问题(SWE-Bench Verified):Kolibri66.4,对手 Qwen3.6 是73.8
终端操作能力(TerminalBench):Kolibri27.7,Qwen3.5 和 Nvidia Nemotron 都是39.7
更大的"稠密"模型 Qwen3.8 27B,英文综合80.2,明显高于 Kolibri
而且,有媒体的评价相当不留情面:Kolibri 能赢过春季发布的对手,但当前开源领域的领先者已经把它远远甩在后面。
另一家科技站点则提醒读者:厂商宣称的低服务成本,目前还没有独立的成本数据来支撑。
三、真正的争议:三个"灵魂拷问"
问题一:拿半年前的对手比,算赢吗?
AI 圈半年等于一个时代。你在一个已经被超越的赛道上领先,听起来像"考了全班倒数第十,但打败了去年的自己"。
问题二:"主权"到底有多"纯"?
翻看官方模型卡会发现一个有趣的细节:训练数据里的合成数据,是用别人的模型生成的,包括 Google 的 Gemma、Mistral 的 NeMo,以及用阿里 Qwen3-32B 给数据打质量分。官方说明这些都是许可证宽松的模型。
更直白的是,官方自己承认训练数据里含有中国模型生成的内容,并因此专门做了过滤和"去政治偏见"的对齐训练。
所以"主权"更准确的意思是:部署和合规可控,而不是"从种子到果实全是自己的"。
问题三:对中文用户有用吗?
基本没有。它只支持德语和英语。官方说这是"深度优先于广度"的刻意选择。对做德国政府、制造、航空业务的人,这是优点;对中文用户,这是硬伤。
四、那它为什么还值得关注?
因为它赌的不是"最强",而是三件事:
- 能自己跑
:官方给的硬件门槛,最低 2 张 A100 80GB,或者 1 张 H200 / B200,对企业而言不算离谱。
- 敢说"我不知道"
:训练时用了一套叫 Merlin-Arthur 的方法,专门教模型在证据不足时"弃权"而不是瞎编。
- 合规优先
:官方强调它面向的是"人审核结果后再行动"的场景,而不是无人监督的全自动系统。
另外有报道称,这个发布在 Hacker News 上拿到了近 500 分、近 300 条评论,对一家欧洲 AI 公司来说相当罕见。
五、给科技爱好者的硬核部分
1)架构细节
项目 | 数值 |
总参数 / 激活参数 | 78.1B / 3.46B |
层数 | 50 |
每层专家 | 384 个路由专家,每个 token 选 6 个,外加 1 个共享专家 |
注意力 | 4:1 的滑动窗口注意力(窗口 512)与全局 GQA 交替 |
隐藏维度 | 2560 |
位置编码 | RoPE 只用在滑动窗口层 |
词表 | 128,000 |
上下文 | 原生 262,144,外推到 1,048,576 |
精度 | FP8 权重,约 78GB |
有两个设计很值得说:
滑动窗口 + 稀疏全局:大多数层只看附近 512 个 token,只有 1/5 的层看全文。这样长文本的显存和计算成本大幅下降。
位置编码只放在滑动窗口层:官方说这让上下文可以在不做位置缩放的情况下继续延长。当然,代价是性能会衰减,RULER 测试里,Kolibri Base 在 4k 长度得分 86.9,到 1M 长度降到 63.2。不过在 1M 这一档,它比同表里的 Nemotron(58.5)和 Qwen3.5(57.5)还高。
2)为德语量身定做的分词器
官方训练了一种叫UniBPE的分词算法,在保留 BPE 贪心合并的前提下,改用 Unigram 目标来挑选合并项,更尊重德语的复合词结构。结果是:德语压缩率4.7 字节/token,英语4.2 字节/token,在同级模型里很有竞争力。
分词效率直接等于省钱:同样一份德语合同,token 越少,推理越快、越便宜。
3)训练成本,一笔明白账
硬件:768 块 NVIDIA B200(96 个 8 卡节点)
预训练:21 天,约 39.2 万 GPU 小时,数据量20 万亿 token
中期训练:5 天,3.44 万亿 token
长上下文扩展:13 小时,2010 亿 token
总计算量:约6.4×10²³ FLOPs
估算耗电:约950 MWh(不含后训练和 RL)
优化器:用的是Muon,并配合 Exact Quantile Balancing 做专家负载均衡
4)怎么让它跑起来
下面的代码来自官方模型卡,我没有亲自在 GPU 上验证,请以官方文档为准。
第一步:安装并启动服务
...Python
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
第二步:像调用 OpenAI 一样调用它,并选择"思考力度"
...Python
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[
{"role": "user", "content": "Erkläre kurz, was ein Mixture-of-Experts-Modell ist."}
],
extra_body={
"chat_template_kwargs": {
"reasoning_effort": "high", # none / low / medium / high
"enable_thinking": True,
}
},
)
print(response.choices[0].message.content)
第三步:让它调用工具(查天气为例)
...Python
import json
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
MODEL = "Aleph-Alpha/Kolibri-1"
tools = [{
"type": "function",
"function": {
"name": "get_weather",
"description": "Get the current weather for a city.",
"parameters": {
"type": "object",
"properties": {"city": {"type": "string"}},
"required": ["city"],
},
},
}]
def get_weather(city):
return {"city": city, "temperature": 18, "conditions": "cloudy"}
messages = [{"role": "user", "content": "Wie ist das Wetter gerade in Heidelberg?"}]
first = client.chat.completions.create(model=MODEL, messages=messages, tools=tools)
msg = first.choices[0].message
messages.append(msg)
for call in msg.tool_calls or []:
result = get_weather(**json.loads(call.function.arguments))
messages.append({"role": "tool", "tool_call_id": call.id,
"content": json.dumps(result)})
final = client.chat.completions.create(model=MODEL, messages=messages, tools=tools)
print(final.choices[0].message.content)
官方推荐的采样参数:temperature=1.0、top_p=0.97、top_k=128。如果想跑超过 262,144 token 的超长上下文,要额外加 --max-model-len 1048576 和对应的 --hf-overrides。
5)"不胡说"是怎么训练出来的?
Merlin-Arthur 协议的思路,类似一场"证据攻防赛":
- Merlin
(好巫师):把上下文里的无关部分藏起来,让正确答案更容易被推出。模型要学会答对。
- Morgana
(坏巫师):把关键证据藏起来,让正确答案推不出来。模型要学会弃权,不要硬编。
这两种样本加上原始样本一起训练,目的是让模型在"证据够"和"证据不够"之间学会分辨。
不过数据也提醒我们不要神话:在官方对比表里,Kolibri 的"闭卷事实问答"(RGB Closed-Book)只有51.0,"事实核查纠错"只有34.0,明显落后于不少对手。
所以它更像是"不太敢乱说",而不是"什么都懂"。
六、我的判断
Kolibri 不是来当"最强 AI"的,它是来当"最让人放心的 AI"的。
对大多数普通用户,它没什么用:不会中文,也不比顶级模型聪明。
但对于那些数据绝对不能出门、又必须讲德语的机构,一个能自己部署、许可证干净、合规文档齐全的模型,可能比多出的几分跑分更有价值。
至于它是欧洲 AI 的翻身仗,还是体面的认输?我倾向于:它是一张入场券,不是一份冠军奖状。真正的考验,是半年后它的下一代,能不能追上那些跑在前面的对手。
最后留个问题给你:
如果有一个"稍弱一点,但数据完全留在你自己手里"的 AI,和一个"最强,但数据要交给别人"的 AI,你会选哪个?
更多transformer,VIT,swin tranformer 参考头条号:人工智能研究所 v号:人工智能研究Suo, 启示AI科技动画详解transformer 在线视频教程