🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度
1. 先确认 MArena 上的是哪个 Gemini 3
LMArena(原 Chatbot Arena)的榜单页会随投票滚动更新,同一模型在不同日期、不同子榜(Overall / Coding / Hard Prompts)上的名次并不一致。所以复现之前,先把「登顶」这件事拆成可核对的三件事:榜名、查阅日期、具体名次或分数,以及页面来源。本文不引用任何未经核实的 ELO 数字,只写复现流程和本地 Token 记录。
我这次的做法是:打开 LMArena 的 Leaderboard 页面,记下查阅日期,找到 Gemini 3 系列在 Overall 榜上的位置,把模型在页面上的完整显示名抄下来(例如gemini-3-pro这类带版本后缀的写法)。这一步很关键,因为榜单上的展示名和 API 里的模型 ID 经常不是同一个字符串——榜单可能写「Gemini 3 Pro」,而模型广场里挂的是另一个 ID。两者对不上,后面切模型就会 404。
需要说明的是:公榜上参赛的是模型本身,不是任何 API 通道。TaoToken 在这里的角色是统一 API 基线——你在 TaoToken 创建 Key、拿到 Base URL,然后把请求打到同一个 Gemini 3 模型上。榜单名次归模型,通道归通道,这两件事在本文里始终分开写。
复现的目标不是「验证 Gemini 3 是不是第一」,那需要跑完整投票集,个人做不了。目标是:用同一套提示集,在本地把 Gemini 3 的对话手感跑一遍,记录每组对话的 Token 消耗,形成一张可对照的本地表。这张表只代表我这一次运行,不代表公榜。
1.1 榜单快照要记哪几个字段
如果你也要做这件事,建议在动手前先建一个记录文件,至少包含:
| 字段 | 说明 |
|---|---|
| 榜名 | LMArena / Chatbot Arena,写全 |
| 查阅日期 | 精确到日,例如 2025-XX-XX |
| 子榜 | Overall / Coding / Hard Prompts,选一个 |
| 模型显示名 | 页面上原样抄写 |
| 名次或分数 | 页面显示什么写什么,不换算 |
| 页面来源 | 榜单 URL |
这六个字段缺一个,后面的「复现」就没有锚点。尤其是查阅日期——榜单每天在动,今天的第一和上周的第一可能不是同一个模型。
1.2 官方模型名 vs 广场 ID
榜单显示名和 API 模型 ID 的差异是复现里最容易翻车的地方。我的处理方式是:先在 TaoToken 的模型广场里搜「gemini」,看当前挂出来的 Gemini 3 系列 ID 长什么样,再拿这个 ID 去填客户端。模型 ID 一律以模型广场为准,不要凭记忆写,也不要把榜单显示名直接当 ID 用。
如果广场里同时有多个 Gemini 3 变体(比如带-pro、-flash后缀的),先确认你要复现的是榜单上那一个。选错了变体,对话手感对不上,Token 消耗也对不上。
2. 把 Base URL 填进客户端,再切到 Gemini 3
这一步是整篇的核心操作。TaoToken 出现在「切模型」这个动作里:Key 和 Base URL 是入口,模型列表里选 Gemini 3 是切换点。
2.1 创建 Key 与确认 Base URL
在 TaoToken 控制台 创建一把 API Key,占位符记作YOUR_API_KEY。Base URL 固定写:
https://taotoken.net/api注意末尾不带/v1。很多客户端默认会自己拼/v1/chat/completions,你只要把根地址填对就行。填成https://taotoken.net/api/v1反而会拼出/v1/v1/...,直接 404。
2.2 通用客户端填法
大多数支持 OpenAI 兼容协议的客户端(Chatbox、NextChat、各类桌面端)填三个字段:
| 字段 | 值 |
|---|---|
| API Base / Base URL | https://taotoken.net/api |
| API Key | YOUR_API_KEY |
| Model | 模型广场里的 Gemini 3 ID |
填完保存,在模型下拉里切到 Gemini 3,发一条「你好」确认连通。连通了再进正式提示集。
2.3 Claude Code 的接法
如果你习惯在 Claude Code 里跑对话,走环境变量或~/.claude/settings.json的env段:
export ANTHROPIC_BASE_URL="https://taotoken.net/api" export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY" export ANTHROPIC_MODEL="模型广场里的 Gemini 3 ID"或者写进~/.claude/settings.json:
{ "env": { "ANTHROPIC_BASE_URL": "https://taotoken.net/api", "ANTHROPIC_AUTH_TOKEN": "YOUR_API_KEY", "ANTHROPIC_MODEL": "模型广场里的 Gemini 3 ID" } }三件套里ANTHROPIC_MODEL必须和广场 ID 一致,写错就是模型不存在。Claude Code 的详细接入步骤可以对照 Claude Code 接入文档。
2.4 Codex 的接法
Codex 走的是另一套配置,别把ANTHROPIC_*套上去。改~/.codex/config.toml:
model = "模型广场里的 Gemini 3 ID" model_provider = "taotoken" [model_providers.taotoken] name = "TaoToken" base_url = "https://taotoken.net/api" env_key = "TAOTOKEN_API_KEY"然后在环境里导出TAOTOKEN_API_KEY=YOUR_API_KEY。Codex 和 Claude Code 的配置字段完全不同,混用是最常见的 401 来源。
2.5 CC Switch 的接法
用 CC Switch 管理多供应商时,新增一个自定义供应商:
- 供应商名:TaoToken
- Base URL:
https://taotoken.net/api - API Key:
YOUR_API_KEY - 模型 ID:模型广场里的 Gemini 3 ID
保存后切到这个供应商,再在模型列表里选 Gemini 3。CC Switch 的好处是切换供应商不用改环境变量,适合同时挂着多个通道做对照。
2.6 切换后先做一次连通性检查
切完模型别急着跑提示集,先发一条短消息,确认返回正常、没有 401/404。这一步能挡掉大部分配置错误。如果报 401,先查 Key 有没有复制全、有没有多余空格;如果报 404,先查模型 ID 是不是和广场一致、Base URL 末尾有没有多写/v1。
3. 五组同款对话:提示集与 Token 记录
提示集我固定五组,覆盖不同对话类型,方便看手感差异。每组都记录输入 Token、输出 Token、总 Token。下面的数字是我这一次运行的结果,只代表本地一次运行,不代表公榜,也不构成对模型能力的排名。
3.1 提示集设计
五组提示按难度和类型分层:
- 事实问答:一个需要准确回忆的问题,看模型会不会编。
- 多步推理:一道需要中间步骤的题,看推理链是否完整。
- 长文改写:给一段 300 字左右的文字,要求压缩到 100 字以内,看信息保留度。
- 代码解释:给一段有 bug 的代码,要求指出问题并给修复思路,看定位准不准。
- 开放式建议:一个没有标准答案的规划类问题,看结构性和可执行性。
这五组不追求覆盖所有能力,只求类型分散,让 Token 消耗和手感都有对照价值。
3.2 本地复现记录表
| 组号 | 类型 | 输入 Token | 输出 Token | 总 Token | 完成情况 |
|---|---|---|---|---|---|
| 1 | 事实问答 | 以控制台用量页为准 | 以控制台用量页为准 | 以控制台用量页为准 | 完成 |
| 2 | 多步推理 | 以控制台用量页为准 | 以控制台用量页为准 | 以控制台用量页为准 | 完成 |
| 3 | 长文改写 | 以控制台用量页为准 | 以控制台用量页为准 | 以控制台用量页为准 | 完成 |
| 4 | 代码解释 | 以控制台用量页为准 | 以控制台用量页为准 | 以控制台用量页为准 | 完成 |
| 5 | 开放式建议 | 以控制台用量页为准 | 以控制台用量页为准 | 以控制台用量页为准 | 完成 |
这里我没有填具体数字,原因是:Token 计数依赖客户端和通道的统计口径,不同客户端报的数可能不一致。要拿到可信的数字,应该以 TaoToken 控制台的用量页为准,把每次调用的实际消耗抄进表里。凭客户端界面上的估算值填表,误差可能很大。
3.3 怎么把 Token 数字填准
跑完一组后,去控制台的用量记录里找对应时间戳的调用,抄下输入和输出 Token。五组跑完,汇总成上面的表。这张表的价值在于:同一把 Key、同一套提示、同一时间段,横向对比五组对话的消耗结构。哪类提示吃 Token 多,一目了然。
需要再强调一次:这张表是本地一次运行的结果,不是公榜数据,也不能拿来和 LMArena 的 ELO 放一起比较。公榜表在第一节,本地表在这一节,两张表分开看。
3.4 手感记录怎么写
除了 Token,建议每组补一句主观记录:回答是否切题、有没有明显幻觉、结构是否清晰。这部分不写数字,只写观察。比如事实问答组如果模型给了不确定的答案,就记「该组出现一次不确定表述」;代码解释组如果定位准确,就记「一次定位到问题行」。这些观察和 Token 数字配合,才是完整的复现记录。
4. 复现时容易踩的配置坑
这一节只写本篇配置相关的错误,不展开通用排障。
4.1 模型 ID 写错
最常见的是把榜单显示名当模型 ID。榜单写「Gemini 3 Pro」,你就在客户端填「Gemini 3 Pro」,结果 404。正确做法是去模型广场抄实际 ID。模型 ID 一律以模型广场为准。
4.2 Base URL 多写 /v1
https://taotoken.net/api是根地址,末尾不要加/v1。加了之后客户端再拼一次,路径就重复了。这个错误在 OpenAI 兼容客户端里特别常见,因为很多客户端的默认模板里 Base URL 是带/v1的,替换时容易连/v1一起带进去。
4.3 Claude Code 与 Codex 配置混用
ANTHROPIC_*只给 Claude Code 用,Codex 走~/.codex/config.toml。把ANTHROPIC_BASE_URL塞进 Codex 的环境里,Codex 不认,直接连不上。两套配置分开维护。
4.4 Key 复制带空格
从控制台复制 Key 时,前后容易带上空格或换行。填进客户端后表现为 401。粘贴后手动检查一遍首尾字符。
4.5 切换模型后没重连
有些客户端切换模型后需要重新建立会话,旧会话还挂在之前的模型上。切完模型新建一个对话再发消息,避免拿旧会话的结果当新模型的输出。
5. 用同一把 Key 复现对照表
五组对话跑完、Token 抄进表之后,建议做两件事收尾。
第一件,打开 模型对话 确认 Gemini 3 的模型 ID 和广场一致,顺便再发一条短消息,验证这次评测的调用是否正常入账。如果用量页能看到刚才的调用记录,说明整条链路是通的。
第二件,如果你打算长期做这类复现,可以看 Coding Plan,把多模型对照的调用集中管理。Key 在 控制台 创建,Claude Code / CC Switch 的三件套配置对照 接入文档。
复现这件事的价值不在「证明谁第一」,而在你手里有了一张自己跑出来的对照表:同一套提示、同一把 Key、同一时间段,五组对话的 Token 消耗和手感记录都在。下次榜单变动,你换一个模型 ID 再跑一遍,两张表就能横向比。榜单归榜单,你的表归你的表。
🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度